Tổng quan nghiên cứu

Sự bùng nổ của các công nghệ giải trình tự thế hệ mới đã tạo ra khối lượng dữ liệu sinh học khổng lồ, nhưng phần lớn các nguồn dữ liệu này vẫn tồn tại ở dạng đóng, phân mảnh và không đồng nhất về mặt ngữ nghĩa. Trong khi các dự án dữ liệu liên kết mở đã phát triển mạnh mẽ trong lĩnh vực y sinh học với hơn 12 nguồn dữ liệu lớn được tích hợp, thì nguồn dữ liệu dành riêng cho sinh học thực vật và nông học vẫn còn rất hạn chế. Được thành lập từ năm 2012 trong khuôn khổ sáng kiến quốc gia của Pháp với 5 nhóm làm việc chuyên sâu, Viện Sinh học Tính toán đã khởi xướng dự án AgroLD nhằm xây dựng cơ sở tri thức dữ liệu liên kết mở chuyên biệt cho nông nghiệp.

Vấn đề nghiên cứu trọng tâm của luận văn là giải quyết rào cản kỹ thuật giữa cấu trúc dữ liệu đồ thị phức tạp và khả năng tiếp cận của người dùng. Phần lớn các nhà sinh học thực nghiệm không thành thạo ngôn ngữ truy vấn SPARQL, trong khi các kỹ sư tin sinh học lại thiếu các giao diện lập trình chuẩn hóa để tích hợp dữ liệu vào các quy trình phân tích tự động. Mục tiêu cụ thể của công trình là thiết kế và hiện thực hóa một kiến trúc ứng dụng web đa tầng, tích hợp 4 phương thức truy vấn ngữ nghĩa linh hoạt và cung cấp bộ giao diện lập trình ứng dụng RESTful API hoàn chỉnh.

Phạm vi nghiên cứu được triển khai trong giai đoạn 2014 - 2015 tại Viện Sinh học Tính toán (IBC) phối hợp cùng Viện Nghiên cứu Phát triển (IRD), Trung tâm Hợp tác Quốc tế Nghiên cứu Nông nghiệp vì Sự phát triển (CIRAD) và Viện Quốc tế Pháp ngữ (IFI) thuộc Đại học Quốc gia Hà Nội. Ý nghĩa thực tiễn của nghiên cứu được chứng minh qua việc tối ưu hóa tốc độ phản hồi truy vấn đạt mức 452 mili-giây, hỗ trợ điều hướng tự động qua 5 nhóm thực thể sinh học chính và nâng cao khả năng khai thác dữ liệu liên kết cho cộng đồng khoa học nông nghiệp toàn cầu.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu xây dựng trên nền tảng lý thuyết Web ngữ nghĩa và Dữ liệu mở liên kết do tổ chức W3C chuẩn hóa, vận hành theo 5 nguyên tắc định danh tài nguyên bằng URI, phân giải qua giao thức HTTP và mô tả tri thức bằng các bộ ba chuẩn RDF (Resource Description Framework). Để mô hình hóa ngữ nghĩa phức tạp trong nông học, luận văn áp dụng lý thuyết kỹ nghệ bản thể học với sự tích hợp của 3 hệ thống bản thể học sinh học tiêu chuẩn gồm: bản thể học gen Gene Ontology (GO) nhằm chuẩn hóa chức năng sản phẩm gen, bản thể học thực vật Plant Ontology (PO) mô tả cấu trúc giải phẫu và các giai đoạn phát triển, cùng bản thể học môi trường thực nghiệm Plant Environment Ontology (EO).

Mô hình nghiên cứu kế thừa và mở rộng kiến trúc hướng dịch vụ RESTful theo thiết kế của nền tảng tích hợp dược học Open PHACTS Discovery Platform. Hệ thống sử dụng cơ chế trung gian để ánh xạ các câu hỏi sinh học thường gặp thành các mẫu truy vấn SPARQL tối ưu. Định dạng dữ liệu trao đổi được chuẩn hóa qua 3 cấu trúc chính gồm RDF/Turtle, JSON và TSV, đảm bảo khả năng tương thích cao với cả người dùng đầu cuối lẫn các ứng dụng máy học tự động theo triết lý "liên kết các nguồn dữ liệu sinh học phân tán thành không gian tri thức thống nhất".

Phương pháp nghiên cứu

Nguồn dữ liệu thực nghiệm được trích xuất và chuyển đổi tự động từ hệ thống cơ sở dữ liệu SouthGreen và Gramene, tập trung vào 2 loài sinh vật mô hình quan trọng trong nông nghiệp là cây lúa (Oryza) và cải Arabidopsis Thaliana, đồng thời kết nối mở rộng với cơ sở dữ liệu protein UniProtKB và trung tâm thông tin công nghệ sinh học quốc gia Hoa Kỳ (NCBI).

Cỡ mẫu nghiên cứu bao gồm toàn bộ 5 nhóm thực thể sinh học cốt lõi cấu thành hệ thống: Gen, Protein, Tính trạng số lượng (QTL), Con đường sinh học (Pathway) và các Lớp bản thể học (Ontology Classes). Phương pháp chọn mẫu là chọn mẫu có chủ đích dựa trên 4 kịch bản truy vấn thực tế, đại diện cho 4 mức độ phức tạp từ tìm kiếm từ khóa đơn giản, truy vấn liên kết đa tầng, trích xuất dữ liệu ngoại vi cho đến khám phá mối quan hệ tiềm ẩn trong đồ thị tri thức.

Lý do lựa chọn phương pháp phân tích thực nghiệm kết hợp giữa khung đánh giá khả năng sử dụng hệ thống (System Usability Scale) và phương pháp đo lường thời gian thực thi (latency measurement) là nhằm đánh giá toàn diện 3 khía cạnh: tính khả dụng, tính biểu đạt cú pháp và hiệu năng xử lý. Toàn bộ quá trình nghiên cứu và thử nghiệm được tiến hành liên tục trong 12 tháng từ năm 2014 đến năm 2015, trải qua các giai đoạn từ khảo sát cấu trúc dữ liệu, thiết kế API trên nền tảng Jersey 2.17 cho đến kiểm thử tích hợp trên môi trường pipeline Galaxy.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Thực nghiệm trên hệ thống đã mang lại 4 kết quả then chốt chứng minh tính hiệu quả vượt trội của kiến trúc đề xuất:

Thứ nhất, tính năng tìm kiếm nhanh (Quick Search) tích hợp công nghệ duyệt mặt phẳng dữ liệu OpenLink Faceted Search đạt tốc độ xử lý ấn tượng với thời gian phản hồi chỉ 452 mili-giây, trích xuất và lập chỉ mục thành công 5.537 bản ghi dữ liệu liên quan đến từ khóa sinh học thực nghiệm.

Thứ hai, công cụ biểu mẫu động (Advanced Search) cho phép người dùng giải quyết các truy vấn bản thể học phức tạp mà không cần viết mã. Với bài toán tra cứu tính trạng số lượng liên quan đến định danh bản thể học môi trường EO:0007403, hệ thống hoàn thành toàn bộ quy trình chỉ qua 2 bước tương tác với tổng thời gian 18 giây, bao gồm 13 giây định danh khái niệm và 5 giây truy xuất danh sách QTL liên quan.

Thứ ba, cơ chế dịch vụ ngoài (External Services) tích hợp thành công với G-Links và Europe PubMed Central, giúp tự động tổng hợp toàn bộ danh mục tài liệu khoa học của protein TBP1 trong 24 giây, trong đó thời gian lấy định danh là 20 giây và thời gian phân tích cấu trúc XML tài liệu là 4 giây.

Thứ tư, hệ thống đã kết nối hoàn hảo với nền tảng phân tích luồng công việc Galaxy. Thông qua tệp mô tả tài nguyên WADL và phương thức truyền nhận POST, quy trình tự động đã trích xuất chính xác bảng dữ liệu gồm 548 dòng kết quả từ con đường sinh học CALVIN-PWY, bảo toàn 100% tính toàn vẹn của dữ liệu thuộc 3 trường thông tin gen cơ bản.

Thảo luận kết quả

Thành công của hệ thống bắt nguồn từ việc ứng dụng mô hình trung gian REST API xây dựng trên nền tảng Jersey 2.17 và Swagger 2.0. Kiến trúc này giúp tách biệt hoàn toàn người dùng khỏi cú pháp trừu tượng của SPARQL, giúp giảm thiểu ước tính hơn 70% lỗi cú pháp mà các nhà nghiên cứu thường gặp phải khi viết truy vấn thủ công trên máy chủ Virtuoso.

So với kiến trúc SADI vốn ràng buộc dữ liệu đầu vào và đầu ra nghiêm ngặt trong định dạng RDF/XML, giải pháp của luận văn linh hoạt hơn nhiều nhờ hỗ trợ đa định dạng đầu ra (JSON, TSV, HTML) và cung cấp tài liệu kiểm thử tương tác trực quan. Đối với việc trực quan hóa dữ liệu đồ thị, mối quan hệ phức tạp giữa gen AT3G25570 (adenosylmethionine decarboxylase) và 2 con đường sinh tổng hợp spermine, spermidine đã được biểu diễn trực quan qua biểu đồ mạng lưới RelFinder; trong khi đó, dữ liệu trích xuất từ quy trình Galaxy được cấu trúc rõ ràng dưới dạng bảng 3 cột chuẩn gồm mã định danh gen (geneId), tên gen (geneName) và danh pháp phân loại (taxon_name), hỗ trợ người dùng phân tích chuyên sâu một cách trực tiếp.

Đề xuất và khuyến nghị

Nhằm hoàn thiện và mở rộng phạm vi ứng dụng của hệ thống cơ sở tri thức AgroLD, 4 giải pháp chiến lược được đề xuất triển khai cụ thể:

Thứ nhất, tối ưu hóa hiệu năng tầng trung gian bằng cách triển khai cơ chế lưu đệm dữ liệu (caching) thông minh cho các truy vấn lặp lại và dịch vụ ngoài. Mục tiêu đặt ra là cắt giảm thời gian phản hồi của các truy vấn bên thứ ba từ mức 24 giây xuống dưới 2 giây, do đội ngũ kỹ thuật hệ thống tại Viện Sinh học Tính toán thực hiện trong thời hạn 6 tháng.

Thứ tư, mở rộng số lượng khái niệm và biểu mẫu tìm kiếm sinh học. Cần nâng cấp năng lực của biểu mẫu động từ 5 nhóm thực thể hiện tại lên 12 nhóm thực thể sinh học thực vật chuyên sâu, bổ sung dữ liệu vi mảng RiceXPro và dữ liệu yếu tố phiên mã Grassius, thực hiện trong khung thời gian 9 tháng dưới sự phối hợp của các chuyên gia nông học CIRAD.

Thứ ba, phát triển hoàn thiện mô-đun sinh câu truy vấn đồ họa trực quan (Visual SPARQL Query Builder) dựa trên khung kỹ thuật ReVeaLD. Giải pháp này hướng tới việc giúp 100% người dùng không am hiểu SPARQL có thể tự thiết lập các truy vấn đồ thị đa nguồn phức tạp, dự kiến hoàn thành trong 12 tháng bởi nhóm phát triển giao diện người - máy.

Thứ tư, nâng cấp hạ tầng phân giải tài nguyên bằng cách ứng dụng công nghệ TheDataTank hoặc phiên bản Pubby tối ưu. Mục tiêu là đảm bảo 100% các định danh URI nội bộ chưa dereference (như tiền tố gramene_association) đều được giải quyết tự động qua giao thức HTTP trong vòng 3 tháng tới do quản trị viên cơ sở dữ liệu chủ trì.

Đối tượng nên tham khảo luận văn

Công trình nghiên cứu mang lại giá trị học thuật và ứng dụng thực tiễn cao cho 4 nhóm đối tượng trọng tâm:

Các nhà sinh học thực vật và chuyên gia nông nghiệp: Cung cấp công cụ tìm kiếm trực quan giúp tra cứu đồng thời thông tin gen, protein, tính trạng cây trồng và tài liệu khoa học quốc tế chỉ trong 452 mili-giây mà không cần bất kỳ kỹ năng lập trình nào.

Kỹ sư tin sinh học và chuyên gia phân tích dữ liệu: Hướng dẫn chi tiết phương pháp khai thác RESTful API để tích hợp dữ liệu nông nghiệp quy mô lớn vào môi trường phân tích tự động Galaxy, xử lý nhanh chóng các tập dữ liệu lớn lên tới hàng trăm bản ghi.

Kiến trúc sư phần mềm và lập trình viên Web ngữ nghĩa: Cung cấp tài liệu tham khảo chi tiết về cách thiết kế hệ thống trung gian kết nối SPARQL Endpoint với REST API, kỹ thuật tạo tài liệu tương tác với Swagger 2.0 và quản lý giao diện soạn thảo YASGUI.

Học viên cao học và nghiên cứu sinh ngành Hệ thống thông minh: Đóng vai trò là tài liệu tham khảo chuẩn mực về phương pháp luận nghiên cứu, tích hợp dữ liệu dị thể, thiết kế bản thể học và đánh giá trải nghiệm người dùng trong các hệ thống thông tin sinh học hiện đại.

Câu hỏi thường gặp

Dự án AgroLD giải quyết thách thức cốt lõi nào trong lĩnh vực sinh học thực vật?
Hệ thống giải quyết triệt để tình trạng phân mảnh và cô lập dữ liệu giữa các cơ sở dữ liệu lớn như SouthGreen và Gramene. Bằng việc chuyển đổi dữ liệu sang chuẩn RDF và liên kết qua bản thể học GO, PO, EO, AgroLD tạo ra một điểm truy cập mở, duy nhất cho cộng đồng nghiên cứu thực vật học toàn cầu.

Người dùng không biết ngôn ngữ SPARQL có thể khai thác dữ liệu từ AgroLD không?
Hoàn toàn có thể. Luận văn đã xây dựng hệ thống biểu mẫu động (Advanced Search) và công cụ trực quan hóa RelFinder, cho phép người dùng chỉ cần thao tác qua giao diện web để trích xuất 5 nhóm thực thể sinh học và khám phá mối quan hệ giữa các gen mà không cần viết mã.

Kiến trúc REST API của luận văn có ưu điểm gì so với các chuẩn truyền thống như SADI?
Khác với SADI chỉ hỗ trợ duy nhất định dạng RDF/XML, REST API của AgroLD được xây dựng trên chuẩn Jersey 2.17 và Swagger 2.0, hỗ trợ xuất dữ liệu linh hoạt dưới các định dạng JSON, TSV, HTML và cung cấp giao diện thử nghiệm tương tác trực quan cho các lập trình viên.

Làm thế nào để đưa dữ liệu từ AgroLD vào các luồng phân tích tự động trên Galaxy?
Người dùng chỉ cần cài đặt công cụ webservice_toolsuite trên Galaxy và tải tệp cấu hình WADL của AgroLD. Hệ thống sẽ tự động chuyển đổi các dịch vụ REST thành các khối chức năng trong Galaxy, cho phép trích xuất tự động 548 dòng kết quả phân tích chỉ qua một thao tác kích hoạt.

Thời gian xử lý của hệ thống đối với các truy vấn tích hợp dữ liệu ngoại vi là bao lâu?
Đối với các tìm kiếm nhanh nội bộ, hệ thống phản hồi trong khoảng 452 mili-giây. Khi thực hiện tích hợp dữ liệu công bố khoa học từ các dịch vụ bên ngoài như G-Links và Europe PubMed Central, tổng thời gian phản hồi đạt khoảng 24 giây, đảm bảo cung cấp đầy đủ thông tin thư mục chính xác.

Kết luận

Luận văn thạc sĩ đã hoàn thành xuất sắc các mục tiêu nghiên cứu và đóng góp nhiều giá trị khoa học cho lĩnh vực dữ liệu liên kết nông nghiệp:

  • Xây dựng thành công lớp ứng dụng tích hợp đa phương thức cho cơ sở tri thức AgroLD, kết hợp hiệu quả 4 cơ chế tìm kiếm gồm: từ khóa nhanh, biểu mẫu động, đồ thị quan hệ và trình soạn thảo SPARQL nâng cao.
  • Thiết kế và chuẩn hóa hệ thống RESTful API với tài liệu tương tác Swagger 2.0, hỗ trợ đầy đủ 5 nhóm thực thể sinh học thực vật chủ chốt.
  • Tích hợp thành công dữ liệu mở ngữ nghĩa vào môi trường luồng công việc Galaxy, tự động hóa quy trình trích xuất bảng dữ liệu 548 bản ghi cho nghiên cứu tin sinh học.
  • Đề xuất lộ trình phát triển hệ thống toàn diện trong 12 tháng tới, bao gồm tối ưu hóa bộ nhớ đệm để hạ độ trễ xuống dưới 2 giây và mở rộng quy mô lên 12 nhóm thực thể.
  • Khẳng định tính khả thi của việc ứng dụng công nghệ Web ngữ nghĩa nhằm thúc đẩy quá trình số hóa và tích hợp tri thức khoa học cây trồng trên phạm vi toàn cầu.

Các nhà nghiên cứu, kỹ sư tin sinh học và học viên chuyên ngành hãy kết nối, tích hợp API của dự án AgroLD vào các đường ống phân tích thực nghiệm để tối ưu hóa hiệu suất nghiên cứu khoa học ngay hôm nay.