Tổng quan nghiên cứu

Trong kỷ nguyên kinh tế số và phát triển đô thị thông minh, dữ liệu mở đóng vai trò là nguồn tài nguyên đầu vào cốt lõi cho hàng ngàn ứng dụng và hệ sinh thái đa dịch vụ. Theo ước tính từ các báo cáo công nghệ thông tin, hơn 75% các hệ thống phân tích dữ liệu lớn và trí tuệ nhân tạo hiện nay phụ thuộc vào các nguồn dữ liệu chia sẻ công cộng. Tuy nhiên, sự phát triển nhanh chóng của các kho dữ liệu mở đi kèm với thách thức lớn về tính xác thực và chất lượng. Có đến khoảng 68% người dùng và tổ chức bày tỏ sự lo ngại về việc dữ liệu bị chỉnh sửa trái phép, thiếu thông tin lịch sử thay đổi hoặc bắt nguồn từ các nguồn không đáng tin cậy.

Vấn đề nghiên cứu trọng tâm được đặt ra là sự thiếu hụt một cơ chế bảo vệ tính toàn vẹn và truy vết xuất xứ dữ liệu mà không cần phụ thuộc vào bên thứ ba tập trung. Để giải quyết triệt để vấn đề này, luận văn tập trung vào mục tiêu thiết kế và hiện thực hóa mô hình tích hợp công nghệ chuỗi khối với nền tảng dữ liệu mở, cụ thể là kết hợp giữa nền tảng CKAN và mạng lưới chuỗi khối doanh nghiệp Hyperledger Fabric.

Phạm vi nghiên cứu được thực hiện tại Trường Đại học Bách Khoa thuộc Đại học Quốc gia Thành phố Hồ Chí Minh, với khung thời gian triển khai từ ngày 11 tháng 02 năm 2019 đến ngày 08 tháng 12 năm 2019. Đề tài mang ý nghĩa thực tiễn to lớn khi thiết lập một khung quản trị dữ liệu tin cậy cao, đảm bảo 100% các thao tác thay đổi dữ liệu đều được ghi nhận bất biến và nâng tỷ lệ chính xác trong truy xuất nguồn gốc đạt mức tuyệt đối.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng trên nền tảng của 3 khung lý thuyết và mô hình công nghệ chính:

Khung mô hình siêu dữ liệu nguồn gốc theo chuẩn W3C PROV cung cấp cấu trúc chuẩn hóa quốc tế để mô tả lịch sử xuất xứ của dữ liệu. Mô hình này bao gồm 3 thành phần cốt lõi là Thực thể (Entity), Hoạt động (Activity), Tác nhân (Agent) cùng 5 mối quan hệ nền tảng gồm Tạo ra (wasGeneratedBy), Sử dụng (used), Dẫn xuất (wasDerivedFrom), Liên hệ (wasAttributedTo) và Liên kết (wasAssociatedWith). Thông tin nguồn gốc được biểu diễn qua 4 định dạng chuyển đổi linh hoạt gồm PROV-N, PROV-XML, PROV-O và PROV-JSON.

Khung kiến trúc chuỗi khối phân quyền Hyperledger Fabric là nền tảng chuỗi khối cấp doanh nghiệp do Linux Foundation bảo trợ. Khác với các mạng chuỗi khối công khai, Hyperledger Fabric sử dụng hệ thống Nhà phát hành chứng chỉ số để quản lý định danh người dùng theo chuẩn X.509, vận hành cơ chế đồng thuận 3 giai đoạn chặt chẽ gồm Chứng thực (Endorsement), Sắp xếp (Ordering) và Xác nhận cam kết (Validation and Commitment). World state của sổ cái phân tán được lưu trữ linh hoạt trên cơ sở dữ liệu LevelDB hoặc CouchDB.

Nền tảng dữ liệu mở mã nguồn mở CKAN được phát triển bởi tổ chức Open Knowledge Foundation, quản lý tài nguyên thông qua cấu trúc Bộ dữ liệu (Datasets) và Tệp tài nguyên (Resources) với sự hỗ trợ của hơn 60 phần mở rộng độc lập.

Phương pháp nghiên cứu

Nghiên cứu sử dụng nguồn dữ liệu thực nghiệm gồm 100 bộ dữ liệu mở đa dạng cấu trúc và hơn 500 tệp tài nguyên thành phần ở các định dạng phổ biến như CSV, JSON, XML và PDF. Phương pháp chọn mẫu được áp dụng là phương pháp chọn mẫu ngẫu nhiên phân tầng, nhằm bao phủ đầy đủ các kích thước tệp từ vài kilobyte đến hàng trăm megabyte trên nhiều lĩnh vực khác nhau như kinh tế, giao thông và giáo dục.

Lý do lựa chọn phương pháp phân tích thực nghiệm và kiểm thử chức năng chuyên sâu là để đánh giá chính xác độ trễ giao dịch, thông lượng xử lý và khả năng phục hồi dữ liệu trong môi trường phân tán thực tế. Tiến trình nghiên cứu được triển khai chặt chẽ trong vòng 10 tháng, chia làm 3 giai đoạn chính: khảo sát mô hình lý thuyết trong 3 tháng đầu, xây dựng kiến trúc tích hợp và lập trình hợp đồng thông minh trong 4 tháng tiếp theo, và tiến hành kiểm thử hiệu năng, mô phỏng tấn công giả mạo dữ liệu trong 3 tháng cuối.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thực nghiệm và đánh giá hệ thống đã mang lại 4 phát hiện quan trọng:

Thứ nhất, việc tích hợp thành công tiện ích mở rộng Webhook kết hợp với cơ chế hàng đợi xử lý chạy nền Redis Queue trên CKAN đã giúp tự động hóa 100% quy trình bắt sự kiện thay đổi dữ liệu, đạt tỷ lệ đồng bộ hóa thành công lên chuỗi khối là 99,8% với thời gian phản hồi trung bình chỉ 180 mili-giây.

Thứ hai, việc sử dụng cơ sở dữ liệu CouchDB thay cho LevelDB trong lưu trữ trạng thái thế giới của chuỗi khối đã giúp tăng tốc độ xử lý các truy vấn siêu dữ liệu phức tạp lên 35%, đồng thời cho phép trích xuất lịch sử phả hệ dữ liệu qua hơn 10 phiên bản sửa đổi mà không làm suy giảm hiệu năng hệ thống.

Thứ ba, thử nghiệm kiểm tra tính bất biến và khả năng chống giả mạo chứng minh tính ưu việt vượt trội của hệ thống. Khi cố tình can thiệp chỉnh sửa dữ liệu trực tiếp tại 1 nút cơ sở dữ liệu CouchDB cục bộ, mạng lưới chuỗi khối đã ngay lập tức phát hiện sự sai lệch thông qua mã băm mật mã và tự động khôi phục lại 100% trạng thái dữ liệu chuẩn xác từ 3 nút mạng còn lại trong vòng chưa đầy 1,5 giây.

Thứ tư, hệ thống đã chuẩn hóa và xuất thành công thông tin xuất xứ dữ liệu sang 4 định dạng chuẩn quốc tế của W3C PROV, đồng thời tạo ra các sơ đồ trực quan hóa đồ thị phả hệ dữ liệu dưới dạng tệp PDF với độ chính xác cấu trúc đạt 100%.

Thảo luận kết quả

Nguyên nhân chính dẫn đến sự thành công của mô hình là nhờ tận dụng triệt để kiến trúc module hóa của Hyperledger Fabric kết hợp với tính năng xử lý hàng đợi bất đồng bộ. Khác với các giải pháp trên chuỗi khối công khai như DataProv dựa trên Ethereum vốn có chi phí giao dịch cao và độ trễ từ 15 đến 30 giây mỗi giao dịch, giải pháp trong luận văn hoàn toàn không mất phí vận hành mạng và rút ngắn thời gian xác nhận giao dịch xuống dưới 1 giây. So với mô hình ProvChain, giải pháp này không bị phụ thuộc vào một nhà cung cấp đám mây đơn lẻ mà tạo ra một cổng giao tiếp định danh mở cho nhiều nền tảng cùng tham gia.

Các kết quả kiểm thử có thể được trình bày rõ ràng thông qua biểu đồ đường thể hiện độ trễ đồng bộ dữ liệu theo thời gian thực và bảng ma trận đối chiếu quyền hạn truy cập của các tổ chức thành viên. Biểu đồ phả hệ trực quan giúp người dùng dễ dàng quan sát từng nhánh phát triển của bộ dữ liệu từ tệp tin gốc ban đầu đến các phiên bản phái sinh mới nhất.

Đề xuất và khuyến nghị

Nhằm tối ưu hóa và đưa kết quả nghiên cứu vào ứng dụng thực tiễn trên diện rộng, 4 giải pháp chiến lược sau đây được đề xuất:

Xây dựng và ban hành bộ chuẩn giao tiếp cổng thông tin dữ liệu mở thống nhất cho các cơ quan chính phủ điện tử. Mục tiêu cụ thể là rút ngắn thời gian tích hợp các cổng dữ liệu mở cấp tỉnh, thành phố xuống dưới 24 giờ cho mỗi hệ thống. Thời gian thực hiện dự kiến trong 6 tháng đầu năm, do Bộ Thông tin và Truyền thông chủ trì phối hợp cùng các đơn vị chuyên trách công nghệ thông tin.

Tối ưu hóa hiệu năng mã chuỗi (Chaincode) và kiến trúc hàng đợi thông điệp phân tán. Mục tiêu là nâng công suất xử lý đạt mức trên 1.500 giao dịch mỗi giây và giảm độ trễ ghi nhận xuống dưới 100 mili-giây. Lộ trình triển khai thực hiện trong 9 tháng tiếp theo, do đội ngũ kiến trúc sư hệ thống và kỹ sư phần mềm đảm nhiệm.

Triển khai quy trình tự động nặc danh hóa dữ liệu nhạy cảm theo tiêu chuẩn bảo vệ dữ liệu cá nhân quốc tế trước khi lưu vết lên sổ cái. Mục tiêu đảm bảo 100% dữ liệu y tế và định danh công dân không bị tái định danh trái phép, tuân thủ nghiêm ngặt các quy định pháp luật hiện hành. Thời gian hoàn thiện trong vòng 12 tháng, do các chuyên gia bảo mật và quản trị dữ liệu thực hiện.

Mở rộng giao diện người dùng trực quan hóa dữ liệu xuất xứ tương tác trên nền tảng web và di động. Mục tiêu giúp người dùng không chuyên có thể kiểm tra nguồn gốc dữ liệu chỉ bằng 1 thao tác nhấn chuột và giảm 80% thời gian tra cứu. Kế hoạch triển khai hoàn thành trong 3 tháng, do nhóm phát triển trải nghiệm người dùng thực hiện.

Đối tượng nên tham khảo luận văn

Nội dung luận văn mang lại giá trị thực tiễn và học thuật sâu sắc cho 4 nhóm đối tượng sau:

Cán bộ quản trị dữ liệu và chuyên gia phụ trách cổng thông tin chính phủ điện tử: Nhận được bản thiết kế kiến trúc hoàn chỉnh để xây dựng kho dữ liệu mở minh bạch, ứng dụng cho các hệ thống quản lý hơn 10.000 bộ dữ liệu công cộng của địa phương.

Kỹ sư phát triển phần mềm và kiến trúc sư giải pháp chuỗi khối: Tiếp cận chi tiết phương pháp lập trình Chaincode trên Hyperledger Fabric, kỹ thuật xây dựng plugin trên CKAN và phương thức kết nối các tiến trình bằng Node.js và Python.

Giảng viên, nghiên cứu sinh và học viên cao học chuyên ngành Khoa học máy tính: Tìm thấy tài liệu tham khảo chất lượng cao với hơn 20 tài liệu nghiên cứu chuyên sâu về chuẩn W3C PROV, kỹ thuật bảo vệ tính toàn vẹn dữ liệu và các giải pháp chống giả mạo phân tán.

Doanh nghiệp và tổ chức khai thác dữ liệu số, trí tuệ nhân tạo: Nắm bắt phương pháp thẩm định tính đúng đắn của dữ liệu đầu vào cho các mô hình học máy, giúp giảm thiểu 95% rủi ro do sử dụng phải các tập dữ liệu sai lệch hoặc không rõ nguồn gốc.

Câu hỏi thường gặp

Nền tảng CKAN đóng vai trò gì trong kiến trúc giải pháp đề xuất? Nền tảng CKAN đóng vai trò là hệ thống lưu trữ và quản lý dữ liệu mở đầu cuối, nơi người dùng tải lên các bộ dữ liệu và tệp tài nguyên. CKAN cung cấp giao diện quản lý và các điểm kết nối webhook để bắt trọn vòng đời thay đổi của dữ liệu, chuyển tiếp sang chuỗi khối xử lý.

Tại sao luận văn lại lựa chọn Hyperledger Fabric thay vì Ethereum hay Bitcoin? Hyperledger Fabric là chuỗi khối phân quyền có tốc độ xử lý vượt trội đạt trên 1.000 giao dịch mỗi giây, không tốn phí giao dịch và hỗ trợ bảo mật danh tính qua chứng chỉ X.509. Điều này hoàn toàn phù hợp với môi trường doanh nghiệp và các tổ chức quản lý dữ liệu mở công cộng.

Chuẩn W3C PROV giải quyết vấn đề gì trong quản lý nguồn gốc dữ liệu? Chuẩn W3C PROV cung cấp mô hình ngữ nghĩa chung gồm 3 thực thể và 5 mối quan hệ, giúp chuẩn hóa toàn bộ thông tin về người tạo, thời gian sửa đổi và công cụ xử lý. Nhờ đó, các hệ thống khác nhau có thể dễ dàng trao đổi và diễn giải dữ liệu xuất xứ.

Hệ thống phản ứng như thế nào khi một nút dữ liệu bị can thiệp và sửa đổi trái phép? Nhờ cơ chế đồng thuận phân tán, khi một nút cơ sở dữ liệu bị sửa đổi nội dung, hệ thống sẽ phát hiện sự không trùng khớp về mã băm và tự động khôi phục 100% dữ liệu chính xác từ các nút mạng trung thực còn lại trong vòng 1,5 giây.

Người dùng phổ thông có cần cài đặt phần mềm chuỗi khối để kiểm tra nguồn gốc dữ liệu không? Người dùng hoàn toàn không cần cài đặt phần mềm chuỗi khối phức tạp. Toàn bộ thông tin lịch sử và phả hệ dữ liệu được cổng thông tin trích xuất tự động qua các API và hiển thị dưới dạng biểu đồ đồ họa hoặc tệp tài liệu PDF thân thiện trên trình duyệt web.

Kết luận

  • Luận văn đã thiết kế và hiện thực hóa thành công mô hình tích hợp toàn diện giữa nền tảng dữ liệu mở CKAN và chuỗi khối Hyperledger Fabric, giải quyết triệt để bài toán quản lý nguồn gốc dữ liệu.
  • Chuẩn hóa toàn bộ cấu trúc siêu dữ liệu xuất xứ theo tiêu chuẩn quốc tế W3C PROV, đảm bảo đầy đủ 5 thuộc tính an toàn gồm tính bảo mật, tính toàn vẹn, không thể làm giả, không thể chối cãi và tính sẵn sàng cao.
  • Kết quả thực nghiệm khẳng định hệ thống đạt độ tin cậy 99,8%, thời gian phản hồi dưới 180 mili-giây và khả năng tự động phục hồi dữ liệu hoàn hảo trước các cuộc tấn công thay đổi dữ liệu cục bộ.
  • Lộ trình phát triển trong 12 tháng tới sẽ tiếp tục mở rộng khả năng tương thích của giải pháp sang các nền tảng dữ liệu mở phổ biến khác như Socrata và OGDI-DataLab.
  • Các cơ quan quản lý nhà nước và doanh nghiệp công nghệ hãy chủ động ứng dụng khung giải pháp này để xây dựng một môi trường dữ liệu mở minh bạch, bền vững và an toàn tuyệt đối.