Chương 1. Tổng quan đề tài: Giới thiệu động lực, phát biểu bài toán, thách thức, mục tiêu nghiên cứu, đối tượng và phạm vi, kiến trúc đề tài, và đóng góp cho nghiên cứu. Cơ sở lý thuyết: Nền tảng lý thuyết về chuyền đôi từ ngôn ngữ tự nhiên sang ERD và SQL, bao gồm mô hình ERD và DDL, mô hình T5, và các phương pháp đánh giá. Phân tích và thực nghiệm: Phân tích và thực nghiệm giải pháp cho hai bài toán: Text to ERD va Text to SQL, bao gồm quy trình xây dựng và đánh giá các mô hình.
Thiết kế hệ thống và triển khai ứng dụng: Thiết kế hệ thống và triển khai ứng dụng, bao gồm thiết kế chức năng và xử lý, cùng với phương thức triển khai giao diện và API. Kết quả đạt được và hướng phát triển: Tóm tắt kết quả đạt được trong quá trình nghiên cứu, các hạn chế, và đề xuất hướng phát triển trong tương lai. TONG QUAN DE TÀI 1. Động lực nghiên cứu Trước sự phát triển nhanh chóng của công nghệ thông tin, việc tự động hóa quy trình thiết kế và triển khai cơ sở đữ liệu là cực kỳ cần thiết.
Kết hợp kỹ thuật xử lý ngôn ngữ tự nhiên và máy học dé tạo ra lược đồ cơ sở dữ liệu từ mô ta băng ngôn ngữ tự nhiên không chỉ giúp tiết kiệm thời gian và tài nguyên mà còn gia tăng tính linh hoạt và hiệu quả trong quản lý dữ liệu. Việc này mang lại lợi ích rõ rệt trong việc nâng cao hiệu suất làm việc và tăng cường chất lượng dịch vụ, từ đó gia tăng sự hài lòng của khách hàng. Trong lĩnh vực tự động hóa thiết kế và truy vấn cơ sở dữ liệu dựa trên ngôn ngữ tự nhiên đã từng được các nhà nghiên cứu đi trước đề xuất phương pháp và triển khai. Cụ thể đối với tự động hóa thiết kế cơ sở dữ liệu đã có Amani Abdel-Salam Al-Btoush từng mô tả phương pháp trích xuất ERD từ các câu văn Tiếng Anh [1], hay Esra A.
Abdelnabi và cộng sự từng trình bày phương pháp sinh ra lược đồ class sử dụng các kỹ thuật NLP và bộ quy tắc tự học [2]. Trong bài toán sinh ra câu lệnh truy vấn từ ngôn ngữ tự nhiên bằng tiếng Anh, nghiên cứu của Zefeng Cai, Xiangyu Li và cộng sự đã phát triển phương pháp tiền huấn luyện có hướng dẫn bởi SQL, sử dụng các tập dữ liệu như SPARC [3] và COSQL [4] do Đại học Yale phat triển, nhằm cải thiện độ chính xác và khả năng xử lý ngữ cảnh phức tạp của truy vấn SQL [5]. Bên cạnh đó, nghiên cứu của Victor Zhong, Caiming Xiong, và Richard Socher đã áp dụng học tăng cường trên tập dit liệu WikiSQL do Hugging Face [6] phát triển, giúp tối ưu hóa việc tạo ra câu lệnh SQL và cải thiện đáng kể hiệu suất của mô hình [7]. Những nghiên cứu đã cho thấy việc xử lý ngôn ngữ tự nhiên tiếng Anh trong lĩnh vực tự động hóa thiết kế cơ sở dữ liệu và sinh ra câu lệnh truy vấn từ ngôn ngữ tự nhiên đã trở nên rất phố biến và được ứng dụng rộng rãi.
Tuy nhiên, bên cạnh đó tiếng Việt là ngôn ngữ quan trọng được sử dụng rộng rãi tại Việt Nam và các cộng đồng người Việt trên toàn thế giới. Mặc dù đã có những nghiên cứu tiên phong của tác giả Anh Tuan Nguyen và cộng sự đã thử nghiệm về việc phân tích câu tiếng Việt và chuyền đổi chúng thành câu lệnh truy vấn cơ sở dữ liệu [8] hay một nghiên cứu khác tập trung vào việc khảo sát và so sánh hiệu suất của các mô hình ngôn ngữ được tiền huấn luyện và các phương pháp học khác nhau trong việc phân tích nghĩa và chuyên đồi văn bản tiếng Việt thành câu lệnh SQL của nhóm tác giả Nhan Cao Thi, Y Thien Huynh va Nhat Viet Nguyen [9], những nghiên cứu này đã đóng góp quan trọng vào việc nghiên cứu và phát triển công nghệ ngôn ngữ cho tiếng Việt. Tuy nhiên nhìn tổng quan, sự phát triển công nghệ đề hiểu và xử lý ngôn ngữ tự nhiên tiếng Việt trong tự động hóa hệ thống quản lý cơ sở dữ liệu và truy van từ ngôn ngữ tự nhiên vẫn còn rất hạn chế. Vì vậy, phát triển hệ thống hỗ trợ xử lý ngôn ngữ tự nhiên tiếng Việt sang ERD (Entity- Relationship Diagram), DDL (Data Definition Language), va SQL (Structured Query Language) dang trở nên ngày càng cần thiết trong lĩnh vực công nghệ thông tin va quản lý dữ liệu.
Việc xây dựng hệ thống tự động chuyên đồi từ các văn bản hay câu mô tả bằng ngôn ngữ tự nhiên tiếng Việt thành các biéu đồ ERD, các câu lệnh DDL đề định nghĩa cấu trúc dữ liệu, và các câu truy van SQL dé truy xuất dữ liệu sẽ giúp giảm thiểu sự phụ thuộc vào ngôn ngữ kỹ thuật và tăng tính linh hoạt trong quản lý cơ sở dữ liệu. Đây là một bước tiễn quan trọng giúp cải thiện hiệu quả và chính xác trong quản lý thông tin, đồng thời mở rộng phạm vi ứng dụng của công nghệ dữ liệu trong các lĩnh vực đa dạng từ doanh nghiệp đến giáo dục và nghiên cứu. Bằng cách nghiên cứu áp dụng các phương pháp và kĩ thuật xử lý ngôn ngữ tự nhiên tiếng Việt, ta có thể tự động hóa các giai đoạn phức tạp trong quá trình thiết kế và triển khai cơ sở dữ liệu, bao gồm phân tích yêu cầu và tạo ra các lệnh dé tạo bảng, ràng buộc và các câu lệnh truy vấn dữ liệu. Điều này không chỉ giúp giảm bớt gánh nặng công việc cho các chuyên viên cơ sở dữ liệu mà còn tạo ra một quy trình làm việc hiệu quả và nhất quán.
Phát biểu bài toán 1. Bài toán 1 - Text to ERD Đâu vào: Một văn bản tiêng Việt mô tả cơ sở dữ liệu. Đầu ra: Mã PlantUML (PlantUML là một công cụ hỗ trợ vẽ các lược đồ UML và non-UML với bộ mã có quy tắc riêng) mô phỏng ERD theo mô tả tiếng Việt của người dùng, ảnh ERD được tạo ra từ mã PlantUML và các câu DDL tương ứng với cơ sở dữ liệu đó. Nhiệm vụ xử lý: e Chuyển đối đoạn văn mô tả sang các câu văn theo chuẩn rule-based mẫu.
e Xác định các phân tử ERD trong câu văn chuân rule-based va sinh ra mã PlantUML tương ứng. e Sinh ra các câu DDL xây dựng cơ sở dữ liệu từ cầu trúc ERD tương ứng. Bài toán 2 - Text to SQL Đầu vào: Đây là câu hỏi truy vấn bằng ngôn ngữ tự nhiên, được viết bằng tiếng Việt, mà người dùng muốn chuyên đổi thành câu truy van SQL. Đầu ra: câu truy van SQL tương ứng với câu hỏi tiếng Việt, có thé chạy trực tiếp trên cơ sở dữ liệu dé lấy ra kết quả mong muốn.
Nhiệm vụ xử lý: e Tiền xử lý dữ liệu: Xử lý câu hỏi tiếng Việt dé chuẩn hóa, loại bỏ các ký tự không can thiết, và biến đổi các từ viết tắt thành dạng day đủ. e_ Mã hóa câu hỏi: Sử dụng mô hình T5 dé mã hóa câu hỏi tiếng Việt thành các biểu diễn số học (embeddings). e Sinh câu truy van SQL: Sử dụng mô hình T5 để giải mã các biéu diễn số học này thành câu truy vấn SQL. e Hậu xử lý: Kiểm tra và sửa lỗi cú pháp trong câu truy van SQL dé đảm bảo tính chính xác và hiệu quả khi thực thi.
Thách thức e Tiêng Việt có ít tài nguyên được nghiên cứu san ở lĩnh vực này hơn so với Tiêng Anh, chăng hạn như các mô hình xử lí ngôn ngữ tự nhiên và đoạn văn mô tả thiết kế cơ sở dữ liệu. Điều này dẫn đến việc thiếu hụt bộ đữ liệu Tiếng Việt dé train các mô hình cho cả 2 bài toán. e Sự đa dạng cấu trúc câu và trật tự sắp xếp từ trong Tiếng Việt cũng là một thách thức khá lớn trong việc thu thập dữ liệu. Cần phải lựa chọn các đoạn văn mô tả thé hiện rõ ý các thành phần ERD trên mặt chữ dé có thé xác định và train cho mô hình đạt được kết quả tốt nhất.
e Việc áp dụng các phương pháp va kỹ thuật xử lí ngôn ngữ tự nhiên đã được đề xuất từ Tiếng Anh đề tự động hóa thiết kế cơ sở dữ liệu và sinh ra câu lệnh truy vấn từ Tiếng Việt đòi hỏi chuyên môn sâu về ngôn ngữ và các lĩnh vực liên quan vì tính đa dạng sắc thái trong ngôn ngữ của Tiếng Việt. Mục tiêu nghiên cứu e Xây dựng được bộ mã nguồn có thể tự động chuyển đổi văn bản mô tả hệ thống bằng ngôn ngữ tự nhiên tiếng Việt sang lược đồ thực thể mối kết hợp (ERD) thông qua đoạn mã PlantUML đồng thời sinh ra được các câu lệnh định nghĩa dữ liệu (DDL) tạo bảng, khóa và các ràng buộc tương ứng với văn bản mô tả hệ thống. Bộ mã nguồn này sẽ trở thành một công cụ giúp người dùng tiết kiệm thời gian vẽ và tập trung hơn cho việc phát triển hệ thống, góp phần cải thiện hiệu suất làm việc. e Xây dựng được bộ mã nguồn có thé tự động chuyên đổi câu truy van bang ngôn ngữ tự nhiên tiếng Việt thành câu lệnh truy van dữ liệu (SQL) dé truy van cơ sở dữ liệu một cách tự động và hiệu quả.
e Phát triển ứng dụng web để người dùng có thé tương tác với công cụ thông qua giao diện người dùng (UI). Điều này sẽ giúp người dùng có thé tiếp cận và sử dụng công cụ một cách trực quan và dễ dàng hơn so với việc thực thi các lệnh trực tiếp trên bộ mã nguồn. Đối tượng và phạm vi nghiên cứu 1. Đối tượng nghiên cứu Các phương pháp và mô hình để phân tích câu mô tả, nhận diện và xác định các thực thể, các mối quan hệ giữa chúng, và các thuộc tính của các thực thê để sinh ra lược đồ thực thể mối kết hợp (ERD) và các câu lệnh định nghĩa dữ liệu (DDL).
Các phương pháp va mô hình dé hiểu và ánh xạ các yêu cầu truy van từ ngôn ngữ tự nhiên thành các câu lệnh SQL phù hợp. Phạm vi nghiên cứu 1. Bài toán 1 — Text To ERD Thu thập các tài liệu hoặc đoạn văn mô tả hệ thống cơ sở dữ liệu bằng ngôn ngữ tự nhiên. Sử dụng kỹ thuật xử lý ngôn ngữ tự nhiên (NLP) như Rule-based, heuristics rule và machine learning như mô hình transformer (theo kiến trúc mT5), mô hình pre-trained “VietA1/vit5-base” cho ngôn ngữ tiếng Việt, kiến trúc BERT cho đa ngôn ngữ.
Kiểm tra tính chính xác và độ hoàn thiện của mô thông qua các độ đo Expert (chuyên gia), ROUGE. Sử dụng PlantUML dé vẽ ERD bang các cú pháp đơn giản và dé hiéu.