Luận Văn Thạc Sĩ: Xây Dựng Mô Hình Xác Định Chủ Đề Cho Câu Truy Vấn Trong Khoa Học Máy Tính

Luận văn thạc sĩ khoa học máy tính tập trung xây dựng mô hình xác định chủ đề cho câu truy vấn, ứng dụng trong xử lý ngôn ngữ tự nhiên và tìm kiếm thông tin.

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

luận văn thạc sĩ

2012

90
1
0

Phí lưu trữ

30 Point

Tóm tắt

I. Xây dựng mô hình xác định chủ đề cho câu truy vấn

Luận văn tập trung vào xây dựng mô hình để xác định chủ đề cho câu truy vấn trong lĩnh vực khoa học máy tính. Mục tiêu chính là tăng độ chính xác của các hệ thống tìm kiếm thông tin bằng cách xác định chủ đề của câu truy vấn và sử dụng các cụm từ đặc trưng làm từ khóa. Mô hình xác định chủ đề được xây dựng dựa trên phương pháp Support Vector Machines (SVM)ontology để xác định các cụm từ đặc trưng. Điều này giúp cải thiện hiệu quả tìm kiếm thông tin trên các cơ sở dữ liệu cục bộ.

1.1. Phương pháp phân lớp dữ liệu

Luận văn sử dụng phương pháp phân lớp dữ liệu để xác định chủ đề của câu truy vấn. Phân lớp chủ đề được thực hiện thông qua mô hình học máy dựa trên SVM. Phương pháp này giúp phân loại câu truy vấn vào các chủ đề cụ thể, từ đó xác định cơ sở dữ liệu phù hợp để tìm kiếm thông tin. Phân lớp dữ liệu là bước quan trọng trong việc tối ưu hóa hiệu suất tìm kiếm.

1.2. Xây dựng ontology chủ đề

Ontology chủ đề được xây dựng để xác định các cụm từ đặc trưng trong câu truy vấn. Ontology giúp mô hình hóa các mối quan hệ ngữ nghĩa giữa các từ khóa, từ đó nâng cao khả năng xác định chủ đề. Việc sử dụng ontology trong xử lý ngôn ngữ tự nhiên giúp hệ thống hiểu rõ hơn về ngữ nghĩa của câu truy vấn, từ đó cải thiện độ chính xác của kết quả tìm kiếm.

II. Hiện thực mô hình và đánh giá hiệu quả

Luận văn trình bày quá trình hiện thực mô hình và đánh giá hiệu quả của hệ thống. Mô hình xác định chủ đề được xây dựng dựa trên học máyphân tích dữ liệu, sử dụng các thuật toán như SVM để phân lớp chủ đề. Hệ thống được đánh giá thông qua các thử nghiệm với các hàm nhân khác nhau, bao gồm hàm nhân tuyến tính, RBF, đa thức và sigmoid. Kết quả cho thấy mô hình học máy dựa trên SVM đạt hiệu quả cao trong việc xác định chủ đề.

2.1. Tạo mô hình bằng giải thuật SMO

Giải thuật Sequential Minimal Optimization (SMO) được sử dụng để tạo mô hình học máy. SMO là một phương pháp hiệu quả để giải quyết bài toán tối ưu trong SVM, giúp tăng tốc độ huấn luyện và cải thiện độ chính xác của mô hình. Kết quả thử nghiệm cho thấy SMO phù hợp với bài toán phân lớp chủ đề trong khoa học máy tính.

2.2. Đánh giá hiệu quả của ontology

Ontology chủ đề được đánh giá thông qua các thử nghiệm để đo lường độ chính xác trong việc xác định các cụm từ đặc trưng. Kết quả cho thấy ontology giúp cải thiện đáng kể hiệu suất của hệ thống, đặc biệt trong việc xử lý các câu truy vấn phức tạp. Ontology cũng giúp hệ thống hiểu rõ hơn về ngữ nghĩa của các từ khóa, từ đó nâng cao chất lượng tìm kiếm thông tin.

III. Ứng dụng và hướng phát triển

Luận văn không chỉ dừng lại ở việc xây dựng mô hình mà còn đề xuất các ứng dụng thực tiễnhướng phát triển trong tương lai. Mô hình xác định chủ đề có thể được áp dụng trong các hệ thống tìm kiếm thông tin, xử lý ngôn ngữ tự nhiêntrí tuệ nhân tạo. Các hướng phát triển bao gồm cải tiến mô hình học máy, mở rộng ontology và tích hợp các phương pháp phân tích dữ liệu tiên tiến để nâng cao hiệu quả của hệ thống.

3.1. Ứng dụng trong tìm kiếm thông tin

Mô hình xác định chủ đề có thể được tích hợp vào các hệ thống tìm kiếm thông tin để cải thiện độ chính xác của kết quả tìm kiếm. Bằng cách xác định chủ đề của câu truy vấn và sử dụng các cụm từ đặc trưng làm từ khóa, hệ thống có thể trả về các tài liệu liên quan một cách chính xác hơn. Điều này đặc biệt hữu ích trong các lĩnh vực chuyên ngành như khoa học máy tínhkhoa học dữ liệu.

3.2. Hướng phát triển trong tương lai

Luận văn đề xuất các hướng phát triển trong tương lai, bao gồm việc cải tiến mô hình học máy bằng cách sử dụng các thuật toán tiên tiến hơn như deep learning. Ngoài ra, việc mở rộng ontology để bao quát nhiều lĩnh vực hơn cũng là một hướng đi tiềm năng. Các phương pháp phân tích dữ liệu mới cũng có thể được áp dụng để nâng cao hiệu quả của hệ thống trong việc xác định chủ đề và tìm kiếm thông tin.

21/02/2025

Trích đoạn nội dung tài liệu

DAI HOC QUOC GIA TP. HO CHi MINH TRUONG DAI HOC BACH KHOA TONG VAN HAI XÂY DỰNG MÔ HÌNH XÁC ĐỊNH CHỦ ĐÈ CHO CÂU TRUY VẤN CHUYÊN NGÀNH: KHOA HỌC MÁY TÍNH MÃ SÓ CHUYÊN NGÀNH: 60.01 LUẬN VĂN THẠC SĨ TP. Hồ Chí Minh, tháng 6 năm 2012 CÔNG TRÌNH ĐƯỢC HOÀN THÀNH TẠI TRUONG ĐẠI HỌC BÁCH KHOA -ĐHQG -HCM Cán bộ hướng dẫn khoa học: PGS.TS Phan Thị Tươi Cán bộ chấm nhận xét 1: TS Nguyễn Chánh Thành Cán bộ chấm nhận xét 2: TS Huỳnh Tường Nguyên Luận văn thạc sĩ được bảo vệ tại HỘI ĐỒNG CHÁM BẢO VỆ LUẬN VĂN THẠC SĨ TRUONG DAI HOC BACH KHOA, ngay 18 thang 7 nim 2012 Thành phần Hội đồng đánh giá luận văn thạc sĩ gồm: 1.TS Cao Hoàng Trụ (CT) 2. TS Nguyễn Chánh Thành (PBI) 3.

TS Huỳnh Tường Nguyên (PB2) 4.TS Phan Thị Tươi (UV) 5. TS Nguyễn Hứa Phùng (TK) Xác nhận của Chủ tịch Hội đồng đánh giá luận văn và Trưởng Khoa quản lý chuyên ngành sau khi luận văn đã sửa chữa. CHỦ TỊCH HỘI ĐÒNG TRƯỞNG/PHÓ KHOA (Họ tên và chữ ký) (Họ tên và chữ ký) PGS.TS Cao Hoàng Trụ TRUONG DH BACH KHOA TP. HCM CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM PHONG DAO TAO SDH Độc lập - Tự do - Hạnh phúc Tp.

HCM, ngày tháng năm 2012 NHIỆM VỤ LUẬN VĂN THẠC SĨ Họ tên học viên: Tống Văn Hải Phái: Nam Ngày, tháng, năm sinh: 15/09/1986 Noi sinh: Ninh Binh Chuyén nganh: Khoa hoc may tinh MSHV: 10070477 1. TEN DE TAT: XÂY DỰNG MÔ HÌNH XÁC ĐỊNH CHỦ ĐỀ CHO CÂU TRUY VÁN. NHIỆM VỤ LUẬN VĂN: — _ Tìm hiểu các phương pháp phân lớp dữ liệu. o_ Xây dựng bộ phân lớp chủ đề cho câu truy van.

— Tim hiéu cach x4y dung ontology. o Xay dung ontology chủ dé với mục đích xác định cụm danh từ đặc trưng thuộc lớp chủ đề xác định. NGÀY GIAO NHIỆM VỤ: 4. NGÀY HOÀN THÀNH NHIỆM VỤ: 5.

HỌ VÀ TÊN CÁN BỘ HƯỚNG DẪN: PGS.TS Phan Thị Tươi CÁN BỘ HƯỚNG DẪN CHỦ NHIỆM BỘ MÔN QUẢN LÝ CHUYÊN NGÀNH (Họ tên và chữ ký) (Họ tên và chữ ký) PGS.TS Phan Thị Tươi LỜI CÁM ƠN Đầu tiên, tôi muốn gửi lời cảm ơn sâu sắc nhất đến PGS.TS Phan Thị Tươi. Cô đã tận tình hướng dẫn và chỉ bảo tôi trong suốt quá trình hoàn thành luận văn. Tôi xin cảm ơn TS Nguyễn Chánh Thành đã cung cấp cho tôi những tài liệu tham khảo có liên quan đến đề tài luận văn này. Tôi cũng xin chân thành cảm ơn đến tất cả các thầy cô trong Khoa Khoa Học & Kỹ Thuật Máy Tính, Trường Đại Học Bách Khoa TP.

Hồ Chí Minh đã truyền đạt những kiến thức quý báu trong quãng thời gian tôi học tập tại đây. TOM TAT Cùng với sự phát triển mạnh mẽ của World Wide Web, nguồn thông tin chia sẻ trên Internet ngày càng trở nên phong phú và đa dạng hơn. Đối với các hệ thống tìm kiếm thông tin theo từ khóa ngày nay thường trả về gồm cả những tài liệu có nội dung không liên quan đến thông tin cần tìm kiếm. Chính vì điều này, luận văn đã đi nghiên cứu và xây dựng một mô hình xác định chủ đề cho câu truy vấn.

Ở đây, chủ đề của câu truy vấn được hiểu là câu truy vấn đang nói đến thuộc lĩnh vực nảo. Tuy nhiên, luận văn sẽ không chỉ dừng lại ở bước xác định chủ đề. Vì nếu dừng lại ở bước này và coi toàn bộ câu truy vấn như là một từ khóa để tìm kiếm tài liệu trên cơ sở dữ liệu cục bộ thì hiệu quả không cao bởi vì câu truy vấn là một chuỗi các ký tự thường có độ dài lớn. Vì vậy, bước tiếp theo chúng ta cần phải xác định xem những cụm từ đặc trưng nào xuất hiện trong câu truy vấn và sử dụng những cụm từ đặc trưng này như là từ khóa (thay vì toàn bộ cá câu truy vấn) để tìm kiếm tài liệu trên cơ sở dữ liệu cục bộ sẽ đem lại hiệu quả cao hơn.

1H ABSTRACT Along with the strong development of Word Wide Web, flows of information shared on the Internet are getting more and more in its variety. Today’s Information Retrieval Systems by key words give out lots of results including unexpected and unrelated ones. Therefore, this research studies and builds a model defining topics for queries. In this research, topic for a query is understood as the query is about what kind of topic or field.

However, defining the topics is just a partial step but the destination of the research. If the research stops at this step and the whole query is considered key words to retrieve information based on local data, it might not work with high effectiveness as a query is a chain of letters of length. Thus, the next step we need to define which distinct phrases should be included in the query and be used as key words (instead of as the whole query) to retrieve local database; then the effectiveness of searching information would be high. 1H MỤC LỤC LỜI CẢM ƠN "y1 ~.,ÔỎ ii ca mẽ.2 Đề tài nghiên cứu .-- << s©s° se ©+sEE4 32A4 E39Ex3EEAEEAEAEE4 13 751912413737scxe 1 1.3 Các nghiên cứu liên quan.1 Những vấn đề nghiên cứu trong nước.2 Các nghiên cứu ngoài TưỚCC .-- << 5= 24 s91 S54 498588 4880848508808 056 4 CHƯƠNG 2 CƠ SỞ LÝ THUYÉT PHÂN LỚP VĂN BẢN.1 Mô hình biểu diễn văn bán.--- --cs-se©se+vsEEse+xeerterkeerserrserrserrserssrre 5 2.1 Mô hình không gian veetor.

Một số phương pháp tính trọng số của một từ khóa.2 Một số phương pháp phân lớp,.---- se 2< s©s£ se £s£xseEseEse+xeexzerserserssee 7 2.1 Phân lớp Naive Biay€S .---- <5 sọ HH ch cọ Hư g0 8 2.2 Phân lớp dựa trên cây quyết định.-- -<- << se ss+sessexserserssrssesseree 10 2.3 Phan lớp dựa vào mạng TN€urFaÌ.4 Phương pháp Support Vector Machines .--c «5< 5c ss se se sssssesseesee 17 pc: 8Š .1 Định nghĩa Onnf0ÌOY.2 Cac thanh phan cita Ontology .----2-s°se+cse+vseEvserxeereerrserrserrserrsrrsserssrr 38 3.3 Ngôn ngữ biểu diễn Ontology .4 Phương thức xây dựng Onf0ÌOgV.5 Ontology va bai toán xác định cụm từ đặc frưng. ---- 5-5 << =esc<s=eseseese 43 CHƯƠNG 4 XÂY DỰNG MÔ HÌNH VÀ HIỆN THỰC.1 Xây dựng mô hình xác định chủ đề cho câu truy vấn.2 Hiện thực bộ phân lớp chủ đề.--s-s° se < s£Es£+se©ssSxsersexserseeeersserserl 48 4.1 Tạo mô hình bằng giải thuật SÌMO.----s-scss+vsseresrxesrrsrrssrrsee 48 IV 4.2 Xây dựng tập ngữ liệu huấn luyện. Mã hóa tập ngữ liệu theo định dạng LIBSVM .4 Lựa chọn đặc frưTiE .-- 5 5 5 5 HH HH TH TH Ti 0 00 53 4.6 Gắn nhãn từ ÏOạÌ .7 Công thức để đánh giá hiệu quả của bộ phân lớp chủ đề.3 Xây dựng onfology chủ đỀ.---- << se s<+ssSEs£xseEseEseExsExsersersersereersserser 55 4.1 XAy dung ontology chit dé may tinh .2 Xây dựng bộ từ điển từ vựng.--s-s-s<©s<cserse se vae+eeesserserseresrssesseree 58 4.3 Xác định cụm danh từ đặc trưng ngữ nghĩa dựa trên Onfology.4 Công thức đánh giá độ hiệu quả của Ontology chú đề máy tính .4 Xây dựng mô đun xác định cụm danh từ dự tuyễn .5 Xây dựng mô đun mã hóa định dạng LIBSVM.6 Xây dựng cơ sở dữ liệu cục bộ cho chú đề máy tính.7 Xây dựng mô đun tìm kiếm tài liệu .8 Phân rã cụm danh từ đặc (FWTIg. Ví dụ về toàn bộ quá trình hoạt động của hệ thống.---s- 52s ssseel 67 CHƯƠNG 5 ĐÁNH GIÁ VÀ HƯỚNG PHÁT TRIỂN.1 Đánh giá hiệu quả của bộ phân lớp chú đề .2 Đánh giá hiệu quả xây dựng Ontology chú đề.-------sscssessscsssrssersee 74 kh cC) hố .,ÔỎ 76 NI an.

78 DANH MỤC HÌNH Hình 2.1 Mô hình vector 2 chiỄu.2 Vi du vé cliy quyét Ginl.3 EnfFoDy CA tập) €.- Ăn n1 KH HH 0000001080081 008 0050006 12 Hình 2.4 Mô HÌHH HỘI DCFCGJDẨTOHH.5 Mô Hình HẠHg ÏÝ€IHFAÏ,.6 Mô hình lan truyỀH ng .-oe-cecce<cc<ceSEseEeEEkeEeeExeEreereetkerkeersereerseressrsrre 16 Hình 2. 7 Siéu phẳng ƒphân chia dữ liệu thành 2 lớp + và — với khoảng cách biên lớn nhất. các điêm gân ƒ nhất là Các 'ŠHDĐOF( W€CfOF.8 Siêu phẳng ƒ phân chia tập dữ liệu thành 2 lóp + và —.---cee-ceecexeeces 21 Hình 2.9 Siêu phẳng phân chia tập dữ liệu có nhiễu thành 2 lớp + và —.10 Ảnh xạ từ không gian R“ sang không gian Ñ”(m > đ) .11 Rằng buộc giữa hai nhân LABFAHB€.co< ceccece<ceereereeteetseersereerseresersrre 27 Hình 2.12 Giới hạn của giá trị Œ; trường Hợp Ý\ # Ý¿ .13 Giới hạn của giá trị Œ; (FƯỜng HỢP Ý\ — Ý; ‹-c-.eceece<ceecĂSSee san ga nga nga ngan 28 Hình 2.14 Giá ngưỡng b khi cá hai nhân Lagrange cùng nằm trên đường biên.1 Thể hiện mối quan hệ cha con trong QHf0ÏOBV.2 Mô tả lép trong Ontology (bao gồm cá thực thổ).3 Mỗi quan hệ giữa các thực thể.4 Các thực thỂ trong Qnf0ÏOBV .5 Hệ phân cấp các đối tượng trong thế giới fÏUC.1 Cấu trúc mô hình xác định chú đề cho câu tFM VẤN .2 Dữ liệu được định dạng theo LLI BS WMỸ .- << 5< se «se =sEssessesse 51 Hình 4.3 Ontology chú đỀ máy tÍnh.-eecce©cescceecxeertesrkeersesreertsertsrrksrksrserrssrrerree 5T Hình 4.4 Mỗi quan hệ giữa các lóp đối tượng máy tính trong Qnfology.5 Các mỗi quan hệ được sứ dụng để suy luận trong trường hợp l.6 Các mỗi quan hệ được sứ dụng để suy luận trong trường hợp 2.7 Các mỗi quan hệ được sứ dụng để suy luận trong trường hợp 3.8 Các mỗi quan hệ được sứ dụng để suy luận trong trường hợp 4. 62 VI DANH MỤC BẢNG Bang 4.1 Tập nhãn từ loại của bộ gán HÌHẫH VH ÏS€F'.- «5< 5 =Ă se se se se essesse 54 Bang 5.1 30 câu truy vẫn được sứ dụng để thứ ngÌhiỆHH.2 Két quả thử nghiệm với hàm nhân tuyén tÍnhh .---e--ecccse©csecesecessrssex 73 Bang 5.3 Kết quả thử nghiệm với hàm nhân RBF.4 Két quả thử nghiệm với hàm nhân đa thức.5 Két quả thử nghiệm với hàm nhân sigimoid .6 Két quả thử nghiệm độ chính xác của onf0Ì08V.--eecceecceccseresereseressrsser 75 CHUONG 1 TONG QUAN 1.1 Phat biéu van dé Cùng với sự phát triển mạnh mẽ của World Wide Web, nguồn thông tin chia sẻ trên Internet ngày càng trở nên phong phú và đa dang hon.

Tuy nhiên, một thách thức đặt ra đối với con người là làm thế nào đề có thể sử dụng nguồn thông tin này một cách hiệu quả nhất. Khi tìm kiếm tài liệu, yêu cầu thông tin nhập từ phía người sử dụng hầu hết được biểu diễn dưới dạng các từ khóa. Cách biểu diễn này rõ ràng không có khả năng thể hiện trọn vẹn nội dung của thông tin. Do đó, khi truy hồi thông tin trên các hệ thống ngày nay, người sử dung đều nhận thêm những tài liệu có nội dung không liên quan đến thông tin mà mình mong muốn vì tìm kiếm dựa trên từ khóa thường không đạt được độ chính xác cao.

Nhằm tăng hiệu suất cũng như độ chính xác của các mô hình truy hồi thông tin theo từ khóa, nhiều công trình nghiên cứu đã khai thác tiềm năng ngữ nghĩa của cụm từ đặc trưng.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Xây Dựng Mô Hình Xác Định Chủ Đề Cho Câu Truy Vấn Trong Khoa Học Máy Tính" trình bày một phương pháp hiệu quả để xác định chủ đề cho các câu truy vấn trong lĩnh vực khoa học máy tính. Bài viết nhấn mạnh tầm quan trọng của việc phân tích ngữ nghĩa và cách mà các mô hình học sâu có thể được áp dụng để cải thiện độ chính xác trong việc nhận diện chủ đề. Độc giả sẽ tìm thấy những lợi ích rõ ràng từ việc áp dụng mô hình này, bao gồm khả năng tối ưu hóa tìm kiếm thông tin và nâng cao trải nghiệm người dùng trong các hệ thống thông tin.

Nếu bạn muốn mở rộng kiến thức của mình về các ứng dụng học sâu trong lĩnh vực này, hãy tham khảo thêm tài liệu Luận văn thạc sĩ khoa học máy tính xây dựng hệ thống học sâu tự động thêm dấu cho tiếng việt, nơi bạn có thể tìm hiểu về cách học sâu được áp dụng trong ngôn ngữ tiếng Việt. Ngoài ra, tài liệu Luận văn thạc sĩ khoa học máy tính ứng dụng học sâu vào xây dựng mô hình rút trích thông tin sẽ cung cấp cho bạn cái nhìn sâu sắc về việc rút trích thông tin từ văn bản. Cuối cùng, bạn cũng có thể khám phá tài liệu Luận văn thạc sĩ khoa học máy tính kết hợp học sâu và mô hình ngôn ngữ để nhận dạng giọng nói tiếng việt để hiểu rõ hơn về ứng dụng của học sâu trong nhận dạng giọng nói. Những tài liệu này sẽ giúp bạn mở rộng kiến thức và khám phá thêm nhiều khía cạnh thú vị trong lĩnh vực khoa học máy tính.