Luận Văn Thạc Sĩ Về Ứng Dụng Tập Thô Trong Tìm Kiếm Web

Luận văn thạc sĩ phân tích vnu uet ứng dụng tập thô vào tìm kiếm web, đánh giá thực trạng, chỉ ra hạn chế, đề xuất giải pháp khả thi cho thực tiễn.

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

Luận Văn Thạc Sĩ

2010

89
1
0

Phí lưu trữ

30 Point

Mục lục chi tiết

MỞ ĐẦU

1. CHƯƠNG 1: GIỚI THIỆU TỔNG QUAN

1.1. Lý do chọn đề tài

1.2. Phạm vi công việc

1.3. Cấu trúc luận văn

2. CHƯƠNG 2: MÁY TÌM KIẾM WEB

2.1. Cấu trúc máy tìm kiếm web

2.2. Biểu diễn kết quả tìm kiếm

2.3. Đánh giá chất lượng tìm kiếm

3. CHƯƠNG 3: PHÂN CỤM TÀI LIỆU VÀ VẤN ĐỀ TÁCH TỪ TIẾNG VIỆT

3.1. Ứng dụng của phân cụm tài liệu trong thu thập và tổ chức thông tin

3.2. Mô hình không gian vector và trình bày văn bản

3.3. Các kỹ thuật tiền xử lý tài liệu

3.4. Bảng trọng số

3.5. Biểu diễn cụm

3.6. Các giải thuật phân cụm

3.6.1. Phương pháp phân cụm phân cấp

3.6.2. Phương pháp phân cụm phân hoạch

3.6.3. Thuật toán phân cụm bán giám sát Seeded - KMeans

3.7. Tiêu chuẩn sự tối ưu

3.8. Gán cứng và gán mềm

3.9. Các bước thực hiện phân cụm

3.10. Đánh giá kết quả phân cụm

3.11. Phân cụm kết quả tìm kiếm web

3.12. Các phương pháp tách từ tiếng Việt

3.12.1. Đặc điểm từ trong tiếng Việt

3.12.2. Phương pháp so khớp cực đại

3.12.3. Phương pháp học cải biến

3.12.4. Mô hình tách từ bằng WFST và mạng Neural

3.12.5. Phương pháp tách từ tiếng Việt dựa trên thống kê từ Internet và thuật giải di truyền

4. CHƯƠNG 4: LÝ THUYẾT TẬP THÔ

4.1. Hệ thông tin

4.2. Quan hệ bất khả phân biệt

4.3. Quan hệ tương đương - Lớp tương đương

4.4. Xấp xỉ tập hợp

4.5. Hàm thuộc thô

4.6. Mô hình tập thô dung sai

4.7. Không gian dung sai các từ chỉ mục

4.8. Nâng cao chất lượng biểu diễn tài liệu

4.9. Mở rộng lược đồ trọng số cho xấp xỉ trên

5. CHƯƠNG 5: ÁP DỤNG LÝ THUYẾT TẬP THÔ VÀO PHÂN CỤM KẾT QUẢ TÌM KIẾM WEB

5.1. Vấn đề phân cụm kết quả tìm kiếm web

5.2. Các thuật toán phân cụm tài liệu dựa trên TRSM

5.2.1. Biểu diễn cụm

5.2.2. Thuật toán phân cụm không phân cấp dựa trên TRSM

5.2.3. Thuật toán phân cụm phân cấp dựa trên TRSM

5.2.4. Thuật toán TRC

5.2.5. Xây dựng ma trận từ - tài liệu

5.2.6. Tạo lớp dung sai

5.2.7. Thuật toán phân cụm Seeded - KMeans cải tiến

6. CHƯƠNG 6: XÂY DỰNG ỨNG DỤNG THỬ NGHIỆM

6.1. Xác định yêu cầu

6.2. Các thành phần của ứng dụng thử nghiệm

6.2.1. Xây dựng các thành phần chức năng

6.2.2. Trình thu thập nội dung web

6.2.3. Bộ tách từ tiếng Việt

6.2.4. Bộ xử lý truy vấn

6.2.5. Biểu diễn kết quả tìm kiếm web

6.3. Triển khai ứng dụng thử nghiệm

Tài liệu tham khảo

Tóm tắt

I. Tổng Quan Về Ứng Dụng Tập Thô Trong Tìm Kiếm Web

Ứng dụng lý thuyết tập thô trong tìm kiếm web đã trở thành một chủ đề nghiên cứu quan trọng trong những năm gần đây. Lý thuyết này giúp cải thiện khả năng phân tích và tổ chức thông tin từ các nguồn dữ liệu lớn. Việc áp dụng tập thô không chỉ giúp nâng cao chất lượng tìm kiếm mà còn tối ưu hóa quá trình thu thập và xử lý dữ liệu.

1.1. Khái Niệm Về Tập Thô

Tập thô là một phương pháp phân tích dữ liệu cho phép xử lý thông tin không chính xác hoặc không đầy đủ. Nó giúp xác định các mối quan hệ giữa các đối tượng mà không cần phải có thông tin chính xác tuyệt đối.

1.2. Tầm Quan Trọng Của Tìm Kiếm Web

Tìm kiếm web là một công cụ thiết yếu trong việc truy cập thông tin. Với sự phát triển của công nghệ, nhu cầu tìm kiếm thông tin chính xác và nhanh chóng ngày càng cao, đặc biệt trong bối cảnh dữ liệu khổng lồ trên Internet.

II. Vấn Đề Trong Tìm Kiếm Web Hiện Nay

Mặc dù có nhiều công cụ tìm kiếm hiện đại, nhưng vẫn tồn tại nhiều vấn đề trong việc khai thác thông tin. Các kết quả tìm kiếm thường không chính xác và không đáp ứng được nhu cầu của người dùng. Điều này dẫn đến việc người dùng phải mất nhiều thời gian để tìm kiếm thông tin cần thiết.

2.1. Khó Khăn Trong Việc Tìm Kiếm Thông Tin

Người dùng thường gặp khó khăn trong việc xác định từ khóa chính xác, dẫn đến việc nhận được nhiều kết quả không liên quan. Điều này làm giảm hiệu quả của quá trình tìm kiếm.

2.2. Tình Trạng Thông Tin Trùng Lặp

Sự trùng lặp thông tin trong các kết quả tìm kiếm cũng là một vấn đề lớn. Nhiều tài liệu có nội dung tương tự nhau, gây khó khăn cho người dùng trong việc lựa chọn thông tin phù hợp.

III. Phương Pháp Phân Tích Dữ Liệu Trong Tìm Kiếm Web

Để giải quyết các vấn đề trong tìm kiếm web, nhiều phương pháp đã được đề xuất. Một trong số đó là việc áp dụng lý thuyết tập thô để phân tích và tổ chức thông tin một cách hiệu quả hơn.

3.1. Ứng Dụng Tập Thô Trong Phân Tích Dữ Liệu

Lý thuyết tập thô cho phép phân tích dữ liệu không chính xác và giúp xác định các mối quan hệ giữa các tài liệu. Điều này giúp cải thiện chất lượng kết quả tìm kiếm.

3.2. Kỹ Thuật Phân Cụm Kết Quả Tìm Kiếm

Phân cụm kết quả tìm kiếm theo chủ đề giúp người dùng dễ dàng tìm kiếm thông tin hơn. Kỹ thuật này giúp nhóm các tài liệu liên quan lại với nhau, từ đó nâng cao trải nghiệm người dùng.

IV. Kết Quả Nghiên Cứu Về Ứng Dụng Tập Thô

Nghiên cứu cho thấy việc áp dụng lý thuyết tập thô vào tìm kiếm web đã mang lại nhiều kết quả tích cực. Các công cụ tìm kiếm được phát triển dựa trên lý thuyết này đã cải thiện đáng kể khả năng phân tích và tổ chức thông tin.

4.1. Hiệu Quả Của Các Công Cụ Tìm Kiếm Mới

Các công cụ tìm kiếm mới sử dụng lý thuyết tập thô đã cho thấy sự cải thiện rõ rệt trong việc cung cấp kết quả tìm kiếm chính xác và nhanh chóng hơn.

4.2. Phản Hồi Từ Người Dùng

Người dùng đã có những phản hồi tích cực về các công cụ tìm kiếm mới, cho rằng chúng giúp tiết kiệm thời gian và nâng cao hiệu quả tìm kiếm thông tin.

V. Kết Luận Và Tương Lai Của Tìm Kiếm Web

Tương lai của tìm kiếm web sẽ tiếp tục phát triển với sự hỗ trợ của các công nghệ mới. Việc áp dụng lý thuyết tập thô sẽ đóng vai trò quan trọng trong việc cải thiện khả năng tìm kiếm và phân tích thông tin.

5.1. Xu Hướng Phát Triển Công Nghệ Tìm Kiếm

Công nghệ tìm kiếm sẽ ngày càng trở nên thông minh hơn, với khả năng hiểu ngữ nghĩa và ngữ cảnh của người dùng.

5.2. Tầm Quan Trọng Của Nghiên Cứu Liên Tục

Nghiên cứu liên tục trong lĩnh vực này là cần thiết để đáp ứng nhu cầu ngày càng cao của người dùng và cải thiện chất lượng tìm kiếm.

22/07/2025

Trích đoạn nội dung tài liệu

Chương 1: Giới thiệu tổng quan. Chương 2: Trình bày kiến thức tổng quan về máy tìm kiếm Web. Chương 3: Trình bày các kiến thức về phân cụm tài liệu và vấn đề tách từ Tiếng Việt. Chương 4: Trình bày tổng quan về lý thuyết tập thô và mô hình tập thô dung sai.

LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Chương 5: Trình bày cách áp dụng lý thuyết tập thô vào việc phân cụm kết quả tìm kiếm Web. Chương 6: Trình bày kết quả thử nghiệm của luận văn. Và phần cuối cùng là kết luận của luận văn LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Chương 2: MÁY TÌM KIẾM WEB 2. Khái niệm Máy tìm kiếm Web là một công cụ giúp người sử dụng tìm kiếm thông tin trên mạng một cách nhanh chóng và đầy đủ.

Máy tìm kiếm web tương tác với người sử dụng thông qua một giao diện khá đơn giản và thân thiện. Người sử dụng chỉ cần đặt câu hỏi truy vấn về vấn đề quan tâm, máy tìm kiếm web ngay lập tức sẽ trả về tập kết quả tìm kiếm (snippets). Thông thường, mỗi kết quả tìm kiếm bao gồm tựa đề, địa chỉ của tài liệu và miêu tả ngắn gọn nội dung chính tài liệu. Ngoài ra một số máy tìm kiếm web còn cho phép người dùng xem nội dung của tài liệu được lưu lại trên máy chủ của dịch vụ tìm kiếm.

Tên tài liệu Tóm tắt nội dung Snippet URL của tài liệu Hình 2-1. Giao diện biểu diễn kết quả tìm kiếm Web của Google LUAN VAN CHAT LUONG download : add luanvanchat@agmail. Cấu trúc máy tìm kiếm web Cấu trúc của máy tìm kiếm web được thể hiện trong hình 2-2 Hình2- 2. Cấu trúc bên trong của của máy tìm kiếm Web Trình thu thập web (Web Crawler) Web Crawler hay còn được gọi là Web Spider là một trong hai thành phần tương tác trực tiếp với WWW.

WWW là một tập hợp các tài liệu được liên kết với nhau bởi các siêu liên kết, web crawler có nhiệm vụ là phát hiện các trang mới trên WWW bằng cách thu thập các siêu liên kết từ các trang tài liệu. Quá trình này được thực hiện đệ qui để thăm dò hầu hết các trang web trên Internet. Trong quá trình này web crawler sẽ phải sử dụng một số kỹ thuật để tránh không bị lấy thông LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com tin trùng lặp. Web crawler vừa thu thập các trang web mới nhưng cũng đồng thời kiểm tra lại những siêu liên kết đã không còn tồn tại trên WWW để loại chúng khỏi các kết quả tìm kiếm.

Chỉ mục tài liệu (Document Index) Thành phần lập chỉ mục tài liệu thực hiện chức năng xây dựng bảng chỉ số tài liệu hỗ trợ công việc tìm kiếm. Thông thường, các hệ thống tìm kiếm thông tin thực hiện việc tìm kiếm các tài liệu hoặc dựa trên phương pháp lựa chọn tài liệu có chứa các từ trong câu hỏi truy vấn, hoặc dựa trên phương pháp xếp hạng tài liệu (Document Ranking) liên quan đến câu hỏi truy vấn. Do đó hầu hết các máy tìm kiếm đều sử dụng biến dữ liệu có cấu trúc chỉ mục ngược (inverted index) để hỗ trợ thực hiện công việc này. Inverted index có cấu trúc giống như bảng mục lục ở phần cuối của cuốn sách – tương ứng với mỗi một từ là một danh sách liên kết chứa địa chỉ các trang trong đó nó xuất hiện (hình 2-3).

Với kiểu lưu trữ này nó có khả năng giúp máy tìm kiếm xác định đúng các tài liệu liên quan đến câu hỏi truy vấn một cách nhanh chóng. Cấu trúc dữ liệu inverted index Lưu trữ tài liệu (Document Cache) Hiện nay có nhiều máy tìm kiếm vừa lưu trữ bảng chỉ số tài liệu như ở phần trên, vừa lưu trữ tài liệu gốc. Ví dụ như trong Google, bảng chỉ số tài liệu gốc được LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com sử dụng để tạo các snippet và phục vụ cho việc lưu trữ các phiên bản của tài liệu. Tính hạng tài liệu (Document Ranking) World Wide Web càng ngày càng phát triển do vậy lượng thông tin ngày càng lớn, số kết quả tìm kiếm với một từ khóa bất kỳ đều rất lớn, ngay cả với những câu hỏi truy vấn hoàn thiện và chính xác, số kết quả tìm kiếm vẫn có thể lên đến hàng ngàn hoặc hàng triệu.

Chính vì vậy cần có module tính hạng tài liệu để xác định được tài liệu nào có độ liên quan đến các từ khóa mà người dùng tìm kiếm nhất. Xử lí truy vấn Xử lí truy vấn là thành phần có nhiệm vụ phân tích cú pháp tìm kiếm của người dùng thông qua các toán tử và cú pháp được định nghĩa sẵn, sau đó bộ xử lí truy vấn kết hợp với bảng chỉ số tài liệu, các tài liệu được lưu trữ, và thành phần tính hạng tài liệu để đưa ra tập kết quả tìm kiếm thỏa mãn cú pháp tìm kiếm của người dùng. Kết quả của quá trình này được đưa đến người sử dụng thông qua giao diện biểu diễn kết quả của máy tìm kiếm. Giao diện biểu diễn kết quả Giao diện biểu diễn kết quả tìm kiếm là thành phần quan trọng trong máy tìm kiếm và trực tiếp tương tác với người sử dụng.

Do vậy giao diện biểu diễn kết quả tìm kiếm là yếu tố đầu tiên được xem xét khi đánh giá chất lượng của một chương trình tìm kiếm, nó có vai trò vô cùng quan trọng và có ảnh hưởng rất lớn đến toàn bộ chất lượng của máy tìm kiếm. Google được yêu thích và được đa số người dùng sử dụng khi tìm kiếm thông tin là nhờ có một giao diện đơn giản nhưng lại dễ sử dụng. Biểu diễn kết quả tìm kiếm Giao diện của máy tìm kiếm đóng vai trò vô cùng quan trọng trong việc tìm kiếm thông tin của người dùng, giao diện tìm kiếm được thiết kế tốt sẽ giúp người LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com dùng nhanh chóng tìm được kết quả tìm kiếm mình mong muốn. Hầu hết các máy tìm kiếm hiện nay đều thực hiện việc tìm kiếm dựa trên phương pháp tính hạng tài liệu và biểu diễn kết quả tìm kiếm theo thứ tự hạng xuất hiện.

Tuy nhiên hiện nay WWW đang phát triển với tốc độ rất nhanh, lượng thông tin trên mạng ngày càng lớn vì thế số lượng kết quả tìm kiếm có thể lên đến hàng ngàn tài liệu, nên người sử dụng không đủ thời gian và kiên nhẫn đọc toàn bộ lượng tài liệu này để xác định các tài liệu cần thiết. Do vậy cách biểu diễn này có nhiều hạn chế. Thực tế cho thấy khi tìm kiếm thông tin, nếu biết được tài liệu mình tìm kiếm thuộc chủ đề nào thì người sử dụng sẽ nhanh chóng tiếp cận được với tài liệu cần tìm. Chính vì vậy để nâng cao hiệu quả trong việc tìm kiếm, ta nên biểu diễn kết quả tìm kiếm Web theo nhóm chủ đề vì nó có những ưu điểm sau:  Tên chủ đề giúp người sử dụng phát hiện được các chủ đề chính của tập kết quả trả về và do đó có thể xác định nhanh chóng tài liệu cần tìm.

 Phân chia tập kết quả theo chủ đề còn giúp người sử dụng có thể nghiên cứu thêm các tài liệu liên quan đến những chủ đề khác mà nó thường bị bỏ qua khi duyệt kết quả tìm kiếm theo thứ tự hạng xuất hiện, vì những kết quả này thường nằm ở các trang sau và thường bị người dùng bỏ qua. Khi người dùng tìm kiếm, tập kết quả phụ thuộc vào câu hỏi truy vấn mà người dùng đưa ra, do đó không thể biết trước bất kỳ thông tin nào về các chủ đề chứa trong tập kết quả này. Đây là một trong những khó khăn lớn để xây dựng các công cụ tìm kiếm web theo chủ đề. Để giải quyết vấn đề này một trong các giải pháp được đề xuất là sử dụng phương pháp phân cụm tài liệu.

Phân cụm tài liệu thực hiện nhóm các kết quả tìm kiếm theo chủ đề và tạo ra mô tả nội dung của mỗi LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com nhóm; người sử dụng chỉ cần quan sát tóm tắt nội dung các nhóm là dễ dàng định vị được vùng tài liệu mà mình quan tâm. Đánh giá chất lượng tìm kiếm Để đánh giá chất lượng tìm kiếm của một máy tìm kiếm, hai độ đo chuẩn thường được sử dụng để đánh giá là độ chính xác (precision) và độ hồi cứu (recall). Giả sử, ta có tập các câu truy vấn Q, tập các văn bản D, với mỗi câu truy vấn q  Q ta có: + Tập các văn bản trả về Rq  D + Tập các văn bản liên quan Dq (được chọn thủ công từ toàn bộ tập văn bản D), Dq  D Độ chính xác (precision) được định nghĩa là tỉ lệ giữa các văn bản liên quan được trả về với mọi văn bản trả về. Dq  Rq precision  Rq Độ chính xác biến thiên từ 0 đến 1, trường hợp xấu nhất nếu độ chính xác là 0 có nghĩa là không có văn bản liên quan nào được trả về, trường hợp tốt nhất nếu độ chính xác là 1 nghĩa là toàn bộ văn bản được trả về đều là các văn bản liên quan.

Đây là trạng thái lý tưởng mà một hệ thống tìm kiếm cần đạt được, tuy nhiên có thể vẫn còn các văn bản liên quan mà không được trả về. Độ hồi cứu (recall) là độ đo biểu diễn tỉ lệ giữa các văn bản liên quan được trả về với mọi văn bản liên quan. Dq  Rq recall  Dq Trường hợp lý tưởng là recall = 1, tức là mọi văn bản liên quan đều được trả về, còn trường hợp xấu nhất là recall = 0, tức là không có văn bản liên quan nào LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com được trả về. Độ độ chính xác và độ hồi cứu quyết định mối quan hệ giữa hai tập văn bản: tập văn bản liên quan (Dq) và tập văn bản trả về (Rq).

Trong trường hợp lý tưởng thì độ chính xác và độ hồi cứu đều bằng 1 (tuy nhiên điều này không bao giờ xảy ra trong các hệ thống thực tế). LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Chương 3: PHÂN CỤM TÀI LIỆU VÀ VẤN ĐỀ TÁCH TỪ TIẾNG VIỆT 3. Khái niệm Phân cụm dữ liệu là một kỹ thuật trong khai phá dữ liệu, nhằm tìm kiếm, phát hiện các cụm, các mẫu dữ liệu tự nhiên tiềm ẩn được quan tâm trong tập dữ liệu lớn, từ đó cung cấp các thông tin hữu ích hỗ trợ cho việc ra quyết định. Kỹ thuật phân cụm đã được áp dụng thành công trong các ứng dụng thuộc lĩnh vực khai phá dữ liệu, thống kê hay lưu trữ thông tin.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ