Luận văn về hệ thống tìm kiếm thông tin đa ngôn ngữ Việt - Anh - Hoa

Luận văn tốt nghiệp trình bày hệ thống tìm kiếm thông tin xuyên ngôn ngữ Việt-Anh-Hoa, ứng dụng công nghệ hiện đại và giải pháp tối ưu.

Trường đại học

Trường Đại Học

Chuyên ngành

Công Nghệ Thông Tin

Người đăng

Ẩn danh

Thể loại

luận văn

2023

133
0
0

Phí lưu trữ

35 Point

Mục lục chi tiết

MỞ ĐẦU

1. CHƯƠNG 1: TỔNG QUAN

1.1. Giới thiệu mô hình tìm kiếm thông tin (Information Retrieval)

1.2. Hệ thống tìm kiếm thông tin xuyên ngôn ngữ (CLIR)

1.3. Các vấn đề của CLIR

1.4. Các hướng tiếp cận

1.4.1. Dựa trên từ điển đa ngữ (Multilingual Thesauri)

1.4.2. Dựa trên ngữ liệu (Corpus-based techniques)

1.5. Một số công trình nghiên cứu trong và ngoài nước

1.5.1. Trên thế giới

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT

2.1. Giới thiệu về MRD (Machine Readable Dictionary)

2.1.1. Sơ lược lịch sử phát triển MRD trên thế giới

2.1.2. Vai trò và cấu trúc của MRD

2.1.3. Khai thác tài nguyên từ điển

2.1.4. Xây dựng từ điển tự động

2.1.5. Cấu trúc vĩ mô và vi mô của từ điển MRD

2.1.6. Một số từ điển MRD

2.2. Các phương pháp tách từ

2.2.1. Mô hình WFST

2.2.2. Mô hình MMSEG

2.3. Các phương pháp khử nhập nhằng

2.3.1. Khử nhập nhằng

3. CHƯƠNG 3: PHÂN TÍCH VÀ THIẾT KẾ

3.1. Tổng quan hệ thống

3.2. Phát biểu bài toán

3.3. Mô hình hệ thống

3.4. Phát sinh quản lý

3.5. Phân tích – thiết kế hệ thống

3.5.1. Mô hình Usecase

3.5.2. Đặc tả usecase

3.6. Thiết kế lớp

3.7. Thiết kế giao diện

3.8. Xây dựng hệ thống

3.8.1. Tổ chức các MRD

3.8.2. Phương pháp tìm kiếm dựa trên MRD

3.8.3. Tìm kiếm tài liệu bằng công cụ tìm kiếm

4. CHƯƠNG 4: CÀI ĐẶT VÀ THỬ NGHIỆM

4.1. Cấu trúc dữ liệu

4.2. Dịch từ từ điển

4.3. Khử nhập nhằng

4.3.1. Module dịch và khử nhập nhằng

4.3.2. Chương trình demo trên web

4.4. Chương trình tìm kiếm trên Web

4.4.1. Module dịch và khử nhập nhằng

4.4.2. Chương trình tìm kiếm trên Web

5. CHƯƠNG 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

5.1. Đối với từ điển và ngữ liệu

5.2. Đối với IR Engine

5.3. Mở rộng ngôn ngữ tìm kiếm cho hệ thống

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về hệ thống tìm kiếm thông tin đa ngôn ngữ

Hệ thống tìm kiếm thông tin đa ngôn ngữ (CLIR) là một công cụ quan trọng trong việc xử lý và truy xuất thông tin từ các nguồn tài liệu khác nhau. Với sự phát triển của công nghệ, nhu cầu tìm kiếm thông tin bằng nhiều ngôn ngữ ngày càng tăng. Hệ thống này cho phép người dùng nhập câu truy vấn bằng một ngôn ngữ và nhận kết quả từ các tài liệu bằng ngôn ngữ khác. Điều này không chỉ giúp tiết kiệm thời gian mà còn mở rộng khả năng tiếp cận thông tin cho người dùng.

1.1. Khái niệm về hệ thống tìm kiếm thông tin

Hệ thống tìm kiếm thông tin (IR) là một quá trình cho phép người dùng tìm kiếm tài liệu liên quan đến một chủ đề cụ thể. Trong bối cảnh đa ngôn ngữ, hệ thống CLIR giúp người dùng tìm kiếm tài liệu bằng ngôn ngữ khác với ngôn ngữ của câu truy vấn.

1.2. Lợi ích của hệ thống tìm kiếm thông tin đa ngôn ngữ

Hệ thống CLIR mang lại nhiều lợi ích, bao gồm khả năng truy cập thông tin từ nhiều nguồn khác nhau, hỗ trợ người dùng trong việc tìm kiếm tài liệu mà không cần phải biết nhiều ngôn ngữ, và tăng cường khả năng nghiên cứu và học tập.

II. Các thách thức trong hệ thống tìm kiếm thông tin đa ngôn ngữ

Mặc dù hệ thống tìm kiếm thông tin đa ngôn ngữ mang lại nhiều lợi ích, nhưng cũng đối mặt với nhiều thách thức. Một trong những vấn đề lớn nhất là sự khác biệt về ngữ nghĩa và ngữ pháp giữa các ngôn ngữ. Điều này có thể dẫn đến việc hệ thống không hiểu đúng câu truy vấn hoặc không trả về kết quả chính xác.

2.1. Vấn đề chuyển ngữ trong CLIR

Chuyển ngữ là một trong những thách thức lớn nhất trong hệ thống CLIR. Việc dịch từ ngôn ngữ này sang ngôn ngữ khác không chỉ đơn thuần là thay thế từ mà còn cần phải hiểu ngữ cảnh và ý nghĩa của câu.

2.2. Khó khăn trong việc xác định độ liên quan

Độ liên quan giữa câu truy vấn và tài liệu là một yếu tố quan trọng trong hệ thống tìm kiếm. Tuy nhiên, việc xác định độ liên quan trong các ngôn ngữ khác nhau có thể gặp khó khăn do sự khác biệt trong cách diễn đạt và cấu trúc câu.

III. Phương pháp xây dựng hệ thống tìm kiếm thông tin đa ngôn ngữ

Để xây dựng một hệ thống tìm kiếm thông tin đa ngôn ngữ hiệu quả, cần áp dụng nhiều phương pháp khác nhau. Các phương pháp này bao gồm việc sử dụng từ điển đa ngữ, khai thác ngữ liệu và áp dụng các công nghệ mới như trí tuệ nhân tạo.

3.1. Sử dụng từ điển đa ngữ

Từ điển đa ngữ giúp hệ thống xác định cách dịch chính xác cho các từ và cụm từ trong câu truy vấn. Việc xây dựng và cập nhật từ điển này là rất quan trọng để đảm bảo tính chính xác của kết quả tìm kiếm.

3.2. Khai thác ngữ liệu

Khai thác ngữ liệu từ các nguồn tài liệu khác nhau giúp hệ thống có được thông tin phong phú và đa dạng. Điều này không chỉ giúp cải thiện độ chính xác mà còn tăng cường khả năng tìm kiếm.

IV. Ứng dụng thực tiễn của hệ thống tìm kiếm thông tin đa ngôn ngữ

Hệ thống tìm kiếm thông tin đa ngôn ngữ đã được áp dụng trong nhiều lĩnh vực khác nhau, từ giáo dục đến kinh doanh. Việc sử dụng hệ thống này giúp người dùng dễ dàng tiếp cận thông tin cần thiết mà không bị rào cản ngôn ngữ.

4.1. Ứng dụng trong giáo dục

Trong giáo dục, hệ thống CLIR giúp sinh viên và giảng viên tìm kiếm tài liệu nghiên cứu từ nhiều nguồn khác nhau, hỗ trợ việc học tập và nghiên cứu hiệu quả hơn.

4.2. Ứng dụng trong kinh doanh

Trong lĩnh vực kinh doanh, hệ thống tìm kiếm thông tin đa ngôn ngữ giúp các công ty tiếp cận thông tin thị trường quốc tế, từ đó đưa ra quyết định kinh doanh chính xác hơn.

V. Kết luận và hướng phát triển của hệ thống tìm kiếm thông tin đa ngôn ngữ

Hệ thống tìm kiếm thông tin đa ngôn ngữ đang ngày càng trở nên quan trọng trong bối cảnh toàn cầu hóa. Việc phát triển và cải tiến hệ thống này sẽ giúp người dùng tiếp cận thông tin một cách dễ dàng và hiệu quả hơn. Hướng phát triển trong tương lai có thể bao gồm việc tích hợp trí tuệ nhân tạo và học máy để nâng cao khả năng tìm kiếm.

5.1. Tích hợp công nghệ mới

Việc tích hợp các công nghệ mới như trí tuệ nhân tạo và học máy sẽ giúp cải thiện độ chính xác và hiệu quả của hệ thống tìm kiếm thông tin đa ngôn ngữ.

5.2. Mở rộng ngôn ngữ hỗ trợ

Hệ thống cần mở rộng hỗ trợ cho nhiều ngôn ngữ hơn, từ đó đáp ứng nhu cầu tìm kiếm thông tin của người dùng trên toàn cầu.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

25/07/2025
Luận văn tốt nghiệp hệ thống tìm kiếm thông tin xuyên ngôn ngữ việt anh hoa

Trích đoạn nội dung tài liệu

Chương 1: TỔNG QUAN Trong chương này, chúng tôi sẽ trình bày khái quát về các hệ thống tìm kiếm (Information Retrieval), hệ thống tìm kiếm thông tin xuyên ngôn ngữ (Cross-Language Information Retrieval) và một số khảo sát về tình hình nghiên cứu trong và ngoài nước. Cuối chương chúng tôi sẽ rút ra kết luận chung và lựa chọn hướng tiếp cận cho hệ thống của mình. Nội dung trình bày bao gồm: 9 Giới thiệu mô hình tìm kiếm thông tin. 9 Hệ thống tìm kiếm thông tin xuyên ngôn ngữ.

9 Một số công trình nghiên cứu trong và ngoài nước.1 Giới thiệu mô hình tìm kiếm thông tin (Information Retrieval): Hệ thống tìm kiếm thông tin xuyên ngữ (Cross Language Information Retrieval - CLIR) có liên hệ rất mật thiết với hệ thống tìm kiếm thông tin (Information Retrieval - IR) và cũng có rất nhiều đặc trưng của hệ thống này (IR). Qui trình của hệ thống tìm kiếm thông tin như sau: • Người dùng muốn xem những tài liệu liên quan đến một chủ đề nào đó. • Người dùng cung cấp một mô tả về chủ đề đó dưới dạng câu truy vấn. • Từ câu truy vấn này hệ thống sẽ lọc ra những cụm từ chỉ mục.

• Những cụm từ chỉ mục này sẽ được so khớp với những cụm từ chỉ mục của các tài liệu đã được xử lý trước đó. • Những tài liệu nào có mức độ liên quan cao nhất sẽ được trả về cho người dùng. Hồ Bảo Quốc 5 Nguyễn Thị Hồng Nhung - 0112235 TS. Đinh Điền Nguyễn Thị Tuyết Mai - 0112229 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Hệ thống tìm kiếm thông tin xuyên ngôn ngữ Việt – Anh – Hoa Mục đích của IR là hiển thị cho người dùng một tập các thông tin thỏa mãn nhu cầu của họ.

Chúng ta định nghĩa chính xác cho thông tin cần thiết là “câu truy vấn”(query), và các thông tin được chọn là “tài liệu” (documents). Mỗi cách tiếp cận trong IR bao gồm 2 thành phần chính: một là các kỹ thuật để biểu diễn thông tin (câu truy vấn, tài liệu), và hai là phương pháp so sánh các cách biểu diễn này. Mục đích là để tự động qui trình kiểm tra các tài liệu bằng cách tính toán độ tương quan giữa các câu truy vấn và tài liệu. Qui trình tự động này thành công khi nó trả về các kết quả giống với các kết quả được con người tạo ra khi so sánh câu truy vấn với các tài liệu.

Có một vấn đề thường xảy ra đối với hệ thống tìm kiếm là những từ mà người dùng đưa ra trong câu truy vấn thường khác xa những từ trong tập tài liệu chứa thông tin mà họ tìm kiếm. Trường hợp như thế gọi là “paraphrase problem” (vấn đề về diễn giải). Để giải quyết vấn đề này hệ thống đã tạo ra các hàm biểu diễn xử lý các câu truy vấn và các tài liệu một cách khác nhau để đạt đến một độ tương thích nào đó. Hồ Bảo Quốc 6 Nguyễn Thị Hồng Nhung - 0112235 TS.

Đinh Điền Nguyễn Thị Tuyết Mai - 0112229 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Hệ thống tìm kiếm thông tin xuyên ngôn ngữ Việt – Anh – Hoa Hình 1.1: Mô hình hệ thống tìm kiếm thông tin Gọi miền xác định của hàm biểu diễn câu truy vấn q là Q, tập hợp các câu truy vấn có thể có; và miền giá trị của nó là R, không gian thống nhất biểu diễn thông tin. Gọi miền xác định của hàm biểu diễn tài liệu d là D, tập hợp các tài liệu; và miền giá trị của nó là R2. Miền xác định của hàm so sánh c là R x R và miền giá trị của nó là [0,1], tập các số thực từ 0 đến 1. Trong một hệ thống tìm kiếm lí tưởng: c(q(query), d(doc)) = j(query, doc) , ∀query∈ Q, ∀doc ∈ D, khi j: Q x D --> [0,1] biểu diễn việc xử lý của người dùng giữa các mối quan hệ của 2 thông tin, được tính dựa trên một tiêu chuẩn nào đó (ví dụ: sự giống nhau về nội dung hay sự giống nhau về kiểu …).1 minh họa mối quan hệ này.

Có hai kiểu hệ thống tìm kiếm: tìm kiếm dựa trên so khớp chính xác và dựa trên sắp xếp. Mô hình trên đây có thể mô tả cả 2 cách tiếp cận. Trong hệ thống tìm kiếm dựa trên so khớp chính xác, miền giá trị của c được giới hạn từ 0 đến 1, và nó được chuyển sang nhị phân để quyết định liệu 1 tài liệu có thỏa biểu thức bool được xác định bởi câu truy vấn hay không? Các IR dựa trên so khớp chính xác thường cung cấp các tài liệu không sắp xếp thỏa câu truy vấn của người dùng, hầu hết các hệ thống tìm kiếm hiện nay đều dùng cách này. Cách hoạt động chi tiết của hệ thống sẽ được mô tả ở phần sau.

Đối với hệ thống IR dựa trên sắp xếp, thì các tài liệu sẽ được sắp xếp theo thứ tự giảm dần về mức độ liên quan. Có 3 loại hệ thống tìm kiếm dựa trên sắp xếp: “ranked Boolean”, “probabilistic” và “similarity based”. Trong 3 cách trên miền giá trị của c là [0,1], tuy nhiên chúng khác nhau ở cách tính “giá trị trạng thái tìm kiếm” (“retrieval status value”): • Trong hệ thống dựa trên “ranked Boolean” giá trị này là mức độ mà thông tin thỏa mãn biểu thức bool được chỉ ra bởi các thông tin còn lại. Hồ Bảo Quốc 7 Nguyễn Thị Hồng Nhung - 0112235 TS.

Đinh Điền Nguyễn Thị Tuyết Mai - 0112229 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Hệ thống tìm kiếm thông tin xuyên ngôn ngữ Việt – Anh – Hoa • Trong hệ thống dựa trên “probabilistic” , khái niệm này hơi khác một chút, giá trị này là xác suất mà thông tin có liên quan đến một câu truy vấn. Rất nhiều hệ thống tìm kiếm dựa trên xác suất được thiết kế để chấp nhận câu truy vấn được diễn tả bằng ngôn ngữ tự nhiên hơn là một biểu thức bool. • Trong hệ thống tìm kiếm dựa trên sự giống nhau, giá trị trạng thái tìm kiếm được tính bằng cách tính mức độ giống nhau của nội dung thông tin. Trong các hệ thống tìm kiếm dựa trên so khớp chính xác, việc đánh giá hệ thống chủ yếu dựa trên việc đánh giá mức độ liên quan.

Giả sử j là giá trị nhị phân và được cho trước. Nói cách khác, ta giả sử rằng các tài liệu hoặc có hoặc không có liên quan đến câu truy vấn, và độ liên quan giữa tài liệu và câu truy vấn do con người xác định là chính xác. Theo giả định này, tính hiệu quả của các hệ thống tìm kiếm dựa trên so khớp chính xác được đánh giá dựa trên 2 đại lượng thống kê là “độ chính xác” (precision) và “độ bao phủ” (recall). Độ chính xác là tỉ lệ các tài liệu được chọn, các tài liệu thực sự liên quan đến các thông tin mà người dùng cần, độ bao phủ là tỉ lệ tài liệu có liên quan được sắp xếp chính xác theo độ liên quan bởi hệ thống tìm kiếm.

Nói cách khác, độ chính xác bằng 1 trừ đi tỉ lệ cảnh báo sai, trong khi đó độ bao phủ đo mức độ hoàn chỉnh của việc tìm kiếm.1 minh họa cho các mối quan hệ này. Selected as Actually is Relevant Not relevant Relevant Found False alarm Not Relevant Missed Found Pr ecision = Found + False alarm Found Re call = Found + Missed GVHD: TS. Hồ Bảo Quốc 8 Nguyễn Thị Hồng Nhung - 0112235 TS. Đinh Điền Nguyễn Thị Tuyết Mai - 0112229 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Hệ thống tìm kiếm thông tin xuyên ngôn ngữ Việt – Anh – Hoa Bảng 1.1: Tính độ hiệu quả của hệ thống tìm kiếm thông tin Việc đánh giá tính hiệu quả của hệ thống tìm kiếm dựa trên sắp xếp thì phức tạp hơn.

Một cách tính độ hiệu quả phổ biến cho các hệ thống này là “độ chính xác trung bình”. Nó được tính bằng cách chọn một tập lớn hơn các tài liệu ở đầu danh sách có giá trị bao phủ giữa 0 và 1. Phương pháp thường được sử dụng là phương pháp tính dựa trên 5, 7, 11 điểm theo độ bao phủ. Độ chính xác sau đó sẽ được tính cho từng tập một.

Qui trình sẽ được lặp lại cho từng câu truy vấn, và tương ứng mỗi độ chính xác trung bình sẽ cho một độ bao phủ. Mỗi giá trị trung bình của những số này sau đó sẽ được tính toán và ghi nhận như là một đặc trưng của hệ thống. Độ chính xác trung bình càng lớn thì càng tốt, và việc so sánh chỉ thực sự có ý nghĩa khi chúng ta sử dụng cùng một tập tài liệu và câu truy vấn. Tuy nhiên độ chính xác trung bình cũng làm giảm đi mức độ thay đổi của các câu truy vấn có các đặc tính khác nhau (ví dụ như số lượng tài liệu có liên quan khác nhau).

Hơn thế nữa, các tài liệu có liên quan thường tập trung ở đầu danh sách sắp xếp nên thông thường độ chính xác sẽ giảm mỗi khi tập tài liệu được mở rộng để tăng độ bao phủ.2 Hệ thống tìm kiếm thông tin xuyên ngôn ngữ (CLIR): 1.1 Khái niệm: Hệ thống tìm kiếm thông tin xuyên ngôn ngữ (CLIR) là hệ thống tìm kiếm (IR) cho phép người dùng nhập câu truy vấn bằng một ngôn ngữ để tìm kiếm các tài liệu trong một ngôn ngữ khác. Đối tượng sử dụng hệ thống tìm kiếm thông tin xuyên ngữ (CLIR) là: • Những người có khả năng đọc các tài liệu tiếng nước ngoài, nhưng gặp khó khăn khi tạo câu truy vấn bằng ngôn ngữ đó. • Những người gặp khó khăn khi đọc/ tìm kiếm các tài liệu tiếng nước ngoài nhưng lại cần một số lượng giới hạn các tài liệu được tìm kiếm bằng CLIR để sử dụng trong các hệ thống dịch máy (MT), thay vì phải dịch toàn bộ tập hợp các tài liệu. Hồ Bảo Quốc 9 Nguyễn Thị Hồng Nhung - 0112235 TS.

Đinh Điền Nguyễn Thị Tuyết Mai - 0112229 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Hệ thống tìm kiếm thông tin xuyên ngôn ngữ Việt – Anh – Hoa • Những người biết các từ khóa hoặc cụm từ tiếng nước ngoài, và muốn đọc các tài liệu có liên quan với những từ khóa hoặc cụm từ đó bằng ngôn ngữ bản xứ.2 Các vấn đề của CLIR: Vì câu truy vấn do người dùng nhập vào và các tài liệu được tìm kiếm ở hai ngôn ngữ khác nhau nên CLIR cần phải có qui trình chuyển ngữ cùng với qui trình tìm kiếm theo cách tìm kiếm truyền thống của các hệ đơn ngữ. Các hệ tìm kiếm đơn ngữ hiện nay thực hiện rất tốt qui trình tìm kiếm đơn ngữ.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ