Luận văn: Trích Rút Thông Tin Cá Nhân từ Văn Bản Tiếng Việt - Nguyễn Cao Cường

Luận văn về trích rút thông tin cá nhân từ văn bản tiếng Việt. Nghiên cứu các phương pháp và kỹ thuật hiệu quả để nhận diện và trích xuất thông tin cá nhân quan trọng.

Trường đại học

Đại học Bách khoa Hà Nội

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

Luận văn Thạc sỹ
75
1
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

BẢNG TỪ VIẾT TẮT

DANH MỤC CÁC BẢNG

DANH MỤC CÁC HÌNH

1. CHƯƠNG 1: MỞ ĐẦU

1.1. Lý do chọn đề tài

1.2. Mục đích và phạm vi

1.2.1. Mục đích nghiên cứu

1.2.2. Phạm vi nghiên cứu

1.3. Nội dung nghiên cứu

1.4. Bố cục luận văn

1.5. Ý nghĩa của luận văn

2. CHƯƠNG 2: MÔ TẢ BÀI TOÁN VÀ HƯỚNG GIẢI QUYẾT

2.1. Khái quát về trích rút thông tin

2.1.1. Bài toán trích rút thông tin

2.2. Kiến trúc của hệ thống trích rút thông tin

2.3. Bài toán trích rút thông tin cá nhân

2.4. Phương pháp giải quyết bài toán trích rút thông tin cá nhân

2.4.1. Bài toán trích rút thực thể

2.4.2. Bài toán trích rút mối quan hệ

2.5. Ứng dụng của bài toán trích rút thông tin cá nhân

2.6. Phương pháp đánh giá kết quả

3. CHƯƠNG 3: TRÍCH RÚT THỰC THỂ VÀ TRÍCH RÚT QUAN HỆ

3.1. Trích rút thực thể

3.1.1. Một số hướng tiếp cận giải quyết bài toán trích rút thực thể

3.2. Mô hình trường ngẫu nhiên có điều kiện

3.3. TRÍCH RÚT QUAN HỆ

3.3.1. Một số hướng tiếp cận giải quyết bài toán trích rút thực thể

3.4. Các đặc trưng được sử dụng trong trích rút quan hệ

3.5. Biểu thức chính qui

3.5.1. Ứng dụng biểu thức chính qui để trích rút quan hệ

4. CHƯƠNG 4: THIẾT KẾ VÀ XÂY DỰNG CHƯƠNG TRÌNH

4.1. Kiến trúc của hệ thống

4.2. Tiền xử lý

4.3. Bộ trích rút thực thể dựa trên mô hình CRF

4.3.1. Các đặc trưng trong quá trình học máy

4.3.1.1. Đặc trưng ngữ cảnh
4.3.1.2. Đặc trưng từ điển
4.3.1.3. Đặc trưng chính tả
4.3.1.4. Đặc trưng chính quy và từ loại

4.4. Hậu xử lý

4.4.1. Xử lý đồng tham chiếu đến thực thể người

4.4.2. Chỉnh sửa nhãn

4.5. Trích rút quan hệ

4.6. Quản lý thông tin cá nhân

4.7. Cài đặt, thử nghiệm và đánh giá

4.7.1. Một số tùy chọn trong bộ công cụ FlexCRFs

4.7.2. Kết quả trích rút thông tin

4.7.3. Nhận xét

5. CHƯƠNG 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

5.1. Các kết quả đạt được trong luận văn

5.2. Về thực nghiệm

5.3. Nhận xét

5.4. Hướng phát triển

PHỤ LỤC 1: TẬP DỮ LIỆU

PHỤ LỤC 2: MỘT SỐ GIAO DIỆN CHƯƠNG TRÌNH

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng Quan Trích Rút Thông Tin Cá Nhân Từ Văn Bản Việt

Trong kỷ nguyên số, lượng thông tin cá nhân trực tuyến tăng trưởng bùng nổ. Trích rút thông tin cá nhân từ văn bản tiếng Việt trở nên vô cùng quan trọng. Nó hỗ trợ nhiều ứng dụng, từ quảng cáo đến nghiên cứu thị trường. Các nhà nghiên cứu và phát triển web đều quan tâm đến lĩnh vực này. Nếu thông tin cá nhân được trích rút tự động và lưu trữ có cấu trúc, nó sẽ mang lại nhiều lợi ích. Ví dụ, nó có thể hỗ trợ nghiên cứu về con người, quảng cáo, thiết kế sản phẩm và đánh giá thói quen người dùng. Ý thức được tầm quan trọng của việc phát triển NLP tiếng Việt, các nghiên cứu tập trung vào việc giải quyết bài toán trích rút thông tin cá nhân từ văn bản tiếng Việt. Vấn đề đặt ra là làm sao để trích rút hiệu quả và chính xác, đồng thời đảm bảo tuân thủ các quy định về bảo vệ thông tin cá nhân, tránh vi phạm luật bảo vệ dữ liệu cá nhân như PDPAGDPR.

1.1. Tại Sao Trích Rút Thông Tin Cá Nhân Lại Quan Trọng

Ngày nay, sự bùng nổ của Internet và phát triển mạnh mẽ của công nghệ thông tin truyền thông, khả năng tiếp cận thông qua máy tính được kết nối Internet với khối lượng lớn các kho dữ liệu văn bản khắp nơi trên thế giới là rất lớn. Trích rút thông tin giúp người dùng không bị "chìm ngập" trong thông tin và tiết kiệm thời gian tìm kiếm. Một lượng lớn các tài liệu chứa các thông tin về cá nhân tiếp tục được tạo ra và xuất bản hàng ngày trên internet. Các thông tin này luôn chiếm một vị trí quan trọng trong các máy tìm kiếm dữ liệu cũng như các trang web và thu hút sự quan tâm của người dùng, các nhà nghiên cứu cũng như của các nhà phát triển dịch vụ web.

1.2. Ứng Dụng Tiềm Năng Của Trích Rút Thông Tin Cá Nhân

Nếu các thông tin này được trích rút tự động và lưu trữ trong các cơ sở dữ liệu có cấu trúc thì chúng sẽ hỗ trợ tốt cho các nghiên cứu về con người và các lĩnh vực liên quan như quảng cáo, nghiên cứu thị trường, thiết kế sản phẩm và đánh giá thói quen người dùng. Ý thức được những lợi ích mà các bài toán trích rút thông tin cá nhân mang lại, đồng thời phát triển cho ngôn ngữ tiếng Việt, tác giả đã chọn hướng nghiên cứu nhằm giải quyết bài toán trích rút thông tin cá nhân từ văn bản tiếng Việt làm đề tài luận văn của mình.

II. Thách Thức Nhận Dạng Thực Thể Trong Văn Bản Tiếng Việt

Bài toán trích rút thông tin cá nhân từ văn bản tiếng Việt đối mặt với nhiều thách thức. Tiếng Việt là một ngôn ngữ giàu sắc thái, có cấu trúc phức tạp. Việc nhận dạng thực thể được đặt tên (NER tiếng Việt) trở nên khó khăn hơn so với các ngôn ngữ khác. Các phương pháp xử lý ngôn ngữ tự nhiên (NLP tiếng Việt) cần được điều chỉnh để phù hợp với đặc thù của tiếng Việt. Hơn nữa, việc xử lý các biến thể tên, địa chỉ, và thông tin liên lạc đòi hỏi các thuật toán thông minh. Đảm bảo an toàn thông tinbảo vệ thông tin cá nhân là một yêu cầu bắt buộc. Các kỹ thuật ẩn danh hóa dữ liệu, mã hóa dữ liệu, và kiểm soát truy cập cần được áp dụng để ngăn chặn lạm dụng thông tin.

2.1. Khó Khăn Trong Xử Lý Ngôn Ngữ Tiếng Việt

Tiếng Việt có cấu trúc ngôn ngữ riêng, khác biệt so với tiếng Anh và các ngôn ngữ khác. Điều này đòi hỏi các thuật toán xử lý ngôn ngữ tự nhiên phải được điều chỉnh để phù hợp. Ví dụ, việc tokenization, stemming, và lemmatization có thể phức tạp hơn do đặc điểm của từ ghép và từ láy trong tiếng Việt. Các bộ dữ liệu tiếng Việt hiện tại còn hạn chế so với các ngôn ngữ phổ biến khác.

2.2. Bài Toán Nhận Dạng Thực Thể Tên Riêng Tiếng Việt

Bài toán nhận dạng thực thể được đặt tên (NER) trong tiếng Việt là một thách thức lớn. Việc phân biệt giữa tên người, tên địa điểm, tên tổ chức, và các loại thực thể khác đòi hỏi độ chính xác cao. Các mô hình học máy (machine learning) và học sâu (deep learning) cần được huấn luyện với lượng dữ liệu lớn để đạt được hiệu suất tốt.

III. Giải Pháp Ứng Dụng Mô Hình Học Máy Để Trích Rút Hiệu Quả

Để giải quyết bài toán trích rút thông tin cá nhân, có thể sử dụng các mô hình học máydeep learning. Các mô hình như Conditional Random Fields (CRF), BERT, và PhoBERT đã chứng minh được hiệu quả trong nhiều bài toán NLP. Việc xây dựng mô hình trích rút đòi hỏi một quy trình chặt chẽ, từ thu thập và tiền xử lý dữ liệu, đến huấn luyện mô hình, đánh giá hiệu suất, và fine-tuning model. Các thuật toán trích rút cần được tối ưu hóa để đạt được độ chính xác và độ tin cậy cao. Các kỹ thuật tiền xử lý văn bản như tokenization, stop word removal, và part-of-speech tagging đóng vai trò quan trọng trong việc cải thiện hiệu suất của mô hình.

3.1. Sử Dụng CRF Để Trích Rút Thực Thể

Mô hình CRF (Conditional Random Fields) là một phương pháp phổ biến để trích rút thực thể. CRF là một mô hình xác suất có điều kiện, giúp dự đoán chuỗi nhãn dựa trên chuỗi đầu vào. Ưu điểm của CRF là khả năng sử dụng nhiều đặc trưng khác nhau, bao gồm đặc trưng ngữ cảnh, đặc trưng từ điển, và đặc trưng chính tả. Mô hình CRF phù hợp với bài toán trích rút thông tin từ văn bản tiếng Việt vì nó có thể xử lý các đặc điểm phức tạp của ngôn ngữ.

3.2. Áp Dụng Transformer Models BERT và PhoBERT

Transformer models như BERTPhoBERT đã đạt được những thành công vượt trội trong lĩnh vực NLP. Các mô hình này có khả năng hiểu ngữ cảnh sâu sắc và biểu diễn từ một cách hiệu quả. PhoBERT là một phiên bản pretrained model được huấn luyện trên dữ liệu tiếng Việt, giúp cải thiện hiệu suất trong các bài toán NLP tiếng Việt, bao gồm trích rút thông tin cá nhân. Việc fine-tuning model PhoBERT trên một dataset tiếng Việt cụ thể có thể mang lại kết quả rất tốt.

IV. Kỹ Thuật Xây Dựng Hệ Thống Trích Rút Thông Tin Cá Nhân Hoàn Chỉnh

Một hệ thống trích rút thông tin cá nhân hoàn chỉnh bao gồm nhiều thành phần. Đầu tiên, dữ liệu văn bản cần được tiền xử lý để loại bỏ các ký tự đặc biệt, chuẩn hóa định dạng, và phân tách câu. Tiếp theo, mô hình NER sẽ được sử dụng để nhận dạng thực thể như tên người, địa điểm, và tổ chức. Sau đó, các thuật toán trích rút quan hệ sẽ được áp dụng để tìm kiếm mối quan hệ giữa các thực thể. Cuối cùng, thông tin được trích rút sẽ được lưu trữ trong một cơ sở dữ liệu có cấu trúc. Quá trình hậu xử lý cũng rất quan trọng để giải quyết các vấn đề như xử lý đồng tham chiếuchỉnh sửa nhãn.

4.1. Quy Trình Tiền Xử Lý Văn Bản Tiếng Việt

Tiền xử lý văn bản là bước quan trọng để đảm bảo chất lượng dữ liệu đầu vào cho mô hình trích rút thông tin. Quy trình này bao gồm các bước như loại bỏ HTML tags, chuyển đổi về chữ thường, tokenization, stop word removal, và stemming/lemmatization. Các công cụ text processing tiếng Việt cần được sử dụng để thực hiện các bước này một cách hiệu quả.

4.2. Trích Rút Quan Hệ Giữa Các Thực Thể

Sau khi nhận dạng thực thể, bước tiếp theo là trích rút quan hệ giữa các thực thể. Ví dụ, cần xác định mối quan hệ "sinh sống ở" giữa một người và một địa điểm. Các phương pháp trích rút quan hệ có thể dựa trên các luật, biểu thức chính quy, hoặc các mô hình học máy phức tạp hơn. Kết quả trích rút quan hệ sẽ được sử dụng để xây dựng cơ sở dữ liệu thông tin cá nhân.

4.3. Đánh Giá Hiệu Suất Hệ Thống

Việc đánh giá hiệu suất là rất quan trọng để đảm bảo chất lượng của hệ thống. Các chỉ số như độ chính xác, độ tin cậy, và F1-score được sử dụng để đánh giá khả năng của hệ thống trong việc trích rút thông tin cá nhân một cách chính xác. Cần xây dựng các bộ dữ liệu tiếng Việt được gán nhãn thủ công để làm cơ sở so sánh và đánh giá các phương pháp trích rút thông tin.

V. Ứng Dụng Tạo Dựng Cơ Sở Dữ Liệu Thông Tin Cá Nhân Từ Wikipedia

Một ứng dụng thực tiễn của trích rút thông tin cá nhân là tạo dựng một cơ sở dữ liệu thông tin cá nhân từ Wikipedia. Các trang tiểu sử trên Wikipedia chứa rất nhiều thông tin giá trị về người nổi tiếng, nhà khoa học, và các nhân vật lịch sử. Bằng cách áp dụng các kỹ thuật trích rút thông tin, có thể tự động thu thập và lưu trữ thông tin này trong một cơ sở dữ liệu có cấu trúc. Cơ sở dữ liệu này có thể được sử dụng cho nhiều mục đích, từ nghiên cứu lịch sử đến phân tích mạng xã hội.

5.1. Thu Thập Dữ Liệu Từ Wikipedia Tiếng Việt

Wikipedia là một nguồn dữ liệu phong phú cho bài toán trích rút thông tin cá nhân. Các trang tiểu sử trên Wikipedia chứa nhiều thông tin có cấu trúc và phi cấu trúc về các nhân vật. Cần xây dựng các công cụ để tự động thu thập dữ liệu từ Wikipedia, bao gồm việc tải trang, trích xuất nội dung văn bản, và lọc bỏ các phần không liên quan.

5.2. Xây Dựng Cơ Sở Dữ Liệu Có Cấu Trúc

Thông tin được trích rút cần được lưu trữ trong một cơ sở dữ liệu có cấu trúc, chẳng hạn như MySQL hoặc PostgreSQL. Cần thiết kế lược đồ cơ sở dữ liệu phù hợp để lưu trữ các thông tin như tên, ngày sinh, nơi sinh, nghề nghiệp, và các mối quan hệ gia đình. Cơ sở dữ liệu này sẽ là nguồn dữ liệu cho các ứng dụng khác.

VI. Tương Lai Phát Triển Các Phương Pháp Trích Rút Nâng Cao Bảo Mật

Trong tương lai, việc nghiên cứu và phát triển các phương pháp trích rút thông tin cá nhân sẽ tiếp tục được đẩy mạnh. Các hướng nghiên cứu tiềm năng bao gồm việc sử dụng các mô hình ngôn ngữ tiên tiến hơn, phát triển các kỹ thuật ẩn danh hóa dữ liệu hiệu quả hơn, và nghiên cứu các phương pháp bảo vệ thông tin cá nhân sáng tạo hơn. Đồng thời, cần có sự hợp tác giữa các nhà nghiên cứu, nhà phát triển, và các nhà hoạch định chính sách để đảm bảo rằng công nghệ trích rút thông tin được sử dụng một cách có trách nhiệm và tuân thủ các quy định về bảo vệ dữ liệu cá nhân.

6.1. Nghiên Cứu Các Mô Hình Ngôn Ngữ Tiên Tiến Hơn

Sự phát triển của các mô hình ngôn ngữ như GPT-3 và các mô hình tương tự hứa hẹn sẽ mang lại những cải tiến đáng kể cho bài toán trích rút thông tin. Cần nghiên cứu cách áp dụng các mô hình này cho tiếng Việt và đánh giá hiệu quả của chúng trong việc nhận dạng thực thểtrích rút quan hệ.

6.2. Phát Triển Kỹ Thuật Ẩn Danh Hóa Dữ Liệu

Các kỹ thuật ẩn danh hóa dữ liệu đóng vai trò quan trọng trong việc bảo vệ thông tin cá nhân. Cần nghiên cứu và phát triển các kỹ thuật mới để đảm bảo rằng thông tin cá nhân được xóa thông tin cá nhân hoặc mặt nạ thông tin một cách an toàn và hiệu quả. Điều này giúp đảm bảo rằng dữ liệu có thể được sử dụng cho mục đích nghiên cứu và phát triển mà không vi phạm quyền riêng tư của cá nhân.

6.3. Chú Trọng Vấn Đề Bảo Vệ Dữ Liệu Cá Nhân

Cần nghiên cứu và phát triển các phương pháp mới để kiểm soát truy cậplọc thông tin nhằm ngăn chặn lạm dụng thông tin cá nhân. Các quy định pháp luật như GDPRPDPA cần được tuân thủ nghiêm ngặt. Cần nâng cao nhận thức của người dùng về tầm quan trọng của việc bảo vệ thông tin cá nhân và cung cấp cho họ các công cụ để kiểm soát thông tin của mình.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

11/09/2025
Luận văn trích rút thông tin cá nhân từ văn bản tiếng việt

Trích đoạn nội dung tài liệu

Chương 1 giới thiện về động cơ, mục tiêu và phạm vì nghiên cửa, những đồng góp chỉnh và câu trúc của luận văn. Chương 2 giới thiệu Lỗng quan về bài toán trích rút thông tím, bắt toán trích rút thông tin cá nhân và các bài toán liên quan là bài toán trích rút thực thể và bải toán. trích rút mỗi quan hệ, để xuất phương pháp giải quyết bài toán trích rút thông tỉn cá nhân cũng như ứng dụng của bài toán này và phương pháp đánh giá kết quả Chương 3 trình bày một số phương pháp trích rút thực thế và trích rút quan hệ từ đó chọn ra phương pháp thích hợp ấp đựng cho bài toán trích rút thực thể từ văn ‘ban tiếng Việt. Luận văn sử dụng phương pháp tiếp cận sử dụng CRT.

Trinh bảy khai quát về biếu thức chính qui (Regularv Expression) và ứng dụng để trích rút quan hệ giữa cáo thục thể, Chương 4 trình bày thiết kế và xây đựng hệ thông trích rút thông tin cả nhân. từ trang web tiếng Việt wikipedia. Trình bay các kết quả đạt cải đặt thử rhiệm và đánh giá Chương 5 tông kết lại các kết quả dạt dược của luận văn và để xuất các hướng, xighiên cửu trong tương lai của luận văn.5 Ý nghĩa của luận văn Với kết quả đã đạt được, luận văn đá mang lại một số kết quả nghiên cứu nhật định trong việc trích rủt thạc thẻ, trích rút quan hệ đặc biệt lá kết phương pháp CRF, các luật đồng tham chiều vẻ tên và biểu thức chính qui đề giải quyết hải toán cụ thể 10 Tuuận văn Thạc sỹ Trích rút thông tin cá nhân từ vin ban tiéng Viet © _ Nghiên cứu các phương pháp trích rút thông tin từ đó lựa chọn một phương pháp phủ hợp với bải toản. © Xay dựng một hệ thống trích thông tin về cả nhân từ văn bản tiếng Việt được lẫy từ trang web wikipedia (http://v1.2 Phạm vi nghiên cứu Luan van tập trung vảo việc trích rút thông tin của cả nhân từ văn bản phi câu.

trúc tiếng Việt trên trang web http:/viwikipedia org, với giả định 01 văn bản chỉ dé cập đến thông tin của một người. Các văn bản nay sé được tiên xử lý trước khi thực hiện trích rút thông tin. Hệ thông sẽ trích rút từ văn bản phi cau trie nảy 04 thực thể: đên người, tên tổ chức, tên địa điểm. ngày tháng và từ đó, tìm môi quan hệ giữa thực thể người với các thực thể còn lại: ngây sinh (tên người-ngày tháng), nơi sinh (fên người — địa điểm), công việc (lên người-tên tổ chức), sống ở (lên người- tên địa điểm), quan hệ gia đình (tên người-tên người).

Cuôi cùng, hệ thông trích sẽ đưa ra bảng dữ liệu gồm các mẫu thông tin về từng cả nhân được lưu trong cơ sở dữ liệu Ví dụ: Lê Công linh (sinh ngày 10 tháng 12 năm 1985) tại Quỳnh Lâm, Quỳnh Lưu, Nghệ -n, là một cẩu thủ bóng đá Uiệt Nam hiện đang thì đấu cho câu lạc bộ Sông Lam Nghé An. Sẽ được trích rút như sau: 1.Họ tên: Lê Công Vnnh. Ngày sinh: 10 thang 12 nam 1985 3. Nơi sinh: Quỳnh Lâm, Quỳnh Lưu, Nghệ -An.

Công việc: Cầu thủ bóng đá, Câu lạc bộ Sông Lam Nghệ An.3 Nội dung nghiên cứu Trong luân văn này, đề giải quyết bài toán trích rút thông tin cá nhân, tác giả nghiên cứu phương pháp trích rút thực thẻ sử dụng trường ngầu nhiên có điều kiện. Nguyễn Cao Cường 9 Luận văn Thạc sỹ Trích rút thông tìn có nhân từ vẫn bản tiếng Việt CHƯƠNG1: MỚDẢU 1.1 Ly do chgn dé tai Llign nay, su bùng nỗ của Internet và phát triển mạnh mẽ của công nghệ thông tin — truyền thông, khả năng tiếp cận thông qua máy tính được kết nôi Internet với khối lượng lớn các kho đữ liệu văn bản khắp nơi trên thể giới là rất lớn. Tuy nhiên, chính khối lượng đữ liệu quá lớn có thể làm người đùng bị “chìm ngập” trong thông tin hoặc mắt quả nhiều thời gian để có được thông tín mong muốn. Vẫn để này được quan lâm giải quyết wong các hệ thống Irích rút thông lín theo miễn ứng dụng cụ thể Một lượng lớn các tải liệu chứa các thông tia về cá nhân tiếp tực dược tạo ra và xuất bản hàng ngày trên internet.

Các thông tin này luân chiếm một vị trí quan. trọng trong các máy tìm kiếm đữ liệu cũng như các trang web và thu hút sự quan tâm của người dùng, các nhả nghiên cửu cũng như của các nhà phát triển dich va web. Nếu các thông tin này được trích rút tự động vả lưu trữ trong các co sở đữ liệu có câu trúc thì chứng sẽ hỗ trợ lối. cho các nghiên cửu về cơn người và các Tĩnh vực liên quan như quảng cáo, nghiên cứu thị trường, thiết kế sản phẩm và đánh giá thói quen người đùng.

Ý thức được những lợi ich má các bài toán trích rút thông tin ca nhân, đồng, thời phát triển cha ngôn ngữ tiếng Việt, tác giả đã chọn hướng nghiên cứu nhằm. giải quyết bài toán trích rút thông lim cá nhân từ văn bản Lễng Việt làm để tải luận văn của mình. 12 Mục đích và phạm vi 1.1 Mục đích nghiên cứu Thông qua nghiên cửu để tài “Trích rút thông tia cá nhân từ văn bản tiếng Việt”, tác giả mong ruuốn dạt một. số kết quả Nguyẫn Cao Cuồng # Luan van Thạc sỹ Trích rút thông tìn có nhân từ vẫn bản tiếng Việt Tôi xin cøm doan, luận văn tết nghiệp Thaơ sỹ này là công trình nghiên cửu của bản thân tôi đưới sự hướng dẫn của PGS.

T8, Lê Thanh Hương, Các kết quả trong luận văn Lốt nghiệp là trung thực, không phải sao chép Loàn vấn của bắt kỳ sông trình nào kháe. Tôi xin chịu hoàn toàn trách nhiệm về nội đụng quyền luận văn nay. Tác giả Nguyễn Cao Cường Nguyẫn Cao Cuồng 4 Luan van Thạc sỹ Trích rút thông tìn có nhân từ vẫn bản tiếng Việt Tuiận văn dược hoàn thành tại trường Đại học Bách khoa Hà Nội. Để hoàn thành luận văn này, tác giá đã nhận được sự chỉ báo tận tỉnh, củng những yêu cầu.

nghiêm khắc ủa DŒ8. T§ Tiên sĩ ê Thanh Hương, người đã truyền đại rất nhiều kiến thức quí báu cũng nÏưư những kinh nghiệm nghiên cứu khoa học trong suốt thời gian táo giả theo học và nghiên cứu, Tác giả xin chân thành gửi lên biết ơn đến Ban lãnh dạo Viện Công nghệ thông, tin va Truyền thông, Viện Dào tạo Sau đại học và Bộ môn IIệ thống Thông tin, thuộc trưởng Đại học Bách khoa Hà Nội đã tạo điều kiên thuận lợi trong quá Bình học tập, nghiên cửa và hoàn thành luận văn. Với năng lực hạn chế của bãn thân cũng như những nguyên nhân chủ quan, khách quan, luận văn không Iránh những thiếu sói. Tác giã rải mong được sự gớpý của quý thây cả, các bạn bè và đồng nghiệp đề luận văn được hoàn thiện hon.

Cuối củng, tác giả muốn gởi lời cảm vô hạn tới gia định vá bạn bẻ, những, người thân yêu luôn bên cạnh và động viên tôi trong suốt quá trình thục hiện luận. ‘Tae giá Nguyễn Cho Cường Nguyẫn Cao Cuồng $ Luan van Thạc sỹ Trích rút thông tìn có nhân từ vẫn bản tiếng Việt CHƯƠNG1: MỚDẢU 1.1 Ly do chgn dé tai Llign nay, su bùng nỗ của Internet và phát triển mạnh mẽ của công nghệ thông tin — truyền thông, khả năng tiếp cận thông qua máy tính được kết nôi Internet với khối lượng lớn các kho đữ liệu văn bản khắp nơi trên thể giới là rất lớn. Tuy nhiên, chính khối lượng đữ liệu quá lớn có thể làm người đùng bị “chìm ngập” trong thông tin hoặc mắt quả nhiều thời gian để có được thông tín mong muốn. Vẫn để này được quan lâm giải quyết wong các hệ thống Irích rút thông lín theo miễn ứng dụng cụ thể Một lượng lớn các tải liệu chứa các thông tia về cá nhân tiếp tực dược tạo ra và xuất bản hàng ngày trên internet.

Các thông tin này luân chiếm một vị trí quan. trọng trong các máy tìm kiếm đữ liệu cũng như các trang web và thu hút sự quan tâm của người dùng, các nhả nghiên cửu cũng như của các nhà phát triển dich va web. Nếu các thông tin này được trích rút tự động vả lưu trữ trong các co sở đữ liệu có câu trúc thì chứng sẽ hỗ trợ lối. cho các nghiên cửu về cơn người và các Tĩnh vực liên quan như quảng cáo, nghiên cứu thị trường, thiết kế sản phẩm và đánh giá thói quen người đùng.

Ý thức được những lợi ich má các bài toán trích rút thông tin ca nhân, đồng, thời phát triển cha ngôn ngữ tiếng Việt, tác giả đã chọn hướng nghiên cứu nhằm. giải quyết bài toán trích rút thông lim cá nhân từ văn bản Lễng Việt làm để tải luận văn của mình. 12 Mục đích và phạm vi 1.1 Mục đích nghiên cứu Thông qua nghiên cửu để tài “Trích rút thông tia cá nhân từ văn bản tiếng Việt”, tác giả mong ruuốn dạt một. số kết quả Nguyẫn Cao Cuồng # Luan van Thạc sỹ Trích rút thông tìn có nhân từ vẫn bản tiếng Việt DANH MỤC CÁC BẢNG Bang 2-1: Các giá trị đánh piá một hệ thẳng trích rút thực thể 24 tảng 4-1: Mẫu ngữ cảnh về từ vụng: _ - 47 Bảng 42: Các từ điển được sử dụng .đỂ Tăng 4-3: Các đặc trưng chỉnh tả.

- - 49 Tăng 4-4: Dặc trưng chính qui và từ loại. - - 50 Bảng 45: Định dạng tên thực thể.51 Bang 46: Cac tham số trong quá trình huấn luyện nhận dạng thực thể 38 Bang 4-7: Dánh giá mức nhãn — Lần thực nghiệm cho kết quả tốt nhất. 59 Bang 48: Danh gia mire cum tir— Lan thực nghiệm cho kết quả tốt nhất. 59 Bang 49: Kết quả trích rút quan hệ - 60 DANH MỤC CÁC HÌXH Hình 2-1: Vi dụ về trích rút thông tỉn.

13 Hình 2-2: Kiến trúc của hệ thông trích rút thông tin - - 14 Linh 2-3: Trich rut thông tin cá nhân từ văn bản tiểu sử phi câu trúc. 16 Hình 2-4: Phân cấp các câu theo tác giá Sérgio Flipe. Hình 3-1: Đỗ thị có hướng mô tả mô bình HMM - - 37 Linh 3-2: Van dé “label bins”.3Ô Tình 3-3: Đỗ thị vô hướng mô tả CREs - 32 Hình 4-1: Kiến trúc hệ thông trích rút thông tin cá nhãn 45 Hình 4-2: Trích rút thực thể sử dụng CRE.4f Tình 4-3: Quá trình hậu xử lý - - - 31 Tình 4-4: Xử lý đồng tham chiéu - - - $6 Nguyẫn Cao Cuồng 7 Luan van Thạc sỹ Trích rút thông tin cá nhân từ văn bản tiếng Liệt BANG TU VIET TAT CRFs | Conditional Random Fields Em trường ngẫu nhiên có điều HMM.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ