Luận văn thạc sĩ vnu uet nhận dạng thực thể tên cho ngôn ngữ nói tiếng việt và ứng dụng trong tương tác với điện thoại thông minh 04

Luận văn thạc sĩ nghiên cứu vnu uet nhận dạng thực thể tên cho ngôn ngữ nói tiếng việt và ứng dụng trong tương tác với điện, đánh giá hiện trạng, phân tích vấn đề, đề xuất biện

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ

2015

74
1
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CAM ĐOAN

BẢNG TỪ VIẾT TẮT

DANH SÁCH BẢNG BIỂU

DANH SÁCH HÌNH VẼ

LỜI CẢM ƠN

MỞ ĐẦU

1. CHƯƠNG 1: NHẬN DẠNG TIẾNG NÓI VÀ NHẬN DẠNG THỰC THỂ TÊN CHO NGÔN NGỮ NÓI

1.1. Sự phát triển và ứng dụng của công nghệ nhận dạng tiếng nói

1.2. Nhận dạng thực thể tên

1.2.1. Tại sao cần nhận dạng thực thể tên?

2. CHƯƠNG 2: PHƯƠNG PHÁP NGHIÊN CỨU VÀ CƠ SỞ LÝ THUYẾT

2.1. Các phương pháp điển hình trong nhận dạng thực thể tên

2.2. Cơ sở lý thuyết mô hình học máy

2.2.1. Cực đại hóa Entropy (Maximum Entropy)

2.2.2. Trường điều kiện ngẫu nhiên (Conditional Random Fields)

2.3. Các phương pháp đánh giá hệ thống nhận dạng thực thể tên

2.4. Các kỹ thuật tối ưu số trong ước lượng tham số mô hình

2.4.1. Thuật toán Generalized Iterative Scaling (GIS)

2.4.2. Thuật toán Improved Iterative Scaling (IIS)

2.4.3. Các kỹ thuật tối ưu số

2.5. Một số nghiên cứu liên quan với bài toán nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt

3. CHƯƠNG 3: HỆ THỐNG TRỢ LÝ ẢO VÀ MÔ HÌNH HỌC MÁY

3.1. Tổng thể hệ thống trợ lý ảo cho người dùng tương tác với điện thoại thông minh

3.2. Mô hình hóa bài toán nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt

3.2.1. Phương pháp học máy Cực đại hóa Entropy (Maximum Entropy - MaxEnt)

3.2.2. Phương pháp Trường điều kiện ngẫu nhiên (Conditional Random Fields – CRFs)

3.3. Lựa chọn thuộc tính và huấn luyện mô hình

4. CHƯƠNG 4: THỰC NGHIỆM VÀ ĐÁNH GIÁ MÔ HÌNH

4.1. Dữ liệu thực nghiệm và cài đặt

4.2. Kết quả thực nghiệm và phân tích

4.2.1. Kết quả thực nghiệm sử dụng MaxEnt

4.2.2. Kết quả thực nghiệm sử dụng CRFs

4.3. Kết quả ứng dụng mô hình nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt trên điện thoại thông minh chạy hệ điều hành Android

5. CHƯƠNG 5: KẾT QUẢ VÀ HƯỚNG PHÁT TRIỂN

5.1. Những vấn đề giải quyết được trong luận văn này

5.2. Công việc nghiên cứu trong tương lai

DANH MỤC CÔNG TRÌNH KHOA HỌC CỦA TÁC GIẢ LIÊN QUAN ĐẾN LUẬN VĂN

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về nhận dạng thực thể tên tiếng Việt trong smartphone

Nhận dạng thực thể tên (NER) là một lĩnh vực quan trọng trong xử lý ngôn ngữ tự nhiên, đặc biệt là trong ngữ cảnh tương tác với smartphone. Công nghệ này cho phép các ứng dụng hiểu và xử lý thông tin từ ngôn ngữ nói, giúp người dùng tương tác hiệu quả hơn với thiết bị. Việc áp dụng NER trong ngôn ngữ nói tiếng Việt đang trở thành một xu hướng nổi bật, với nhiều ứng dụng thực tiễn trong cuộc sống hàng ngày.

1.1. Định nghĩa và vai trò của nhận dạng thực thể tên

Nhận dạng thực thể tên là quá trình xác định và phân loại các thực thể trong văn bản, như tên người, địa điểm, tổ chức, v.v. Vai trò của NER trong smartphone là giúp cải thiện khả năng tương tác của người dùng với thiết bị thông minh, từ đó nâng cao trải nghiệm người dùng.

1.2. Lịch sử phát triển công nghệ nhận dạng thực thể tên

Công nghệ NER đã phát triển mạnh mẽ từ những năm 1990, với nhiều nghiên cứu và ứng dụng trong các lĩnh vực khác nhau. Sự phát triển của AI và machine learning đã thúc đẩy NER trở thành một phần không thể thiếu trong các ứng dụng smartphone hiện đại.

II. Thách thức trong nhận dạng thực thể tên tiếng Việt

Việc nhận dạng thực thể tên trong ngôn ngữ nói tiếng Việt gặp nhiều thách thức do đặc điểm ngôn ngữ và cách sử dụng của người dân. Những khó khăn này cần được giải quyết để cải thiện độ chính xác của các hệ thống NER.

2.1. Đặc điểm ngôn ngữ tiếng Việt ảnh hưởng đến NER

Tiếng Việt có nhiều đặc điểm ngữ pháp và từ vựng khác biệt, như không có dấu câu rõ ràng và cách viết không nhất quán. Điều này gây khó khăn cho việc nhận diện và phân loại thực thể tên trong văn bản ngôn ngữ nói.

2.2. Khó khăn trong việc thu thập và xử lý dữ liệu

Dữ liệu ngôn ngữ nói thường không được chuẩn hóa, dẫn đến việc thu thập và xử lý dữ liệu gặp nhiều khó khăn. Các mô hình NER cần phải được huấn luyện trên tập dữ liệu phong phú và đa dạng để đạt được hiệu suất tốt.

III. Phương pháp nhận dạng thực thể tên hiệu quả cho tiếng Việt

Để giải quyết các thách thức trong nhận dạng thực thể tên tiếng Việt, nhiều phương pháp đã được nghiên cứu và áp dụng. Các phương pháp này không chỉ giúp cải thiện độ chính xác mà còn tối ưu hóa quy trình xử lý.

3.1. Sử dụng mô hình học máy trong NER

Mô hình học máy như Maximum Entropy và Conditional Random Fields đã được áp dụng để cải thiện khả năng nhận diện thực thể tên. Những mô hình này cho phép hệ thống học hỏi từ dữ liệu và cải thiện độ chính xác theo thời gian.

3.2. Kết hợp các kỹ thuật xử lý ngôn ngữ tự nhiên

Việc kết hợp các kỹ thuật như phân tích cú pháp, gán nhãn từ loại và sử dụng từ điển có thể giúp nâng cao hiệu quả của hệ thống NER. Những kỹ thuật này giúp hệ thống hiểu rõ hơn về ngữ cảnh và ý nghĩa của các thực thể trong văn bản.

IV. Ứng dụng thực tiễn của nhận dạng thực thể tên trong smartphone

Nhận dạng thực thể tên có nhiều ứng dụng thực tiễn trong cuộc sống hàng ngày, đặc biệt là trong các ứng dụng smartphone. Những ứng dụng này không chỉ giúp người dùng tiết kiệm thời gian mà còn nâng cao trải nghiệm sử dụng.

4.1. Hệ thống trợ lý ảo và NER

Các hệ thống trợ lý ảo như Siri, Google Assistant sử dụng NER để hiểu và phản hồi các yêu cầu của người dùng. Điều này giúp người dùng tương tác một cách tự nhiên và hiệu quả hơn.

4.2. Ứng dụng trong tìm kiếm thông tin

NER cũng được áp dụng trong các ứng dụng tìm kiếm thông tin, giúp người dùng dễ dàng tìm kiếm và truy cập thông tin cần thiết một cách nhanh chóng và chính xác.

V. Kết luận và tương lai của nhận dạng thực thể tên tiếng Việt

Nhận dạng thực thể tên tiếng Việt trong tương tác với smartphone đang trên đà phát triển mạnh mẽ. Với sự tiến bộ của công nghệ AI và machine learning, tương lai của NER hứa hẹn sẽ mang lại nhiều cải tiến và ứng dụng mới.

5.1. Triển vọng phát triển công nghệ NER

Công nghệ NER sẽ tiếp tục phát triển và hoàn thiện, với nhiều ứng dụng mới trong các lĩnh vực khác nhau. Sự kết hợp giữa NER và AI sẽ mở ra nhiều cơ hội mới cho người dùng.

5.2. Thách thức và cơ hội trong nghiên cứu

Mặc dù có nhiều cơ hội, nhưng vẫn còn nhiều thách thức trong việc phát triển NER cho tiếng Việt. Nghiên cứu và phát triển các phương pháp mới sẽ là cần thiết để vượt qua những thách thức này.

22/07/2025
Luận văn thạc sĩ vnu uet nhận dạng thực thể tên cho ngôn ngữ nói tiếng việt và ứng dụng trong tương tác với điện thoại thông minh 04

Trích đoạn nội dung tài liệu

Chương 1 trình bày tổng quan về sự phát triển vượt trội của công nghệ nhận dạng tiếng nói trong một vài năm trở lại đây và những ứng dụng của nó trong thế giới công nghệ hiện nay. Ở chương này cũng trình bày về nhận dạng thực thể tên trong văn bản viết thông thường và trong văn bản ngôn ngữ nói cũng như định nghĩa thế nào là nhận dạng thực thể tên, nêu một số khó khăn thách thức đặc thù của dữ liệu và bài toán nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt. Chương này cũng đề cập tới việc tại sao cần nhận dạng thực thể tên, nêu bật được ý nghĩa của bài toán nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt. Chương 2 trình bày khái quát một số phương pháp điển hình đã được áp dụng trong bài toán nhận dạng thực thể tên và một số kiến thức cơ bản trong việc đánh giá kết quả của hệ thống nhận dạng thực thể tên, một số hướng tiếp cận, kỹ thuật tối ưu trong việc ước lượng tham số mô hình học máy, từ đó tìm hiểu chi tiết cơ sở lý thuyết mô hình học máy Cực đại hóa Entropy (Maximum Entropy) và Trường điều kiện ngẫu nhiên (Conditional Random Fields).

Trên cơ sở bài toán và lý thuyết đi tìm hiểu những nghiên cứu có liên quan cả trong văn bản viết thông thường và ngôn ngữ nói đối với bài toán nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt. Chương 3 trình bày sơ lược về tổng thể hệ thống trợ lý ảo cho người dùng tương tác với điện thoại thông minh bằng ngôn ngữ nói của con người và mô tả rõ cách tích hợp thành phần nhận dạng thực thể tên cho văn bản ngôn ngữ nói trong hệ thống VAV. Tại chương này cũng trình bày chi tiết về cách giải quyết bài toán nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt sử dụng phương pháp học máy Cực đại hóa Entropy (Maximum Entropy - MaxEnt) do Berger cùng các cộng sự giới thiệu lần đầu vào những năm 1996. Đây cũng là chương chính trình bày cụ thể mô hình hóa bài toán và các bước thực hiện bài toán, kỹ thuật lựa chọn thuộc tính, huấn luyện mô hình dựa trên tập dữ liệu mẫu có nội dung giao tiếp, tương tác giữa người sử dụng và điện thoại thông minh qua ngôn ngữ nói tiếng Việt, nhấn mạnh việc chọn sử dụng phương pháp MaxEnt huấn luyện mô hình ứng dụng trên ĐTTM và các chiến lược trích chọn thuộc tính hiệu quả nhất với bài toán đã đề ra.

Bên cạnh đó cũng đưa ra thêm một cách đánh giá nữa sử dụng phương pháp Trường điều kiện ngẫu nhiên (Conditional Random Fields –CRFs) do Lafferty cùng các cộng sự giới thiệu năm 2001 nhằm đánh giá kết quả mô hình nhận dạng thực thể tên cho ngôn ngữ nói được khách quan hơn. Chương 4 trình bày các kết quả thực nghiệm cụ thể, một cách chi tiết và cẩn thận cho cả hai phương pháp MaxEnt và CRFs, phân tích và đánh giá từng kết quả trung LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 3 bình của 4 lần kiểm tra và đánh giá chéo có được cho mỗi loại thực thể tên, bên cạnh đó cũng lý giải rõ vì sao từng loại thực thể đó đã đạt được kết quả như vậy. Chương 5 tổng kết bằng cách nêu lại các việc đã thực hiện và kết quả đạt được, chưa đạt được trong luận văn này. Ngoài ra chương này cũng đề cập tới hướng phát triển nghiên cứu của đề tài trong tương lai.

LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 4 Chƣơng 1. Nhận dạng tiếng nói và nhận dạng thực thể tên cho ngôn ngữ nói 1. Sự phát triển và ứng dụng của công nghệ nhận dạng tiếng nói Hiện nay, với những thế mạnh vượt trội [8, 11, 12] của công nghệ nhận dạng tiếng nói tự động, việc sử dụng ngôn ngữ tự nhiên để giao tiếp và tương tác với các thiết bị thông minh (TBTM) ngày nay càng trở nên phổ biến. Đây là xu thế phát triển mới và tiềm năng trong tương lai gần.

Chúng ta có thể dễ dàng thấy được một trong số các công cụ đã thực hiện thành công ứng dụng công nghệ nhận dạng tiếng nói tự động. Thứ nhất phải kể đến đó là công cụ dịch tự động từ ngôn ngữ nói sang ngôn ngữ nói [2] của Microsoft1 và AT&T2 là Microsoft Skype Translator hay AT&T Speech – to – Speech Translator. Thứ hai, các ứng dụng trong các trung tâm cuộc gọi tự động (call center) và trong nghành công nghiệp ô tô hiện đại như: điều khiển ô tô tự hành… Bên cạnh đó, gần đây sự xuất hiện của các phần mềm trợ lý ảo cho người dùng trên các TBTM gồm điện thoại thông minh (ĐTTM), máy tính bảng như: Siri3 của Apple, Cortana4 của Microsoft hay Google Now5 của Google là 3 hãng công nghệ lớn nhất và nổi tiếng trên thế giới đã tiên phong hiện thực hóa việc giao tiếp và tương tác bằng giọng nói giữa con người với các TBTM. Mới đây nhất, một hãng công nghệ nổi tiếng ở Châu Á - hãng Sharp của Nhật đã giới thiệu một sản phẩm công nghệ cao là chú robot có tên RoboHon6 có thể giao tiếp trực tiếp với con người thông qua ngôn ngữ nói của con người trong mọi lĩnh vực.

Chú robot đó có khả năng hết sức ấn tượng, có thể thực hiện các công việc như: nhắc nhở, đánh thức, thực hiện cuộc gọi cho ai đó theo yêu cầu của người dùng hay giúp người sử dụng trình chiếu các slides, chụp ảnh, quay phim, tìm kiếm thông tin. Không dừng lại ở đó chú còn có thể hội thoại trực tiếp với người sử dụng, thực hiện các mệnh lệnh do người sử dụng đưa ra với độ chính xác cực cao. Tất cả các ứng dụng này phục vụ với nhiều mục đích khác nhau nhưng tất cả chúng đều có hai giai đoạn chính: nhận dạng tiếng nói tự động (Automatic Speech Recognition – ASR) và hiểu văn bản ngôn ngữ nói (spoken texts understanding) [21]. Nhận dạng thực thể tên (Named Entity Recognition) cho văn bản ngôn ngữ nói chính là một trong những vấn đề cơ bản và cần thiết để giúp cho việc hiểu được ngôn ngữ tự nhiên một cách dễ dàng hơn.

Nhận dạng thực thể tên 1. Tại sao cần nhận dạng thực thể tên? 1 Microsoft Skype Translator: http://research.com/en-us/about/speech-tospeech-milestones.aspx 2 AT&T: Speech–to–speech translation, with no latency.com/projects/Speech_Translation 3 http://www.com/ios/siri/ 4 http://windows.com/en-us/windows-10/getstarted-what-is-cortana 5 https://www.com/landing/now/#whatisit 6 https://robohon.com/special/english/ LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 5 Chúng ta đang sống trong thời đại thông tin, trong mọi thời điểm một lượng lớn thông tin được tạo ra trên Internet và một số nguồn khác đã làm gia tăng kích thước thông tin khổng lồ và nhanh chóng. Muốn truy cập và sử dụng lượng thông tin này, chúng ta cần phải thực sự thay đổi hoàn toàn cách làm việc và nghiên cứu với số lượng thông tin khổng lồ đó. Đối với một tổ chức, doanh nghiệp hay công ty việc sở hữu và sử dụng có hiệu quả các thông tin được coi là một phần quan trọng của chiến lược cạnh tranh.

Mặt khác, quy mô và phạm vi của các thông tin hữu ích trong lượng thông tin khổng lồ kia mà người sử dụng cần phải xử lý, thao tác tại một thời điểm nhất định là điều vô cùng khó khăn nếu như không có phương pháp hoặc kỹ thuật tốt. Hơn nữa, việc truy cập thông tin sẽ không được sử dụng nhiều nếu không có cách tiếp cận cũng như kỹ thuật phù hợp để xử lý và trích chọn các thông tin hữu ích đó. Vậy đâu là câu trả lời cho những thách thức khó khăn như vậy? Chính là kỹ thuật trích chọn thông tin (Information Extraction) [23], kỹ thuật này cho phép biến đổi dữ liệu văn bản không có cấu trúc biểu diễn thành dữ liệu có cấu trúc và được hiểu bằng máy. Trích chọn thông tin được nghiên cứu từ nhiều thập kỷ trước và nó có rất nhiều nhánh chủ đề khác nhau được cộng đồng xử lý ngôn ngữ tự nhiên giải quyết một cách nghiêm túc và thấu đáo.

Một trong những hội nghị quan trọng nhất về xử lý ngôn ngữ tự nhiên được đánh giá cao đó là hội nghị Message Understanding Conferences. Cũng ở hội nghị này vào năm 1996 (MUC-67), Grishman và Sundheim lần đầu tiên trình bày nghiên cứu của mình về nhiệm vụ xác định tên cho các thực thể từ các văn bản ngôn ngữ tự nhiên. Do đó nhiệm vụ này còn có tên nhận dạng thực thể tên [4, 5, 20]. Với lượng thông tin lớn và đa dạng phong phú như vậy sẽ là không khả thi cho con người xử lý các dữ liệu đó để xác định tìm kiếm các thông tin.

Máy tính và các TBTM hiện nay là cần thiết để thực hiện các công việc tìm kiếm xác định các thông tin hữu ích, có giá trị giúp con người. Nhận dạng thực thể tên (Named Entity Recognition) là một phương pháp chính đóng vai trò quan trọng cho việc tìm kiếm xác định, trích chọn những thông tin và giúp hiểu hơn về các thông tin đó. Định nghĩa thực thể tên và nhận dạng thực thể tên Nhận dạng thực thể tên được nhiều nhà khoa học nghiên cứu rất nhiều trong suốt gần 20 năm qua. Lần đầu tiên được giới thiệu tại hội nghị MUC6 [6, 9] bởi Grishman và Sundheim và sau đó 2 năm, vào năm 1998 tại MUC7 Chinchor và Robinson cũng có thêm những trình bày mở rộng hơn cho lĩnh vực nghiên cứu này.

Ban đầu nhận dạng thực thể tên tập trung vào một số ngôn ngữ như: tiếng Anh, tiếng Trung, tiếng Tây Ban Nha, tiếng Nhật và một số ngôn ngữ khác. Không có một định nghĩa chính thức “Thế nào là một thực thể tên” từ góc nhìn ngôn ngữ học. Thuật ngữ thực thể tên được chính hai tác giả là Sundheim và Grishman giới thiệu lần đầu tiên tại hội nghị MUC-6. Ý tưởng cơ bản của vấn đề này là tìm kiếm 7 http://www.edu/cs/faculty/grishman/muc6.html LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 6 trong văn bản các tên người, tên tổ chức, tên các vị trí, thời gian, tiền tệ, biểu thức tỉ lệ phần trăm … Mục tiêu là trích chọn trong văn bản ngôn ngữ tự nhiên tất cả các từ, cụm từ có cùng loại thực thể.

Theo hai tác giả Grishman & Sundheim thuật ngữ nhận dạng thực thể tên được định nghĩa đầy đủ như sau: “Nhận dạng thực thể tên (Named Entity Recognition) là một quá trình xác định tìm kiếm các từ hoặc cụm từ có nghĩa từ văn bản ngôn ngữ tự nhiên phân loại thành các nhóm duy nhất được định nghĩa trước đó như: tên người (person), tên tổ chức (organization), ngày giờ (datetime), địa điểm (location), con số (number), tiền tệ… ”.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ