Chương 1 trình bày tổng quan về sự phát triển vượt trội của công nghệ nhận dạng tiếng nói trong một vài năm trở lại đây và những ứng dụng của nó trong thế giới công nghệ hiện nay. Ở chương này cũng trình bày về nhận dạng thực thể tên trong văn bản viết thông thường và trong văn bản ngôn ngữ nói cũng như định nghĩa thế nào là nhận dạng thực thể tên, nêu một số khó khăn thách thức đặc thù của dữ liệu và bài toán nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt. Chương này cũng đề cập tới việc tại sao cần nhận dạng thực thể tên, nêu bật được ý nghĩa của bài toán nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt. Chương 2 trình bày khái quát một số phương pháp điển hình đã được áp dụng trong bài toán nhận dạng thực thể tên và một số kiến thức cơ bản trong việc đánh giá kết quả của hệ thống nhận dạng thực thể tên, một số hướng tiếp cận, kỹ thuật tối ưu trong việc ước lượng tham số mô hình học máy, từ đó tìm hiểu chi tiết cơ sở lý thuyết mô hình học máy Cực đại hóa Entropy (Maximum Entropy) và Trường điều kiện ngẫu nhiên (Conditional Random Fields).
Trên cơ sở bài toán và lý thuyết đi tìm hiểu những nghiên cứu có liên quan cả trong văn bản viết thông thường và ngôn ngữ nói đối với bài toán nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt. Chương 3 trình bày sơ lược về tổng thể hệ thống trợ lý ảo cho người dùng tương tác với điện thoại thông minh bằng ngôn ngữ nói của con người và mô tả rõ cách tích hợp thành phần nhận dạng thực thể tên cho văn bản ngôn ngữ nói trong hệ thống VAV. Tại chương này cũng trình bày chi tiết về cách giải quyết bài toán nhận dạng thực thể tên cho ngôn ngữ nói tiếng Việt sử dụng phương pháp học máy Cực đại hóa Entropy (Maximum Entropy - MaxEnt) do Berger cùng các cộng sự giới thiệu lần đầu vào những năm 1996. Đây cũng là chương chính trình bày cụ thể mô hình hóa bài toán và các bước thực hiện bài toán, kỹ thuật lựa chọn thuộc tính, huấn luyện mô hình dựa trên tập dữ liệu mẫu có nội dung giao tiếp, tương tác giữa người sử dụng và điện thoại thông minh qua ngôn ngữ nói tiếng Việt, nhấn mạnh việc chọn sử dụng phương pháp MaxEnt huấn luyện mô hình ứng dụng trên ĐTTM và các chiến lược trích chọn thuộc tính hiệu quả nhất với bài toán đã đề ra.
Bên cạnh đó cũng đưa ra thêm một cách đánh giá nữa sử dụng phương pháp Trường điều kiện ngẫu nhiên (Conditional Random Fields –CRFs) do Lafferty cùng các cộng sự giới thiệu năm 2001 nhằm đánh giá kết quả mô hình nhận dạng thực thể tên cho ngôn ngữ nói được khách quan hơn. Chương 4 trình bày các kết quả thực nghiệm cụ thể, một cách chi tiết và cẩn thận cho cả hai phương pháp MaxEnt và CRFs, phân tích và đánh giá từng kết quả trung z 3 bình của 4 lần kiểm tra và đánh giá chéo có được cho mỗi loại thực thể tên, bên cạnh đó cũng lý giải rõ vì sao từng loại thực thể đó đã đạt được kết quả như vậy. Chương 5 tổng kết bằng cách nêu lại các việc đã thực hiện và kết quả đạt được, chưa đạt được trong luận văn này. Ngoài ra chương này cũng đề cập tới hướng phát triển nghiên cứu của đề tài trong tương lai.
Nhận dạng tiếng nói và nhận dạng thực thể tên cho ngôn ngữ nói 1. Sự phát triển và ứng dụng của công nghệ nhận dạng tiếng nói Hiện nay, với những thế mạnh vượt trội [8, 11, 12] của công nghệ nhận dạng tiếng nói tự động, việc sử dụng ngôn ngữ tự nhiên để giao tiếp và tương tác với các thiết bị thông minh (TBTM) ngày nay càng trở nên phổ biến. Đây là xu thế phát triển mới và tiềm năng trong tương lai gần. Chúng ta có thể dễ dàng thấy được một trong số các công cụ đã thực hiện thành công ứng dụng công nghệ nhận dạng tiếng nói tự động.
Thứ nhất phải kể đến đó là công cụ dịch tự động từ ngôn ngữ nói sang ngôn ngữ nói [2] của Microsoft1 và AT&T2 là Microsoft Skype Translator hay AT&T Speech – to – Speech Translator. Thứ hai, các ứng dụng trong các trung tâm cuộc gọi tự động (call center) và trong nghành công nghiệp ô tô hiện đại như: điều khiển ô tô tự hành… Bên cạnh đó, gần đây sự xuất hiện của các phần mềm trợ lý ảo cho người dùng trên các TBTM gồm điện thoại thông minh (ĐTTM), máy tính bảng như: Siri3 của Apple, Cortana4 của Microsoft hay Google Now5 của Google là 3 hãng công nghệ lớn nhất và nổi tiếng trên thế giới đã tiên phong hiện thực hóa việc giao tiếp và tương tác bằng giọng nói giữa con người với các TBTM. Mới đây nhất, một hãng công nghệ nổi tiếng ở Châu Á - hãng Sharp của Nhật đã giới thiệu một sản phẩm công nghệ cao là chú robot có tên RoboHon6 có thể giao tiếp trực tiếp với con người thông qua ngôn ngữ nói của con người trong mọi lĩnh vực. Chú robot đó có khả năng hết sức ấn tượng, có thể thực hiện các công việc như: nhắc nhở, đánh thức, thực hiện cuộc gọi cho ai đó theo yêu cầu của người dùng hay giúp người sử dụng trình chiếu các slides, chụp ảnh, quay phim, tìm kiếm thông tin.
Không dừng lại ở đó chú còn có thể hội thoại trực tiếp với người sử dụng, thực hiện các mệnh lệnh do người sử dụng đưa ra với độ chính xác cực cao. Tất cả các ứng dụng này phục vụ với nhiều mục đích khác nhau nhưng tất cả chúng đều có hai giai đoạn chính: nhận dạng tiếng nói tự động (Automatic Speech Recognition – ASR) và hiểu văn bản ngôn ngữ nói (spoken texts understanding) [21]. Nhận dạng thực thể tên (Named Entity Recognition) cho văn bản ngôn ngữ nói chính là một trong những vấn đề cơ bản và cần thiết để giúp cho việc hiểu được ngôn ngữ tự nhiên một cách dễ dàng hơn. Nhận dạng thực thể tên 1.
Tại sao cần nhận dạng thực thể tên? 1 Microsoft Skype Translator: http://research.com/en-us/about/speech-tospeech-milestones.aspx 2 AT&T: Speech–to–speech translation, with no latency.com/projects/Speech_Translation 3 http://www.com/ios/siri/ 4 http://windows.com/en-us/windows-10/getstarted-what-is-cortana 5 https://www.com/landing/now/#whatisit 6 https://robohon.com/special/english/ z 5 Chúng ta đang sống trong thời đại thông tin, trong mọi thời điểm một lượng lớn thông tin được tạo ra trên Internet và một số nguồn khác đã làm gia tăng kích thước thông tin khổng lồ và nhanh chóng. Muốn truy cập và sử dụng lượng thông tin này, chúng ta cần phải thực sự thay đổi hoàn toàn cách làm việc và nghiên cứu với số lượng thông tin khổng lồ đó. Đối với một tổ chức, doanh nghiệp hay công ty việc sở hữu và sử dụng có hiệu quả các thông tin được coi là một phần quan trọng của chiến lược cạnh tranh. Mặt khác, quy mô và phạm vi của các thông tin hữu ích trong lượng thông tin khổng lồ kia mà người sử dụng cần phải xử lý, thao tác tại một thời điểm nhất định là điều vô cùng khó khăn nếu như không có phương pháp hoặc kỹ thuật tốt.
Hơn nữa, việc truy cập thông tin sẽ không được sử dụng nhiều nếu không có cách tiếp cận cũng như kỹ thuật phù hợp để xử lý và trích chọn các thông tin hữu ích đó. Vậy đâu là câu trả lời cho những thách thức khó khăn như vậy? Chính là kỹ thuật trích chọn thông tin (Information Extraction) [23], kỹ thuật này cho phép biến đổi dữ liệu văn bản không có cấu trúc biểu diễn thành dữ liệu có cấu trúc và được hiểu bằng máy. Trích chọn thông tin được nghiên cứu từ nhiều thập kỷ trước và nó có rất nhiều nhánh chủ đề khác nhau được cộng đồng xử lý ngôn ngữ tự nhiên giải quyết một cách nghiêm túc và thấu đáo. Một trong những hội nghị quan trọng nhất về xử lý ngôn ngữ tự nhiên được đánh giá cao đó là hội nghị Message Understanding Conferences.
Cũng ở hội nghị này vào năm 1996 (MUC-67), Grishman và Sundheim lần đầu tiên trình bày nghiên cứu của mình về nhiệm vụ xác định tên cho các thực thể từ các văn bản ngôn ngữ tự nhiên. Do đó nhiệm vụ này còn có tên nhận dạng thực thể tên [4, 5, 20]. Với lượng thông tin lớn và đa dạng phong phú như vậy sẽ là không khả thi cho con người xử lý các dữ liệu đó để xác định tìm kiếm các thông tin. Máy tính và các TBTM hiện nay là cần thiết để thực hiện các công việc tìm kiếm xác định các thông tin hữu ích, có giá trị giúp con người.
Nhận dạng thực thể tên (Named Entity Recognition) là một phương pháp chính đóng vai trò quan trọng cho việc tìm kiếm xác định, trích chọn những thông tin và giúp hiểu hơn về các thông tin đó. Định nghĩa thực thể tên và nhận dạng thực thể tên Nhận dạng thực thể tên được nhiều nhà khoa học nghiên cứu rất nhiều trong suốt gần 20 năm qua. Lần đầu tiên được giới thiệu tại hội nghị MUC6 [6, 9] bởi Grishman và Sundheim và sau đó 2 năm, vào năm 1998 tại MUC7 Chinchor và Robinson cũng có thêm những trình bày mở rộng hơn cho lĩnh vực nghiên cứu này. Ban đầu nhận dạng thực thể tên tập trung vào một số ngôn ngữ như: tiếng Anh, tiếng Trung, tiếng Tây Ban Nha, tiếng Nhật và một số ngôn ngữ khác.
Không có một định nghĩa chính thức “Thế nào là một thực thể tên” từ góc nhìn ngôn ngữ học. Thuật ngữ thực thể tên được chính hai tác giả là Sundheim và Grishman giới thiệu lần đầu tiên tại hội nghị MUC-6. Ý tưởng cơ bản của vấn đề này là tìm kiếm 7 http://www.edu/cs/faculty/grishman/muc6.html z 6 trong văn bản các tên người, tên tổ chức, tên các vị trí, thời gian, tiền tệ, biểu thức tỉ lệ phần trăm … Mục tiêu là trích chọn trong văn bản ngôn ngữ tự nhiên tất cả các từ, cụm từ có cùng loại thực thể. Theo hai tác giả Grishman & Sundheim thuật ngữ nhận dạng thực thể tên được định nghĩa đầy đủ như sau: “Nhận dạng thực thể tên (Named Entity Recognition) là một quá trình xác định tìm kiếm các từ hoặc cụm từ có nghĩa từ văn bản ngôn ngữ tự nhiên phân loại thành các nhóm duy nhất được định nghĩa trước đó như: tên người (person), tên tổ chức (organization), ngày giờ (datetime), địa điểm (location), con số (number), tiền tệ… ”.