Luận Văn: Nghiên Cứu Phát Triển Công Nghệ Nhận Dạng Và Xử Lý Ngôn Ngữ Tiếng Việt

Luận văn nghiên cứu phát triển công nghệ nhận dạng tổng hợp và xử lý ngôn ngữ tiếng Việt, ứng dụng trong lĩnh vực AI và xử lý ngôn ngữ tự nhiên.

Trường đại học

Viện Khoa học và Công nghệ Việt Nam - Viện Công nghệ Thông tin

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

báo cáo tổng kết khoa học và kỹ thuật

2004

121
4
0

Phí lưu trữ

35 Point

Tóm tắt

I. Tổng quan tình hình nghiên cứu trong và ngoài nước

Nghiên cứu về nhận dạngxử lý ngôn ngữ tiếng Việt đã được thực hiện từ sớm, với nhiều chương trình trọng điểm quốc gia. Ba lĩnh vực chính bao gồm nhận dạng tiếng nói, nhận dạng chữ, và xử lý ngôn ngữ tự nhiên. Các nghiên cứu này không chỉ giúp phát triển công nghệ thông tin mà còn đáp ứng nhu cầu giao tiếp bằng tiếng Việt. Mặc dù có nhiều thành tựu trong lĩnh vực này, nhưng việc phát triển các sản phẩm thương mại cho tiếng Việt vẫn còn hạn chế. Các phần mềm thương mại cho tiếng Anh đã đạt được chất lượng cao, trong khi tiếng Việt vẫn cần nhiều nghiên cứu hơn để đạt được kết quả tương tự. Đặc biệt, việc xử lý ngôn ngữ tự nhiêndịch tự động vẫn là những thách thức lớn, với nhu cầu cấp thiết trong việc phát triển các công cụ hỗ trợ cho người dùng. Những nghiên cứu này không chỉ mang lại giá trị lý thuyết mà còn có ứng dụng thực tiễn trong đời sống hàng ngày.

II. Những nội dung đã thực hiện

Đề tài đã thực hiện ba nội dung chính: nhận dạng và tổng hợp tiếng Việt, nhận dạng chữ Việt in và viết tay, và xử lý ngôn ngữ tự nhiên tiếng Việt. Mỗi nội dung đều có những sản phẩm phần mềm cụ thể như VnVoice 2.0 cho tổng hợp tiếng nói, VnCommand cho nhận dạng lệnh, và VnDOCR 3.0 cho nhận dạng chữ in. Các sản phẩm này không chỉ phục vụ cho nghiên cứu mà còn có thể ứng dụng trong thực tiễn. Đặc biệt, việc phát triển phần mềm dịch tự động EVTRAN 2.0 đã góp phần quan trọng trong việc hỗ trợ người dùng trong việc dịch văn bản. Tuy nhiên, việc nhận dạng chữ viết tay vẫn còn nhiều hạn chế và cần được nghiên cứu thêm. Các kết quả nghiên cứu đã được công bố trên nhiều tạp chí và hội nghị, làm phong phú thêm lý thuyết về tổng hợp và nhận dạng ngôn ngữ đơn âm đa thanh điệu.

III. Kết quả nghiên cứu về Tổng hợp và Nhận dạng tiếng Việt

Đề tài đã tiến hành khảo sát về ngữ âm tiếng Việt, một yếu tố quan trọng trong việc phát triển công nghệ nhận dạng và tổng hợp tiếng nói. Tiếng Việt có cấu trúc âm tiết đặc trưng với các thanh điệu khác nhau, điều này đòi hỏi các phương pháp nghiên cứu phù hợp. Đã có ba phương pháp tổng hợp tiếng Việt được nghiên cứu, trong đó phương pháp kết nối các đơn vị âm cơ bản (PSOLA) được lựa chọn là giải pháp tối ưu. Phương pháp này cho phép tạo ra âm thanh cho bất kỳ âm tiết nào, mở ra khả năng ứng dụng rộng rãi trong các sản phẩm công nghệ. Việc phân tích âm tiết và thanh điệu đã giúp xây dựng cơ sở dữ liệu âm cho tiếng Việt, từ đó nâng cao chất lượng nhận dạng và tổng hợp tiếng nói.

IV. Nghiên cứu phát triển kỹ thuật nhận dạng chữ in và viết tay tiếng Việt

Nghiên cứu về nhận dạng chữ đã đạt được những thành tựu nhất định, đặc biệt là trong lĩnh vực nhận dạng chữ in. Phần mềm VnDOCR 2.0 đã được phát triển và thương mại hóa, tuy nhiên vẫn cần cải thiện để đáp ứng yêu cầu cao hơn về chất lượng nhận dạng. Nhận dạng chữ viết tay vẫn là một thách thức lớn, với nhiều phương pháp hiện tại chỉ có thể nhận dạng chữ viết tay có hạn chế. Việc phát triển các công nghệ mới và cải tiến các phương pháp hiện có là cần thiết để nâng cao khả năng nhận dạng chữ viết tay tiếng Việt. Các nghiên cứu này không chỉ có giá trị lý thuyết mà còn có ứng dụng thực tiễn trong việc số hóa tài liệu và hỗ trợ người dùng trong việc tương tác với máy tính.

V. Nghiên cứu phát triển các kỹ thuật xử lý ngôn ngữ tự nhiên tiếng Việt

Xử lý ngôn ngữ tự nhiên là một lĩnh vực quan trọng trong nghiên cứu công nghệ thông tin. Đề tài đã tập trung vào việc phát triển các phương pháp dịch tự động và xây dựng từ điển điện tử cho tiếng Việt. Sản phẩm EVTRAN 2.0 đã được phát triển để hỗ trợ dịch văn bản từ tiếng Anh sang tiếng Việt, tuy nhiên, việc dịch ngược lại vẫn chưa được thực hiện. Các nghiên cứu về xử lý ngôn ngữ tự nhiên cần được mở rộng để bao quát nhiều khía cạnh hơn, từ phân tích ngữ nghĩa đến xây dựng các công cụ hỗ trợ cho người dùng. Việc phát triển các công nghệ này không chỉ giúp nâng cao khả năng giao tiếp giữa người và máy mà còn góp phần vào việc bảo tồn và phát triển ngôn ngữ Việt Nam trong thời đại số.

01/03/2025
Luận văn nghiên cứu phát triển công nghệ nhận dạng tổng hợp và xử lý ngôn ngữ tiếng việt

Trích đoạn nội dung tài liệu

LỜI MỞ ĐẦU Nhận dạng và xử lý ngôn ngữ nói và viết tiếng Việt là nhu cầu thiết yếu của phát triển và ứng dụng công nghệ thông tin ở Việt nam. Giới nghiên cứu và công nghiệp trên thế giới do theo đuổi các nghiên cứu cơ bản và công nghệ này từ hàng chục năm qua, gần đây đã thu được nhiều thành tựu quan trọng. Khác với các sản phẩm khác của công nghệ thông tin, sản phẩm về tiếng nói, chữ viết và ngôn ngữ Việt không thể mua được từ nước ngoài, chỉ có thể do người Việt làm ra trên cơ sở tiếp thu được các thành tựu khoa học công nghệ trên thế giới và theo đuổi thực hiện lâu dài. Những năm qua trong khuôn khổ chương trình trọng điểm nhà nước, một số kết quả nghiên cứu và sản phẩm về nhận dạng và xử lý tiếng Việt - tập trung cho nhận dạng chữ Việt in - đã thành công và bắt đầu được sử dụng rộng rãi.

Đề tài này nhằm theo đuổi những nghiên cứu và phát triển phải thực hiện lâu dài về tiếng Việt trên máy tính với sự triển khai một số phương hướng mới. Mục tiêu của đề tài là nghiên cứu làm chủ các phương pháp, kỹ thuật tiên tiến trong một số lĩnh vực của trí tuệ nhân tạo và lý thuyết nhận dạng trên thế giới để xây dựng các phương pháp hiệu quả cho nhận dạng tiếng nói, chữ viết, và xử lý ngôn ngữ tự nhiên tiếng Việt. Đề tài vừa tiếp tục xây dựng các phương pháp và công cụ cơ bản vừa từng bước tạo ra một số sản phẩm thiết thực nhằm giải quyết một số bài toán cấp bách trong phát triển và ứng dụng công nghệ thông tin ở Việt nam. Ba nội dung chính quan hệ chặt chẽ với nhau được nghiên cứu trong đề tài là: 1.

Nhận dạng và tổng hợp tiếng Việt 2. Nhận dạng chữ Việt in và viết tay 3. Xử lý ngôn ngữ tự nhiên tiếng Việt 2. NỘI DUNG CHÍNH CỦA BÁO CÁO 2.

Tổng quan tình hình nghiên cứu trong và ngoài nước Ba lĩnh vực (1) nhận dạng và tổng hợp tiếng nói, (2) nhận dạng chữ, và (3) xử lý ngôn ngữ tự nhiên có liên quan mật thiết với nhau, và là nền tảng cho sự phát triển và ứng dụng công nghệ thông tin của mọi quốc gia Nhận dạng tiếng nói nhằm chuyển thông tin từ tiếng nói con người vào máy tính, và tổng hợp tiếng nói nhằm tự động tạo ra tiếng người nói bằng máy tính. Cùng với sự phát triển nhanh chóng của công nghệ thông tin nói chung và mạng Internet nói riêng, nhận dạng và tổng hợp tiếng nói càng ngày càng trở nên là một xu hướng tất yếu cho những máy tính thế kỉ 21. Trong vòng 50 năm qua, rất nhiều thuật toán được đề xuất và triển khai trên các hệ tự động nhận dạng và tổng hợp tiếng nói. Trên thế giới đã có nhiều bộ phần mềm thương mại dành cho tiếng Anh như IBM ViaVoice, Dragon Naturally Speaking, L&H Voice Xpress.

Những phần mềm này cung cấp các chức năng chủ yếu như: nhập văn bản vào máy, đọc văn bản thành lời, duyệt Web bằng giọng nói. Gần đây nhất hãng Microsoft đã công bố việc tích hợp VUI (Voice User Interface) thay cho GUI (Graphic User Interface) truyền thống vào phiên bản hệ điều hành Windows thế hệ mới với mật danh 7 Whistler. Kết quả này có ý nghĩa rất lớn trong giao tiếp người-máy: thay vì giao tiếp với máy tính qua những biểu tượng và cửa sổ, các máy tính trong tương lai chỉ giao tiếp với con người bằng những mệnh lệnh đơn giản. Nhận dạng và tổng hợp tiếng nói có vai trò quan trọng đối với việc phát triển các hệ thông tin di động thế hệ thứ 3 (3G), với các tính năng ưu việt tập trung trong chiếc máy điện thoại di động mà một trong các dịch vụ điển hình là hệ thống thông điệp hợp nhất (Unified Messaging System - UMS).

Sản phẩm về các bo mạch của Dialogic đã tích hợp các công nghệ tổng hợp và nhận dạng tiếng nói qua điện thoại cho nhiều ngôn ngữ hệ Latinh. Ngoài ra, một trong những ứng dụng điển hình và mang tính chất kinh điển từ trước tới nay của nhận dạng tiếng phục vụ cho điều khiển bằng giọng nói và bảo mật, cho tự động hoá văn phòng, những ứng dụng rộng rãi trong viễn thông, bảo tồn văn hoá, hỗ trợ người khuyết tật. Về lĩnh vực nhận dạng chữ, các phần mềm thương phẩm nhận dạng chữ in cho các ngôn ngữ hệ Latinh và Slavơ đã đạt được chất lượng nhận dạng rất cao, ví dụ như OMNIPAGE 11.0 của Caere (Mỹ), Fine Reader 7. Để đạt tới các phiên bản với chất lượng cao như vậy, từ hơn 10 năm nay, các hãng phần mềm này vẫn phải liên tục cho phát triển hoàn thiện các chức năng nhận dạng cũng như tiền và hậu xử lý.

Nhưng đối với chữ viết tay trực tuyến hoặc gián tiếp, chất lượng nhận dạng thấp hơn nhiều và các phương pháp hiện nay mới chỉ nhận dạng được chữ viết tay có hạn chế. Vì vậy trên các tạp chí chuyên ngành về nhận dạng, các chủ đề này vẫn còn đang được đề cập đến nhiều với các cách tiếp cận khác nhau, đề cập tới các phương pháp cải tiến để tăng chất lượng nhận dạng, tách và cắt chữ, và kết hợp với ngữ nghĩa của từng ngôn ngữ cụ thể. Xử lý ngôn ngữ tự nhiên là lĩnh vực nhằm làm cho máy tính có thể hiểu và sử dụng được ngôn ngữ tự nhiên của con người (cả ngôn ngữ nói và ngôn ngữ viết), bao gồm các hệ dịch tự động, tìm kiếm thông tin, tổng hợp văn bản tự động, tính toán ngôn ngữ, v. Dịch văn bản từ một ngôn ngữ qua ngôn ngữ khác bằng máy tính là mơ ước từ buổi đầu của công nghệ thông tin.

Với thành tựu nghiên cứu về xử lý ngôn ngữ tự nhiên bắt đầu từ những năm 60, cùng với sự tiến bộ nhanh chóng của kỹ thuật tính toán, việc dịch tự động ngôn ngữ tự nhiên đang được từng bước ứng dụng. Hiện nay trên thế giới đã có nhiều hệ dịch máy thương phẩm với chất lượng chấp nhận được (SYSTRAN, GLOBALINK, STYLUS, IBM,. Các cặp ngôn ngữ đã được thực hiện chủ yếu là những ngôn ngữ Âu châu (bao gồm Anh-Pháp, Pháp- Anh, Anh-Đức, Anh-Tây ban nha, Anh-Nga, Anh-Nhật, Nhật-Anh, v. và một số sản phẩm dịch một chiều khác).

Các sản phẩm dịch tự động được sử dụng phổ biến từ những phần mềm cho các hệ máy lớn, trạm làm việc và máy tính cá nhân đến những thiết bị dịch tự động chuyên dụng cầm tay. Trên thế giới chưa có thương phẩm nào biên dịch Anh-Việt hay Việt-Anh. Tình hình nghiên cứu trong nước: Nghiên cứu về nhận dạng và ứng dụng đã được tiến hành ở nước ta từ khá sớm. Các chương trình trọng điểm quốc gia về tin học, CNTT từ năm 1981 đến nay đều có nội dung nghiên cứu về nhận dạng.

Đặc biệt từ năm 1991 đến nay, trong 8 chương trình khoa học và công nghệ KC-01 (giai đoạn 1991-1995, 1996-2000), các vấn đề về Nhận dạng và xử lý thông tin hình ảnh đã được quan tâm và là nội dung nghiên cứu chính của đề tài KC-01-10, KC-01-07. Các đề tài đều được nghiệm thu đánh giá xuất sắc. Tuy nhiên trong giai đoạn này mới chỉ tập trung nỗ lực vào vấn đề nhận dạng chữ (sản phẩm VnDOCR 1.0) và một phần về dịch tự động (sản phẩm EVETRAN 1.0), nhận dạng và tổng hợp tiếng nói mới là những nghiên cứu thử nghiệm. Mặc dù trên thế giới đã có những bước tiến khá dài trong lĩnh vực nhận dạng-tổng hợp tiếng nói, và xử lý ngôn ngữ tự nhiên, ở Việt nam vấn đề này chỉ mới được quan tâm và chưa nhiều người nghiên cứu.

Trong khi đó nhu cầu giao tiếp với máy tính bằng tiếng Việt đang ngày càng cấp thiết bởi chúng ta không thể lúc nào cũng sử dụng các phần mềm nhận dạng và tổng hợp tiếng nói với ngôn ngữ là tiếng Anh. Nhận dạng, tổng hợp tiếng nói Việt, nhận dạng chữ viết Việt, máy hiểu ngôn ngữ Việt không chỉ cần những nghiên cứu cơ bản và kỹ thuật chung, mà còn phải dựa trên các đặc trưng ngôn ngữ tiếng Việt. Đã có những bước đi ban đầu của một số cơ sở có tiến hành nghiên cứu về lĩnh vực này: - Phòng Nhận dạng và Công nghệ Tri thức, Viện Công nghệ Thông tin, - Trung tâm MICA, Đại học Bách khoa, Hà nội - Nhóm nghiên cứu của Bộ môn Khoa học Máy tính, Khoa CNTT, ĐHBK Hà Nội, - Nhóm nghiên cứu của Khoa Công nghệ Thông tin, Trường Đại học Khoa học Tự nhiên, TP. Hồ Chí Minh, - Công ty CDIT, Tổng Công ty Bưu chính Viễn thông Việt nam - Softext, Viện ứng dụng công nghệ và còn một số công trình của các cá nhân làm đề tài thạc sĩ và tiến sĩ.

Về nhận dạng và tổng hợp tiếng Việt: Trước hết đây là vấn đề khó, đòi hỏi phải có tập trung nghiên cứu trong thời gian dài. Trong thời gian qua, các nghiên cứu còn tản mạn, các kết quả tập trung chủ yếu vào thử nghiệm bước đầu tổng hợp tiếng Việt dựa trên một số kỹ thuật cơ bản, và giải quyết các ứng dụng điều khiển bằng giọng nói với lượng từ vựng nhỏ để có thể triển khai nhanh, để minh họa và thực tế là chưa khai thác đặc điểm riêng của ngữ âm tiếng Việt. Trong đề tài KC- 01-10, các nội dung về tổng hợp và nhận dạng tiếng Việt mới được tiến hành nghiên cứu ở hai năm cuối (1999-2000). Vì thế chưa có sản phẩm có khả năng ứng dụng rộng rãi chẳng hạn cho các ứng dụng văn phòng hay các ứng dụng trong viễn thông.

Về nhận dạng chữ Việt: Phòng Nhận dạng và Công nghệ tri thức Viện CNTT đã bước đầu thành công trong lĩnh vực nhận dạng chữ Việt in, đã và đang phát triển phần mềm Nhận dạng VnDOCR 2.0 hiện đang thương mại hoá rộng rãi trên thị trường. Cũng như bất kỳ một sản phẩm phần mềm nào, VnDOCR cần được hoàn thiện để giải quyết các yêu cầu cao hơn về chất lượng nhận dạng trên các văn bản đầu vào xấu hơn, các tài liệu cũ, v. Ngoài ra, các khoa Công nghệ Thông tin của các trường đại học như Bách khoa Hà nội, Đại học Quốc gia, Đại học KHTN TP 9 Hồ Chí Minh cho sinh viên làm luận văn cao học hoặc cử nhân về nhận dạng chữ, nhưng đều ở dạng tiếp cận kiến thức, chưa thành dạng thương phẩm. Sản phẩm Image Scan của Công ty CadPro cũng có giới thiệu bước đầu trên thị trường.

Ngoài ra vấn đề nhận dạng chữ viết tay tiếng Việt cũng cần được đặt ra để giải quyết cho từng bài toán cụ thể.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Nghiên cứu phát triển công nghệ nhận dạng và xử lý ngôn ngữ tiếng Việt" tập trung vào việc ứng dụng các công nghệ tiên tiến như học sâu và xử lý ngôn ngữ tự nhiên (NLP) để cải thiện khả năng nhận dạng và xử lý tiếng Việt. Nghiên cứu này mang lại lợi ích lớn cho các nhà phát triển và nhà nghiên cứu trong việc xây dựng các hệ thống thông minh, từ chatbot đến dịch máy, đặc biệt là trong bối cảnh tiếng Việt có nhiều đặc thù phức tạp. Để hiểu sâu hơn về các ứng dụng cụ thể, bạn có thể tham khảo Luận văn thạc sĩ khoa học máy tính xây dựng hệ thống học sâu tự động thêm dấu cho tiếng Việt, nghiên cứu về việc tự động hóa quá trình thêm dấu trong tiếng Việt. Ngoài ra, Luận văn thạc sĩ khoa học máy tính trích xuất thông tin thực thể và quan hệ trong văn bản tiếng Việt bằng mô hình đồ thị động cung cấp cái nhìn chi tiết về việc trích xuất thông tin từ văn bản tiếng Việt. Cuối cùng, Luận văn thạc sĩ khoa học máy tính dịch máy tiếng Việt bằng phương pháp attention là một tài liệu hữu ích để khám phá cách áp dụng các phương pháp dịch máy hiện đại vào tiếng Việt.