Chương 1: Tổng quan về tổng hợp và nhận dạng tiếng nói. 6 Chương này trình bày khái quát về tổng hợp và nhận dạng tiếng nói dựa trên phương pháp Corpus-based theo cả hai phương pháp là chọn đơn vị để ghép nối và mô hình tổng hợp dựa trên HMM cho vấn đề tổng hợp tiếng nói và mô hình HMM cho vấn đề nhận dạng tiếng nói. Chương này còn phân tích một số hệ thống tổng hợp và nhận dạng tiếng nói cũng như mô hình Fujisaki để tổng hợp đường F0. Chương 2: Xử lý tiếng nói và các mô hình học máy.
Chương này trình bày các công cụ cơ bản trong tiền xử lý tiếng nói, trích chọn đặc trưng tiếng nói, đặc trưng ngôn điệu và các mô hình học máy cho vấn đề dự báo, học và nhận dạng tiếng nói. Dự báo trường độ, âm lượng và tổng hợp thanh điệu tiếng Việt Chương này trình bày một số kết quả của luận án về tổng hợp tiếng Việt: Nghiên cứu về các mô hình ngôn điệu, phân tích đặc trưng tiếng Việt. Dự báo trường độ và âm lượng của âm tiết trong ngữ lưu. Tổng hợp tiếng Việt trên các hệ thống tài nguyên hạn chế.
Kết hợp tham số cấu âm, formant và thanh điệu để nâng cao chất lượng nhận dạng tiếng Việt Nghiên cứu về nhận dạng thanh điệu tiếng Việt. Nghiên cứu đưa đặc trưng thanh điệu, tham số formant và tham số cấu âm của người nói để nâng cao chất lượng nhận dạng tiếng Việt. Nhận dạng tiếng Việt trên các hệ thống tài nguyên hạn chế. Kết quả đạt được của luận án Các kết quả đạt được của luận án đã được công bố trong 2 bài báo tại chí chuyên ngành năm 2011, 3 bài báo cáo đăng tại kỷ yếu hội nghị trong nước năm 2012, 2014.
Ngoài ra nghiên cứu sinh cũng là đồng tác giả của một số báo cáo tại hội nghị trong 7 nước, nước ngoài thời gian trước khi là nghiên cứu sinh. Những kết quả đạt được của luận án có thể tóm tắt như sau: Bài tạp chí “Tổ hợp đường F0 và VTLN cho nhận dạng tên riêng tiếng Việt“, Tạp chí Tin học và Điều khiển học”, trang 273 – 282, Tập 27, số 3, 2011. Bài báo trình bày nghiên cứu và thử nghiệm hiệu ứng của tổ hợp đặc trưng F0 và chuẩn hóa độ dài bộ phận cấu âm (VTLN, vocal tract length normalisation) để nâng cao chất lượng nhận dạng tiếng tên tiếng Việt trong mô hình nhận dạng tiếng nói phát âm liên tục dựa trên HMM. Các kết quả của bài báo chứng tỏ rằng hệ nhận dạng tiếng nói độc lập người nói với đặc trưng tiếng nói dựa trên đường F0 và đặc trưng MFCC biến đổi theo VTLN đã chuẩn hóa tốt biến thiên tần số của người nói mới và cải tiến được kết quả nhận dạng.
“Dự báo các giá trị ngôn điệu tiếng Việt cho tiếng nói tổng hợp”, Tạp chí Công nghệ Thông tin và Truyền thông, Tập V-1 số 6(26), 09-2011, trang 236-241. Bài báo trình bày các kết quả nghiên cứu và thử nghiệm tích hợp các giá trị ngôn điệu tiếng Việt được dự báo như trường độ và âm lượng cho câu tiếng nói tổng hợp sử dụng mô hình học thống kê CART. Các kết quả trình bày trong bài báo chứng tỏ việc đưa giá trị ngôn điệu được dự báo từ văn bản vào trong bộ tổng hợp tiếng Việt được thống kê chi tiết cho cơ sở dữ liệu âm huấn luyện mô hình kết hợp các ngữ cảnh mức âm vị khác nhau đã cải tiến được chất lượng dự báo các tham số ngôn điệu như trường độ và âm lượng, dẫn đến thay đổi đáng kể chất lượng câu tiếng nói được tổng hợp. Kỷ yếu hội thảo “Trích chọn đặc trưng âm học tiếng Việt dựa trên F0 và biến thể của MFCC với ước lượng VTLN từ các giá trị formant”.
Hội nghị quốc gia lần thứ VII "Nghiên cứu cơ bản và ứng dụng Công nghệ thông tin", FAIR 2014. Bài báo cáo trình bày 8 ứng dụng phương pháp ước lượng tham số VTLN dựa trên bộ phát hiện tiếng nói và các giá trị formant thay thế cho phương pháp ML (Maximum likelihood) để tối ưu hóa về tính toán khi xây dựng một hệ thống nhận dạng tên tiếng Việt. “Tối ưu lưu trữ và tính toán tín hiệu tiếng nói cho hệ tổng hợp Tiếng Việt dựa trên ghép nối”, Hội nghị quốc gia lần thứ VII "Nghiên cứu cơ bản và ứng dụng Công nghệ thông tin", FAIR 2014. Bài báo cáo trình bày kết quả xây dựng hệ tổng hợp tiếng Việt theo phương pháp ghép nối âm cơ bản trên môi trường chip với tài nguyên hạn chế.
“Thiết kế hệ thống nhận dạng khẩu lệnh tiếng Việt điều khiển thiết bị tự hành trên nền các vi hệ thống điện năng thấp với phép chuẩn hóa VTLN – MFCC”, hội nghị VCM-2012. Bài báo cáo trình bày thiết kế và thử nghiệm hệ thống nhận dạng khẩu lệnh tiếng Việt để điều khiển thiết bị tự hành, tích hợp hoàn toàn trong một chip vi hệ thống điện năng thấp như họ PSoC5 lõi (ARMCortex M3 chip, 64KB RAM, 256KB Flash) hoặc họ OMAP3 (lõi ARM7,128MB RAM), được phát triển dựa trên mô hình nhận dạng Markov ẩn kết hợp mạng nơ ron dự báo. Các công bố trước thời gian làm nghiên cứu sinh Phân lớp các đường thanh điệu trong ngữ cảnh câu, kỷ yếu Hội thảo Quốc gia, NXB KHKT, 2006, tr 279-284. Nhận dạng thanh điệu tiếng Việt trên tiếng nói rời rạc phụ thuộc người nói, kỷ yếu Hội thảo Quốc gia, NXB KH&KT, tr 443-449, 2006.
Sử dụng mô hình Fujisaki và mạng nơ ron trong nhận dạng và tổng hợp thanh điệu tiếng Việt" (2006), kỷ yếu hội thảo: “Nghiên cứu cơ bản và ứng dụng công nghệ thông tin FAIR2005”, Thành phố Hồ Chí Minh tháng 9 năm 2005, NXB KHKT, Hà Nội. Toward integrating the Fujisaki model into Vietnamese TTS, proceeding of the International Conference on Spoken Language Processing, Korea 2004. 9 Quantitative Analysis and Synthesis of Syllabic Tones in Vietnamese,” Proc. in EUROSPEECH, Geneva, pages 177-180, 2004.
Thiết kế các hệ thống nhận dạng tiếng Việt trong thời gian thực, kỷ yếu báo cáo hội nghị FAIR nghiên cứu cơ bản và ứng dụng công nghệ thông tin, trang 349 – 357, 2003. Development of Automatic Data Entry Systems with Pattern Recognition Techniques, International Symposium on Knowledge Creation in Economics,Enviromental and Societal Systems, JAIST, Kanazawa, pp 72-78. Vietnamese text normalize and processing, Proceedings of National IT Conference. TỔNG QUAN VỀ TỔNG HỢP VÀ NHẬN DẠNG TIẾNG NÓI 1.
Tổng hợp tiếng nói Tổng hợp tiếng nói là một bộ môn khoa học nhằm nghiên cứu và xây dựng các công nghệ để tạo ra âm thanh tiếng nói từ máy giống như tiếng nói của con người. Trong những năm gần đây tiếng nói tổng hợp đã trải qua chặng đường khá dài, việc ứng dụng tổng hợp tiếng nói vào thực tiễn đã trở nên phổ biến. Tuy nhiên, chất lượng âm thanh và độ tự nhiên của tiếng nói tổng hợp cho đến nay vẫn còn là những vấn đề mở. Hệ thống TTS tổng quát.
Nói chung quá trình Tổng hợp tiếng nói bao gồm các giai đoạn chính: i)Chuẩn hóa văn bản và phân tích câu - xử lý ngôn ngữ tự nhiên. ii) Chuyển văn bản sang đơn vị tiếng nói. iii) Dự báo ngôn điệu. iv) Sinh tiếng nói.
Chuẩn hóa văn bản và phân tích câu – xử lý ngôn ngữ tự nhiên Chuẩn hoá văn bản là quá trình tiền xử lý văn bản trong thiết lập đầu vào của hệ thống TTS, mục đích của bước này là phân tích văn bản và diễn giải được văn bản đầu vào thành một chuỗi văn bản để máy có thể hiểu và đọc đúng. Quá trình chuẩn hóa văn bản thường không đơn giản. Lý do là các văn bản thường chứa nhiều từ đồng tự, số và từ viết tắt, đòi hỏi phải hiểu ngữ cảnh để diễn đạt lại trong văn bản đầy đủ. Do trong văn bản có khá nhiều từ phi chữ số như đại lượng, ngày tháng, chữ viết tắt, có các từ tiếng Anh xuất hiện xen kẽ trong văn bản tiếng Việt v.v… Quá trình này bao gồm ba bước chính: - Tiền xử lý: mô đun tiền xử lý tổ chức các câu đầu vào thành dãy các từ.
Nó xác định các số, các từ viết tắt, tên riêng, thành ngữ và biến đổi chúng thành dạng văn bản đầy đủ khi cần đến. - Phân tích hình thái: nhiệm vụ cung cấp mọi khả năng loại từ của một từ riêng lẻ. - Phân tích ngữ cảnh: xét các từ trong ngữ cảnh và từ loại đi với chúng trong từng ngữ cảnh đó. Quá trình này phải xem xét các từ trong ngữ cảnh để phiên âm phù hợp nhất với ngữ cảnh trong câu.
Xử lý các khả năng xuất hiện sự nhập nhằng về mặt ngữ nghĩa của từ hiện tại và các từ lân cận với nó. Chuyển văn bản sang đơn vị tiếng nói Bước này thực hiện dựa trên từ điển phát âm hay theo quy luật ngôn ngữ. Quá trình chuyển đổi “phiên âm” này rất quan trọng, chiếm tới hơn 30% khối lượng công việc cho phần lớn các ngôn ngữ và chữ viết không phải là loại chữ viết ghi âm - loại chữ viết nhằm tái hiện lại chuỗi âm thanh nối tiếp nhau trong từ (chữ viết của tiếng Việt là loại chữ viết ghi âm, đọc và viết là như nhau) [9] 1. Dự báo ngôn điệu Trong tổng hợp tiếng nói, việc xử lý ngữ điệu được thực hiện trên các yếu tố vật lý của tiếng nói bao gồm: tần số cơ bản F0, cường độ và trường độ.
Các hệ thống tổng 12 hợp tiếng nói hầu hết tập trung vào mục đích là tạo ra giọng nói với ngữ điệu bình thường, có sự nhấn giọng hợp lý, nhịp điệu nhịp nhàng tự nhiên và bỏ qua các hình thái cảm xúc của người nói. Dựa vào một CSDL ngữ âm đã được gán nhãn (từng câu văn bản đã được phân tích thành các âm vị, đặc trưng ngôn ngữ và tham số tín hiệu tương ứng trong phát ngôn tiếng nói) như: âm vị hiện tại, âm vị bên trái, bên phải, vị trí của âm vị trong âm tiết, thanh điệu, số âm tiết của ngữ đoạn v. ta có thể dự đoán được các tham số ngôn điệu. Xử lý ngôn điệu tiếng Việt 1.
Các phương pháp tổng hợp tiếng nói Hai tính chất quan trọng của chất lượng hệ thống tổng hợp giọng nói là mức độ tự nhiên và mức độ dễ nghe. Có ba công nghệ chính được dùng là tổng hợp ghép nối, tổng hợp cộng hưởng tần số (Tổng hợp theo cấu âm, tổng hợp formant theo quy luật), và tổng hợp theo HMM. 13 Trong phần này, luận án sẽ trình bày khái quát một số phương pháp tổng hợp tiếng nói hiện nay và những đánh giá sơ bộ về từng phương pháp (xem [11]).