chương 1 trình bày về thiết kết của hệ TTS tiếng Việt - Vnspeech, gồm so sánh để lựa chọn phương pháp tổng hợp tiếng nói formant cho triển khai của đề tài; chương 2 trình bày về bộ tổng hợp tiếng nói formant của Klatt, áp dụng để tổng hợp tiếng Việt, đây là phần xử lý tín hiệu số, tạo ra tín hiệu tiếng nói, làm cho máy biết “nói” tiếng Việt; các kết quả về nghiên cứu ngữ âm tiếng Việt cho mục đích tổng hợp tiếng nói được trình bày trong chương 3; nội dung của chương 4 là các công việc về chuyển văn bản tiếng Việt thành các tham số điều khiển bộ tổng hợp formant, là đầu vào của bộ tổng hợp, đây là bước “đạy máy đọc văn bản tiếng Việt”; chương 5 trình bày một số tiêu chuẩn và cách tiến hành đánh giá chất lượng tiếng nói tổng hợp; cuối cùng là chương 6 giới thiệu sản phẩm của đề tài, kết luận cũng như phương hướng p hát triển trong tương lai. Theo bản thuyết minh, nội dung đề tài được chia thành 12 chuyên đề, trong đó có 8 chuyên để thực hiện các nhiệm vụ lập trình cụ thể, còn lại là về quy trình và đữ liệu. Sự tương ứng giữa trình bày trong báo cáo, sản phẩm phần mềm và các chuyên để trong bản thuyết minh đề tài như sau: Vietnamese Text-To-Speech Conversion based-on Formant Synthesis Chuyên để 1: sản phẩm phải đạt là quy trình và các nhiệm vụ của hệ TTS được trình bày chủ yếu trong chuong 1. Chuyên đề 3 và 5 là các nghiên cứu về ngữ âm tiếng Việt, được trình bày trong chương 3.
Chuyên đề 4 là nghiên cứu để bước đầu xây dựng Corpus tiếng nói tiếng Việt được thực hiện và trình bày trong chương 3, dữ liệu đã được sử dụng trong quá trình nghiên cứu về ngữ âm tiếng Việt, trường độ các âm vị, âm tiết, dấu cách cũng như sự thay đổi c ủa trường độ trong chương 4 và sử dụng trong phần đánh giá chất lượng của chương 6. Các chuyên đề 2, 6, 7, 8, 9,1 0, 11, 12 là các công việc về lập trình, các kết quả được thể hiện trong sản phẩm phần mềm cuối cùng Vnspeech, các mô đun chính được giới thiệu trong chương 6. Nghiên cứu này được thực hiện trong khuôn khổ đề tài cấp Bộ - Bộ Khoa học và Công nghệ (hợp đồng số 3/HĐ/ĐT- Bộ KHCNGMT, ngày 6/2/2002) thời gian thực hiện từ 1/2002-12/2003, do Viện Ứng dụng Công nghệ chủ trì. Thông tin giới thiệu, kết quả, phần mềm demo, thư viện lập trình có thể download tại http://www.
Vietnamese Text-To-Speech Conversion based-on Formant Synthesis Chuong 1 THIET KE HE TTS TIENG VIET- VNSPEECH Phần này giới thiệu một số nét chung về xử lý tiếng nói, chuyên văn bản thành tiếng nói để lựa chọn giải pháp tổng hợp tiếng nói cho xây dựng hệ chuyển văn bản thành tiếng nói cho tiếng Việt. Hầu hết các hệ TTS ngày nay sử dụng một trong hai công nghệ là tổng hợp formant hoặc tổng hợp xích chuỗi (ghép nối) để tạo tín hiệu tiếng nói [Klau§7, Keller02, Tuắn00c]. Mỗi công nghệ đều có các ưu điểm riêng và đây là phần khác biệt khi xây dựng một hệ TTS. Các bước phân tích chuẩn hoá văn bản, xác định thông tin ngữ điệu là công việc chung nhưng phát sinh các tham số điều khiển từ văn bản sẽ phụ thuộc vào công nghệ tổng hợp được lựa chọn.
Xử lý tiếng nói Xử lý tiếng nói là thuật ngữ chỉ các nghiên cứu về phân tích tiếng nói, tổng hợp tiếng nói và nhận dạng tiếng nói, người nói.I là sơ đồ về các công việc chính và mối liên hệ giữa chúng trong nghiên cứu, triển khai xử lý tiếng nói. Văn bản Phân tích. Cac đặc trưng: Phân lớp us , | tiêng nói âm vị, ngôn điệu. xi ¡ Tiêng nói Người nói HIE.
ị Phân tích Tong hợp ị Văn bản văn bản tiêng nói Tiếng nói ị tông hợp | Hình 1. Các công việc chính của lĩnh vực xử lý tiếng nói Vietnamese Text-To-Speech Conversion based-on Formant Synthesis Tu tiéng nói tự nhiên, phân tích để xác định các đặc trưng ngữ âm, qua quá trình phân lớp, nếu để xác định đó là nội dung gì thì công việc này gọi là “hận dạng tiếng nói”, nêu đễ xác định người nói thì đó là “nhận dạng hay giám định người nó?`. Nếu đầu vào là văn bản, căn cứ vào các thông tin dữ liệu về ngữ âm, tạo ra tiếng nói tổng hợp tương ứng với nội dung này thì đó là quá trình “chuyển văn bản thành tiếng nói”. Ta thấy, phần tích tiếng nói đề xác định các thông tin ngữ âm đặc trưng là công việc trung tâm của xử lý tiếng nói.
Tổng hợp tiếng nói Tổng hợp tiếng nói là quá trình tạo tiếng nói không phải bằng bộ máy phát âm của con người.1, tổng hợp tiếng nói là một trong các nhiệm vụ chính của xử lý tiếng nói. Về chỉ tiết có thể có nhiều phương pháp, mô hình khác nhau để tạo tiếng nói, nhưng nói chung có thể chia thành 2 loại chính: 1. Phương pháp trên cơ sở hệ thống Phương pháp này được gọi là tổng hợp Articulatory, là phương pháp tổng hợp trên nguyên tắc tạo một hệ thống (vật lý hay mô phỏng) giống như bộ máy phát âm con người về vị trí, hình đáng cũng như sự địch chuyên các bộ phận khi cấu âm. Hiện tại phương pháp này mới đạt được một số kết quả ban đầu trong phòng thí nghiệm, tuy nhiên, nó được xem như là một hướng đi tiềm năng để tạo được tiếng nói tổng hợp chất lượng cao.
Hiện có một nghiên cứu về tổng hợp Articulatory gián tiếp (mô phỏng) các nguyên âm tiếng Việt đang được tiến hành trong khuôn khổ luận án NCS [Thắng00]. Các phương pháp trên cơ sở tín hiệu Các phương pháp này dựa trên nguyên tắc tiếng nói là một loại tín hiệu, do vậy nó quan tâm đến việc làm thế nào để sinh ra các tín hiệu giống tiếng nói tự nhiên của con người về các đặc tính đặc trưng như sóng, phổ, năng lượng, Vietnamese Text-To-Speech Conversion based-on Formant Synthesis spectrogram, tin sé co ban, tan số cắt không. Phương pháp này có nhiều hướng tiếp cận khác nhau. 1: Ông hop Concatenation Tổng hợp Concatenation là phương pháp tạo tiếng nói bằng cách phát lại các ghép đoạn tiếng nói tự nhiên ghi trước.
Phân loại phương pháp dựa theo chiều dài của các đoạn tiếng nói được ghi, tuy nhiên, nếu đoạn tiếng nói ghi trước là các ngữ đoạn có nghĩa hoặc kịch bản được ghi trước (PRP) thì đó không gọi là tổng hợp mà là hệ thống phát thông báo, đo đó đơn vị của phương pháp này thường nhỏ hơn mức từ. Các phương pháp dựa trền Concatenation thường sử dụng kỹ thuật PSOLA (Pitch Synchronous OverLap Add) dé làm trơn điểm ghép nồi và thay đổi trường độ cũng như chu kỳ Pitch, thông dụng nhất là TD-PSOLA (PSOLA miền thời gian), ngoài ra còn có FD-PSOLA (PSOLA miễn tần số), LP-PSOLA (PSOLA dự đoán tuyến tính). Tong hop Formant Lý thuyết âm học của quá trình tạo tiếng nói con người xem bộ máy phát âm của con người là hệ thống gồm: nguồn âm là đôi đây thanh điều khiển dòng khí thoát ra từ phổi; tuyến âm là các khoang cộng hưởng gồm khoang hầu, khoang miệng và khoang mũi, lưỡi thay đổi vị trí làm thay đổi hình đáng tuyến âm; hình đáng và vị trí đôi môi, sự cho phép hay không cho phép dòng khí thoát qua đường mũi khi nói, cách thoát hơi qua miệng thể hiện đặc tính tán xạ của mô hình. Tuyến âm được mô tả theo hai cách: mô hình tuyến âm nối tiếp - các bộ cộng hưởng được ghép nối tiếp; và mô hình tuyến âm song song - sự cộng hưởng để thể hiện các tần số formant được diễn ra đồng thời.
Tổng hợp formant là phương pháp dựa trên lý thuyết âm học của quá trình tạo tiếng nói [Klat§7, Styger94]. Mô hình bộ tổng hợp là một hệ thống nguồn gồm nguồn âm và các bộ lọc (Hình 1. Các tần số formant và các tham số đặc trưng khác là tham số điều khiển mô hình này. Phương pháp này mềm dẻo, tạo được số 10 Vietnamese Text-To-Speech Conversion based-on Formant Synthesis lượng âm không hạn chế, yêu cầu đữ liệu lưu trữ nhỏ nhưng độ tự nhiên của tiếng nói tổng hợp chưa cao.
F0 Khuyếchđại Các hệ số lọc Nguồn hữu thanh Nguồn vô thanh Tiếng ồn Hình 1. Mô hình nguồn âm-bộ lọc (source-filter model) Ngoài ra, còn các phương pháp khác được nảy sinh từ các kỹ thuật xử lý tín hiệu như: phương pháp dự đoán tuyến tính LPC, phương pháp hình sin, phương pháp dựa trên mã hoá-giải mã phổ. Có một số cách phân loại khác như phương pháp tổng hợp trên cơ sở luật và phương pháp trên cơ sở tiếng nói tự nhiên ghi trước nhưng kết luận là cũng vẫn chỉ bao gồm 3 phương pháp chính được nêu trên. Mặc dù tồn tại nhiều phương pháp tạo tiếng nói tổng hợp khác nhau nhưng hiện chỉ phương pháp Concatenation và phương pháp tổng hợp Formant là được sử dụng trong các hệ TTS hiện nay.
Chuyén van bản thành tiếng nói Chuyển văn bản thành tiếng nói (Text To Speech - TTS) là ứng dựng tự động đọc thành tiếng văn bản sử dụng tiếng nói tổng hợp, đôi khi nó còn thường được hiểu bao gồm cả chuyển khái niệm thành tiếng nói (Concept To Speech - CTS).1, xây dựng một hệ TTS là một quá trình cần không chỉ tổng hợp tiếng nói mà còn gồm cả phân tích tiếng nói. Một quá trình TTS thường được chia thành hai giai đoạn: 1) Phân tích văn bản, chuyển văn bản đầu vào thành dãy các phiên âm hoặc một sự biểu diễn ngôn ngữ nào đó; và 2) Tạo tín hiệu tiếng nói (tổng hợp tiếng nói), âm thanh tiếng nói đầu II Vietnamese Text-To-Speech Conversion based-on Formant Synthesis ra được tạo ra từ thông tin về phiên âm và ngữ điệu của giai đoạn trước. Hai giai đoạn này còn được gọi Xử lý ngôn ngữ tự nhiên (NLP) và Xử lý tín hiệu số (DSP), có thể minh hoạ bằng sơ đỗ hình 1. Tạo và diễn |L___— y đạt tiếng nói —y\ Phân tích văn bản và ngôn ngữ Ỷ Phiên âm Tiếng nói NLP DSP Văn bản Hình 1.
Mô hình văn bản thành tiếng nói Văn bản đầu vào có thể từ các chương trình xử lý văn bản, trang web, thư điện tử hoặc các nguồn có thể chuyên thành chuỗi ký tự. Chuỗi ký tự sau đó được phân tích chuẩn hoá thành biểu diễn ngữ âm duy nhất, thường là một chuỗi các âm vị với các thông tin như ngữ điệu, trường độ và độ nhấn mạnh. Bộ tổng hợp tiếng nói trực tiếp tạo ra âm thanh tiếng nói từ thông tin cung cấp từ phần xử lý văn bản, các phương pháp tổng hợp tiếng nói chính đã được giới thiệu chỉ tiết tại phần trên.