Tổng quan nghiên cứu

Trích xuất đặc trưng âm học là bước then chốt quyết định độ chính xác của mọi hệ thống nhận dạng tiếng nói tự động (ASR). Trong xử lý tiếng Việt – một ngôn ngữ đơn lập có thanh điệu với 11 nguyên âm đơn và hệ thống nguyên âm đôi phong phú – các mô hình truyền thống thường gặp khó khăn lớn khi xử lý hiện tượng đồng cấu âm và chuyển tiếp âm thanh. Hầu hết các hệ thống nhận dạng thương mại hiện nay vẫn phụ thuộc nhiều vào hệ số MFCC (Mel-Frequency Cepstral Coefficients). Tuy nhiên, MFCC chủ yếu mô tả đường bao phổ tĩnh trong từng khung thời gian ngắn khoảng 20ms đến 30ms, làm mất đi các biến thiên động lực học biểu diễn sự dịch chuyển của cơ quan cấu âm.

Trước thách thức đó, luận văn thạc sĩ ngành Khoa học Máy tính thực hiện tại Viện Nghiên cứu Quốc tế MICA thuộc Trường Đại học Bách Khoa Hà Nội năm 2018 đã tập trung nghiên cứu đề tài mô hình hóa đặc tính âm học động cho nhận dạng tiếng nói tiếng Việt trên nền tảng Kaldi và phân tích sự chuyển tiếp nguyên âm - nguyên âm. Mục tiêu cốt lõi của nghiên cứu là xây dựng phương pháp mô hình hóa dựa trên tần số trọng tâm dải phổ (Spectral Sub-band Centroid Frequency - SSCF) và vector góc SSCF (SSCF angles). Phạm vi nghiên cứu tập trung vào 8 cặp chuyển tiếp nguyên âm phổ biến trong tiếng Việt như /ai/, /ao/, /au/, /ae/, /ea/, /oa/, /ua/, /ui/ với dữ liệu phát âm từ cả người nói nam và nữ. Đóng góp nổi bật của công trình là đề xuất cấu trúc ngân hàng 6 bộ lọc tam giác tối ưu, giúp giảm tỷ lệ lỗi âm tiết (Syllable Error Rate - SER) từ 1.8% đến 3.5% so với mô hình MFCC truyền thống trong các điều kiện thử nghiệm thực tế.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng dựa trên 3 trụ cột lý thuyết âm học và xử lý tín hiệu số: lý thuyết xử lý tín hiệu tiếng nói phi dừng, lý thuyết ngữ âm học cấu âm và mô hình nhận dạng thống kê HMM-GMM. Tín hiệu tiếng nói biến thiên liên tục theo thời gian, trong đó các đỉnh cộng hưởng âm đạo (Formants, ký hiệu là F1, F2) là những tham số đặc trưng quyết định âm sắc của từng nguyên âm. Khi phát âm chuỗi chuyển tiếp nguyên âm - nguyên âm, các formant di chuyển tạo thành quỹ đạo động trên mặt phẳng F1-F2.

Bên cạnh mô hình MFCC tiêu chuẩn vốn dễ bị suy giảm độ chính xác trong môi trường nhiễu, nghiên cứu ứng dụng lý thuyết trọng tâm dải phổ (Spectral Sub-band Centroid - SSC). Trọng tâm phổ phản ánh tần số trung bình có trọng số năng lượng trong từng dải tần số con, đóng vai trò như một ước lượng mạnh mẽ cho các formant. Từ các tọa độ trọng tâm phổ SSCF1 và SSCF2, vector góc SSCF được định nghĩa trên mặt phẳng tọa độ hai chiều nhằm mô tả hướng và tốc độ dịch chuyển cấu âm. Mô hình nhận dạng tiếng nói sau đó được triển khai trên toolkit mã nguồn mở Kaldi, kết hợp mô hình âm học HMM (Hidden Markov Model) và kỹ thuật phân phối Gaussian đa chiều (GMM).

Phương pháp nghiên cứu

Nghiên cứu sử dụng tập dữ liệu âm thanh chuẩn tiếng Việt thu thập từ 4 người nói chính (gồm 2 người nói nữ F1, F2 và 2 người nói nam M1, M2) cùng hàng nghìn mẫu câu thuộc cơ sở dữ liệu tiếng nói MICA với tần số lấy mẫu 16.000 Hz chuẩn 16-bit. Phương pháp chọn mẫu theo dạng phân tầng đại diện, chia thành hai kịch bản thử nghiệm: tập người nói cân bằng (balanced speaker dataset) gồm 50% dữ liệu huấn luyện và 50% kiểm thử, cùng tập người nói không cân bằng (unbalanced speaker dataset) nhằm đánh giá độ bền vững đối với người nói mới.

Quy trình phân tích thực nghiệm diễn ra theo tiến trình 4 giai đoạn rõ ràng:

  1. Thiết kế ngân hàng bộ lọc: So sánh cấu hình 5 bộ lọc tam giác truyền thống và đề xuất ngân hàng 6 bộ lọc tam giác gối nhau trên thang đo tần số Mel trong dải từ 0 Hz đến 8000 Hz.
  2. Thuật toán trích xuất đặc tính động: Lập trình tự động hóa việc tính toán các tọa độ SSCF và vector góc chuyển tiếp nguyên âm trên từng khung tín hiệu 25ms với độ dịch 10ms.
  3. Huấn luyện và nhận dạng trên Kaldi: Cấu hình quy trình nhận dạng âm tiết tiếng Việt với các bộ đặc trưng MFCC, SSCF và SSCF angles cùng các đạo hàm bậc một và bậc hai.
  4. Đánh giá định lượng: Phân tích quỹ đạo chuyển động trên không gian 2 chiều và đo lường tỷ lệ lỗi nhận dạng âm tiết (SER%). Lý do lựa chọn phương pháp phân tích này là vì góc SSCF có tính bất biến cao trước nhiễu và phản ánh trung thực biến thiên sinh lý học của thanh quản hơn các hệ số phổ tĩnh thông thường.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

  • Tối ưu hóa ngân hàng bộ lọc tần số: Ngân hàng 6 bộ lọc tam giác gối nhau do tác giả đề xuất đem lại sự cải thiện vượt bậc so với ngân hàng 5 bộ lọc. Kết quả cho thấy 6 bộ lọc giúp bám sát chính xác quỹ đạo formant F1 và F2 với độ tương đồng hình học đạt trên 94%, loại bỏ hoàn toàn hiện tượng méo quỹ đạo ở các dải tần biên.
  • Phân tích quỹ đạo chuyển tiếp nguyên âm: Trên 8 cặp chuyển đổi nguyên âm chính (/ai/, /ae/, /ao/, /au/, /ea/, /oa/, /ua/, /ui/), vector góc SSCF tái hiện rõ nét các đường cong chuyển tiếp mượt mà. Đồ thị chuyển tiếp của người nói nữ (F1, F2) và người nói nam (M1, M2) đều thể hiện tính hội tụ đồng nhất về hướng vector chuyển dịch trong không gian âm học.
  • Nâng cao độ chính xác nhận dạng trên Kaldi trong tập cân bằng: Khi tích hợp SSCF angles kết hợp các thành phần vi phân bậc một và bậc hai, tỷ lệ lỗi âm tiết (SER) trong kịch bản cân bằng giảm từ mức 24.6% (với MFCC cơ bản) xuống còn khoảng 21.3%, tương đương mức cải thiện hiệu năng nhận dạng đạt 13.4%.
  • Độ bền vững vượt trội trong tập thử nghiệm không cân bằng: Trong kịch bản người nói không cân bằng, mô hình sử dụng đặc tính góc SSCF duy trì mức tăng lỗi SER chỉ 2.1%, trong khi mô hình sử dụng MFCC truyền thống bị tăng lỗi lên tới 5.8%, chứng minh khả năng thích nghi ưu việt với các đặc trưng giọng nói mới.

Thảo luận kết quả

Nguyên nhân cốt lõi giúp đặc tính góc SSCF vượt trội là do tần số trọng tâm dải phổ chỉ phụ thuộc vào vị trí đỉnh năng lượng cục bộ chứ không phụ thuộc vào biên độ tuyệt đối của phổ tín hiệu. Nhờ vậy, khi gặp hiện tượng suy hao đường truyền hoặc biến đổi âm sắc cá nhân, vector góc SSCF vẫn giữ được tính ổn định cao.

Trong công trình, dữ liệu thực nghiệm được trực quan hóa thông qua hệ thống đồ thị 2 chiều trên mặt phẳng SSCF1-SSCF2, đối sánh trực tiếp với tam giác nguyên âm cấu âm cổ điển (Vocalic Triangle). Các bảng thống kê hiệu năng chi tiết (Bảng 4-2, 4-3 và 4-4) cho thấy sự suy giảm SER diễn ra đồng đều trên toàn bộ các đơn vị âm vị tiếng Việt. So sánh với các nghiên cứu nhận dạng tiếng Pháp và tiếng Hindi tương đương trước đó, việc hiệu chỉnh thang Mel cho 6 bộ lọc tiếng Việt đã giải quyết triệt để bài toán nhận dạng các nguyên âm có độ mở hẹp và âm đôi phức tạp.

Đề xuất và khuyến nghị

Dựa trên những phát hiện khoa học từ luận văn, 4 giải pháp chiến lược sau được khuyến nghị nhằm thúc đẩy ứng dụng công nghệ nhận dạng tiếng nói tiếng Việt:

  1. Chuẩn hóa quy trình tiền xử lý với ngân hàng 6 bộ lọc thích nghi: Các nhóm kỹ sư phát triển phần mềm ASR cần tích hợp module trích xuất SSCF 6 bộ lọc vào tầng xử lý tín hiệu đầu vào, hướng tới mục tiêu giảm tỷ lệ lỗi SER tổng thể từ 2.5% đến 4.0% trong lộ trình 6 tháng triển khai.
  2. Mở rộng cơ sở dữ liệu chuyển tiếp âm vị đa phương ngữ: Các viện nghiên cứu ngôn ngữ và trung tâm công nghệ cần phối hợp thu thập 300 đến 500 giờ âm thanh chuẩn đại diện cho 3 miền Bắc, Trung, Nam trong vòng 12 tháng, tập trung vào các biến thể chuyển tiếp nguyên âm phức tạp.
  3. Tích hợp đặc trưng góc động vào kiến trúc Deep Learning hiện đại: Đội ngũ nghiên cứu AI cần kết hợp vector góc SSCF với các mô hình mạng nơ-ron sâu như Conformer, Transformer và CTC-Attention trong vòng 9 tháng để tận dụng tối đa đặc tính động học âm thanh.
  4. Tối ưu hóa thuật toán trích xuất thời gian thực trên phần cứng biên: Các doanh nghiệp sản xuất thiết bị thông minh cần tối ưu mã nguồn C++ của thuật toán tính góc SSCF, cắt giảm thời gian xử lý xuống dưới 12ms trên mỗi khung âm thanh để triển khai trực tiếp trên chip nhúng và hệ thống IoT trong 3 tháng tới.

Đối tượng nên tham khảo luận văn

Luận văn mang lại giá trị thực tiễn và học thuật cao cho 4 nhóm đối tượng trọng tâm:

  1. Kỹ sư nghiên cứu và phát triển ASR (Speech Engineers): Cung cấp mã nguồn thuật toán, cấu hình tham số trên Kaldi toolkit và phương pháp trích xuất đặc trưng mới giúp nâng cao chỉ số SER của các sản phẩm trợ lý giọng nói và chatbot tiếng Việt.
  2. Giảng viên, học viên cao học và nghiên cứu sinh ngành Khoa học Máy tính: Tài liệu tham khảo chuẩn mực gồm 5 chương lý thuyết và thực nghiệm bài bản, cung cấp phương pháp luận chặt chẽ trong xử lý tín hiệu âm thanh và mô hình hóa âm học động.
  3. Nhà phát triển ứng dụng EdTech và luyện ngữ âm tự động: Cung cấp giải pháp phân tích quỹ đạo nguyên âm trực quan với độ chính xác trên 90%, phục vụ xây dựng phần mềm đánh giá phát âm và chỉnh sửa khẩu hình cho người học ngoại ngữ hoặc trẻ em khiếm thính.
  4. Các chuyên gia ngôn ngữ học và ngữ âm học thực nghiệm: Khai thác công cụ định lượng hiện đại trên mặt phẳng SSCF1-SSCF2 để khảo sát sự biến đổi nguyên âm theo vùng miền, hỗ trợ số hóa và bảo tồn dữ liệu phương ngữ học tiếng Việt.

Câu hỏi thường gặp

  1. Đặc tính góc trọng tâm dải phổ (SSCF angles) là gì và có điểm gì vượt trội so với MFCC? Vector góc SSCF biểu diễn hướng chuyển dịch của tần số trọng tâm giữa các dải lọc phổ lân cận trên không gian hai chiều. Khác với MFCC chỉ chụp lại lát cắt phổ tĩnh và dễ bị ảnh hưởng bởi tạp âm nền, SSCF angles mô tả liên tục động học cấu âm, giúp giảm tỷ lệ nhận dạng sai âm tiết xuống hơn 13% trong điều kiện có biến thiên người nói.

  2. Tại sao nghiên cứu lại tập trung giải quyết bài toán chuyển tiếp nguyên âm - nguyên âm? Tiếng Việt sở hữu hệ thống nguyên âm vô cùng phong phú với nhiều âm đôi và âm ba phức tạp. Khi nói tự nhiên, hiện tượng đồng cấu âm làm ranh giới giữa các nguyên âm liên tiếp bị mờ nhạt. Việc mô hình hóa chính xác 8 cặp chuyển tiếp âm học giúp hệ thống ASR bắt trọn quỹ đạo thanh quản thực tế thay vì coi từng âm vị là các trạng thái tĩnh độc lập.

  3. Việc nâng cấp từ 5 bộ lọc lên 6 bộ lọc tam giác mang lại lợi ích cụ thể nào? Ngân hàng 5 bộ lọc truyền thống có độ bao phủ dải tần chưa tương thích tối ưu với vùng formant cao của tiếng Việt. Việc phân bổ lại 6 bộ lọc tam giác trên thang Mel dải tần 0 - 8000 Hz giúp tăng độ khớp với quỹ đạo F1-F2 lên trên 94%, tái hiện chính xác các chuyển tiếp nguyên âm mở và hẹp.

  4. Toolkit Kaldi đóng vai trò gì trong việc kiểm nghiệm mô hình nghiên cứu? Kaldi là nền tảng mã nguồn mở hàng đầu thế giới về nhận dạng giọng nói, được xây dựng trên ngôn ngữ C++. Luận văn đã nhúng trực tiếp thuật toán trích xuất SSCF angles vào mã nguồn Kaldi để thực thi quá trình huấn luyện HMM-GMM và đo lường khách quan tỷ lệ lỗi SER trên bộ dữ liệu thực nghiệm hàng nghìn mẫu.

  5. Phương pháp mô hình hóa âm học động này có thể áp dụng cho các ngôn ngữ khác không? Hoàn toàn có thể áp dụng. Luận văn đã tham chiếu thành công cấu trúc tam giác nguyên âm của tiếng Pháp và tiếng Hindi. Bất kỳ ngôn ngữ nào có hiện tượng biến thiên chuyển tiếp âm tố đều có thể tận dụng không gian SSCF1-SSCF2 để mô hình hóa khẩu hình phát âm với độ chính xác cao.

Kết luận

  • Luận văn thạc sĩ của tác giả Nguyễn Hằng Phương đã giải quyết thành công bài toán mô hình hóa âm học động trong nhận dạng tiếng nói tiếng Việt trên nền tảng Kaldi.
  • Đề xuất sáng tạo ngân hàng 6 bộ lọc tam giác tối ưu trên thang đo Mel, giúp nắm bắt chuẩn xác quỹ đạo chuyển tiếp của 8 cặp nguyên âm điển hình.
  • Ứng dụng thành công vector góc SSCF angles, giúp giảm tỷ lệ lỗi âm tiết (SER) khoảng 3.3% trên tập kiểm thử cân bằng và tăng cường khả năng chống nhiễu vượt trội trong môi trường không cân bằng.
  • Mở ra tiềm năng ứng dụng to lớn cho việc tích hợp vào các mạng nơ-ron học sâu (Deep Learning) và các thiết bị biên IoT trong giai đoạn 12 đến 24 tháng tới.
  • Để khai thác toàn diện các phương pháp trích xuất đặc trưng và công thức thuật toán chi tiết, bạn đọc hãy tham khảo và nghiên cứu toàn văn luận văn thạc sĩ khoa học máy tính tại Viện MICA ngay hôm nay.