Tổng quan nghiên cứu

Việt Nam là một quốc gia đa dạng văn hóa với 54 dân tộc anh em cùng sự phân hóa phương ngữ sâu sắc giữa 3 miền Bắc, Trung, Nam. Trong bối cảnh thị trường trí tuệ nhân tạo (AI) toàn cầu đạt tốc độ tăng trưởng kép hằng năm trên 20%, bài toán xử lý tiếng nói tiếng Việt đang đối mặt với thách thức lớn về sự sai biệt ngữ âm theo giới tính và vùng miền. Các hệ thống nhận dạng truyền thống thường suy giảm độ chính xác rõ rệt khi tiếp nhận các biến thể âm sắc địa phương hoặc giọng nói có tần số dao động phức tạp giữa nam và nữ.

Đề tài luận văn thạc sĩ chuyên ngành Hệ thống thông tin (mã số 8480104) tại Trường Đại học Thủ Dầu Một tập trung giải quyết triệt để vấn đề này. Mục tiêu nghiên cứu cốt lõi là thiết kế, hiện thực hóa mô hình học sâu dựa trên mạng nơ-ron tích chập (Convolutional Neural Network - CNN) kết hợp kỹ thuật trích xuất phổ âm Log-Mel Spectrogram để tự động nhận dạng giới tính (2 nhóm: Nam, Nữ) và phân loại phương ngữ vùng miền (3 nhóm: Bắc, Trung, Nam).

Phạm vi thực nghiệm của công trình sử dụng các nguồn dữ liệu âm thanh tiếng Việt tiêu chuẩn gồm tập dữ liệu VIVOS Corpus và bộ dữ liệu thử nghiệm từ cuộc thi Zalo AI Challenge. Toàn bộ các mẫu âm thanh đầu vào được tiền xử lý đưa về tần số lấy mẫu chuẩn 16 kHz với thời lượng cố định 3 giây cho mỗi phân đoạn. Công trình mang ý nghĩa khoa học và thực tiễn vững chắc khi tối ưu hóa thành công quy trình xử lý tín hiệu âm thanh 2D, đạt độ chính xác dự đoán vượt trội trên 90% và tích hợp trực tiếp vào hệ thống ứng dụng web tương tác thời gian thực, mở ra tiềm năng ứng dụng rộng rãi trong các hệ sinh thái trợ lý ảo, an ninh sinh trắc học và tổng đài tự động.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng trên nền tảng lý thuyết mạng nơ-ron nhân tạo (ANN) và các bước tiến hóa của mạng nơ-ron tích chập (CNN). Mạng nơ-ron nhân tạo xuất phát từ mô hình xử lý sinh học với các khái niệm cốt lõi: lớp đầu vào, lớp ẩn và lớp đầu ra liên kết qua ma trận trọng số. Để giải quyết tính phi tuyến phức tạp trong tín hiệu giọng nói, các hàm kích hoạt tiên tiến như ReLU (Rectified Linear Unit), Sigmoid và Softmax được triển khai nhằm tối ưu hóa quá trình lan truyền ngược (Backpropagation) và thuật toán hạ gradient ngẫu nhiên.

Kiến trúc CNN kế thừa các cột mốc lịch sử từ LeNet-5 (1998) với 60 nghìn tham số, AlexNet (2012) với 60 triệu tham số, VGG-16 với 138 triệu tham số và ResNet-50 với 26 triệu tham số. Trong xử lý âm thanh hiện đại, tín hiệu sóng âm 1 chiều được chuyển đổi thành biểu diễn không gian 2 chiều thông qua phổ âm Log-Mel Spectrogram. Các lớp tích chập đóng vai trò quét qua ma trận năng lượng tần số để nhận diện các đặc trưng cục bộ (formant, cao độ), kết hợp với các lớp gộp cực đại (Max Pooling) để giảm chiều dữ liệu mà vẫn giữ trọn vẹn đặc trưng âm học quan trọng. Hướng tiếp cận này vượt trội so với các công bố của Hua Zhang năm 2020 (đạt UAR 87,86% trên tập EMO-DB) hay nghiên cứu của Fatih Demir năm 2020 (đạt 96,23% trên DCASE-2017), khẳng định tính ưu việt của CNN trong phân tích phổ âm học.

Phương pháp nghiên cứu

Nghiên cứu sử dụng kết hợp phương pháp phân tích tổng hợp lý thuyết và phương pháp thực nghiệm khoa học. Nguồn dữ liệu huấn luyện và kiểm thử được thu thập từ tập âm thanh VIVOS Corpus cùng cơ sở dữ liệu phân biệt giọng nói Zalo AI Challenge với quy mô hàng nghìn tệp âm thanh thực tế.

Cỡ mẫu nghiên cứu được thiết kế đồng bộ và phân chia thành 6 lớp phân loại đặc thù (Nam miền Bắc, Nữ miền Bắc, Nam miền Trung, Nữ miền Trung, Nam miền Nam, Nữ miền Nam). Phương pháp chọn mẫu phân tầng có chủ đích (Stratified Sampling) được áp dụng để đảm bảo sự cân bằng tuyệt đối giữa các nhóm giới tính và phương ngữ địa phương, hạn chế tối đa hiện tượng mất cân bằng dữ liệu (Class Imbalance).

Lý do lựa chọn phương pháp phân tích phổ Log-Mel kết hợp CNN thay vì các phương pháp truyền thống như mô hình Markov ẩn (HMM) hay mô hình hỗn hợp Gaussian (GMM) là vì phương pháp truyền thống dễ bị suy giảm chất lượng khi môi trường thu âm biến đổi. Việc chuyển đổi tín hiệu từ tần số 44,1 kHz sang tần số lấy mẫu 16 kHz (16.000 mẫu/giây) và cắt chuẩn hóa 3 giây giúp Log-Mel Spectrogram bảo toàn trọn vẹn tính liên tục của các dải tần số âm thanh. Mô hình được huấn luyện bằng ngôn ngữ lập trình Python và tối ưu hóa thông qua các chỉ số hàm mất mát (Loss) và độ chính xác (Accuracy). Toàn bộ quá trình thực nghiệm, tinh chỉnh và kiểm thử được hoàn thành đồng bộ trong giai đoạn nghiên cứu năm 2021.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình huấn luyện và kiểm thử thực nghiệm trên 3 kiến trúc mô hình gồm CNN 3 lớp phức hợp, VGG-16 chuyển giao học sâu và mạng CNN 5 tầng tùy biến đã mang lại những kết quả ấn tượng:

Thứ nhất, mô hình học sâu trên phổ Log-Mel Spectrogram đạt độ chính xác phân loại giới tính vượt mốc 95% trên toàn bộ tập dữ liệu kiểm thử. Sự khác biệt về tần số cơ bản giữa giọng nam (trung bình 85 Hz đến 180 Hz) và giọng nữ (trung bình 165 Hz đến 255 Hz) được các bộ lọc tích chập tách biệt rõ nét ngay từ những lớp chập đầu tiên.

Thứ hai, độ chính xác nhận dạng phương ngữ 3 miền Bắc, Trung, Nam đạt tỷ lệ bình quân trên 88%. Trong đó, độ chính xác phân biệt giữa giọng Bắc và giọng Nam đạt mức cao nhất (trên 91%), trong khi phương ngữ miền Trung có sự giao thoa ngữ điệu nên tỷ lệ nhận dạng đạt khoảng 85%, thấp hơn khoảng 6% so với hai vùng còn lại.

Thứ ba, mô hình CNN 5 tầng tự thiết kế thể hiện hiệu năng vượt trội khi giảm hơn 70% số lượng tham số so với kiến trúc VGG-16 chuẩn (138 triệu tham số), giúp tốc độ huấn luyện nhanh hơn 25% và giá trị hàm mất mát giảm đều tiệm cận mức 0,15 mà không xảy ra hiện tượng quá khớp (overfitting).

Thứ tư, kỹ thuật tiền xử lý đưa tần số lấy mẫu về 16 kHz và độ dài cố định 3 giây đã giúp tối ưu hóa hơn 40% dung lượng bộ nhớ tính toán trong quá trình trích xuất đặc trưng ma trận 2D mà vẫn đảm bảo độ tin cậy của mô hình phân lớp.

Thảo luận kết quả

Hiệu quả vượt bậc của mô hình bắt nguồn từ khả năng trích xuất thông tin đa chiều của thang đo tần số Mel. Thang đo này mô phỏng sát sao cơ chế tiếp nhận âm thanh phi tuyến của ốc tai người, nơi các dải tần thấp được phân giải chi tiết hơn dải tần cao. Khi đưa phổ Log-Mel vào mạng CNN, các cửa sổ trượt (sliding window) kích thước nhỏ 3x3 đã phát hiện chính xác các đường bao phổ (spectral envelope) và độ dịch chuyển formant đại diện cho từng vùng địa lý.

So sánh với công trình của Anvarjon Tursunov năm 2021 (đạt 96% nhận dạng giới tính tiếng Hàn) và nghiên cứu của Shashidhar năm 2021 (đạt 90,10% trên bộ dữ liệu tiếng Anh), kết quả của luận văn khẳng định tính tương thích cao của mô hình CNN đối với các ngôn ngữ đơn lập, thanh điệu phức tạp như tiếng Việt.

Để trực quan hóa dữ liệu, kết quả nghiên cứu được thể hiện rõ ràng qua ma trận nhầm lẫn (Confusion Matrix) 6x6, biểu đồ đường cong hội tụ Accuracy/Loss qua từng chu kỳ huấn luyện (Epoch) và bảng so sánh thông số giữa các cấu trúc mạng. Hệ thống còn được tích hợp trực quan vào ứng dụng web xây dựng bằng Flask Framework, cho phép người dùng theo dõi biểu đồ xác suất dự đoán thời gian thực cùng bảng thống kê định lượng chi tiết cho từng mẫu âm thanh đầu vào.

Đề xuất và khuyến nghị

Dựa trên kết quả thực nghiệm của luận văn, 4 nhóm giải pháp kỹ thuật và ứng dụng thực tiễn được đề xuất với lộ trình thực hiện cụ thể:

Thứ nhất, tối ưu hóa kiến trúc mô hình học sâu cho thiết bị biên. Nhóm kỹ sư phần mềm và các viện nghiên cứu công nghệ cần áp dụng kỹ thuật tỉa thưa trọng số (Weight Pruning) và lượng tử hóa mô hình xuống chuẩn 8-bit (Quantization). Giải pháp này giúp giảm ít nhất 50% kích thước mô hình và tiết kiệm 35% tài nguyên phần cứng, cho phép nhúng thuật toán trực tiếp vào chip xử lý của điện thoại di động và thiết bị IoT trong vòng 6 tháng tới.

Thứ hai, mở rộng quy mô cơ sở dữ liệu âm thanh đa vùng miền. Các đơn vị nghiên cứu học thuật cùng doanh nghiệp công nghệ cần phối hợp thu thập thêm hơn 500 giờ ghi âm chuẩn, bao phủ chi tiết hơn 10 tiểu vùng phương ngữ đặc thù (như phương ngữ Nghệ Tĩnh, Quảng Nam, Tây Nam Bộ). Mục tiêu nhằm nâng độ chính xác nhận dạng vùng miền lên trên 92% trong lộ trình 12 tháng.

Thứ ba, tích hợp thuật toán vào hệ thống phân luồng tổng đài tự động. Các doanh nghiệp viễn thông, ngân hàng và thương mại điện tử nên ứng dụng ngay API phân loại giọng nói từ luận văn vào hệ thống Call Center. Giải pháp này giúp tự động chuyển hướng cuộc gọi đến điện thoại viên có cùng phương ngữ bản địa, dự kiến rút ngắn 30% thời gian xử lý yêu cầu và nâng cao trải nghiệm khách hàng trong quý 1 năm tiếp theo.

Thứ tư, phát triển mô-đun lọc nhiễu môi trường thích nghi. Đội ngũ phát triển hệ thống cần tích hợp các thuật toán khử ồn nền thích ứng (Adaptive Denoising) kết hợp kỹ thuật tăng cường dữ liệu âm thanh (Data Augmentation) mô phỏng tiếng ồn đường phố và văn phòng. Mục tiêu đảm bảo duy trì độ chính xác của hệ thống trên 85% ngay cả trong môi trường có cường độ tạp âm từ 40 dB đến 60 dB trong vòng 9 tháng.

Đối tượng nên tham khảo luận văn

Công trình luận văn thạc sĩ này mang lại giá trị học thuật và giải pháp ứng dụng thiết thực cho 4 nhóm đối tượng trọng tâm:

Thứ nhất, học viên cao học, nghiên cứu sinh và giảng viên chuyên ngành Hệ thống thông tin, Khoa học dữ liệu và Trí tuệ nhân tạo. Luận văn cung cấp tài liệu tham khảo chuẩn mực về phương pháp luận xử lý tín hiệu âm thanh, quy trình chuyển đổi phổ Log-Mel Spectrogram 16 kHz và cách xây dựng kiến trúc mạng nơ-ron tích chập từ lý thuyết đến thực nghiệm.

Thứ hai, kỹ sư phát triển phần mềm và chuyên viên xử lý ngôn ngữ tự nhiên (NLP/Speech AI). Nhóm đối tượng này có thể tái sử dụng trực tiếp mô hình xử lý, mã nguồn huấn luyện và phương pháp đóng gói hệ thống với Flask Web Framework để xây dựng các microservices nhận dạng giọng nói, xác thực bảo mật sinh trắc học và kiểm soát chất lượng dữ liệu âm thanh.

Thứ ba, doanh nghiệp phát triển Trợ lý ảo thông minh và Thiết bị nhà thông minh (Smart Home). Tài liệu cung cấp cơ sở kỹ thuật vững chắc để doanh nghiệp tối ưu hóa khả năng phản hồi ngôn ngữ theo ngữ điệu địa phương, giúp hệ thống tương tác tự nhiên, thân thiện và chính xác hơn với người dùng ở cả 3 miền đất nước.

Thứ tư, các nhà quản lý trung tâm chăm sóc khách hàng và tổng đài đa kênh. Luận văn gợi mở phương pháp tự động hóa nhận diện nhân khẩu học (giới tính, vùng miền) của khách hàng để phân bổ cuộc gọi thông minh tới hơn 100 nhân viên tư vấn phù hợp, hỗ trợ gia tăng chỉ số hài lòng khách hàng (CSAT) thêm ít nhất 15%.

Câu hỏi thường gặp

Tại sao luận văn lại lựa chọn đặc trưng Log-Mel Spectrogram thay vì hệ số MFCC truyền thống? Biến đổi cosin rời rạc trong trích xuất MFCC thường làm mất đi tính tương quan cục bộ trên miền tần số. Trong khi đó, Log-Mel Spectrogram giữ nguyên cấu trúc ma trận 2D với các đặc trưng năng lượng phân bố theo thời gian và tần số, giúp mạng tích chập CNN dễ dàng học các đường nét đặc trưng âm thanh tương tự như xử lý ảnh kỹ thuật số với độ chính xác cao hơn rõ rệt.

Tập dữ liệu âm thanh trong nghiên cứu được chuẩn hóa theo các thông số kỹ thuật nào? Toàn bộ các tệp âm thanh thô thu thập từ bộ dữ liệu VIVOS và Zalo AI Challenge đều được đồng bộ hóa định dạng WAV, hạ tần số lấy mẫu từ 44,1 kHz xuống chuẩn 16 kHz (16.000 mẫu/giây) và cắt chuẩn thời lượng chính xác 3 giây cho mỗi mẫu, đảm bảo sự đồng nhất tuyệt đối cho đầu vào của mạng CNN.

Kiến trúc mạng CNN 5 tầng tự thiết kế có điểm gì nổi bật so với mô hình VGG-16? Mạng CNN 5 tầng tùy biến được thiết kế tinh gọn, giảm thiểu đáng kể số lượng tham số so với con số 138 triệu tham số của VGG-16. Nhờ đó, mô hình giảm tải hơn 40% áp lực tính toán phần cứng, rút ngắn thời gian huấn luyện tới 25% mà vẫn duy trì giá trị sai số Loss ở mức thấp 0,15 và độ chính xác phân loại trên 90%.

Hệ thống ứng dụng Web xây dựng bằng Flask Framework đảm nhận những vai trò gì? Ứng dụng Web Flask đóng vai trò giao diện tương tác trực quan cho phép người dùng tải tệp âm thanh hoặc thu âm trực tiếp qua micro. Hệ thống tự động thực hiện tiền xử lý, trích xuất phổ âm Log-Mel Spectrogram 2D, gọi mô hình học sâu đã lưu để dự đoán và hiển thị kết quả phân loại giới tính, vùng miền cùng xác suất thống kê tức thì.

Giải pháp nào giúp nâng cao độ chính xác khi nhận dạng phương ngữ miền Trung? Phương ngữ miền Trung có dải cao độ và biến thiên thanh điệu rất phức tạp. Luận văn đã áp dụng phương pháp chọn mẫu phân tầng cân bằng, kết hợp tinh chỉnh các bộ lọc tích chập đa tầng trên phổ Log-Mel để bắt trọn các formant âm sắc đặc thù, giúp độ chính xác nhận dạng phương ngữ này đạt mức khả quan trên 85%.

Kết luận

  • Công trình đã hoàn thành xuất sắc mục tiêu nghiên cứu, hệ thống hóa toàn diện cơ sở lý thuyết về mạng nơ-ron tích chập (CNN) và kỹ thuật chuyển đổi tín hiệu âm thanh sang ảnh phổ Log-Mel Spectrogram 2D trong bài toán xử lý giọng nói tiếng Việt.
  • Thiết kế, huấn luyện và đánh giá thành công 3 kiến trúc mô hình học sâu trên tập dữ liệu chuẩn VIVOS Corpus và Zalo AI Challenge, xác lập độ chính xác nhận dạng giới tính đạt trên 95% và phân loại phương ngữ 3 miền đạt trên 88%.
  • Đề xuất thành công kiến trúc CNN 5 tầng tùy biến có hiệu năng tối ưu, giảm hơn 70% số lượng tham số so với VGG-16 tiêu chuẩn, mang lại tốc độ hội tụ nhanh hơn 25% trên mẫu âm thanh 3 giây tần số 16 kHz.
  • Xây dựng hoàn chỉnh ứng dụng web thực nghiệm dựa trên Flask Framework, cung cấp giao diện trực quan cho phép thu âm, xử lý đặc trưng và phân loại kết quả thời gian thực với độ trễ thấp.
  • Xác lập lộ trình phát triển rõ ràng trong giai đoạn 12 đến 24 tháng tới nhằm mở rộng dữ liệu lên 500 giờ thu âm đa phương ngữ và lượng tử hóa mô hình 8-bit phục vụ triển khai trên thiết bị di động biên.

Luận văn thạc sĩ "Nhận dạng tiếng nói tiếng Việt bằng phương pháp học sâu" là công trình nghiên cứu công phu, chuẩn mực và có tính ứng dụng cao. Quý độc giả, các nhà nghiên cứu và doanh nghiệp công nghệ quan tâm đến giải pháp nhận dạng giọng nói tiếng Việt hãy khai thác ngay nguồn tài liệu giá trị này để phát triển và tối ưu hóa các sản phẩm AI tiên tiến phục vụ cộng đồng.