Luận văn: Nhận dạng người nói phụ thuộc từ khóa tiếng Việt

Luận văn về nhận dạng người nói phụ thuộc từ khóa tiếng Việt. Nghiên cứu các phương pháp, thuật toán nhận dạng giọng nói chính xác và hiệu quả. Tải luận văn chi tiết.

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ kỹ thuật

2013

75
1
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CAM ĐOAN

DANH MỤC KÝ HIỆU, CHỮ VIẾT TẮT

DANH MỤC HÌNH

DANH MỤC BẢNG

Lý do chọn đề tài

Mục đích, phạm vi nghiên cứu

Đối tượng nghiên cứu

Phương pháp nghiên cứu

Nhiệm vụ nghiên cứu

1. CHƯƠNG 1: Tổng quan về nhận đạng người nói

1.1. Nhận dạng người nói là gì?

1.2. Các ứng dụng của nhận dạng người nói

1.3. Phương pháp nhận dạng người nói phụ thuộc từ khóa

1.4. Các thành phần của một hệ thống nhận dạng người nói phụ thuộc từ khóa

1.5. Các giai đoạn xử lý của một hệ thống nhận dạng người nói phụ thuộc từ khóa

1.6. Tìm hiểu về các kết quả nhận dạng người nói đã có với Tiếng Việt

1.7. Định danh người nói tiếng Việt sử dụng mô hình hỗn hợp Gaussian của nhóm tác giả Đình Lõ Thành, Nguyễn Quế Linh, Trịnh Viết Toàn

2. CHƯƠNG 2: CÁC CÔNG CỤ SỬ DỤNG TRONG ĐỀ TÀI

2.1. Bộ công cụ ALIZE

2.2. Bộ công cụ SPro

2.3. Các công cụ nhận dạng người nói sử dụng SPro và ALIZE

2.4. Bộ công cụ Sphinx3

2.4.1. Tổng quan về bộ giải mãs3

2.5. Công cụ nhận dạng tiếng nói sử dụng Sphinx3

3. TRIỂN KHAI HỆ THỐNG THỬ NGHIỆM NHẬN DẠNG NGƯỜI NÓI TIẾNG VIỆT

3.1. Sơ đồ tổng quan quá trình xây dựng hệ thống nhận dạng người nói phụ thuộc từ khóa tiếng Việt

3.2. Chuẩn bị dữ liệu

3.3. Chuẩn bị dữ liệu cho nhận dạng bởi công cụ ALIZE

3.4. Chuẩn bị dữ liệu cho nhận dạng bởi công cụ Sphinx3

3.5. Nhận dạng người nói sử dụng ALIZE

3.5.1. Bước 1: Tạo thư mục làm việc

3.5.2. Bước 2: Tính tham số MFCC

3.5.3. Bước 3: Dò tìm năng lượng

3.5.4. Bước 4: Phát hiện tiếng nói trong tín hiệu

3.5.5. Bước 5: Chuẩn hóa các tham số của tín hiệu

3.5.6. Bước 6: Chuẩn hóa TrainWorldlni

3.5.7. Bước 7: Chuẩn hóa TrainWorldFimal

3.5.8. Bước 8: Huấn luyện GMM cho từng người nói

3.5.9. Bước 9: Nhận dạng người nói

3.6. Nhận dạng tiếng nói sử dụng Sphinx3

3.6.1. Bước 1: Tạo cấu trúc thư mục và các file cấu hình cần thiết

3.6.2. Bước 2: Cập nhật dữ liệu huấn luyện

3.6.3. Bước 3: Huấn luyện mô hình âm học

3.6.4. Bước 4: Tính tham số MECC của file WAV

3.6.5. Bước 5: Tính điểm số từng từ khóa qua Sphinx3

3.7. Nhận dạng người nói phụ thuộc từ khóa tiếng Việt

3.8. Nhận dạng người nói sử dụng ALLZL và Sphinx3

3.9. Phân tích và đánh giá kết quả

4. CHƯƠNG 4: KẾT LUẬN VÀ KIẾN NGHỊ

4.1. Những vấn đề đã giải quyết trong luận văn

4.2. Hướng phát triển của đề tài

TÀI LIỆU THAM KHẢO

Mô hình hỗn hợp Gauss

A. Đặc tả mô hình

Bài toán ước lượng mật độ

B. Ba bài toán cơ bản của HMM

B.1. Bài toán thứ nhất: Đánh giá xác suất

B.2. Thuật toán thứ hai: 'Tìm dãy trạng thái tối ưu

B.3. Thuật toán thứ ba: Ước lượng tham số của mô hình

Cấu trúc các gói trong thư viện LIA-RAT

C.1. Cấu trúc file NormFeat cfg

C.2. Cấu trúc file NormFeat_energy

C.3. Cấu trúc file TrainWorldInit

C.4. Cấu trúc file TrainWorldF inal cfg

C.5. Cấu trúc gói TrainiTarget

C.6. Cấu trúc gói Computelest

Code chương trình nhận dạng người nói tiếng Việt số

D.1. Code chương trình tổng hợp xác suất của AL122H và Sphhbx

D.2. Code chương trình chạy xác suất tiên nghiệm với ALIZE và Sphinx

Tóm tắt

I. Tổng Quan Về Nhận Dạng Người Nói Phụ Thuộc Từ Khóa

Nhận dạng người nói là một lĩnh vực nghiên cứu quan trọng trong xử lý ngôn ngữ tự nhiên và trí tuệ nhân tạo. Mục tiêu chính là xác định danh tính của người nói dựa trên đặc trưng giọng nói của họ. Trong những năm gần đây, nhận dạng người nói phụ thuộc từ khóa nổi lên như một hướng đi đầy tiềm năng. Khác với các phương pháp truyền thống, hệ thống này tập trung vào việc phân biệt người nói khi họ phát âm một hoặc một vài từ khóa cụ thể. Điều này mang lại lợi thế lớn trong các ứng dụng thực tế, nơi mà người dùng tương tác với hệ thống thông qua các lệnh thoại hoặc truy vấn bằng giọng nói. Ứng dụng của nó vô cùng đa dạng, từ bảo mật truy cập bằng giọng nói, điều khiển thiết bị thông minh đến hỗ trợ trong các cuộc điều tra pháp lý. Sự phát triển của công nghệ này mở ra nhiều cơ hội để cải thiện trải nghiệm người dùng và tăng cường tính bảo mật trong các hệ thống tương tác bằng giọng nói. Tuy nhiên, nhận dạng giọng nói tiếng Việt vẫn còn nhiều thách thức, đặc biệt là trong môi trường có nhiều tạp âm và biến thể giọng nói. Các nghiên cứu gần đây đã tập trung vào việc phát triển các thuật toán mạnh mẽ hơn và các mô hình hóa giọng nói hiệu quả hơn để vượt qua những khó khăn này. Theo luận văn, tác giả Đào Thị Thu Diệp đã nghiên cứu về "Nhận Dạng Người Nói Phụ Thuộc Từ Khóa Tiếng Việt" và đề xuất các phương pháp cải tiến dựa trên các công cụ như ALIZE và Sphinx.

1.1. Định Nghĩa Nhận Dạng Người Nói Là Gì Các Loại Hình

Nhận dạng người nói (Speaker Recognition) là quá trình sử dụng các thuật toán và mô hình để tự động xác định danh tính của một người dựa trên giọng nói của họ. Có hai loại hình chính: Nhận dạng người nói độc lập văn bản (Text-Independent Speaker Recognition) và Nhận dạng người nói phụ thuộc văn bản (Text-Dependent Speaker Recognition). Loại hình đầu tiên không yêu cầu người nói phải đọc một văn bản cụ thể, trong khi loại hình thứ hai đòi hỏi người nói phải phát âm một câu hoặc từ khóa đã được định trước. Nhận dạng người nói phụ thuộc từ khóa là một dạng đặc biệt của loại hình thứ hai, tập trung vào việc nhận dạng người nói khi họ phát âm một số từ khóa nhất định. Điều này cho phép hệ thống tập trung vào các đặc trưng giọng nói quan trọng nhất liên quan đến các từ khóa này, cải thiện độ chính xác và hiệu quả.

1.2. Ứng Dụng Thực Tiễn Của Nhận Dạng Giọng Nói Tiếng Việt

Ứng dụng của nhận dạng người nói rất đa dạng và ngày càng trở nên phổ biến. Trong lĩnh vực bảo mật, nó được sử dụng để xác thực người nói bằng giọng nói trong các hệ thống truy cập, thanh toán điện tử và bảo mật thông tin cá nhân. Trong lĩnh vực điều khiển thiết bị, nó cho phép người dùng điều khiển các thiết bị thông minh như điện thoại, TV, ô tô bằng giọng nói. Trong lĩnh vực pháp lý, nó có thể được sử dụng để phân tích giọng nói trong các bản ghi âm để xác định danh tính của người nói. Ngoài ra, nó còn được ứng dụng trong các hệ thống hỗ trợ người khuyết tật, cho phép họ tương tác với máy tính và các thiết bị khác bằng giọng nói. Với sự phát triển của công nghệ, các ứng dụng của nhận dạng người nói sẽ ngày càng mở rộng và đóng vai trò quan trọng trong cuộc sống.

II. Thách Thức Trong Nhận Dạng Người Nói Tiếng Việt

Mặc dù có nhiều tiềm năng, nhận dạng người nói tiếng Việt vẫn đối mặt với nhiều thách thức đáng kể. Tiếng Việt là một ngôn ngữ có thanh điệu, với sự khác biệt về cao độ và ngữ điệu có thể thay đổi ý nghĩa của từ. Điều này gây khó khăn cho việc trích xuất các đặc trưng giọng nói ổn định và đáng tin cậy. Bên cạnh đó, sự đa dạng về phương ngữ và giọng vùng miền cũng là một trở ngại lớn. Giọng nói của người miền Bắc, miền Trung và miền Nam có những đặc trưng riêng biệt, đòi hỏi hệ thống phải có khả năng thích nghi cao. Ngoài ra, môi trường ồn ào và tạp âm cũng ảnh hưởng đáng kể đến hiệu suất của hệ thống. Các nghiên cứu cần tập trung vào việc phát triển các thuật toán robust hơn, có khả năng loại bỏ nhiễu và xử lý các biến thể giọng nói một cách hiệu quả. Bên cạnh đó, việc xây dựng cơ sở dữ liệu giọng nói tiếng Việt lớn và đa dạng là rất quan trọng để huấn luyện các mô hình chính xác và đáng tin cậy.

2.1. Ảnh Hưởng Thanh Điệu Và Phương Ngữ Đến Độ Chính Xác

Thanh điệu là một đặc trưng quan trọng của tiếng Việt, nhưng đồng thời cũng là một thách thức lớn đối với nhận dạng giọng nói. Sự thay đổi về cao độ và ngữ điệu có thể làm thay đổi ý nghĩa của từ, gây khó khăn cho việc trích xuất các đặc trưng giọng nói ổn định. Phương ngữ cũng là một yếu tố quan trọng cần xem xét. Giọng nói của người miền Bắc, miền Trung và miền Nam có những đặc trưng riêng biệt, đòi hỏi hệ thống phải có khả năng thích nghi cao. Các nghiên cứu cần tập trung vào việc phát triển các phương pháp trích chọn đặc trưng giọng nói không nhạy cảm với thanh điệu và phương ngữ, hoặc sử dụng các mô hình riêng biệt cho từng vùng miền.

2.2. Vấn Đề Nhiễu Và Tạp Âm Ảnh Hưởng Đến Hiệu Năng

Môi trường ồn ào và tạp âm là một vấn đề phổ biến trong các ứng dụng thực tế của nhận dạng người nói. Các tạp âm như tiếng ồn giao thông, tiếng nói chuyện của người khác, tiếng nhạc... có thể làm giảm đáng kể độ chính xác của hệ thống. Các nghiên cứu cần tập trung vào việc phát triển các thuật toán robust hơn, có khả năng loại bỏ nhiễu và tạp âm một cách hiệu quả. Một số phương pháp phổ biến bao gồm sử dụng các bộ lọc nhiễu, kỹ thuật tăng cường tín hiệu và mô hình hóa tiếng ồn.

III. Cách Xây Dựng Hệ Thống Nhận Dạng Tiếng Việt Hiệu Quả

Để xây dựng một hệ thống nhận dạng người nói tiếng Việt hiệu quả, cần chú trọng đến nhiều yếu tố khác nhau. Đầu tiên, việc thu thập và chuẩn bị dữ liệu giọng nói tiếng Việt chất lượng cao là vô cùng quan trọng. Dữ liệu cần phải đa dạng về giới tính, độ tuổi, vùng miền và môi trường ghi âm. Thứ hai, cần lựa chọn các thuật toán nhận dạng giọng nói phù hợp, có khả năng xử lý các đặc trưng của tiếng Việt như thanh điệu và phương ngữ. Các thuật toán phổ biến bao gồm mô hình hỗn hợp Gaussian (GMM), mô hình Markov ẩn (HMM) và các mô hình học sâu như mạng nơ-ron tích chập (CNN) và mạng nơ-ron hồi quy (RNN). Thứ ba, cần tối ưu hóa các tham số của mô hình và đánh giá hiệu suất của hệ thống một cách kỹ lưỡng. Các chỉ số đánh giá quan trọng bao gồm độ chính xác, độ tin cậy và thời gian xử lý. Theo luận văn, tác giả đã sử dụng kết hợp công cụ ALIZE và Sphinx3 để xây dựng và thử nghiệm hệ thống nhận dạng người nói phụ thuộc từ khóa.

3.1. Chuẩn Bị Cơ Sở Dữ Liệu Giọng Nói Tiếng Việt Đa Dạng

Việc chuẩn bị một cơ sở dữ liệu giọng nói tiếng Việt đa dạng là rất quan trọng để huấn luyện các mô hình chính xác và đáng tin cậy. Dữ liệu cần phải bao gồm giọng nói của người từ nhiều vùng miền khác nhau, với nhiều độ tuổi và giới tính khác nhau. Ngoài ra, dữ liệu cũng cần phải được thu thập trong nhiều môi trường khác nhau, từ môi trường yên tĩnh đến môi trường ồn ào. Việc này giúp hệ thống có khả năng thích nghi tốt hơn với các điều kiện thực tế. Cơ sở dữ liệu cần được gắn nhãn cẩn thận để đảm bảo chất lượng và độ chính xác.

3.2. Lựa Chọn Thuật Toán Nhận Dạng Phù Hợp

Việc lựa chọn thuật toán nhận dạng phù hợp là một yếu tố quan trọng để đảm bảo hiệu suất của hệ thống. Các thuật toán phổ biến bao gồm mô hình hỗn hợp Gaussian (GMM), mô hình Markov ẩn (HMM) và các mô hình học sâu như mạng nơ-ron tích chập (CNN) và mạng nơ-ron hồi quy (RNN). Mỗi thuật toán có những ưu điểm và nhược điểm riêng, phù hợp với các ứng dụng khác nhau. Cần cân nhắc kỹ lưỡng các yếu tố như độ phức tạp tính toán, yêu cầu về dữ liệu và khả năng xử lý nhiễu để lựa chọn thuật toán phù hợp nhất.

IV. Ứng Dụng Công Cụ ALIZE Và Sphinx3 Để Nhận Dạng

Luận văn đã sử dụng hai công cụ mạnh mẽ là ALIZE và Sphinx3 để xây dựng và thử nghiệm hệ thống nhận dạng người nói phụ thuộc từ khóa tiếng Việt. ALIZE là một bộ công cụ mã nguồn mở được phát triển bởi LIA (Laboratoire d'Informatique d'Avignon), chuyên về nhận dạng giọng nóiphân tích giọng nói. Sphinx3 là một bộ công cụ nhận dạng tiếng nói mã nguồn mở được phát triển bởi Đại học Carnegie Mellon. Sự kết hợp của hai công cụ này cho phép tận dụng các ưu điểm của cả hai, tạo ra một hệ thống nhận dạng mạnh mẽ và linh hoạt. Theo tác giả, việc sử dụng ALIZE giúp trích xuất các đặc trưng giọng nói hiệu quả, trong khi Sphinx3 được sử dụng để nhận dạng tiếng nói và tính toán điểm số cho từng từ khóa.

4.1. Giới Thiệu Về Bộ Công Cụ ALIZE Và Các Tính Năng

ALIZE là một bộ công cụ mã nguồn mở được phát triển bởi LIA (Laboratoire d'Informatique d'Avignon), chuyên về nhận dạng giọng nóiphân tích giọng nói. Nó cung cấp nhiều tính năng hữu ích, bao gồm trích xuất các đặc trưng giọng nói, mô hình hóa giọng nóiđánh giá hiệu năng nhận dạng. ALIZE hỗ trợ nhiều định dạng dữ liệu và có thể được tích hợp dễ dàng với các công cụ khác. Nó cũng cung cấp các công cụ để chuẩn hóa dữ liệu và loại bỏ nhiễu.

4.2. Tổng Quan Về Công Cụ Nhận Dạng Tiếng Nói Sphinx3

Sphinx3 là một bộ công cụ nhận dạng tiếng nói mã nguồn mở được phát triển bởi Đại học Carnegie Mellon. Nó cung cấp nhiều tính năng mạnh mẽ, bao gồm nhận dạng tiếng nói liên tục, mô hình hóa âm họcmô hình hóa ngôn ngữ. Sphinx3 hỗ trợ nhiều ngôn ngữ khác nhau và có thể được tùy chỉnh để phù hợp với các ứng dụng cụ thể. Nó cũng cung cấp các công cụ để huấn luyện mô hình và đánh giá hiệu suất.

V. Kết Quả Nghiên Cứu Và Đánh Giá Hệ Thống Nhận Dạng

Luận văn đã trình bày kết quả nghiên cứu và đánh giá hệ thống nhận dạng người nói phụ thuộc từ khóa tiếng Việt sử dụng công cụ ALIZE và Sphinx3. Kết quả cho thấy hệ thống đạt được độ chính xác khá cao trong điều kiện thử nghiệm. Tuy nhiên, độ chính xác giảm đi khi môi trường có nhiều tạp âm và biến thể giọng nói. Tác giả cũng đã phân tích các yếu tố ảnh hưởng đến hiệu suất của hệ thống và đề xuất các giải pháp cải tiến. Theo luận văn, độ dài của từ khóa cũng ảnh hưởng đến độ chính xác của nhận dạng. Các từ khóa dài hơn thường mang lại độ chính xác cao hơn, do chứa nhiều thông tin về đặc trưng giọng nói hơn.

5.1. Phân Tích Các Yếu Tố Ảnh Hưởng Đến Độ Chính Xác

Nhiều yếu tố có thể ảnh hưởng đến độ chính xác của hệ thống nhận dạng người nói. Một số yếu tố quan trọng bao gồm chất lượng dữ liệu, độ dài của từ khóa, môi trường ghi âm và thuật toán nhận dạng. Chất lượng dữ liệu ảnh hưởng trực tiếp đến hiệu suất của mô hình. Độ dài của từ khóa cũng quan trọng, vì các từ khóa dài hơn thường mang lại nhiều thông tin hơn. Môi trường ghi âm có thể gây ra nhiễu và tạp âm, làm giảm độ chính xác. Cuối cùng, lựa chọn thuật toán nhận dạng phù hợp cũng rất quan trọng.

5.2. So Sánh Hiệu Năng Giữa ALIZE Và Sphinx3

Luận văn đã sử dụng cả ALIZE và Sphinx3 để xây dựng hệ thống nhận dạng người nói. ALIZE được sử dụng để trích xuất các đặc trưng giọng nói, trong khi Sphinx3 được sử dụng để nhận dạng tiếng nói và tính toán điểm số cho từng từ khóa. Tác giả không so sánh trực tiếp hiệu năng của hai công cụ này, nhưng kết quả cho thấy sự kết hợp của cả hai mang lại hiệu quả tốt. Các nghiên cứu khác đã chỉ ra rằng ALIZE có thể mạnh hơn trong việc trích xuất các đặc trưng giọng nói đặc trưng cho người nói, trong khi Sphinx3 có thể mạnh hơn trong việc nhận dạng tiếng nói liên tục.

VI. Kết Luận Và Hướng Phát Triển Của Nhận Dạng Người Nói

Nhận dạng người nói phụ thuộc từ khóa tiếng Việt là một lĩnh vực đầy tiềm năng, với nhiều ứng dụng thực tế. Luận văn đã đóng góp vào việc nghiên cứu và phát triển công nghệ này, bằng cách xây dựng và đánh giá một hệ thống sử dụng công cụ ALIZE và Sphinx3. Tuy nhiên, vẫn còn nhiều thách thức cần vượt qua, như xử lý nhiễu, thích nghi với các biến thể giọng nói và xây dựng cơ sở dữ liệu giọng nói lớn và đa dạng. Trong tương lai, các nghiên cứu có thể tập trung vào việc phát triển các mô hình học sâu mạnh mẽ hơn, sử dụng các kỹ thuật tăng cường dữ liệu và tích hợp các thông tin bổ sung như ngữ cảnh và biểu cảm.

6.1. Các Vấn Đề Đã Giải Quyết Và Hạn Chế Của Nghiên Cứu

Luận văn đã giải quyết một số vấn đề quan trọng trong nhận dạng người nói phụ thuộc từ khóa tiếng Việt, như xây dựng hệ thống sử dụng công cụ ALIZE và Sphinx3, đánh giá hiệu suất của hệ thống và phân tích các yếu tố ảnh hưởng đến độ chính xác. Tuy nhiên, nghiên cứu cũng có một số hạn chế, như dữ liệu thử nghiệm còn hạn chế, chưa xem xét đến các yếu tố ngữ cảnh và biểu cảm. Các nghiên cứu trong tương lai cần tập trung vào việc giải quyết những hạn chế này.

6.2. Hướng Nghiên Cứu Và Phát Triển Trong Tương Lai

Trong tương lai, có nhiều hướng nghiên cứu và phát triển tiềm năng trong lĩnh vực nhận dạng người nói. Một số hướng quan trọng bao gồm phát triển các mô hình học sâu mạnh mẽ hơn, sử dụng các kỹ thuật tăng cường dữ liệu, tích hợp các thông tin bổ sung như ngữ cảnh và biểu cảm, và phát triển các ứng dụng thực tế cho công nghệ này. Ngoài ra, việc xây dựng cơ sở dữ liệu giọng nói tiếng Việt lớn và đa dạng là rất quan trọng để thúc đẩy sự phát triển của lĩnh vực này.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

11/09/2025
Luận văn nhận dạng người nói phụ thuộc từ khóa tiếng việt

Trích đoạn nội dung tài liệu

CHƯƠNG 1. Tổng quan về nhận đạng người nói. Nhận đụ ngườinỗi là gÌ?. Các ủng đụng của nhận dạng người nói.

Phuong pháp nhận đạng người nói phụ thuộc từ khóa. Cáethành phần của một hệ thing nhận sẻ 1 dang người nói phụ thuộc từ khóa - 18 1. Các giai doan xử ly của một hệ thống nhận dạng người nói phụ thuộc từ khóa - - - - 20 1. Tìm hiểu về các kết quả nhân dang người nói đã có với Tiếng Việt.

Định đanh người nói tiếng Việt sử dựng mô hình hỗn hợp Gaussian của nhôm láo giả Đình Lõ Thành, Nguyễn Quée Lith, Trinh Vin Toan. Bước: Huấu luyện GMM cho lừng người nói %6 3. Hước9: Nhận đạng ngườinói. Nhận đạng tiếng nói sử đụng Sphinx3.

Bước 1; Tạo câu trúc thư mục vá các file cầu hình cân thiết. Bước 2: Cập nhật đữ liệu huấn luyệi _- 3. Bước 3: Huản luyện mô hình âm học - 58 3. Hước 4: Tình tham số MECC của ñile WAV.

sec 59 345, Bước 5: Tính điểm số từng từ khỏa qua Sphinx3 59 3. Nhận đạng người nói phụ thuộc từ khỏa tiếng Việt 6] 3. _ Nhận đạng người nói sử đụng ALLZL: và Sphinx3. Phântíchvà đánh giá kết quả - 65 Chuong 4.

KET LUAN VA KLEN NGHI Al. Những vẫn để đã giải quyết trong luận văn. Hưởng phát triển của dẻ tải. OD TÀI LIỆU THAM KHẢO.

Mö hinh hồn hợp Gauss. Đặc tả mô hinh ~ ~ - ~ 72 A. Bài Loàn ước lượng miật độ. Ba bai ton co ban ctia TIMM 76 ®.

Bài toán thứ nhất: Đánh giá xác suất. Thuật toán thứ hai: 'Tìm dãy trạng thải tối ưu. Thuật toán thứ ba: Ước lượng tham số của mô hình. Cấu trúc các gói trong thu vién LIA-RAT.

Cau tnic file NormFeat cfg - - wo 81 C2. Cau tniie file NormFeat_energy. Cấu trúc file IrainWorldInit. Cau tnic file TrainWorldF inal cfg - - 86 DANH MỤC HÌNH linh 1.

¡lệ thống xác định người nó,. Mô hình xác định người nói. Hệ thống xác trĩnh người nói - 1 Hình 1. Mê hình xác minh người nai.

Các thành phân của một hệ thẳng nhận đạng người n‹ phụ thuộc từ khóa. Hệ thông định đanh người nói sử dụng gii thuat GMM. Pha nhân đạng hệ nhận đạng người nói phụ thuộc từ khóa thay i Hình 1. & qua khao sát độ chính xác nhận dạng người nói phụ thuộc dộ đài từ khóa.

co se Hình 2. Thanh pl của gói céng cu ALIZE. So dé cac cng cu sit dung ALIZH trong nhận dạng người noi Tlinh 3. 116 nhan dang người nói phụ thuộc từ khóa tiếng Việt.

File wav biéu dién tin hiệu phát âm từ khỏa 0 đền 9 cũa người nói. Cúc bước xây dựng hệ nhận dạng người nói sử đụng 8Pro & AITZE.4 Sơ đồ tổng quát x4y dumg Forced alignment proces 57 Hình 3. Biểu đồ thể tiện kết quả nhận dang voi Test 1. Biểu đồ thể hiện kết quả nhận đang với Test 2.

Biếu đồ thế hiên kết quả nhận đạng với các thử nghiệm. Hàm mat dé Gauss - - - —- Hình A. Mé hinh GMM Tlinh A. [Hàm mật độ của GMIM có 3 phần phổi Gauss.

Bước: Huấu luyện GMM cho lừng người nói %6 3. Hước9: Nhận đạng ngườinói. Nhận đạng tiếng nói sử đụng Sphinx3. Bước 1; Tạo câu trúc thư mục vá các file cầu hình cân thiết.

Bước 2: Cập nhật đữ liệu huấn luyệi _- 3. Bước 3: Huản luyện mô hình âm học - 58 3. Hước 4: Tình tham số MECC của ñile WAV. sec 59 345, Bước 5: Tính điểm số từng từ khỏa qua Sphinx3 59 3.

Nhận đạng người nói phụ thuộc từ khỏa tiếng Việt 6] 3. _ Nhận đạng người nói sử đụng ALLZL: và Sphinx3. Phântíchvà đánh giá kết quả - 65 Chuong 4. KET LUAN VA KLEN NGHI Al.

Những vẫn để đã giải quyết trong luận văn. Hưởng phát triển của dẻ tải. OD TÀI LIỆU THAM KHẢO. Mö hinh hồn hợp Gauss.

Đặc tả mô hinh ~ ~ - ~ 72 A. Bài Loàn ước lượng miật độ. Ba bai ton co ban ctia TIMM 76 ®. Bài toán thứ nhất: Đánh giá xác suất.

Thuật toán thứ hai: 'Tìm dãy trạng thải tối ưu. Thuật toán thứ ba: Ước lượng tham số của mô hình. Cấu trúc các gói trong thu vién LIA-RAT. Cau tnic file NormFeat cfg - - wo 81 C2.

Cau tniie file NormFeat_energy. Cấu trúc file IrainWorldInit. Cau tnic file TrainWorldF inal cfg - - 86 3. Bước: Huấu luyện GMM cho lừng người nói %6 3.

Hước9: Nhận đạng ngườinói. Nhận đạng tiếng nói sử đụng Sphinx3. Bước 1; Tạo câu trúc thư mục vá các file cầu hình cân thiết. Bước 2: Cập nhật đữ liệu huấn luyệi _- 3.

Bước 3: Huản luyện mô hình âm học - 58 3. Hước 4: Tình tham số MECC của ñile WAV. sec 59 345, Bước 5: Tính điểm số từng từ khỏa qua Sphinx3 59 3. Nhận đạng người nói phụ thuộc từ khỏa tiếng Việt 6] 3.

_ Nhận đạng người nói sử đụng ALLZL: và Sphinx3. Phântíchvà đánh giá kết quả - 65 Chuong 4. KET LUAN VA KLEN NGHI Al. Những vẫn để đã giải quyết trong luận văn.

Hưởng phát triển của dẻ tải. OD TÀI LIỆU THAM KHẢO. Mö hinh hồn hợp Gauss. Đặc tả mô hinh ~ ~ - ~ 72 A.

Bài Loàn ước lượng miật độ. Ba bai ton co ban ctia TIMM 76 ®. Bài toán thứ nhất: Đánh giá xác suất. Thuật toán thứ hai: 'Tìm dãy trạng thải tối ưu.

Thuật toán thứ ba: Ước lượng tham số của mô hình. Cấu trúc các gói trong thu vién LIA-RAT. Cau tnic file NormFeat cfg - - wo 81 C2. Cau tniie file NormFeat_energy.

Cấu trúc file IrainWorldInit. Cau tnic file TrainWorldF inal cfg - - 86 DANH MỤC HÌNH linh 1. ¡lệ thống xác định người nó,. Mô hình xác định người nói.

Hệ thống xác trĩnh người nói - 1 Hình 1. Mê hình xác minh người nai. Các thành phân của một hệ thẳng nhận đạng người n‹ phụ thuộc từ khóa. Hệ thông định đanh người nói sử dụng gii thuat GMM.

Pha nhân đạng hệ nhận đạng người nói phụ thuộc từ khóa thay i Hình 1. & qua khao sát độ chính xác nhận dạng người nói phụ thuộc dộ đài từ khóa. co se Hình 2. Thanh pl của gói céng cu ALIZE.

So dé cac cng cu sit dung ALIZH trong nhận dạng người noi Tlinh 3. 116 nhan dang người nói phụ thuộc từ khóa tiếng Việt. File wav biéu dién tin hiệu phát âm từ khỏa 0 đền 9 cũa người nói. Cúc bước xây dựng hệ nhận dạng người nói sử đụng 8Pro & AITZE.4 Sơ đồ tổng quát x4y dumg Forced alignment proces 57 Hình 3.

Biểu đồ thể tiện kết quả nhận dang voi Test 1. Biểu đồ thể hiện kết quả nhận đang với Test 2. Biếu đồ thế hiên kết quả nhận đạng với các thử nghiệm. Hàm mat dé Gauss - - - —- Hình A.

Mé hinh GMM Tlinh A. [Hàm mật độ của GMIM có 3 phần phổi Gauss. Xây dmg và khắc át độ dài lừ khỏa trong nhận đạng người nói phụ thuộc vào từ khóa tiếng Việt theo mỏ hình Markov dn tác giả: Ngô Minh Ding, Dang, Van Chuyét - - - 2 CHUONG 2. CAC CONG CU SU DUNG TRONG DE TAT.

Bộ công cụALIZH. HH ho ruê senseeoee. Bộ công cụ SPro - - - e DF 2. Cée céng cunbiau dang nguéi noi sd dung SPro va ALIZE 28 2.2, BG cOng cy Sphinx oc cecsesessenssiesstssnseeensstestnsesensistensetesiaestett 36 22.2, Tổng quanvẻ bộ giải mãs3.

Công cụ nhận đạng tiếng nói sử dựng Sphinx3. TRIEN KHAT HE THONG THU NGHTEM NHAN DANG NGUGI NOI TLENG VIET. Sơ đỗ tổng quan quá trình xây đựng hệ thống nhận đạng người nói phụ thuộc từ khóa tiếng Việt - - 42 3. Chuẩn bị dữ liệu.

co họ nhung rưei 43 32 Chuẩn bị đữ liệu cho nhận dạng bởi sông ụ ALTZE 47 3. Chuẩn bị dữ hệu cho nhận dạng bới công cụ Sphinx3. Nhận đạng người nói sử dựng ALIZE. Bude 1: Tao ther muc lảm việc.

Bude 2: Tinh tham 36 MFCC - - %4 333. Bước 3: Dò lim năng lượng %4 3. Bước 4: Phát hiện tiếng nói trong tín hiệu. Bước 5: Chuẩn hóa các tham số của tín hiệu.

Bước 6: Chuẩn hỏa TrainWorldlni - 55 3. Bước 7: Chuẩn hóa IrainWorldFimal.© DANH MỤC HÌNH linh 1. ¡lệ thống xác định người nó,. Mô hình xác định người nói.

Hệ thống xác trĩnh người nói - 1 Hình 1. Mê hình xác minh người nai. Các thành phân của một hệ thẳng nhận đạng người n‹ phụ thuộc từ khóa. Hệ thông định đanh người nói sử dụng gii thuat GMM.

Pha nhân đạng hệ nhận đạng người nói phụ thuộc từ khóa thay i Hình 1. & qua khao sát độ chính xác nhận dạng người nói phụ thuộc dộ đài từ khóa. co se Hình 2. Thanh pl của gói céng cu ALIZE.

So dé cac cng cu sit dung ALIZH trong nhận dạng người noi Tlinh 3. 116 nhan dang người nói phụ thuộc từ khóa tiếng Việt. File wav biéu dién tin hiệu phát âm từ khỏa 0 đền 9 cũa người nói. Cúc bước xây dựng hệ nhận dạng người nói sử đụng 8Pro & AITZE.4 Sơ đồ tổng quát x4y dumg Forced alignment proces 57 Hình 3.

Biểu đồ thể tiện kết quả nhận dang voi Test 1. Biểu đồ thể hiện kết quả nhận đang với Test 2. Biếu đồ thế hiên kết quả nhận đạng với các thử nghiệm. Hàm mat dé Gauss - - - —- Hình A.

Mé hinh GMM Tlinh A. [Hàm mật độ của GMIM có 3 phần phổi Gauss. Xây dmg và khắc át độ dài lừ khỏa trong nhận đạng người nói phụ thuộc vào từ khóa tiếng Việt theo mỏ hình Markov dn tác giả: Ngô Minh Ding, Dang, Van Chuyét - - - 2 CHUONG 2. CAC CONG CU SU DUNG TRONG DE TAT.

Bộ công cụALIZH. HH ho ruê senseeoee. Bộ công cụ SPro - - - e DF 2. Cée céng cunbiau dang nguéi noi sd dung SPro va ALIZE 28 2.2, BG cOng cy Sphinx oc cecsesessenssiesstssnseeensstestnsesensistensetesiaestett 36 22.2, Tổng quanvẻ bộ giải mãs3.

Công cụ nhận đạng tiếng nói sử dựng Sphinx3. TRIEN KHAT HE THONG THU NGHTEM NHAN DANG NGUGI NOI TLENG VIET. Sơ đỗ tổng quan quá trình xây đựng hệ thống nhận đạng người nói phụ thuộc từ khóa tiếng Việt - - 42 3. Chuẩn bị dữ liệu.

co họ nhung rưei 43 32 Chuẩn bị đữ liệu cho nhận dạng bởi sông ụ ALTZE 47 3. Chuẩn bị dữ hệu cho nhận dạng bới công cụ Sphinx3. Nhận đạng người nói sử dựng ALIZE. Bude 1: Tao ther muc lảm việc.

Bude 2: Tinh tham 36 MFCC - - %4 333. Bước 3: Dò lim năng lượng %4 3. Bước 4: Phát hiện tiếng nói trong tín hiệu. Bước 5: Chuẩn hóa các tham số của tín hiệu.

Bước 6: Chuẩn hỏa TrainWorldlni - 55 3. Bước 7: Chuẩn hóa IrainWorldFimal. Bước: Huấu luyện GMM cho lừng người nói %6 3. Hước9: Nhận đạng ngườinói.

Nhận đạng tiếng nói sử đụng Sphinx3.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ