BỘ GIÁO DỤC VÀ ĐÀO TẠO TRƯỜNG ĐẠI HỌC SƯ PHẠM KỸ THUẬT THÀNH PHỐ HỒ CHÍ MINH LUẬN VĂN THẠC SĨ HUỲNH LÂM ĐỒNG NHẬN DẠNG TIẾNG NÓI DÙNG GIẢI THUẬT TRÍCH ĐẶC TRƯNG MFCC VÀ LƯỢNG TỬ VECTOR TRÊN KIT DSKTMS320C6713 CỦA TI NGÀNH: KỸ THUẬT ĐIỆN TỬ - 605270 S KC 0 0 4 1 5 4 Tp. Hồ Chí Minh, tháng 09 năm 2013 Luan van BỘ GIÁO DỤC VÀ ĐÀO TẠO TRƯỜNG ĐẠI HỌC SƯ PHẠM KỸ THUẬT THÀNH PHỐ HỒ CHÍ MINH LUẬN VĂN THẠC SĨ HUỲNH LÂM ĐỒNG NHẬN DẠNG TIẾNG NÓI DÙNG GIẢI THUẬT TRÍCH ĐẶC TRƯNG MFCC VÀ LƯỢNG TỬ VECTOR TRÊN KIT DSKTMS320C6713 CỦA TI NGÀNH: KỸ THUẬT ĐIỆN TỬ - 60520203 Hướng dẫn khoa học: TS HOÀNG TRANG Tp. Hồ Chí Minh, tháng 09/2013 Luan van LÝ LỊCH KHOA HỌC I. LÝ LỊCH SƠ LƯỢC: Họ & tên: Huỳnh Lâm Đồng Giới tính: nam Ngày, tháng, năm sinh: 31/07/1987 Nơi sinh: TP.
HCM Quê quán: Lâm Đồng Dân tộc: Kinh Chỗ ở riêng hoặc địa chỉ liên lạc: 230/4/10 Phan Văn Tri /̣ P12/ Q.Gò Vấp/TP HCM. Điện thoại cơ quan: Điện thoại nhà riêng: 0838415874 Fax: E-mail: huynhlamdong@gmail. QUÁ TRÌNH ĐÀO TẠO: 1. Trung học chuyên nghiệp: Hệ đào tạo: Thời gian đào tạo từ ……/…… đến ……/ …… Nơi học (trường, thành phố): Ngành học: 2.
Đại học: Hệ đào tạo: Chính quy. Thời gian đào tạo từ 09/2005 đến 12/2010 Nơi học (trường, thành phố): ĐH Sư Phạm Kỹ Thuật TP. Ngành học: Công nghệ điện tử viễn thông Tên đồ án, luận án hoặc môn thi tốt nghiệp: Wimax và các tiêu chuẩn kỹ thuật ứng dụng trong Wimax. Ngày & nơi bảo vệ đồ án, luận án hoặc thi tốt nghiệp: Tháng 10/2010, ĐH SPKT.
Người hướng dẫn: Lê Ngọc Hồ Nguyên. QUÁ TRÌNH CÔNG TÁC CHUYÊN MÔN KỂ TỪ KHI TỐT NGHIỆP ĐẠI HỌC: Thời gian Nơi công tác Công việc đảm nhiệm 2010 đến Công ty Thông Tin Điện Tử Z755 Trợ lý kỹ thuật 08/2013 i Luan van LỜI CAM ĐOAN Tôi cam đoan đây là công trình nghiên cứu của tôi. Các số liệu, kết quả nêu trong luận văn là trung thực và chưa từng được ai công bố trong bất kỳ công trình nào khác. Hồ Chí Minh, ngày 20 tháng 8 năm 2013 (Ký tên và ghi rõ họ tên) Huỳnh Lâm Đồng ii Luan van LỜI CẢM ƠN Em xin chân thành cảm ơn thầy Hoàng Trang đã tận tình hướng dẫn em trong việc thực hiện luận văn này.
Thầy đã luôn giành sự quan tâm, thời gian và những chia sẻ gần gũi để giúp em hiểu và giải quyết những khó khăn trong quá trình thực hiện đề tài nhận dạng tiếng nói. Thầy đã cung câp những tài liệu cũng như định hướng để em có thể hoàn thành luận văn sớm nhất có thể. Em cũng xin chân thành cảm ơn khoa Điện – Điện tử đặc biệt là bộ môn Điện tử đã tạo điều kiện để em có thể thực hiện đề tài. Mình cũng xin cảm ơn các bạn trong lớp cao ho ̣c Điê ̣n – Điê ̣n.
Các bạn đã luôn chia sẻ những kinh nghiệm và sự hiểu biết với mình khi mình gặp những khó khăn và khúc mắc chưa thể giải quyết. Cuối cùng với tấ t cả tấ m lòng con xin cảm ơn gia đình đã luôn quan tâm, chia sẻ và động viên để con có thể hoàn thành chương trình học một cách tốt nhất. iii Luan van TÓM TẮT LUẬN VĂN Trong nhiều thập niên gần đây, việc điều khiển thông qua nhận dạng tiếng nói tự động (ASR) nhận được sự quan tâm lớn thông qua nhiều ứng dụng. Có nhiều giải thuật được đưa ra trong quá trình trích đặc trưng, huấn luyện cũng như nhận dạng.
Thuật toán nhận dạng tiếng nói thông qua quá trình trích đặc trưng các hệ số MFCC (Mel frequency cepstrum coefficient) và xây dựng Codebook bằng phương pháp lượng tử vector là hai phương pháp đặt nền tảng cho các thuật toán nhận dạng tiếng nói khác và chúng được sử dụng một cách rộng rãi trong nhiều ứng dụng. Trong luận văn này, tôi sẽ đánh giá thuật toán nêu trên thông qua việc xây dựng chương trình nhúng trên KIT DSP, mà cụ thể là KIT DSKTMS320C6713 với nền tảng là bộ xử lý TMS320C6000. Nội dung luận văn được chia thành hai phần chính: phần đầu của luận văn sẽ trình bày nội dung về thuật toán trích đặc trưng MFCC và lượng tử vector trong nhận dạng tiếng nói. Đồng thời, xây dựng phần mềm MATLAB mô phỏng các giải thuật để có hình dung khái quát về quá trình nhận dạng.
Phần thứ hai của luận văn sẽ xây dựng chương trình nhúng trên KIT DSKTMS320C6713. Chương trình nhúng gồm có hai phần: huấn luyện và nhận dạng. Trong cả hai phần, tiếng nói được ghi âm và xử lý trực tiếp thông qua IC CODEC mã hóa âm thanh AIC2381, dữ liệu được số hóa 16bit chuẩn bị cho quá trình huấn luyện và nhận dạng. Ngoài ra để đẩy nhanh quá trình tính toán và đánh giá, dữ liệu tiếng nói còn được lưu thành các file header trên CCS.
KIT DSP sẽ lấy dữ liệu trực tiếp từ các file này trong quá trình tính toán. Quá trình đánh giá có thể được thực hiện thông qua việc thay đổi trực tiếp các thông số trên các file dữ liệu. Bộ xử lý DSP C6713 với kiến trúc tập lệnh VLIW và khả năng xử lý dấu chấm động floating-point; việc này đảm bảo độ chính xác cao cho các phép tính. Phạm vi giá trị các phép tính có thể mở rộng trong phạm vi Single (32bit) hoặc double (64bit).
Các dữ liệu trong quá trình tính toán bao gồm codebook đã được huấn luyện và mẫu âm thanh cần nhận dạng được lưu trên bộ nhớ SDRAM 16MB. Số lượng từ vựng cần nhận dạng phụ thuộc vào iv Luan van dung luợng bộ nhớ. Bộ nhớ có thể được mở rộng thông qua giao tiếp bộ nhớ mở rộng bên ngoài EMIF. Quá trình huấn luyện sử dụng dữ liệu tiếng nói được ghi âm trực tiếp trên KIT hoặc từ các file dữ liệu lưu sẵn.
Dữ liệu được xử lý trích đặc trưng MFCC thành một tập các hệ số cho mỗi từ cần huấn luyện. Thông qua giải thuật lượng tử vector xây dựng codebook cho từ cần huấn luyện dựa trên các hệ số MFCC. Trong quá trình nhận dạng dữ liệu tiếng nói được ghi âm trực tiếp trên KIT hoặc từ các file dữ liệu lưu sẵn. Dữ liệu được xử lý trích đặc trưng MFCC thành một tập các hệ số cho mỗi từ cần nhận dạng.
Khoảng cách Euclide được tính toán trên tập các hệ số này so với tập huấn luyện gồm các codebook đã lưu ở phần trên. Khoảng cách Euclide nhỏ nhất sẽ xác định được mẫu tiếng nói cần nhận dạng. Đánh giá thuật toán nhận dạng dựa trên kết quả nhận dạng tập dữ liệu các từ số đếm từ một đến mười và và các từ “trái, phải, trên, dưới, trước, sau”. Mỗi từ được đánh giá 100 lần.
Thuật toán được đánh giá trên cơ sở điều chỉnh các thông số của quá trình huấn luyện và nhận dạng: kích thước của các frame âm thanh, khoảng chồng lấn giữa các frame, kích thước codebook. Để tăng tính chính xác, khách quan của quá trình đánh giá thì dữ liệu trong cả phần huấn luyện và nhận dạng được lấy mẫu theo cùng một phương pháp từ ghi âm, xử lý, tính toán sai số. iv Luan van ABSTRACT In recent decades , the control through automatic speech recognition ( ASR ) received great attention by many applications. There are many algorithms given in the quote process characteristics , training and recognition.
Speech recognition algorithm through characteristic coefficients extracted MFCC ( Mel frequency cepstrum coefficient ) and the construction of codebook by vector quantization methods are based two methods for speech recognition algorithms and their other been widely used in many applications. In this essay , I will evaluate the above algorithms through building programs on embedded DSP KIT , KIT DSKTMS320C6713 in particular with a platform TMS320C6000 processor. The contents of the thesis is divided into two main parts : the first part of the paper presents algorithms extract the contents of MFCC features and vector quantization in speech recognition. At the same time , building simulation software MATLAB algorithms to visualize an overview of the identification process.
The second part of the thesis will build on KIT DSKTMS320C6713 embedded programs. Embedded program consists of two parts : training and recognition. In both sections , the voices were recorded and processed directly through IC AIC2381 audio codec , 16bit digitized data prepared for the training and recognition. In addition to accelerating the calculation and assessment , the voice data is stored in the file header on the CCS.
KIT DSP will retrieve data directly from the file in the calculation process. The evaluation process can be done through changing the parameters directly on the data file. C6713 DSP processor with VLIW instruction set architecture and the ability to handle floating point floating-point , this ensures high precision calculations. Scope value calculations can be extended within single ( 32-bit ) or double ( 64bit ).
The data in the calculation process includes trained codebook and to recognize sound patterns that are stored on 16MB SDRAM memory. The number of iv Luan van required vocabulary recognition depends on the memory capacity. The memory can be expanded via memory interface EMIF external expansion. Training process using voice data is recorded directly in the KIT or from stored data files.
Data processing extract MFCC features into a set of coefficients for each word training. Through the algorithm for vector quantization codebook built from need -based training MFCC coefficients. In the process of identifying the voice data is recorded directly on the KIT or from stored data files. Data processing extract MFCC features into a set of coefficients for each word to be recognized.
Euclidean distance is computed on the set of coefficients from the training set consists of codebook has stored in the previous section. Smallest Euclidean distance to determine the required sample voice recognition. Rating recognition algorithm based on the recognition results from the data set the count from one to ten and and the words " trái (left) , phải (right), trên (top) , dưới (bottom) , trước (front), sau (back)". Each word is evaluated 100 times.
The algorithm is evaluated on the basis of adjusting the parameters of the training process and identity : the frame size of audio , some overlap between the frames , the codebook size. To increase the accuracy and objectivity of the assessment process , the data in both the training and recognition is sampled by the same method of recording , processing , calculation errors. iv Luan van MỤC LỤC Trang tựa TRANG Quyết định giao đề tài Lý lịch cá nhân i Lời cam đoan ii Cảm tạ iii Tóm tắt iv Mục lục v Danh sách các chữ viết tắt vi Danh sách các hình vii Danh sách các bảng viii Chƣơng 1.2 Tình hình nghiên cƣ́u trong và ngoài nƣớc 2 1.3 Tính cấp thiết của đề tài 5 1.4 Mục tiêu nghiên cứu của luận văn 5 1.