Nhận diện từ khóa sử dụng vi điều khiển: Phương pháp và ứng dụng

Chuyên khảo phân tích Nhận diện từ khóa sử dụng vi điều khiển, đánh giá các khía cạnh quan trọng, đề xuất hướng nghiên cứu tiếp theo.

Trường đại học

Đại học Quốc gia TP.HCM

Chuyên ngành

Kỹ thuật máy tính

Người đăng

Ẩn danh

Thể loại

luận văn tốt nghiệp

2022

88
2
0

Phí lưu trữ

30 Point

Tóm tắt

I. Giới thiệu về Nhận diện từ khóa trên vi điều khiển

Nhận diện từ khóa là một lĩnh vực quan trọng trong công nghệ hiện đại, đặc biệt trong bối cảnh phát triển của trí tuệ nhân tạo và Internet of Things (IoT). Việc sử dụng vi điều khiển để nhận diện từ khóa giúp tối ưu hóa quy trình giao tiếp giữa con người và máy móc. Hệ thống này cho phép người dùng tương tác với thiết bị thông qua giọng nói, mang lại trải nghiệm tiện lợi và hiệu quả hơn.

1.1. Tại sao lại chọn Nhận diện từ khóa

Nhu cầu giao tiếp tự nhiên với thiết bị điện tử ngày càng tăng cao. Nhận diện từ khóa giúp đơn giản hóa cách thức tương tác, đặc biệt cho những người gặp khó khăn trong việc sử dụng thiết bị truyền thống.

1.2. Mục tiêu của nghiên cứu

Mục tiêu chính là phát triển một hệ thống nhận diện từ khóa hiệu quả trên vi điều khiển, từ đó mở ra khả năng ứng dụng trong các lĩnh vực như nhà thông minh và trợ lý ảo.

II. Thách thức trong Nhận diện từ khóa trên vi điều khiển

Mặc dù công nghệ nhận diện từ khóa đã phát triển mạnh mẽ, nhưng vẫn tồn tại nhiều thách thức cần giải quyết. Các vấn đề như độ chính xác, khả năng lọc nhiễu và tốc độ xử lý là những yếu tố quan trọng ảnh hưởng đến hiệu quả của hệ thống.

2.1. Độ chính xác trong nhận diện

Độ chính xác của hệ thống nhận diện từ khóa phụ thuộc vào nhiều yếu tố, bao gồm chất lượng âm thanh và thuật toán xử lý. Việc cải thiện độ chính xác là một trong những thách thức lớn nhất.

2.2. Lọc nhiễu âm thanh

Nhiễu âm thanh từ môi trường xung quanh có thể làm giảm hiệu suất của hệ thống. Cần có các phương pháp hiệu quả để lọc nhiễu và cải thiện chất lượng tín hiệu đầu vào.

III. Phương pháp nhận diện từ khóa trên vi điều khiển

Để xây dựng hệ thống nhận diện từ khóa, cần áp dụng các phương pháp và công nghệ tiên tiến. Việc sử dụng neural network là một trong những giải pháp hiệu quả nhất hiện nay.

3.1. Sử dụng Neural Network

Mô hình neural network giúp cải thiện khả năng nhận diện từ khóa bằng cách học từ dữ liệu âm thanh. Các thuật toán như DS-CNN được áp dụng để tối ưu hóa quá trình này.

3.2. Thu thập và xử lý dữ liệu

Quá trình thu thập dữ liệu âm thanh và xử lý chúng là rất quan trọng. Cần sử dụng các công cụ và kỹ thuật phù hợp để đảm bảo dữ liệu đầu vào chất lượng.

IV. Ứng dụng thực tiễn của Nhận diện từ khóa

Hệ thống nhận diện từ khóa có thể được ứng dụng trong nhiều lĩnh vực khác nhau, từ nhà thông minh đến các thiết bị điện tử tiêu dùng. Việc tích hợp công nghệ này vào sản phẩm sẽ mang lại nhiều lợi ích cho người dùng.

4.1. Ứng dụng trong nhà thông minh

Hệ thống nhận diện từ khóa có thể được sử dụng để điều khiển các thiết bị trong nhà thông minh, giúp người dùng dễ dàng tương tác mà không cần sử dụng tay.

4.2. Ứng dụng trong trợ lý ảo

Các trợ lý ảo như Siri hay Alexa có thể sử dụng công nghệ nhận diện từ khóa để cải thiện khả năng tương tác và phục vụ người dùng tốt hơn.

V. Kết luận và tương lai của Nhận diện từ khóa

Nhận diện từ khóa trên vi điều khiển là một lĩnh vực đầy tiềm năng. Với sự phát triển không ngừng của công nghệ, hệ thống này hứa hẹn sẽ mang lại nhiều ứng dụng thực tiễn trong tương lai.

5.1. Đánh giá kết quả đạt được

Kết quả nghiên cứu cho thấy hệ thống có khả năng nhận diện từ khóa với độ chính xác cao, mở ra nhiều cơ hội ứng dụng trong thực tế.

5.2. Hướng phát triển tương lai

Cần tiếp tục nghiên cứu và cải tiến hệ thống để nâng cao độ chính xác và khả năng xử lý, từ đó đáp ứng tốt hơn nhu cầu của người dùng.

15/07/2025

Trích đoạn nội dung tài liệu

Chương 1: Giới thiệu Trong chương này, chúng tôi sẽ nêu ra các vấn đề liên quan đến NDTK sử dụng Vi điều khiển bao gồm: Tại sao lại chọn chủ đề NDTK sử dụng VDK, mục tiêu, ý nghĩa thực tế và khoa học của đề tài. Chương 2: Cơ sở lý thuyết và nền tảng công nghệ Tiếp theo, chương này sẽ trình bày những lý thuyết có liên quan hoặc được áp dụng trong đề tài: Các thông số âm thanh, đặc trưng âm thanh của con người, một số chuẩn kết nối: ADC, UART, SAI,. Ngoài ra, chương này còn mô tả một số phương pháp tiếp cận đề tài: MFCC, DS_CNN,. sử dụng bộ thư viện của Tensorflow.

Chương 3 : Thiết kế hệ thống Chương 3 sẽ trình bày sơ đồ kết nối của hệ thống phần cứng, thông số của từng thành phần trong hệ thống: Microphone, Bộ giải mã âm thanh Audio Codec, MCU và thiết bị xuất dữ liệu - Laptop. Ngoài ra chương này còn mô tả chi tiết luồng hoạt động của hệ thống: MFCC, DS_CNN,. Chương 4 : Hiện thực hệ thống Trong chương này, chúng tôi sẽ trình bày cấu trúc mã nguồn của hệ thống bao gồm 2 phần: Huẩn luyện mô hình và mã nguồn chạy trên Vi điều khiển. Chương 5 : Triển khai hệ thống Chương 5, chúng tôi sẽ hướng dẫn cách triển khai hệ thống từ bộ mã nguồn đã cung cấp, bao gồm: Huấn luyện mô hình, xây dựng chương trình và nạp chương trình vào Vi điều khiển.

Chương 6 : Kết quả thực nghiệm Chương 6, chúng tôi trình bày kết quả thu được từ việc chạy kiểm thử trên mô hình đã được huấn luyện và kiểm thử trên mô hình của Vi điều khiển. Kết quả thực nghiệm được kiểm thử dựa trên một số yếu tố môi trường khác nhau như: Tiếng ồn và tốc độ nói,. Chương 7 : Kết luận và khuyến nghị Chương 7 đánh giá kết quả đạt được so với những yêu cầu đặt ra, những hạn chế gặp phải - đồng thời đề ra giải pháp để tối ưu hệ thống và phát triển trong tương lai. 3 Chương 2 Cơ sở lý thuyết và nền tảng công nghệ Trong chương này, nhóm sẽ trình bày một số kiến thức cơ bản về các nội dung lý thuyết cũng như công nghệ nền tảng dùng trong đề tài.

Nội dung chương sẽ bao gồm 7 phần chính, bắt đầu với các khái niệm liên quan đến âm thanh, tiếng nói và các đặc trưng, tham số của chúng (phần 2. Đồng thời, cách con người tạo ra và thu nhận các loại âm thanh cũng được trình bày một cách cơ bản trong chương này. Tiếp theo, ở phần 2.2, các kiến thức tổng quan về bộ thu âm thanh (microphone) như là khái niệm, các loại microphone phổ biến sẽ được đưa ra.3 mô tả về bộ STM32F746NG discorvery kit, bao gồm các thông tin tổng quan về thông số cấu hình, chức năng và thành phần chính. Bên cạnh đó, trình điều khiển HAL của thiết bị cũng được thảo luận trong phần này.

Một số thông tin cơ bản về nhận dạng giọng nói tự động được trình bày trong phần 2.5 gồm các nội dung về ngôn ngữ lập trình C++ là ngôn ngữ lập trình chính được nhóm sử dụng, cùng với đó là việc giới thiệu về các thư viện hỗ trợ lập trình đối với board STM32F746NG cũng như là nền tảng hỗ trợ cho các vấn đề liên quan đến học máy và áp dụng suy luận trên thiết bị nhúng. Phần tiếp theo (phần 2.6) là các nội dung về mạng nơ-ron bao gồm khái niệm, kiến trúc chung, ứng dụng và các mô hình thường dùng. Phần cuối cùng là các kiến thức cần thiết đối với đề tài nhận diện từ khoá như các loại và mô hình tín hiệu trong xử lý âm thanh (analog/digital, PCM/PDM), phép biến đổi Fourier và các chuẩn kết nối có sử dụng trong đề tài.1 Âm thanh và các đặc trưng của âm thanh 2.1 Âm thanh • Khái niệm: Trong vật lý, âm thanh được định nghĩa là một loại sóng âm mang năng lượng truyền đi trong không gian thông qua các môi trường truyền dẫn như không khí, chất lỏng hoặc chất rắn. Âm thanh có các đặc trưng của sóng âm như: biên độ, bước sóng, tần số dao động, hướng và vận tốc lan truyền.[39][40] • Trong sinh lý học và tâm lý học con người, âm thanh là sự tiếp nhận các loại sóng âm như vậy và được nhận thức và xử lý bởi bộ não.

Tai người có thể cảm nhận được các âm thanh ở tần số trong khoảng 20Hz - 20kHz một cách phi tuyến tính, thông thường tai người nhạy cảm ở tần số thấp và kém nhạy cảm ở tần số cao. [39] • Âm thanh có vai trò đặc biệt quan trọng đối với đời sống con người. Trước hết, âm thanh là phương tiện giao tiếp của con người cũng như của động vật. Con người sử dụng tiếng nói, một số loại động vật như cá heo hoặc cá voi dùng siêu âm để giao tiếp.

Ngoài ra, cùng với sự phát triển của văn minh loài người, âm thanh còn được sử dụng như một phương thức để giải trí, tiêu biểu là âm nhạc.2 Các đặc trưng vật lý của âm thanh [31] a. Tần số • Tần số là số lần dao động của sóng âm trên một đơn vị thời gian. Trong vật lý, tần số có đơn vị là Hertz (Hz), 1 Hz = 1 dao động/giây. • Âm thanh là loại sóng âm có tần số nằm trong ngưỡng có thể nghe được (16Hz - 20kHz).

Ngoài âm thanh, sóng âm còn 2 loại khác là hạ âm (những âm có tần số dưới 16Hz) và siêu âm (âm có tần số lớn hơn 20kHz). Cường độ âm I là năng lượng được sóng âm truyền qua mỗi đơn vị diện tích được đặt vuông góc với phương truyền sóng trong mỗi đơn vị thời gian. Đơn vị đo cường độ âm là W/m2. Mức cường độ âm • Mức cường độ âm L của âm có cường độ âm I là L = lg II0.

Với I0 là cường độ âm chuẩn, là cường độ âm nhỏ nhất mà con người có thể nghe được ở tần số 1kHz và I0 = 10−12 (W/m2 ) • Mức cường độ âm cho biết cường độ âm I lớn hơn bao nhiêu lần so với cường độ âm chuẩn I0 .3 Cách tạo ra âm thanh và thu nhận âm thanh bởi con người [29] • Tiếng nói là một dạng âm thanh đặc trưng giúp con người giao tiếp với nhau. • Tiếng nói được tạo ra bằng cách đẩy một luồng hơi từ phổi đi qua hệ thống dây thanh quản, giúp tạo ra một áp lực lên các dây thanh quản khiến nó mở ra, sau đó luồng hơi thoát ra ngoài qua miệng, áp lực tạo ra bởi luồng hơi đó tác động lên các 5 dây thanh quản giảm xuống khiến nó đóng lại. Quá trình này cứ liên tục lặp lại tạo ra các tần số sóng âm cơ bản, với nam là khoảng 125Hz, 210Hz với nữ. Cùng với đó, các bộ phận khác như vòm họng, khoang miệng, lưỡi, môi,.

có tác dụng như một bộ cộng hưởng có thể thay đổi linh hoạt giúp triệt tiêu một vài tần số hoặc khuếch đại một vài tần số, từ đó phát ra tiếng nói hoàn chỉnh. • Cách hoạt động của tai người: Khi âm thanh truyền tới tai va đập vào màng nhĩ, màng nhĩ rung lên, truyền rung động lên 3 ba xương nhỏ: malleus, incus, stapes tới ốc tai. Ốc tai là 1 bộ phận dạng xoắn, rỗng như 1 con ốc. Ốc tai chứa các dịch nhầy bên trong giúp truyền âm thanh, dọc theo ốc tai là các tế bào lông cảm nhận âm thanh.

Các tế bào lông này rung lên khi có sóng truyền qua và gửi tín hiệu tới não bộ. Các tế bào ở đoạn đầu cứng hơn, rung động với các tần số cao. Càng sâu vào trong, các tế bào càng bớt cứng, đáp ứng các tần số thấp.1 dưới đây cho ta cái nhìn rõ hơn về điều đó.1: Tiếp nhận âm thanh với các tần số khác nhau ở tai người [29] Do cấu tạo ốc tai cùng số lượng các tế bào đáp ứng tần số thấp chiếm phần lớn khiến cho việc cảm nhận của tai người (và động vật) là phi tuyến tính, nhạy cảm ở tần số thấp, kém nhạy cảm ở tần số cao 2.4 Các đặc trưng của tiếng nói [29] • Âm tiết: Một từ có thể được ghép bởi một hoặc nhiều âm tiết. Các âm tiết lại được tạo ra bởi một hoặc nhiều nguyên âm ghép với nhau và có thể có hoặc không có phụ âm đi kèm.

Theo wikipedia, trong ngữ âm học, nguyên âm hay mẫu âm là một âm thanh trong ngôn ngữ nói, như trong tiếng Việt /a/ hay /e/, được phát âm với thanh quản mở, do đó không có sự tích lũy áp suất không khí trên bất cứ điểm nào ở thanh môn. Đối lập với nguyên âm, phụ âm là âm thanh của lời nói, được phát âm rõ ràng với sự đóng hoàn toàn hay một phần của thanh quản. • Âm vị là phân đoạn nhỏ nhất của âm thanh dùng để cấu tạo nên sự phân biệt giữa các cách phát âm. Do đó, âm vị là một nhóm các âm thanh với sự khác biệt tương đối nhỏ cùng đảm nhận một chức năng ý nghĩa tùy theo người nói và phương ngữ.

• Âm tiết, còn gọi là chữ, tiếng, là một đơn vị cấu tạo nên một sự phối hợp trong tiếng nói.2 Thiết bị thu nhận âm thanh 2.1 Tổng quan về bộ thu âm thanh - Microphone • Bộ thu âm thanh - microphone là thiết bị hỗ trợ quá trình thu nhận âm thanh (sóng âm) và chuyển tín hiệu âm thanh tương tự đó thành tín hiệu điện mà thiết bị điện tử có thể xử lý được. Microphone được sử dụng trong nhiều ứng dụng như điện thoại, máy trợ thính, sản xuất phim, thu âm, phát thanh và truyền hình,. [38] • Microphone đầu tiên được cấp bằng sáng chế là của Alexander Graham Bell vào năm 1876. Microphone này gồm một sợi dây dẫn điện một chiều.

Tín hiệu âm thanh được sinh ra và thu nhận bởi một bộ phát phần ứng chuyển động và bộ thu của nó và có thể truyền từ cả hai hướng. Thiết bị truyền thứ hai của ông là một máy phát chất lỏng và được trình diễn lần đầu tiên tại buổi triển lãm kỷ niệm 100 năm Philadelphia vào năm 1876. Microphone này sử dụng nguyên tắc tiếp điểm thay đổi để cung cấp một phương pháp điều chế tín hiệu điện hiệu quả hơn thiết kế trước đó của ông.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Nhận diện từ khóa trên vi điều khiển: Hướng dẫn chi tiết" cung cấp một cái nhìn sâu sắc về cách thức nhận diện từ khóa trong các hệ thống vi điều khiển, giúp người đọc hiểu rõ hơn về quy trình và các kỹ thuật liên quan. Bài viết không chỉ giải thích các khái niệm cơ bản mà còn hướng dẫn chi tiết từng bước thực hiện, từ việc thu thập dữ liệu đến việc áp dụng các thuật toán nhận diện. Điều này mang lại lợi ích lớn cho những ai đang tìm kiếm cách tối ưu hóa hệ thống của mình, đặc biệt trong lĩnh vực công nghệ thông tin và tự động hóa.

Để mở rộng kiến thức của bạn về các ứng dụng thực tiễn trong lĩnh vực này, bạn có thể tham khảo tài liệu "Luận văn thạc sĩ nhận dạng phương tiện giao thông sử dụng kỹ thuật học sâu", nơi bạn sẽ tìm thấy những nghiên cứu về nhận diện phương tiện giao thông. Ngoài ra, tài liệu "Luận văn tốt nghiệp khoa học máy tính phát triển hệ thống nhận diện cảm xúc qua giọng nói" cũng sẽ giúp bạn hiểu rõ hơn về cách nhận diện cảm xúc trong các ứng dụng giọng nói. Cuối cùng, tài liệu "Ứng dụng thuật toán cảnh báo ùn tắc giao thông và đề xuất đường đi thay thế" sẽ cung cấp thêm thông tin về việc áp dụng các thuật toán trong việc giải quyết vấn đề giao thông. Những tài liệu này sẽ giúp bạn có cái nhìn toàn diện hơn về các ứng dụng của nhận diện trong công nghệ hiện đại.