Khóa Luận Tốt Nghiệp: Loa Thông Minh Nhận Dạng Giọng Nói và Điều Khiển Tự Động Hóa Trong Nhà

Khóa luận trình bày về loa thông minh nhận dạng và điều khiển bằng giọng nói, ứng dụng trong nhà, góp phần nâng cao trải nghiệm người dùng.

Chuyên ngành

Kỹ thuật máy tính

Người đăng

Ẩn danh

Thể loại

Khóa luận tốt nghiệp

2021

65
3
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: LÝ DO CHỌN ĐỀ TÀI

1.1. Mục đích và ý nghĩa của đề tài

1.2. Mục tiêu và nhiệm vụ

1.3. Phạm vi nghiên cứu

2. CHƯƠNG 2: NHỮNG NGHIÊN CỨU LIÊN QUAN

2.1. Những vấn đề tồn đọng

2.2. Những vấn đề cần nghiên cứu giải quyết

3. CHƯƠNG 3: TỔNG QUAN VỀ XỬ LÝ TIẾNG NÓI

3.1. Tổng quan về xử lý tiếng nói

3.2. Các lĩnh vực xử lý tín hiệu tiếng nói

3.3. Một số hệ thống nhận dạng tiếng nói

3.4. Các đặc trưng của tiếng nói

3.5. Các giải thuật nhận dạng mang deep learning

3.6. Những hạn chế bài toán

4. CHƯƠNG 4: NGHIÊN CỨU ĐÁNH GIÁ THỰC NGHIỆM

4.1. Nghiên cứu thiết kế hệ thống

4.2. Xử lý loại bỏ nhiễu bằng giải thuật PNCC

4.3. Phân khung tín hiệu

4.4. Chuẩn hóa công suất trung bình

4.5. Thông số kĩ thuật

4.6. Chương trình thực tế

4.7. Kịch bản kiểm thử sản phẩm

4.8. Kết quả đạt được

4.9. Hướng phát triển

5. CHƯƠNG 5: TỔNG KẾT

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về Loa Thông Minh Nhận Dạng Giọng Nói

Loa thông minh nhận dạng giọng nói đang trở thành một phần không thể thiếu trong cuộc sống hiện đại. Công nghệ này cho phép người dùng điều khiển các thiết bị thông minh trong nhà chỉ bằng giọng nói. Với sự phát triển của công nghệ AI, loa thông minh không chỉ đơn thuần là thiết bị phát nhạc mà còn là trợ lý ảo giúp quản lý các thiết bị trong nhà. Việc tích hợp hệ thống âm thanh thông minh và khả năng nhận diện giọng nói đã mở ra nhiều cơ hội mới cho người dùng.

1.1. Khái niệm về Loa Thông Minh và Giọng Nói

Loa thông minh là thiết bị có khả năng nhận diện giọng nói và thực hiện các lệnh từ người dùng. Công nghệ này sử dụng các thuật toán phức tạp để phân tích và hiểu ngữ nghĩa của lời nói, từ đó thực hiện các tác vụ như bật/tắt đèn, điều chỉnh nhiệt độ, và nhiều hơn nữa.

1.2. Lịch sử phát triển của công nghệ nhận dạng giọng nói

Công nghệ nhận dạng giọng nói đã có lịch sử phát triển lâu dài, từ những năm 1950 với các hệ thống đơn giản cho đến nay với các ứng dụng phức tạp như Siri, Alexa và Google Assistant. Sự phát triển của deep learning đã giúp cải thiện độ chính xác và khả năng nhận diện giọng nói trong nhiều ngữ cảnh khác nhau.

II. Vấn đề và Thách thức trong Nhận Dạng Giọng Nói

Mặc dù công nghệ nhận dạng giọng nói đã đạt được nhiều tiến bộ, nhưng vẫn còn nhiều thách thức cần phải vượt qua. Các vấn đề như độ chính xác trong môi trường ồn ào, sự khác biệt trong giọng nói của từng người, và khả năng hiểu ngữ cảnh vẫn là những thách thức lớn. Việc phát triển một hệ thống có thể nhận diện giọng nói tiếng Việt một cách chính xác là một nhiệm vụ không hề đơn giản.

2.1. Những khó khăn trong việc nhận diện giọng nói

Các yếu tố như tiếng ồn xung quanh, tốc độ nói và ngữ điệu có thể ảnh hưởng đến khả năng nhận diện giọng nói. Hệ thống cần phải được huấn luyện để nhận diện được các biến thể này nhằm cải thiện độ chính xác.

2.2. Sự khác biệt trong giọng nói và ngữ cảnh

Mỗi người có một chất giọng riêng, điều này tạo ra sự khó khăn trong việc nhận diện chính xác. Hệ thống cần phải có khả năng thích ứng với các giọng nói khác nhau và hiểu được ngữ cảnh của câu nói để đưa ra phản hồi chính xác.

III. Phương pháp Giải quyết Vấn đề Nhận Dạng Giọng Nói

Để giải quyết các vấn đề trong nhận dạng giọng nói, nhiều phương pháp đã được nghiên cứu và áp dụng. Việc sử dụng các thuật toán học sâu như mạng nơ-ron nhân tạo (ANN) đã giúp cải thiện đáng kể độ chính xác của hệ thống. Ngoài ra, việc xử lý âm thanh và loại bỏ nhiễu cũng là những yếu tố quan trọng trong quá trình này.

3.1. Ứng dụng của mạng nơ ron trong nhận dạng giọng nói

Mạng nơ-ron nhân tạo (ANN) đã được chứng minh là có khả năng nhận diện giọng nói với độ chính xác cao. Các mô hình này có thể học từ dữ liệu lớn và cải thiện khả năng nhận diện theo thời gian.

3.2. Giải pháp xử lý âm thanh và loại bỏ nhiễu

Việc xử lý âm thanh trước khi đưa vào hệ thống nhận diện là rất quan trọng. Các thuật toán như PNCC (Power-Normalized Cepstral Coefficient) giúp loại bỏ nhiễu và cải thiện chất lượng âm thanh, từ đó nâng cao độ chính xác của nhận diện giọng nói.

IV. Ứng dụng Thực tiễn của Loa Thông Minh trong Nhà

Loa thông minh không chỉ là một thiết bị giải trí mà còn là một phần quan trọng trong hệ thống tự động hóa trong nhà. Người dùng có thể điều khiển các thiết bị như đèn, quạt, và điều hòa không khí chỉ bằng giọng nói. Điều này không chỉ mang lại sự tiện lợi mà còn giúp tiết kiệm năng lượng và nâng cao trải nghiệm sống.

4.1. Các thiết bị thông minh có thể điều khiển bằng giọng nói

Nhiều thiết bị trong nhà như đèn thông minh, máy lạnh, và TV có thể được điều khiển thông qua loa thông minh. Điều này giúp người dùng dễ dàng quản lý và điều chỉnh các thiết bị mà không cần phải di chuyển.

4.2. Lợi ích của việc sử dụng loa thông minh trong nhà

Việc sử dụng loa thông minh giúp tiết kiệm thời gian và công sức cho người dùng. Ngoài ra, nó còn tạo ra một môi trường sống tiện nghi và hiện đại, phù hợp với xu hướng công nghệ hiện đại.

V. Kết luận và Tương lai của Công nghệ Nhận Dạng Giọng Nói

Công nghệ nhận dạng giọng nói đang trên đà phát triển mạnh mẽ và hứa hẹn sẽ mang lại nhiều tiện ích cho cuộc sống hàng ngày. Với sự tiến bộ của công nghệ AI và các thuật toán học sâu, khả năng nhận diện giọng nói sẽ ngày càng chính xác hơn. Tương lai của loa thông minh và tự động hóa trong nhà sẽ mở ra nhiều cơ hội mới cho người dùng.

5.1. Xu hướng phát triển của công nghệ nhận dạng giọng nói

Công nghệ nhận dạng giọng nói sẽ tiếp tục phát triển với nhiều cải tiến về độ chính xác và khả năng hiểu ngữ cảnh. Các ứng dụng mới sẽ được phát triển để phục vụ nhu cầu ngày càng cao của người dùng.

5.2. Tầm quan trọng của nghiên cứu và phát triển trong lĩnh vực này

Nghiên cứu và phát triển trong lĩnh vực nhận dạng giọng nói là rất quan trọng để đáp ứng nhu cầu ngày càng tăng của thị trường. Việc cải thiện công nghệ này sẽ giúp nâng cao chất lượng cuộc sống và tạo ra nhiều cơ hội mới trong tương lai.

10/07/2025
Khóa luận tốt nghiệp kỹ thuật máy tính loa thông minh nhận dạng và điều khiển bằng giọng nói cho ứng dụng trong nhà

Trích đoạn nội dung tài liệu

Mở đầu: Chương đầu tiên của luận văn đưa ra lời giới thiệu sơ lược về đê tai, xác định mục tiêu, nhiệm vụ và phạm vi nghiên cứu của sản phâm Chương 2: Tống quan: Trình bày những nghiên cứu liên quan những vấn đề còn tồn đọng và đưa ra những van đề cần giải quyết đề thực hiện trong đề tài. Chương 3: Cơ sở lý thuyết: Trình bày những cơ sở lý thuyết những hạn chế của bài toán từ đó đưa ra thiết kế tổng quát và đi sâu vào thiết kế chi tiết cuối cùng là hoàn thành sản phẩm. Chương 4: Nghiên cứu đánh giá thực nghiệm: Hiện thực chương trình ngoải thực tế từ đó đưa ra những kịch bản kiểm thử sản phẩm và rút ra những kết qua đánh giá Chương 5: Tổng kết: Tổng hợp kết quả đạt được, đánh giá những thuận lợi khó khăn đưa ra hướng phát triển trong tương lai và kết luận Chuong1. Lý do chọn đề tài.

Trước đây, việc điều khiển một cỗ máy bằng cách nói chuyện với chúng chỉ là những câu chuyện trong khoa học viễn tưởng. Nhưng viễn tưởng này đang dần trở thành hiện thực với sự phát triển vượt bậc về công nghệ, đặc biệt là sự phát triển của Trí tuệ nhân tạo (AJ) và những nên tảng khác dé tạo ra một giao diện người dùng cho phép sử dụng giọng nói dé điều khiến các thiết bị công nghệ. Ngày nay nghệ này không còn là một khái niệm mới mẻ, tất cả những ông lớn ngành công nghệ đều đã đang lấn sân vào “cuộc chơi” này. Đó là trợ lý ảo Siri của Apple, Cortana của Microsoft, Alexa của Amazon, đến cả Samsung cũng chập chững cho thai nghen trợ ly Bixby của riêng mình hay không thé không ké đến Google Assistant cua Google.

Nhận dạng giọng nói đã được biết đến hang thập ky, tai sao chỉ đến bây giờ, công nghệ mới thực sự bùng nỗ? Theo wikipedia, khó khăn cơ bản của nhận dạng giọng nói đó là tiếng nói luôn biến thiên theo thời gian và có sự khác biệt lớn giữa tiếng nói của những người nói khác nhau, tốc độ nói, ngữ cảnh và môi trường âm học khác nhau. Sự ra đời của Deep Learning đã giúp nhận diện giọng nói chính xác, thậm chí ở ngoài môi trường phòng lab. Qua đó chúng ta có thé tương tác với các thiết bi công nghệ dé thực hiện các công việc hàng ngày trong lao động va sản xuất một cách hiệu quả hoàn toàn bằng giọng nói. Tiềm năng của công nghệ Nhận dạng giọng nói là rất lớn.

Nó sẽ là cộng nghệ hướng đến trong tương lai và được ứng dụng rộng rãi giúp con người đơn giản hóa cuộc sông của mình. Vì vậy, nhóm chúng em chon đề tại điều khiển các thiết bi bằng giọng nói trong môi trường trong nhà làm đề tài khóa luận. Với mong muốn sử dụng những kiến thức thầy cô giảng dạy trên môi trường đại học để tạo nên một sản phẩm có thê điều khiển các thiết bị thông minh bằng giọng nói với ngôn ngữ sử dụng là tiếng Việt và trong môi trường trong nhà. Mục đích và ý nghĩa của đề tài.

Mục đích - __ Nghiên cứu và đề xuất phương pháp xử lý âm thanh bằng giải thuật PNCC. - _ xây dựng và cài đặt hệ thống nhận dạng giọng nói dé điều khiến các thiết bị thông minh bằng tiếng Việt với các lệnh cho trước. Hệ thống có khả năng nhận dạng không phụ thuộc người nói. Y nghĩa khoa học thực tiễn.

- Góp phần nhỏ trong số các phương pháp xử lý tiếng nói cho tiếng Việt. - Có thé mở rộng bộ từ vựng dé xây dựng các ứng dụng giao tiếp với các thiết bi thông minh trong nhà có độ chính xác cao và thân thiện với người dùng trong tương lai. Mục tiêu và nhiệm vụ 1. Mục tiêu - Hiện thực hệ thong nhận dang giọng nói qua dé điều khiển các thiết bi thông minh bang tiếng Việt với các lệnh cho trước trên board respeaker V2 mic array.

- San phẩm sau khi hoàn thành có kha năng nhận dạng và điều khiến các thiết bị trong nhà bằng ngôn ngữ là tiếng Việt Các chức năng chính: - _ Nhận dang giọng nói tiếng Việt ứng dụng trong nhà thông minh. - C6 thé điều khiến các thiết bị thông minh băng tiếng Việt - _ Độ chính xác của nhận diện từ khóa Alo trên 90% - _ Nhận dang các lệnh dé điều khiển các thiết bị trong nhà có độ chính xác trên 80% Các lệnh điều khiển gồm: - Bat/tat đèn phòng ngủ - Bật/tắt đèn phòng khách - Bật/tắt đèn toilet - Bật/tắt đèn ban công - Bậttắt đèn nhà bếp - Bat/tat tivi phòng khách - Bat/tat tivi phòng ngủ - Bat/tat lò vi sóng - Bật/tắt quạt phòng ngủ - Bậtt/tắt quạt phòng khách - Mở/đóng cửa phòng khách - Mở/đóng cửa nhà vệ sinh - Mở/đóng cửa nhà bếp - Mở/đóng cửa phòng ngủ 1. Nhiệm vụ - Nghiên cứu lý thuyết và ứng dụng mô hình mạng neuron ANN và thuật toán xử lý âm thanh PNCC - Tìm hiểu bộ công cụ Respeaker V2 mic array cho nhận dạng tiếng nói. - Thu âm đữ liệu tiếng nói của nhiều người với các chất giọng khác nhau - Cài đặt chương trình huấn luyện ANN từ dữ liệu thu âm - Cài đặt chương trình nhận dạng tiếng nói dùng Respeaker V2 mic array.

- Đánh giá độ chính xác của chương trình nhận dạng. - Điều khiến các thiết bị thông minh trong nhà thông qua tín hiệu từ board qua quá trình nhận dạng giọng nói, 1. Phạm vi nghiên cứu - _ Ngôn ngữ sử dụng tiếng Việt - Tai một thời điểm cho phép một người điều khiến. - Môi trường sử dụng là trong nhà thông minh - Khoản cách giao tiếp với loa không quá 2m Chuong 2.

Những nghiên cứu liên quan Trên thế giới, công nghệ nhận dạng giọng nói hiện dang phát trién và bùng nỗ với tốc độ nhanh chóng. Với những sản phẩm đã có mặt tại thị trường như là trợ lý ao Siri của Apple, Cortana của Microsoft, Alexa cua Amazon, Samsung cũng chập chững cho thai nghen trợ ly Bixby của riêng minh hay không thé không kê đến Google Assistant của Google. Chúng đều có thé thé dé dàng tìm kiếm chỉ với giọng nói câu lệnh từ người dùng. Có thé chuyền đổi giọng nói thành văn bản ở một mức độ xử lý với tốc độ cao và chính xác.

Đồng thời có thé hiểu được câu nói của bạn và phản hoi lại với một kêt quả có thê nói là gân như hoàn hảo. Ở nước ta, nhận dạng tiếng nói vẫn là một lĩnh vực đang được đầu tư phát triển. Do còn tùy thuộc vào điều kiện nghiên cứu và sự phức tạp của ngữ âm tiếng Việt nên các nghiên cứu về hệ thống dạng giọng nói tiếng Việt vẫn còn nhiều hạn chế. Đến nay, nghiên cứu về nhận dạng tiếng Việt đã đạt một số kết quả nhất định và mang tính ứng dụng cao như: Ứng dụng iSago thực hiện giao tiếp bằng giọng nói tiếng Việt trên điện thoại iPhone và VIS (Viet Voice Systems) - tổng dai hỏi đáp thông tin tự động bằng tiếng Việt, sử dụng công nghệ nhận dạng và tông hợp giọng nói tiếng Việt với độ chính xác cao và tốc độ xử lý nhanh do Phòng thí nghiệm Trí tuệ Nhân tao (AILab) của Trường Dai học Khoa học Tự nhiên nghiên cứu, phát triên.

Mang điều khiển máy tính bằng giọng nói ở Việt Nam. Có thê nói, ViaVoice là một trong những phần mềm điều khiển máy tính bằng tiếng nói xuất hiện đầu tiên ở Việt Nam và cũng chỉ sử dụng được băng tiếng Anh. Với Vspeech: đây là một phần mềm điều khién máy tính bằng giọng nói do, Đại học Bách Khoa thành phố Hồ Minh nghiên cứu. Phần mềm sử dụng thư viện Microsoft Speech SDK dé nhận dạng tiếng Anh nhưng được chuyền thành tiếng Việt.

Hướng phát triển ứng dụng điều khiển máy tính bằng giọng nói tiếng Việt đang là tiềm năng và là xu thé của một số ứng dụng tại Việt Nam, đem đến nhiều tiện ích trong cuộc song. Những vấn dé tồn dong Do tính chât của tiêng nói phụ thuộc vào nhiêu yêu tô nên việc thu nhận, phân tích các đặc trưng của tiêng nói là việc không dé. O đây, chúng ta có thê nêu ra một số yêu tố khó khăn cho bài toán nhận dạng tiếng nói: e Khi phát âm, người nói thường nói nhanh, chậm khác nhau. e Các từ được nói thường dài ngắn khác nhau.

e Một người cùng nói một từ, nhưng ở hai lần phát âm khác nhau. Kết quả phân tích khác nhau. e Mỗi người có một chất giọng riêng được thể hiện thông qua độ cao, độ to, cường độ của âm và âm sắc. e Những yếu tô như nhiễu của môi trường, nhiễu của thiết bị thu.ảnh hưởng không nhỏ tới hiệu quả nhận dạng.

Có thể thấy nhận dạng tiếng nói là một lĩnh vực nghiên cứu có nhiều ứng dụng trong thực tế. Các hệ thông nhận dạng góp phan rat lớn trong việc thúc day phát triển nhiều ngành. Tuy là lĩnh vực mang ý nghĩa to lớn đó, nhưng việc phát triển các hệ thống nhận dạng cũng gặp không ít những khó khăn. Ngoài ra, các thiết bị hiện nay ngoài thị trường vẫn còn nhiều bat cập đối với người dùng và các vẫn đề thường gặp phải như hau hết các thiết bị đều hoạt động với ngôn ngữ là tiếng Anh, chưa thân thiện với người dùng Việt.

Những vấn đề cần nghiên cứu giải quyết Với những khó khăn của quá trình nhận diện giọng nói và những bất cập về sản phẩm thị trường cũng như ngôn ngữ sử dụng chúng em đã chọn những vấn đề đê nghiên cứu và thực hiện trong khóa luận như sau: - _ Xây dựng một hệ thống nhận dạng giọng nói dé điều khiến các thiết bi thông minh với ngôn ngữ tiếng Việt. - _ Xử lý âm thanh nhiễu trong quá trình sử dụng - Nang cao độ chính xác và tốc độ xử lý của sản phẩm - Môi trường thực hiện là trong nhà với khả năng ứng dụng cao với rất nhiều các thiết bị thông minh và các ứng dựng liên quan khác. - _ Liên kết điều khiến các thiết bi thông minh bằng wifi Chuong 3. Tống quan về xử lý tiếng nói Nhận dạng tiếng nói là làm cho máy hiểu, nhận biết được ngữ nghĩa của lời nói.

Đây là quá trình biến đổi tín hiệu âm thanh thu được qua micro, qua các thiết bị thu thanh khác. thành một chuỗi các từ, sau đó được nhận dạng dé sử dụng trong các ứng dụng điều khiến thiết bi, nhập dữ liệu hoặc soạn thảo văn bản bang lời. hoặc đưa đên một quá trình xử lý ngôn ngữ ở mức cao hơn. Tiếng nói là công cụ truyền đạt thông tin quan trọng của người.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ