Mở đầu: Chương đầu tiên của luận văn đưa ra lời giới thiệu sơ lược về đê tai, xác định mục tiêu, nhiệm vụ và phạm vi nghiên cứu của sản phâm Chương 2: Tống quan: Trình bày những nghiên cứu liên quan những vấn đề còn tồn đọng và đưa ra những van đề cần giải quyết đề thực hiện trong đề tài. Chương 3: Cơ sở lý thuyết: Trình bày những cơ sở lý thuyết những hạn chế của bài toán từ đó đưa ra thiết kế tổng quát và đi sâu vào thiết kế chi tiết cuối cùng là hoàn thành sản phẩm. Chương 4: Nghiên cứu đánh giá thực nghiệm: Hiện thực chương trình ngoải thực tế từ đó đưa ra những kịch bản kiểm thử sản phẩm và rút ra những kết qua đánh giá Chương 5: Tổng kết: Tổng hợp kết quả đạt được, đánh giá những thuận lợi khó khăn đưa ra hướng phát triển trong tương lai và kết luận Chuong1. Lý do chọn đề tài.
Trước đây, việc điều khiển một cỗ máy bằng cách nói chuyện với chúng chỉ là những câu chuyện trong khoa học viễn tưởng. Nhưng viễn tưởng này đang dần trở thành hiện thực với sự phát triển vượt bậc về công nghệ, đặc biệt là sự phát triển của Trí tuệ nhân tạo (AJ) và những nên tảng khác dé tạo ra một giao diện người dùng cho phép sử dụng giọng nói dé điều khiến các thiết bị công nghệ. Ngày nay nghệ này không còn là một khái niệm mới mẻ, tất cả những ông lớn ngành công nghệ đều đã đang lấn sân vào “cuộc chơi” này. Đó là trợ lý ảo Siri của Apple, Cortana của Microsoft, Alexa của Amazon, đến cả Samsung cũng chập chững cho thai nghen trợ ly Bixby của riêng mình hay không thé không ké đến Google Assistant cua Google.
Nhận dạng giọng nói đã được biết đến hang thập ky, tai sao chỉ đến bây giờ, công nghệ mới thực sự bùng nỗ? Theo wikipedia, khó khăn cơ bản của nhận dạng giọng nói đó là tiếng nói luôn biến thiên theo thời gian và có sự khác biệt lớn giữa tiếng nói của những người nói khác nhau, tốc độ nói, ngữ cảnh và môi trường âm học khác nhau. Sự ra đời của Deep Learning đã giúp nhận diện giọng nói chính xác, thậm chí ở ngoài môi trường phòng lab. Qua đó chúng ta có thé tương tác với các thiết bi công nghệ dé thực hiện các công việc hàng ngày trong lao động va sản xuất một cách hiệu quả hoàn toàn bằng giọng nói. Tiềm năng của công nghệ Nhận dạng giọng nói là rất lớn.
Nó sẽ là cộng nghệ hướng đến trong tương lai và được ứng dụng rộng rãi giúp con người đơn giản hóa cuộc sông của mình. Vì vậy, nhóm chúng em chon đề tại điều khiển các thiết bi bằng giọng nói trong môi trường trong nhà làm đề tài khóa luận. Với mong muốn sử dụng những kiến thức thầy cô giảng dạy trên môi trường đại học để tạo nên một sản phẩm có thê điều khiển các thiết bị thông minh bằng giọng nói với ngôn ngữ sử dụng là tiếng Việt và trong môi trường trong nhà. Mục đích và ý nghĩa của đề tài.
Mục đích - __ Nghiên cứu và đề xuất phương pháp xử lý âm thanh bằng giải thuật PNCC. - _ xây dựng và cài đặt hệ thống nhận dạng giọng nói dé điều khiến các thiết bị thông minh bằng tiếng Việt với các lệnh cho trước. Hệ thống có khả năng nhận dạng không phụ thuộc người nói. Y nghĩa khoa học thực tiễn.
- Góp phần nhỏ trong số các phương pháp xử lý tiếng nói cho tiếng Việt. - Có thé mở rộng bộ từ vựng dé xây dựng các ứng dụng giao tiếp với các thiết bi thông minh trong nhà có độ chính xác cao và thân thiện với người dùng trong tương lai. Mục tiêu và nhiệm vụ 1. Mục tiêu - Hiện thực hệ thong nhận dang giọng nói qua dé điều khiển các thiết bi thông minh bang tiếng Việt với các lệnh cho trước trên board respeaker V2 mic array.
- San phẩm sau khi hoàn thành có kha năng nhận dạng và điều khiến các thiết bị trong nhà bằng ngôn ngữ là tiếng Việt Các chức năng chính: - _ Nhận dang giọng nói tiếng Việt ứng dụng trong nhà thông minh. - C6 thé điều khiến các thiết bị thông minh băng tiếng Việt - _ Độ chính xác của nhận diện từ khóa Alo trên 90% - _ Nhận dang các lệnh dé điều khiển các thiết bị trong nhà có độ chính xác trên 80% Các lệnh điều khiển gồm: - Bat/tat đèn phòng ngủ - Bật/tắt đèn phòng khách - Bật/tắt đèn toilet - Bật/tắt đèn ban công - Bậttắt đèn nhà bếp - Bat/tat tivi phòng khách - Bat/tat tivi phòng ngủ - Bat/tat lò vi sóng - Bật/tắt quạt phòng ngủ - Bậtt/tắt quạt phòng khách - Mở/đóng cửa phòng khách - Mở/đóng cửa nhà vệ sinh - Mở/đóng cửa nhà bếp - Mở/đóng cửa phòng ngủ 1. Nhiệm vụ - Nghiên cứu lý thuyết và ứng dụng mô hình mạng neuron ANN và thuật toán xử lý âm thanh PNCC - Tìm hiểu bộ công cụ Respeaker V2 mic array cho nhận dạng tiếng nói. - Thu âm đữ liệu tiếng nói của nhiều người với các chất giọng khác nhau - Cài đặt chương trình huấn luyện ANN từ dữ liệu thu âm - Cài đặt chương trình nhận dạng tiếng nói dùng Respeaker V2 mic array.
- Đánh giá độ chính xác của chương trình nhận dạng. - Điều khiến các thiết bị thông minh trong nhà thông qua tín hiệu từ board qua quá trình nhận dạng giọng nói, 1. Phạm vi nghiên cứu - _ Ngôn ngữ sử dụng tiếng Việt - Tai một thời điểm cho phép một người điều khiến. - Môi trường sử dụng là trong nhà thông minh - Khoản cách giao tiếp với loa không quá 2m Chuong 2.
Những nghiên cứu liên quan Trên thế giới, công nghệ nhận dạng giọng nói hiện dang phát trién và bùng nỗ với tốc độ nhanh chóng. Với những sản phẩm đã có mặt tại thị trường như là trợ lý ao Siri của Apple, Cortana của Microsoft, Alexa cua Amazon, Samsung cũng chập chững cho thai nghen trợ ly Bixby của riêng minh hay không thé không kê đến Google Assistant của Google. Chúng đều có thé thé dé dàng tìm kiếm chỉ với giọng nói câu lệnh từ người dùng. Có thé chuyền đổi giọng nói thành văn bản ở một mức độ xử lý với tốc độ cao và chính xác.
Đồng thời có thé hiểu được câu nói của bạn và phản hoi lại với một kêt quả có thê nói là gân như hoàn hảo. Ở nước ta, nhận dạng tiếng nói vẫn là một lĩnh vực đang được đầu tư phát triển. Do còn tùy thuộc vào điều kiện nghiên cứu và sự phức tạp của ngữ âm tiếng Việt nên các nghiên cứu về hệ thống dạng giọng nói tiếng Việt vẫn còn nhiều hạn chế. Đến nay, nghiên cứu về nhận dạng tiếng Việt đã đạt một số kết quả nhất định và mang tính ứng dụng cao như: Ứng dụng iSago thực hiện giao tiếp bằng giọng nói tiếng Việt trên điện thoại iPhone và VIS (Viet Voice Systems) - tổng dai hỏi đáp thông tin tự động bằng tiếng Việt, sử dụng công nghệ nhận dạng và tông hợp giọng nói tiếng Việt với độ chính xác cao và tốc độ xử lý nhanh do Phòng thí nghiệm Trí tuệ Nhân tao (AILab) của Trường Dai học Khoa học Tự nhiên nghiên cứu, phát triên.
Mang điều khiển máy tính bằng giọng nói ở Việt Nam. Có thê nói, ViaVoice là một trong những phần mềm điều khiển máy tính bằng tiếng nói xuất hiện đầu tiên ở Việt Nam và cũng chỉ sử dụng được băng tiếng Anh. Với Vspeech: đây là một phần mềm điều khién máy tính bằng giọng nói do, Đại học Bách Khoa thành phố Hồ Minh nghiên cứu. Phần mềm sử dụng thư viện Microsoft Speech SDK dé nhận dạng tiếng Anh nhưng được chuyền thành tiếng Việt.
Hướng phát triển ứng dụng điều khiển máy tính bằng giọng nói tiếng Việt đang là tiềm năng và là xu thé của một số ứng dụng tại Việt Nam, đem đến nhiều tiện ích trong cuộc song. Những vấn dé tồn dong Do tính chât của tiêng nói phụ thuộc vào nhiêu yêu tô nên việc thu nhận, phân tích các đặc trưng của tiêng nói là việc không dé. O đây, chúng ta có thê nêu ra một số yêu tố khó khăn cho bài toán nhận dạng tiếng nói: e Khi phát âm, người nói thường nói nhanh, chậm khác nhau. e Các từ được nói thường dài ngắn khác nhau.
e Một người cùng nói một từ, nhưng ở hai lần phát âm khác nhau. Kết quả phân tích khác nhau. e Mỗi người có một chất giọng riêng được thể hiện thông qua độ cao, độ to, cường độ của âm và âm sắc. e Những yếu tô như nhiễu của môi trường, nhiễu của thiết bị thu.ảnh hưởng không nhỏ tới hiệu quả nhận dạng.
Có thể thấy nhận dạng tiếng nói là một lĩnh vực nghiên cứu có nhiều ứng dụng trong thực tế. Các hệ thông nhận dạng góp phan rat lớn trong việc thúc day phát triển nhiều ngành. Tuy là lĩnh vực mang ý nghĩa to lớn đó, nhưng việc phát triển các hệ thống nhận dạng cũng gặp không ít những khó khăn. Ngoài ra, các thiết bị hiện nay ngoài thị trường vẫn còn nhiều bat cập đối với người dùng và các vẫn đề thường gặp phải như hau hết các thiết bị đều hoạt động với ngôn ngữ là tiếng Anh, chưa thân thiện với người dùng Việt.
Những vấn đề cần nghiên cứu giải quyết Với những khó khăn của quá trình nhận diện giọng nói và những bất cập về sản phẩm thị trường cũng như ngôn ngữ sử dụng chúng em đã chọn những vấn đề đê nghiên cứu và thực hiện trong khóa luận như sau: - _ Xây dựng một hệ thống nhận dạng giọng nói dé điều khiến các thiết bi thông minh với ngôn ngữ tiếng Việt. - _ Xử lý âm thanh nhiễu trong quá trình sử dụng - Nang cao độ chính xác và tốc độ xử lý của sản phẩm - Môi trường thực hiện là trong nhà với khả năng ứng dụng cao với rất nhiều các thiết bị thông minh và các ứng dựng liên quan khác. - _ Liên kết điều khiến các thiết bi thông minh bằng wifi Chuong 3. Tống quan về xử lý tiếng nói Nhận dạng tiếng nói là làm cho máy hiểu, nhận biết được ngữ nghĩa của lời nói.
Đây là quá trình biến đổi tín hiệu âm thanh thu được qua micro, qua các thiết bị thu thanh khác. thành một chuỗi các từ, sau đó được nhận dạng dé sử dụng trong các ứng dụng điều khiến thiết bi, nhập dữ liệu hoặc soạn thảo văn bản bang lời. hoặc đưa đên một quá trình xử lý ngôn ngữ ở mức cao hơn. Tiếng nói là công cụ truyền đạt thông tin quan trọng của người.