Chương 1: Tổng quan đề tài: Trình bày về sự cần thiết đề tài, vai trò của đề tài trong cuộc sống. Đồng thời nêu ra được các phương pháp tiếp cận và thực hiện đề tài theo từng bước. Chương 2: Giới thiệu về các kiến thức lý thuyết cơ bản về công nghệ Internet, giới thiệu kit Raspberry Pi 3 với hệ điều hành Rasbian. Nêu lên các đặc điểm, giao thức truyền nhận dữ liệu, lựa chọn thiết bị thu âm, đèn thông minh và các thư viện hỗ trợ thực hiện đề tài.
Chương 3: Lắp đặt hệ thống. Trình bày về hệ thống gương thông minh gồm sơ đồ khối, sơ đồ nguyên lý toàn hệ thống. Đưa ra lưu đồ giải thuật cho ứng dụng và chương trình vi xử lý. Chương 4: Kết quả so sánh, thực nghiệm, phân tích, tổng hợp.
Chương này đưa ra các kết quả kiểm ra thực tế vào nhiều thời điểm trong ngày hoặc hoạt động trong các môi trường khác nhau. Chương 5: Kết luận và hướng phát triển: Chương này sẽ đưa ra các kết quả đạt được sau khi thực hiện đồ án, các hướng phát triển và mở rộng của đồ án. 3 do an ĐỒ ÁN TỐT NGHIỆP Chương 2: CƠ SỞ LÝ THUYẾT LIÊN QUAN 2. Công nghệ nhận dạng giọng nói Giọng nói đang ngày càng trở nên "quyền lực" khi có thể điều khiển mọi thiết bị công nghệ hiện đại ngày nay.
Chúng đều có thể nhận diện giọng nói của bạn để thực hiện nhiều tính năng và hành động khác nhau. Nhận dạng tiếng nói là một quá trình nhận dạng mẫu, với mục đích là phân lớp (classify) thông tin đầu vào là tín hiệu tiếng nói thành một dãy tuần tự các mẫu đã được học trước đó và lưu trữ trong bộ nhớ. Các mẫu là các đơn vị nhận dạng, chúng có thể là các từ, hoặc các âm vị. Nếu các mẫu này là bất biến và không thay đổi thì công việc nhận dạng tiếng nói trở nên đơn giản bằng cách so sánh dữ liệu tiếng nói cần nhận dạng với các mẫu đã được học và lưu trữ trong bộ nhớ.
Khó khăn cơ bản của nhận dạng tiếng nói đó là tiếng nói luôn biến thiên theo thời gian và có sự khác biệt lớn giữa tiếng nói của những người nói khác nhau, tốc độ nói, ngữ cảnh và môi trường âm học khác nhau. Xác định những thông tin biến thiên nào của tiếng nói là có ích và những thông tin nào là không có ích đối với nhận dạng tiếng nói là rất quan trọng. Đây là một nhiệm vụ rất khó khăn mà ngay cả với các kỹ thuật xác suất thống kê mạnh cũng khó khăn trong việc tổng quát hoá từ các mẫu tiếng nói những biến thiên quan trọng cần thiết trong nhận dạng tiếng nói. Các nghiên cứu về nhận dạng tiếng nói dựa trên ba nguyên tắc cơ bản: Tín hiệu tiếng nói được biểu diễn chính xác bởi các giá trị phổ trong một khung thời gian ngắn (short-term amplitude spectrum).
Nhờ vậy ta có thể trích ra các đặc điểm tiếng nói từ những khoảng thời gian ngắn và dùng các đặc điểm này làm dữ liệu để nhận dạng tiếng nói. Nội dung của tiếng nói được biểu diễn dưới dạng chữ viết, là một dãy các ký hiệu ngữ âm. Do đó ý nghĩa của một phát âm được bảo toàn khi chúng ta phiên âm phát âm thành dãy các ký hiệu ngữ âm. 4 do an ĐỒ ÁN TỐT NGHIỆP Nhận dạng tiếng nói là một quá trình nhận thức.
Thông tin về ngữ nghĩa (semantics) và suy đoán (pragmatics) có giá trị trong quá trình nhận dạng tiếng nói, nhất là khi thông tin về âm học là không rõ ràng. Các công nghệ nhận dạng giọng nói: Đã có nhiều nghiên cứu về việc triển khai hoặc giới thiệu thành công những ứng dụng giọng nói. Chúng có thể nhắc đến Ask.com, một dịch vụ cho phép người dùng hỏi và nhận câu trả lời, đã tích hợp công nghệ nhận dạng giọng nói do Nuance phát triển vào ứng dụng iOS và Android của mình. Sự liên kết này cho phép người dùng hỏi, trả lời cũng như đăng tải các lời bình luận.
Amazon cũng cập nhật app Kindle trên iOS để hỗ trợ tính năng VoiceOver trong iOS. VoiceOver sẽ tự động đọc nội dung trên màn hình để giúp cho việc xem sách của những người bị khiếm thị được dễ dàng và thuận tiện hơn. Hãng cho biết có khoảng 1,8 triệu đầu sách e-book tương thích với tính năng này. Bản thân Amazon cũng từng mua lại công ty IVONA Software vốn cung cấp giải pháp chuyển đổi từ chữ sang giọng nói cho các sách mua từ Amazon.
Và rồi chúng ta có Siri, Google Voice hay Cortana. Đây đều là những ứng dụng được phát triển bởi các tập đoàn công nghệ lớn với tiềm lực mạnh mẽ và quy tụ nhiều nhân tài. Bộ ba phần mềm này đã giúp người dùng thiết bị di động tương tác với thiết bị của mình một cách thông minh hơn, từ việc đặt câu hỏi, nhận câu trả lời cho đến điều chỉnh các thông số máy và khởi chạy app. Một việc đơn giản có thể kể đến là đặt lịch hẹn hoặc báo thức.
Trước đây chúng ta phải mất cả chục thao tác chạm mới đặt xong một sự kiện, còn với Siri, Google Voice hay Cortana, bạn chỉ cần ra lệnh một cái là xong. Mọi thao tác, từ việc ghi nội dung cho đến thiết lập giờ giấc, đều được thực hiện một cách tự động. Thuật toán nhận diện giọng nói Quá trình nhận diện giọng nói được thực hiện qua 2 quá trình: Quá trình đăng ký người nói: Tiếng nói của người cần nhận diện được thu thập và sử dụng đểhuấn luyện mô hình. Tập các mô hình của nhiều người nói còn được gọi là cơ sở dữ liệu người nói.
5 do an ĐỒ ÁN TỐT NGHIỆP Quá trình định danh người nói: Dữ liệu tiếng nói của một người dùng không rõ định danh được đưa vào hệ thống và so khớp với các mô hình trong cơ sở dữ liệu người nói. Cả hai quá trình đều có chung hai bước đầu. Bước đầu tiên là thu thập tiếng nói.Tiếng nói có thể được thu thập thông qua micro và chuyển thành tín hiệu rời rạc – tín hiệu số .Tuy nhiên dữ liệu này thông thường sẽ bị nhiễu, do đó cần phải được tiền xử lý trước khi đưa vào pha bước thứ hai. Bước thứ hai đó là rút trích đặc trưng, nhằm mục đích giảm kích thước dữ liệu nhưng vẫn đảm bảo đủ thông tin để phân biệt người nói.
Ở bước thứ ba của quá trình đăng ký, thông tin người nói sau khi đã được rút trích đặc trưng được mô hình hóa và lưu vào cơ sở dữ liệu. Ở bước thứ ba của quá trình định danh, dữ liệu rút trích được so khớp với các dữ liệu trong cơ sở dữ liệu. Phương pháp rút trích đặc trưng MFCC là đặc trưng thường được dùng để diễn tả âm thanh tiếng nói. Nó dựa trên quan sát đó là thông tin được mang bởi các thành phần có tần số thấp thường quan trọng hơn các âm thanh có tần số cao – do tiếng nói con người biến đổi chậm.
Các bước để rút trích đặc trưng này như sau: Hình 2 – 1: Các bước rút trích đặc trưng MFCC. Bước thứ nhất đó là windowing, chia tín hiệu âm thanh ban đầu thành các frame liên tiếp nhau. Mỗi frame này sẽ được đưa vào và rút trích đặc trưng MFCC tương ứng. 6 do an ĐỒ ÁN TỐT NGHIỆP Bước thứ hai đó là biến đổi fourier rời rạc.
Bước này nhằm chuyển đổi tín hiệu ban đầu thành tổ hợp của các đồ thị hình sin tương ứng với từng tần số khác nhau. Bước thứ ba là bước chuyển tín hiệu ở dạng tần số thu được ở bước hai sang một vùng tần số theo cảm nhận của tai người. Bước thứ tư là lấy log để tách tín hiệu tần số thấp và tần số cao thành 2 vùng khác nhau. Bước thứ năm thực hiện phép biến đổi fourier đảo, ta thu được đặc trưng MFCC.
Các thư viện giọng nói phổ biến Nuance có lẽ là cái tên được nhắc đến nhiều nhất trong việc cung cấp thư viện giọng nói cho app di động. Chính nhờ vào những thư viện như thế này mà lập trình viên không cần phải tự mình thiết kế hệ thống nhận dạng, phiên dịch cho app mà chỉ cần xài lại cái có sẵn, tiết kiệm được nhiều thời gian, công sức và tiện bạc. Nuance có hỗ trợ cho tiếng Việt trong ứng dụng Dragon Dictation do chính hãng này phát triển. OpenEars cũng là một thư viện khác nhưng nó thuộc dạng nguồn mở và hoạt động offline, hạn chế là chỉ hỗ trợ tiếng Anh và Tây Ban Nha.
Vài cái tên khác có thể kể đến như Ivona, iSpeech, Vocalkit and Acapela. Một cách khác mà nhiều phần mềm hiện cũng đang xài đó là tận dụng bộ nguồn nhận dạng có sẵn trên các hệ điều hành di động. Người dùng có thể kích hoạt tính năng này ở những chỗ cần nhập văn bản. Từ iOS 7 về trước thì tính năng này không hỗ trợ tiếng Việt, phải lên iOS 8 mới có.
Google thì bắt đầu hỗ trợ nhập liệu tiếng Việt cho Android khoảng một năm về trước. Ngoài ra, Apple, Google cũng có cung cấp các hàm API giúp app của lập trình viên biết nói chỉ với vài dòng mã nguồn. Giới thiệu về RASPBERY PI Hiện tại ở Việt Nam và trên thế giới có rất nhiều KIT điện tử được sử dụng phổ biến như: Raspberry Pi, Arduino, STM32F103, Mini 2440,. Trong đó, Raspberry 7 do an ĐỒ ÁN TỐT NGHIỆP Pi và Arduino là 2 KIT được sử dụng phổ biến nhất với giá thành vừa phải và có thể đáp ứng được yêu cầu đặt ra cho việc thực hiện điều khiển các thiết bị và truyền thông tin qua Internet.
Arduino thường áp dụng với hệ thống linh hoạt với các khả năng giao tiếp với hầu hết các thiết bị đồng thời cũng là hệ thống lý tưởng để học tập lần đầu và nhiều dự án nhỏ hơn. Raspberry Pi thích hợp cho những dự án lớn hơn với yêu cầu cần hiển thị hay cần kết nối mạng. Với các chức năng tương tự như một máy tính mini chạy hệ điều hành Linux, cùng với việc thực hiện được nhiều dự án lớn, Raspberry Pi sẽ là lựa chọn hợp lý cho nhóm nghiên cứu để thực hiện đề tài “THIẾT KẾ VÀ THI CÔNG MÔ HÌNH GƯƠNG THÔNG MINH (SMART MIRROR)”. Giới thiệu về bo mạch RASPBERRY PI 3 Raspberry Pi – Chiếc máy tính mini bắt đầu được sản xuất bởi Quỹ Raspberry Pi vào tháng 12/2011.
Chiếc máy tính này chỉ có kích cỡ bằng một chiếc thẻ tín dụng với đầy đủ các kết nối và tuỳ dung lượng RAM mà người mua lựa chọn.