chương 1, đồ án sẽ trình bày tổng quan về bài toán nhận dạng giọng nói trong đó có ba nhiệm vụ con là nhận dạng người nói, phát hiện giọng nói giả mạo và xác định hiệu lệnh, giới thiệu các phương pháp được sử dụng rộng rãi cho ba nhiệm vụ con này và mục tiêu của đồ án qua các phần: ¢ Bài toán nhận dạng giọng nói s Các phương pháp nhận dạng giọng nói hiện nay ¢ Mục tiêu do án Sinh viên: Đào Hoàng Mai - B17DCCN4II - Lớp DI7HTTT2 3 CHUONG 1. TONG QUAN VE CAC TAC VU CHO BAI TOAN NHAN DANG GIONG NOI 1.1 Bài toán nhận dang giọng nói Nhận dạng giọng nói là một lĩnh vực phụ liên ngành của khoa học máy tính và ngôn ngữ học tính toán phát triển các phương pháp và công nghệ cho phép một máy tính hoặc chương trình có thể xử lý, hiểu và thực hiện các tác vụ được yêu cầu bằng giọng nói. Hệ thống nhận dạng giọng nói cho phép người sử dụng tương tác với công nghệ bằng ngôn ngữ tự nhiên. Chỉ bằng việc nói chuyện đơn giản, người sử dụng có thể yêu cầu các hệ thống này thực hiện các tác vụ cụ thể, kích hoạt các yêu cầu, lời nhắc và các tác vụ đơn giản khác mà không cần sử dụng đến tay.
OPEN A BROWSER TURN OFF ALARM TURN ON MUSIC Hình 1.1: Một số ứng dung của nhận dạng giọng nói. (Nguồn: Internet) Việc sử dụng nhận dạng giọng nói đã phát triển nhanh chóng cùng với sự phát triển của trí tuệ nhân tạo, học máy và sự chấp nhận của người tiêu dùng. Hiện nay, các hệ thống nhận dạng giọng nói ngày càng trở nên nổi tiếng và được sử dụng phổ biến, ví dụ như các trợ lý ảo thông minh Alexa của Amazon, Siri của Apple, và Cortana của Microsoft. Cách người tiêu dùng sử dụng công nghệ nhận dạng giọng nói khác nhau tùy thuộc vào sản phẩm, nhưng nó có thể bao gồm chuyển giọng nói thành văn bản, thiết lập lời nhắc, tìm kiếm trên internet và trả lời các câu hỏi và yêu cầu đơn giản, chang hạn như phát nhạc hoặc chia sẻ thông tin thời tiết hoặc giao thông.
Các cơ quan chính phủ, cơ quan an ninh quốc gia cũng đang phát triển các công nghệ nhận dạng giọng nói cho các mục đích bảo mật hệ thống bằng việc sử dụng giọng nói như một đặc điểm sinh trắc học để nhận dạng. Các ứng dụng nhận dạng Sinh viên: Đào Hoàng Mai - B17DCCN4II - Lớp DI7HTTT2 4 CHUONG 1. TONG QUAN VỀ CÁC TÁC VỤ CHO BÀI TOÁN NHẬN DẠNG GIỌNG NÓI giọng nói bao gồm giao diện người dùng bằng giọng nói, chẳng hạn như gọi điện bằng giọng nói (vi dụ: “gọi điện về nhà”), định tuyến cuộc gọi, điều khiển thiết bị, tim kiếm các từ khóa (ví dụ: tìm một podcast trong đó các từ cụ thể đã nói), nhập dữ liệu đơn giản (ví dụ: nhập số thẻ tín dụng), chuẩn bị tài liệu có cấu trúc (ví dụ: báo cáo X-quang), xác định đặc điểm của người nói, xử lý lời nói thành văn bản (ví dụ: bộ xử lý văn bản hoặc email), v. Nhận dạng giọng nói là một lĩnh vực tương đối rộng lớn, bao gồm nhiều bài toán nhỏ, ví dụ như nhận dạng người nói, nhận dạng khẩu lệnh, yêu cầu, phát hiện bất thường trong giọng nói (ví dụ như giọng nói giả mạo), chuyển đổi giọng nói sang chữ viết.
Tất cả nhiệm vụ con này đều có một điểm chung là máy tính nhận đầu vào là tín hiệu âm thanh, sau đó xử lý trích xuất các đặc trưng và thuộc tính quan trọng, cuối lựa chọn một bộ giải mã thích hợp để lấy được đầu ra phù hợp với tác vụ đang xử lý. Đồ án sẽ tập trung vào mô hình nhận dạng giọng nói đa tác vụ, giải quyết ba nhiệm vụ nhỏ đó là phát hiện giọng nói bị làm giả (giọng nói giả mạo), định danh giọng nói (hay người nói) và nhận diện khẩu lệnh trong giọng nói.1 Định danh người nói Định danh người nói là một phương pháp sử dụng giọng nói như một thẻ định danh để xác thực định danh của người dùng từ đó xác thực quyển truy cập vào hệ thống của người dùng đó. Vì giọng nói của con người có những đặc điểm độc đáo và duy nhất nên có tiểm năng sử dụng cho các tác vụ định danh sử dụng đặc điểm sinh trắc học. Định danh giọng nói có thể được phân loại thành hai loại: phụ thuộc vào văn bản và độc lập với văn bản.
Loại đầu tiên sử dụng một đoạn văn bản được xác định trước làm mật khẩu, loại còn lại không yêu cầu một đoạn văn bản cố định để xác minh người dùng. Loại đầu tiên có thể gây bất tiện cho người dùng vì có thể quên mật khẩu, và cũng khiến hệ thống dễ bị tấn công từ các truy nhập giả mạo khi mật khẩu được đọc lên thành tiếng và chỉ có một mật khẩu duy nhất. Loại định danh độc lập với văn bản tuy có thể tăng cường tính bảo mật của hệ thống và dễ sử dụng với người dùng nhưng điều này cũng gây ra nhiều thách thức cho các hệ thống xác minh. Quá trình nhận dạng và xác minh có thể được chia thành hai bước: đăng ký và xác minh.
Các hệ thống xác minh thường khởi tạo với các mô hình nền, mỗi mô hình Sinh viên: Đào Hoàng Mai - B17DCCN4II - Lớp DI7HTTT2 5 CHUONG 1. TONG QUAN VỀ CÁC TÁC VỤ CHO BÀI TOÁN NHẬN DẠNG GIỌNG NÓI được đào tạo với một người dùng đã đăng ký riêng. Trong bước đăng ký, với dữ liệu giọng nói đã đăng ký với hệ thống, hệ thống sẽ xây dựng các mô hình phân loại để xác định đối tượng, chủ thể của giọng nói. Tiếp theo, trong bước xác minh, hệ thống sẽ xác minh xem giọng nói đầu vào có tương ứng với danh tính được yêu cầu hay không bằng cách so sánh nó với các mô hình giọng nói đã được đăng ký trước đó.
Xác minh người nói có một loạt các ứng dụng thực tế như bảo mật ngân hàng, tương tác giữa con người và máy tính và xác minh môi trường xung quanh. Các cơ chế xác minh cổ điển có thể là thách thức đối với người dùng khuyết tật hoặc có thể dễ dàng bị kẻ gian phá vỡ. Chang hạn, sẽ không thích hợp nếu một hệ thống yêu cầu người khiếm thị nhập mật khẩu bằng bàn phím hoặc màn hình cảm ứng. Hoặc ví dụ, để điều khiển nhà thông minh, con người được yêu cầu nhập mật mã với mỗi khẩu lệnh đặt ra khiến cho việc tương tác giữa người dùng và hệ thống trở nên phức tạp và phiền phức.
Điều này dẫn đến sự tương tác giữa các công nghệ và con người cần phải tự nhiên nhất có thể. Trong những trường hợp này, các đặc điểm như giọng nói hoặc cử chỉ của con người sẽ là cách thích hợp để tương tác với môi trường xung quanh như nhà thông minh hoặc bếp thông minh. Như vậy, hệ thống xác thực sử dụng đặc điểm sinh trắc học như giọng nói của con người sẽ là một phương pháp thay thế đầy hứa hẹn.2 Phat hiện giọng nói gia mạo Định danh bằng giọng nói đem đến cho con người sự tiện lợi và những trải nghiệm vượt trội so với các tác vụ định danh truyền thống. Tuy nhiên, nhiệm vụ này cũng đem đến một thách thức về mặt bảo mật đó là giọng nói giả mạo.
Trước khi công nghệ trí tuệ nhân tạo bùng nổ, các giọng nói giả mạo thường được tạo ra bằng một cách thủ công như thu âm lại từ nguồn thứ phát, sử dụng nhiễu tín hiệu, v.v để truy cập trái phép vào hệ thống. Ngày nay, các mối đe dọa về giả mạo giọng nói còn có tiềm năng lớn hơn rất nhiều với công nghệ học sâu và các mô hình DeepFake có thể mô phỏng lại giống đến 90% giọng nói của một người bất kỳ chỉ với 5s dữ liệu đầu vào. Điều này đồng nghĩa với việc, các hệ thống xác minh giọng nói cần phải được tăng cường khả năng bảo mật, đặc biệt là với giọng nói giả mạo để có thể đối phó với những truy cập trái phép. Tác vụ phát hiện giọng nói giả mạo sẽ giúp các hệ thống xác minh học được các đặc trưng của giọng nói thực và giọng nói Sinh viên: Đào Hoàng Mai - B17DCCN4II - Lớp DI7HTTT2 6 CHUONG 1.
TONG QUAN VỀ CÁC TÁC VỤ CHO BÀI TOÁN NHẬN DẠNG GIỌNG NÓI tổng hợp trực tiếp từ trí tuệ nhân tạo, từ đó đưa ra các quyết định một cách chính xác hơn. Cụ thể, mô hình nhận dữ liệu đầu vào là tín hiệu âm thanh của một câu nói, và xác định xem câu nói đó được nói bởi người thật hay được tổng hợp bởi một cỗ máy bằng cách gán cho tín hiệu âm thanh nhãn True hoặc False.3 Nhận diện khẩu lệnh trong giọng nói Lưu ý rằng tác vụ nhận diện khẩu lệnh (command detection) là khác so với tác vụ phân loại khẩu lệnh (command classification) hay dò tim từ khóa (keyword spotting). Với bài toán này, mô hình sẽ nhận đầu vào là câu nói của người dùng, và phát hiện ra trong câu nói đó có chứa câu khẩu lệnh hay không tương tự như một bài toán phân loại nhị phân. Nhiệm vụ này là một trong những nhiệm vụ cơ bản và đầu tiên của các hệ thống hội thoại định hướng nhiệm vụ.
Các hệ thống hội thoại này đầu tiên cần xác định câu nói thu được từ người dùng có chứa câu khẩu lệnh hay không và từ đó đưa ra quyết định có tiếp tục xử lý câu nói đó cho các tác vụ hạ nguồn. Điều này sẽ giúp hệ thống giảm được lượng lớn tính toán không cần thiết thay vì phải xử lý tất cả các câu nói của người dùng. Thêm vào đó, các hệ thống trợ lý ảo hiện nay như Siri của Apple cần có một lời gọi để kích hoạt (ví dụ “Hi Siri’), điều này sẽ gây ra bất tiện cho người dùng và tăng thời gian chờ đợi phản hồi của người dùng khi phải đợi hệ thống được kích hoạt và tiếp tục giao nhiệm vụ. Với tác vụ này, các hệ thống có thể lắng nghe các câu khẩu lệnh một cách bị động và tự động xử lý các tác vụ được giao mà không cần có lời gọi để kích hoạt trước.
Trải nghiệm của người dùng có thể được tăng lên đáng kể nhờ nhiệm vụ phát hiện câu khẩu lệnh.2 Các phương pháp tiếp cận đương dai 1.1 Các bộ dư liệu cho nhận dạng giọng nói ASVspoof 2019 va ASVspoof 2021 là hai bộ dữ liệu tiếng Anh phổ biến nhất trong việc chống giả mạo để tự động xác minh người nói.