Đặt vấn đề Người khiếm thính tạo nên một cộng đồng khá lớn với các nhu cầu cụ thể liên quan mà các nhà nghiên cứu và công nghệ chỉ mới bắt đầu nhắm đến khai thác gần đây. Việc tạo ra một công cụ có thể giao tiếp với người khiếm tính sẽ tạo điều kiện thuận lợi cho việc giao tiếp trao đổi thông tin, cũng như chia sẻ, giúp đỡ qua lại một cách dễ dàng giữa người bình thường với người khiếm thính, giúp lấp đầy khoảng cách giữa các cộng đồng người khiếm thính và người bình thường. Trong nghiên cứu này, Học viên tập trung thiết kế một hệ thống giá rẻ có thể chuyển đổi từ lời nói sang ngôn ngữ cử chỉ (hay còn được gọi là ngôn ngữ ký hiệu, thủ ngữ) ở Việt Nam với việc sử dụng các thuật toán hỗ trợ trên ngôn ngữ lập trình bậc cao Python để cho ra một mô hình đơn giản, dễ sử dụng và không yêu cầu thông số phần cứng cao, có thể áp dụng theo hướng phát triển của đề tài đã nêu. Hệ thống có thể hỗ trợ xử lý lời nói thu âm và xuất ra video thể hiện ngôn ngữ cử chỉ tương ứng hỗ trợ sử dụng ngôn ngữ Tiếng Việt với các video ngôn ngữ cử chỉ của Bộ Giáo dục và Đào tạo [1].
Tính cấp thiết của đề tài Cộng đồng người khiếm thính ngày càng gia tăng do một số nguyên nhân: dân số thế giới nói chung và Việt Nam nói riêng ngày càng gia tăng, các khu công nghiệp mở ra nhiều dẫn đến lượng hóa chất vào không khí và hóa chất sử dụng trong thức ăn gia tăng, môi trường làm việc độc hại hơn, do di truyền… dẫn đến số lượng người khuyết tật gia tăng, trong đó có người khiếm thính. Hiện tại có ít hoặc chưa có phần mềm miễn phí, ứng dụng, thiết bị chuyển đổi sẵn có để hỗ trợ cho việc giao tiếp với những người khiếm thính. Các nghiên cứu liên quan nhận dạng giọng nói như chuyển đổi giọng nói sang văn bản, chuyển đổi văn bản sang giọng nói, tự động dịch thuật…; ít hoặc không có nghiên cứu về đề tài chuyển đổi giọng nói sang ngôn ngữ cử chỉ (hay còn gọi là thủ ngữ) sử dụng cho người khiếm thính ở Việt Nam. Mục tiêu của đề tài - Nghiên cứu các công nghệ chuyển đổi từ giọng nói sang văn bản (speech to text).
- Nghiên cứu nguyên lý, vận hành của ngôn ngữ cử chỉ. - Nghiên cứu ứng dụng máy học và các giải thuật so sánh, tìm kiếm, thiết kế hệ thống nhận dạng giọng nói chuyển đổi sang ngôn ngữ cử chỉ. - Thiết kế một ứng dụng giá rẻ, gọn nhẹ có thể thực thi ổn định hệ thống chuyển đổi từ giọng nói sang ngôn ngữ cử chỉ trên board Raspberry Pi 4 với một màn hình hiển thị ngôn ngữ cử chỉ 7 inches. Ứng dụng này có thể giúp ích cho các nhân viên siêu thị, nhân viên bán hàng tạp hóa, nhân viên văn phòng trong việc hỗ trợ người khiếm thính mua hàng hoặc sử dụng các loại giấy tờ tùy thân cũng như các công việc liên quan khác trong cuộc sống 1.
Giới hạn của đề tài Cơ sở dữ liệu về ngôn ngữ giao tiếp tương đối ít, chủ yếu tập trung khai thác khoảng 200 câu thông dụng trong cuộc sống ở Việt Nam. 2 CHƯƠNG 2: TỔNG QUAN 2. Các nghiên cứu và ứng dụng liên quan 2. Các nghiên cứu và ứng dụng ngoài nước Trước đây, trên thế giới, để giao tiếp hoặc truyền đạt thông tin đến người câm điếc, người bình thường buộc phải học và hiểu thủ ngữ.
Tại Mỹ, có nhiều sách hướng dẫn sử dụng thủ ngữ. Đa phần những sách này hướng dẫn về sử dụng thủ ngữ thông qua các cử chỉ tay rời rạc mà không phải một câu hoàn chỉnh [2], [3]. Do đó, nhiều ứng dụng và phần mềm ra đời nhằm mục đích giúp cho người bình thường không cần học hay hiểu về thủ ngữ cũng vẫn có thể giúp cho người khiếm thính hiểu được ý họ là gì. Việc làm chứng minh nhân dân cho những người khiếm thính ở Tây Ban Nha được hỗ trợ bởi một hệ thống chuyển đổi từ giọng nói sang ngôn ngữ cử chỉ tiếng Tây Ban Nha.
Hệ thống gồm bộ nhận dạng giọng nói và bộ hiển thị những cử chỉ bằng hình ảnh 3D với 31,6% SER (Sign Error Rate, tỷ lệ lỗi kí hiệu cử chỉ) và 0,5780 BLEU (Bilingual Evaluation Understudy, tỷ lệ này càng lớn thì độ khớp giữa câu mẫu và câu được quy định sẵn càng cao) [4]. Một nhóm nghiên cứu khác là Radzi Ambar, Chan Kar Fai, Mohd Helmy Abd Wahab, Muhammad Mahadi Abdul Jamil và Ahmad Alabqari Ma’radzi thuộc các trường Đại học ở Malaysia đã nghiên cứu và phát triển một thiết bị đeo tay với chức năng chuyển đổi ngôn ngữ cử chỉ sang giọng nói và văn bản. Thiết bị dựa trên thiết kế của một chiếc găng tay có thể đọc chuyển động của một cánh tay và 5 ngón tay. Thiết bị này bao gồm 5 cảm biến uốn để phát hiện sự uốn cong của ngón tay và gia tốc kế để phát hiện chuyển động của cánh tay.
Thiết bị có thể xác định bất kỳ cử chỉ cụ thể nào tương ứng với các từ và cụm từ trong Ngôn ngữ ký hiệu của Mỹ (ASL) và dịch nó thành lời nói qua loa và văn bản được hiển thị trên màn hình LCD [5]. Tại hội nghị máy tính và truyền thông quốc tế (ICCCE'06) của IEEE tại Kuala Lumpur, Malaysia năm 2006, các nhà nghiên cứu giới thiệu một hệ thống SSLIS (Speech to Sign Language Interpreter System). Hệ thống này trình bày về việc dịch 3 bài phát biểu bằng tiếng Anh thành video ngôn ngữ ký hiệu của Mỹ (ASL) ở chế độ trực tiếp. Trong hệ thống này, Sphinx 3.5 được sử dụng cho việc nhận dạng lời nói và dịch thuật.
CMU Sphinx, còn được gọi ngắn gọn là Sphinx, là thuật ngữ chung để mô tả một nhóm các hệ thống nhận dạng giọng nói được phát triển tại Đại học Carnegie Mellon. Chúng bao gồm một loạt các máy nhận dạng giọng nói (Sphinx 2 - 4) và một mô hình huấn luyện âm thanh (SphinxTrain) [6]. Một hệ thống khác là Voice to Sign Language Translation System (V2S) được Oi Mean Foong, Tang Jung Low, và Wai Wan La thuộc trường Đại học Công nghệ PETRONAS ở Malaysia nghiên cứu và phát triển với chức năng phiên dịch từ giọng nói sang ngôn ngữ cử chỉ và ngược lại cho người khiếm thính ở Malaysia. Hệ thống này sử dụng hai kỹ thuật đó là kỹ thuật nhận dạng lời nói và kỹ thuật xử lý ảnh, với kỹ thuật nhận dạng template-based làm phương pháp chính.
Hệ thống V2S trước tiên cần được huấn luyện với các giọng nói mẫu dựa trên một số tập tham số về phổ. Các tham số này sau đó sẽ được lưu trữ dưới dạng template trong cơ sở dữ liệu. Hệ thống sẽ thực hiện quy trình nhận dạng thông qua việc so khớp bộ tham số của lời nói ngõ vào với các template được lưu trữ, sau đó hiển thị ngôn ngữ ký hiệu ở định dạng video. Kết quả thực nghiệm cho thấy hệ thống có tỷ lệ nhận dạng là 80,3% [7].
Hệ thống giúp chuyển đổi từ tiếng Tây Ban Nha sang thủ ngữ giúp cho người câm điếc trong việc nộp hoặc làm mới các tài liệu định danh và hộ chiếu được nghiên cứu trong [8]. Hệ thống này giúp cho các cán bộ có thể giải thích cho người khiếm thính thông qua thủ ngữ. Cấu trúc hệ thống này gồm một bộ nhận dạng giọng nói (chuyển đổi câu nói thành một chuỗi từ), một bộ dịch ngôn ngữ tự nhiên (chuyển các chuỗi từ thành một chuỗi các cử chỉ trong thủ ngữ) và một mô đun 3D hiển thị cử chỉ. Qua các thí nghiệm thì có được các tỷ lệ GER 27,2% (tỷ lệ lỗi cử chỉ) và giá trị BLEU đạt 0,62.
Hệ thống so sánh giữa việc ngõ vào là dạng văn bản và dạng lời nói thì có tỷ lệ sai như sau: 4 Bảng 2.1: Tỷ lệ các lỗi so sánh giữa ngõ vào là văn bản và ngõ vào là lời nói của hệ thống BLEU GER INS DEL SUB TEXT 0,79 16,8 4,2 10,2 2,4 SPEECH 0,62 27,2 6,5 17,8 2,9 Các tỉ lệ sai số trên có tỉ lệ chênh lệch cao ở hai mục là tỷ lệ GER và DEL là do hệ thống nhận dạng giọng nói chưa được tốt dẫn, đến các từ xuất hiện trong câu nói không có trong tập câu đã quy định. Do đó các cử chỉ ở ngõ ra của hệ thống sẽ không được thể hiện. Một hệ thống khác được nghiên cứu ở [9] cũng cho việc chuyển đổi giọng nói sang thủ ngữ ở Tây Ban Nha trong việc hướng dẫn người khiếm thính sử dụng passport và những thông tin liên quan. Kết quả của thử nghiệm trong bài báo này với tỷ lệ SER là 32,0% thấp hơn so với [8] và BLEU là 0,71 tốt hơn so với [8].
Các nghiên cứu và ứng dụng trong nước Hiện tại, do chưa có ứng dụng liên quan nào được nghiên cứu và phát triển trong việc chuyển lời nói hay văn bản sang thủ ngữ tiếng Việt một cách trực tiếp ở Việt Nam, nên khi muốn giao tiếp với người câm điếc buộc người nói phải hiểu và biết cách sử dụng thủ ngữ. Đối với người không hiểu về thủ ngữ, đa phần phải sử dụng các ứng dụng chuyển đổi như đã nêu trên của nước ngoài với điều kiện phải biết ngôn ngữ mà ứng dụng đó hỗ trợ, như tiếng Anh. Mặc dù có sự tương đồng về thủ ngữ giữa các nước, nhưng việc lạm dụng sử dụng ứng dụng của nước khác nhau sẽ không tránh khỏi những nhầm lẫn hoặc thiếu sót không đáng có. Một cách khác không thường xuyên khác để người bình thường truyền tải thông tin tới người khiếm thính là người bình thường phải sử dụng từ điển thủ ngữ tiếng Việt.
Nhược điểm của từ điển này là chỉ biểu thị được từng từ một. 5 CHƯƠNG 3: CƠ SỞ LÝ THUYẾT 3. Tổng quan về kỹ thuật nhận dạng giọng nói tự động Mục tiêu của nhận dạng giọng nói tự động là tạo ra chuỗi từ chính xác hoặc bảng phiên âm dựa vào một dạng sóng giọng nói đã cho. Có rất nhiều hình thức để biểu đạt thông tin và cảm xúc của một cá nhân, trong đó tiếng nói là một hình thức dễ dàng nhất giúp con người có thể truyền tải đầy đủ thông tin và cả cảm xúc của bản thân.
Do đó, kỹ thuật nhận diện giọng nói tự động (Automatic Speech Recognition – ASR) ra đời để phục cho các mục đích liên quan [10], [11]. Kể từ khi máy móc có thể mô phỏng hành vi của con người, ASR là một trong những tác vụ quan trọng nhất với sự trợ giúp của máy tính.