Chương 1: Tổng quan Chương này cung cấp ngắn gọn và tổng quát về các yêu cầu của báo cáo bao gồm giới thiệu, mục tiêu, phạm vi và nội dung của luận văn. Chương 2: Cơ sở lý thuyết Chương này trình bày những cơ sở bao gồm các khảo sát về các nghiên cứu đã được thực hiện, lý thuyết về các thuật toán và nguyên lý hoạt động của các module được sử dụng để thực hiện đề tài. Chương 3: Thiết kế hệ thống Chương này trình bày chi tiết các thiết kế cho toàn bộ hệ thống bao gồm: phần cứng, phần mềm và các thuật toán. Chương 4: Thi công và thực nghiệm Chương này trình bày về những thực nghiệm bao gồm thi công phần cứng, mô tả về các quá trình thu thập dữ liệu và huấn luyện các mô hình mạng.
3 Chương 5: Kết quả thực hiện, nhận xét và đánh giá Chương này đưa ra các kết quả thực hiện, các biểu đồ phần tích hiệu năng của hai mô hình nhận diện và đưa ra nhận xét chung về toàn hệ thống. Chương 6: Kết luận và hướng phát triển Chương này đưa ra kết luận đề tài và hướng phát triển tiếp theo. Các nghiên cứu đã thực hiện 2. Cánh tay robot Aslan Một nhóm nghiên cứu thuộc đại học Antwerp đã nghiên cứu phát triển thành công một thiết bị phiên dịch văn bản hoặc lời nói sang ngôn ngữ ký hiệu kí hiệu dựa trên nguyên mẫu phần cứng là một cánh tay robot [10].
Để sử dụng, người dùng cần kết nối với mạng cục bộ và gửi tin nhắn văn bản đến Aslan, và cánh tay sẽ thao tác các chữ cái trong hệ thống bảng chữ cái theo như nhóm thiết kế gọi đó là chính tả ngón tay, trong đó mỗi chữ cái riêng lẻ được thể hiện thông qua một cử chỉ riêng biệt. Mô hình cánh tay robot Aslan. Phần cứng của cánh tay robot đã được chế tạo và lắp ráp từ công nghệ in 3 như hình 2. Để điều khiển được cánh tay robot hoạt động, bên trong cánh tay robot đã sử dụng 16 động cơ servo, 3 bộ điều khiển động cơ, 1 board vi điều khiển Arduino Due, và một số các linh kiện khác.
Nhận diện ngôn ngữ kí hiệu dựa trên YoloV5 Trong bài báo được công bố vào năm 2021 [11], Tasnim Ferdous Dima và đồng nghiệp đã cho công bố một hệ thống có thể nhận diện 36 chữ cái và chữ số trong ngôn ngữ kí hiệu Mỹ. Để cải thiện được tốc độ nhận diện nhưng không ảnh hưởng đến độ chính xác, nhóm tác giả đã đề xuất cách tiếp cận mới đó là mạng YoloV5. Tập dữ liệu Benchmark (MU_HandImages ASL) đã được dùng trong suốt quá trình huấn luyện và đánh giá. Kết quả mà hệ thống thu được là khả năng nhận diện thời gian thực với độ chính xác trung bình khá ấn tượng bao gồm: 95% Precision, 97% Recall, 98% mAP@0.
Nhận diện ngôn ngữ kí hiệu sử dụng MediaPipe và Long Short-Term Memory Với một cách tiếp cận mới hơn, đối tượng hướng đến là các cử chỉ động trong ngôn ngữ kí hiệu Mỹ. Trong bài báo [12], Souradeep Ghosh đã sử dụng MediaPipe 5 Hand framework để trích xuất tọa độ 42 keypoints từ các đốt ngón tay của hai bàn tay. Sau đó, các tọa độ này được đưa vào mô hình LSTM phục vụ cho việc huấn luyện, một mô hình cực kì phù hợp với các bài toán làm với dữ liệu dạng chuỗi. Mô hình của tác giả tạo ra có thể nhận diện trong thời gian thực với 5 từ bao gồm: “wait, think, tiger, teacher, twins”.
Ngôn ngữ kí hiệu Việt Nam Ngôn ngữ ký hiệu của mỗi quốc gia hay mỗi khu vực sẽ khác nhau. Nó không được sáng tạo ra bởi duy nhất một ai cả mà dần hình thành dựa trên phong tục, văn hóa, lịch sử của từng cộng đồng người câm – điếc. Qua thời gian, ngôn ngữ ký hiệu càng phát triển và dần có những điểm chung giữa các cộng đồng. Tuy nhiên họ vẫn giữ cho mình những nét đặc trưng nhất định của từng khu vực.
Như ở Hồ Chí Minh, người ta dùng tay chỉ vào môi để nói về “màu hồng” trong khi người Hà Nội lại dùng tay xoa vào má. Bảng ký hiệu thủ ngữ cơ bản trong Tiếng Việt Dựa theo cách diễn đạt, có thể chia ngôn ngữ ký hiệu thành hai nhóm là đánh vần và nhóm giao tiếp. Nhóm giao tiếp thường được dùng trong các hoạt động hằng ngày như ngủ sẽ lấy hai tay chắp lại đưa lên má hoặc hát sẽ nắm tay lại đưa ra trước miệng và thường diễn đạt bằng cả hai tay kết hợp với cơ thể, biểu cảm của khuôn mặt để diễn đạt một từ, một cụm từ hoặc một câu ở những ngữ cảnh nhất định. Trong khi ở nhóm đánh vần, đối tượng sử dụng sẽ là những người bắt đầu học ngôn ngữ ký hiệu, các ký tự thủ ngữ trong nhóm này thường chỉ dùng một tay để diễn đạt.
Trong nhóm đánh vần sẽ bao gồm những ký tự về chữ cái, chữ số hay và các dấu thanh cơ bản (hình 2.2)và đây cũng là đối tượng chính mà đề tài nhóm hướng đến. Dựa vào luận án về nhận dạng ngôn ngữ ký hiệu Tiếng Việt [13], có thể chia các ký tự này thành hai loại là ký hiệu tĩnh và liên tục. Ký hiệu tĩnh chủ yếu được dùng để diễn tả cử chỉ tĩnh như chữ “A”, “S” hay các số “2”, “5”. Còn đối với loại ký tự liên tục cần 6 thực hiện một chuỗi các thao tác để diễn tả như dấu ngã (~), dấu huyền (`) hay các chữ cái “Ă”, “Ê”, “Ư”.
Deep Learning ra đời đã tạo một cuộc đua xây dựng các kiến trúc mô hình với hàng chục thậm chí hàng trăm lớp mạng được chồng lên nhau để giải quyết các bài toán cụ thể chẳng hạn như thị giác máy tính hay xử lí ngôn ngữ tự nhiên. Convolution Neural Networks (CNNs) là một mô hình mạng cơ bản và cực kì nổi tiếng trong lĩnh vực học sâu. CNNs ra đời giúp tiết kiệm thời gian cho việc trích xuất đặc trưng của các đối tượng trong một tấm ảnh so với các phương pháp thủ công trước đó. Mạng CNNs đưa chúng ta đến một cách tiếp cận mới hơn trong các bài toán nhận thức hình ảnh.
Cụ thể CNNs đã khai thác các nguyên lý từ đại số tuyến tính, đặc biệt là phép nhân ma trận để định danh các mẫu trong một tấm ảnh. Điều đó cũng đồng nghĩa là công nghệ này đỏi hỏi cao về mặt tính toán, đòi hỏi các đơn vị xử lí đồ họa (GPUs) mạnh mẽ để đào tạo các mô hình. Mạng nơ-ron với nhiều lớp Convolution [14] Nhìn chung các mô hình CNN đều tuân theo một kiến trúc mạng nhất định. Mỗi mô hình sẽ là một sự chuỗi các lớp mạng nối tiếp mà đầu ra của lớp trước chính là đầu vào của lớp sau.
Trong số đó có 3 ba lớp mạng chính được thể hiện ở hình 2.3, bao gồm lớp Convolution, lớp Pooling và lớp Fully connected. - Lớp Convolution: Sử dụng các bộ lọc dưới dạng các ma trận để nhân chập với ảnh đầu vào, sau đó cho qua các hàm kích hoạt để tạo ra các bản đồ đặc trưng (feature map) - Lớp Pooling: Pooling là một lớp nằm sau các lớp convolution layer, có tác dụng làm giảm kích thước của bản đồ đặc trưng, từ đó giúp giảm số lượng tính 7 toán cho các lớp phía sau. Nhờ sự tổ hợp của lớp Convolution lớp Pooling đi kèm đã giúp cho các đặc trưng càng về sau càng có tính khai quát cao - Lớp Fully connected (FC): Lớp này hoạt động tương tự như một mạng nơ-ron nhiều lớp của ANNs. FC giúp biến đối các đặc trưng ở giai đoạn cuối của mạng và đưa kết quả đến ngõ ra.
Phát hiện vật thể (Object Detection) 2. Giới thiệu Khi nhắc đến lĩnh vực thị giác máy tính, một trong những phương thức quan trọng tạo nên làn sóng giúp công nghệ trí tuệ nhân tạo phát triển đó là bài toán phát hiện vật thể. Khác với bài toán phân loại, phát hiện vật thể có khả năng thực hiện hai nhiệm vụ gần như đồng thời, đó là xác định vị trí của một hay nhiều đối tượng trong một ảnh và gán nhãn phân loại cho các đối tượng đó. Các ứng dụng của phát hiện vật thể xuất hiện nhiều trong các lĩnh vực khác nhau như an ninh, thống kê, người máy và vô số lĩnh vực khác.
Tuy nhiên với khả năng mà CNNs mang lại thì cách tiếp cận đó không thể giải quyết được được bài toán mà phát hiện vật thể đặt ra, vì bản chất CNNs chỉ là một mạng trích xuất đặt trưng ảnh và đầu ra là kết quả phân loại. Từ khoảng năm 2012 cho đến nay, hàng loạt các mạng chuyên sâu ra đời như một hướng tiếp cận mới cho vấn đề này. Đáng kể đến là các kiến trúc mạng RCN, fast R-CNN, faster R-CNN, đó là những kiến trúc mạng khai sinh ra thuật ngữ Region of Interest (RoI) hay còn được hiểu là kĩ thuật đề xuất các vùng có thể chứa đối tượng. Và sau này nhu cầu về triển khai với tốc độ đáp ứng thời gian thực trở thành một xu hướng từ đó dẫn đến sự xuất hiện các mạng nhận diện với tốc độ nhanh hơn như YOLO hay SSD.
Sự khác biệt cơ bản của các mạng này đó là có thể đưa ra dự đoán cho các “class” và vẽ “bounding box” chỉ với một lần chạy thuật toán. Mạng xương sống CSPDarknet Bắt đầu từ những năm 2000 đến nay, hàng loạt các cấu trúc mạng CNNs phức tạp làm cơ sở để trích xuất các đặc trưng ảnh theo chiều sâu đã được được đề xuất với tên gọi là mạng xương sống “backbone”. Mục tiêu của các mạng xương sống này là tăng tính khái quát và trừu tượng của mô hình để tính toán các đặc trưng của ảnh ngày một sâu hơn. Đồng thời tăng tính ứng dụng trong nhiều bài toán nhận thức hình ảnh khác nhau dựa trên khái niệm trường nhìn (Receptive Field) của từng nơ-ron.
CSPNet là một mô hình mạng sương sống với nguyên lý được mô tả ở hình 2.4 Mô hình bắt đầu bằng việc chia bản đồ đặc trưng đầu vào thành hai phần bằng nhau, một phần được giữ nguyên để đưa ghép nối ở các lớp sau, phần còn lại được đưa vào khối xử lý gốc thông thường để trích xuất các đặc trưng. Điểm mạnh của khối CSP 8 là giảm thiểu 50% khối lượng tính toán bằng cách chia feature map ra làm hai. Từ đó kết nối CSP vừa giúp bảo toàn một phần thông tin từ các lớp trước, vừa đảm độ phức tạp của mô hình mà còn giảm được số lượng tính toán. Input Feature Part 1 Part 2 Convolution layer Combination Concat Output Feature Hình 2.