MỞ ĐẦU Hệ thống trả lời câu hỏi trực quan cần thiết cho nhiều tình huống thực tế như là hỗ trợ, dé xuất, trả lời câu hỏi cho khách hàng hay tìm kiếm hình ảnh. Ngoài ra, hỏi đáp trực quan còn có thê tích hợp vào các hệ thống chatbot. Các hệ thống hỏi đáp trực quan là công cụ rất hữu ích cho những người khiếm thị, nó có thể giúp họ nhận biết được cảnh vật hay tình huống xung quanh, làm giảm thiểu tai nạn không mong muốn. ls there anyone on the right? Hình 1.1: Minh họa công dụng của hỏi đáp trực quan.
Việc xây dựng mô hình đa ngôn ngữ sẽ làm giảm chỉ phí xây dựng, và nâng cấp so với xây dựng riêng từng mô hình cho từng loại ngôn ngữ. Gần đây, có nhiều bộ di liệu và mô hình hỏi dap trực quan được đưa ra nhưng hầu hết đều trên các loại ngôn ngữ phổ biến như tiếng Anh và tiếng Trung. Hiện tại chưa có bộ dữ liệu đa ngôn ngữ nào vừa chứa tiếng Việt và tiếng Nhật nên chúng tôi muốn xây dựng bộ dit liệu đa ngôn ngữ trên 3 thứ tiếng đó là tiếng Anh, tiếng Việt và tiếng Nhật dé đóng góp vào cộng đồng xử lý ngôn ngữ tự nhiên tại Việt Nam. Chúng tôi quyết định xây dựng bộ liệu hỏi đáp trực quan đa ngôn ngữ được xây dựng trên 3 ngôn ngữ là tiếng Việt, tiếng Nhật và tiếng Anh thông qua các bộ dữ liệu có sẵn là ViVQA [1], VQA [2].
So với chỉ sử dụng một ngữ thì việc áp dụng đa ngôn vào bài toán này sẽ tránh được trường hợp phải đào tạo một mô hình đơn ngữ cho mọi ngôn ngữ. Ngoài ra, mô hình đa ngôn ngữ có thê đạt được hiệu suất tốt hơn so với các mô hình đơn ngữ, đặc biệt là đối với các ngôn ngữ ít tài nguyên. Tuy nhiên, dé có thé cho ra một mô hình đa ngôn có kết quả khả quan, thì cần một bộ dữ liệu có độ chính xác nhất định cho từng ngôn ngữ. Một bộ dữ liệu đa ngôn ngữ sẽ cần nhiều nguồn lực dé xây dựng và kiểm tra dit liệu trên mỗi loại ngôn ngữ, điều đó dẫn đến việc xây dựng trở nên khó khăn và tốn kém hơn.
Vì vậy, chúng tôi quyết định chỉ thực hiện xây dựng bộ dữ liệu trên 3 ngôn ngữ. Và sau đó, nghiên cứu các mô hình, thuật toán phù hợp với bộ dữ liệu đã tạo. Chuong 2:TONG QUAN 2. Giới thiệu bài toán Visual question answering (VQA) hay hỏi đáp trực quan là bài toán nhằm mục đích tìm ra câu trả lời đúng cho một câu hỏi nhất định phù hợp với nội dung trực quan của một hình ảnh nhất định.
Mục tiêu đích của bài toán nảy là tạo ra các hệ thống có thé hiểu nội dung của một hình ảnh giống như cách mà con người làm và giao tiếp hiệu quả về hình ảnh đó bằng ngôn ngữ tự nhiên. Đây thực sự là một nhiệm vụ đầy thách thức vì nó đòi hỏi sự tương tác và bé sung của cả trình trích xuất tinh năng hình anh và trình xử lý ngôn ngữ tự nhiên. Question Answer EN what parked next to the sidewalk bus VI _ những gi đỗ bên cạnh via hè xe buýt JA #;¡ŠØ§*(-ƒJ2'§†#L 9H M Question Answer EN whatissitting on the toiletinsideof cat the bathroom VI cái gì đang ngồi trên nhà vệ sinh con mèo bên trong phòng tắm JA FA LORORALICIAA a BotTWata Question Answer EN how many sheep grazingin agrassy bus field near a wire fence? VI có bao nhiêu con cừu dang chan thả xe buýt trên đồng cỏ gần hàng rào dây thép JA. FAR HS a YAO Hình 2.1: Một số vi dụ về hỏi dap trực quan da ngôn ngữ 2.
Hướng tiếp cận Một trong các hướng tiếp cận tốt nhất hiện nay cho bài toán hỏi đáp trực quan đó là dựa trên cơ chế attention. Phương pháp này cô găng tìm hiểu sự tương tác giữa các đặc trưng trong ảnh và các đặc trưng trong câu hỏi thông qua một mô-đun gọi là attention. Sau đó, các tính năng chung có được từ mô-đun đó được tận dung dé trả lời câu hỏi tương ứng. Hướng tiếp cận này có 4 bước chính: Image: = CNN | (2 Visual | _Representation | | Joint Answer ` | Answer: KoitoboiictdiebcTlZ61g0gi600/3(4:3:3:470-3'08 Representation | __ prediction ! Baseball bat ' Question: h >J ~S” Va, ỐC ỐỒỘỐ ` ộo.°¬ | What is the girl holding '——> j {Textual á | + in her hand? | Representation sceeceudccccoecsccecoceue F— hi | Word/Sentence | embedding Hình 2.
2: Quy trình xử lý theo hướng tiếp cận attention e Visual Representation Các thuộc tính hoặc khía cạnh cơ bảnrõ ràng giúp chúng ta nhận ra một đối tượng, hình ảnh hoặc một cái gì đó cụ thé được gọi là các đặc trưng. Các đặc điểm phân biệt là các thuộc tính khác biệt. Khi thao tác trên tập dữ liệu VQA, chúng ta phải trích xuất các đặc điểm của các hình ảnh khác nhau dé tách các hình ảnh dựa trên các tinh năng hoặc khía cạnh cụ thé. Đặc điểm hình ảnh là một trong những phan thông tin quan trọng nhất dé hệ thống VQA đưa ra câu trả lời chính xác.
e Textual Representation Textual Representation có thé được cung cấp theo nhiều cách khác nhau. Các kỹ thuật dựa trên số lượng và tần số như count vectoization và TF-IDF là những vi dụ về các phương pháp tiếp cận cũ hơn. Ngoài ra còn có các cách tiếp cận dựa trên dự đoán như bag of words va skip grams, pre-trained Word2Vec. Embeddings cũng có thé được tao bằng cách sử dụng kiến trúc học sâu như RNN, LSTM, GRU và 1-D CNN.
LSTM là một trong những cách thường được sử dung trong tài liệu VỌA. Đối với nhúng câu hỏi trong VQA, Glove hoặc BERT được sử dụng rộng rãi dé nam bắt sự biểu diễn của các từ và câu trong các ngữ cảnh khác nhau. e Joint Representation Trong các hệ thống VQA hiện tại, thành phần phương thức chung đóng một vai trò thiết yếu vì nó có thể học các biêu diễn chung có ý nghĩa giữa đầu vào ngôn ngữ và hình ảnh bằng cách áp dụng cơ chế attention. e Visual Representation Gan day, cac dac diém chung nhận được từ co chế attention sau đó được chuyền qua bộ phân loại dé đưa ra câu trả lời dự đoán.
Tuy nhiên, nhiều mô-đun hơn cũng có thể được áp dụng đề tạo ra kiến thức bên ngoài và giải quyết các câu hỏi khó. Các công trình liên quan 2. UIT-ViVQA COCO-QA N Get questions-answers “an ¬ | ấy Translate Guidelines ˆ ' of Translated Dataset |—>| vự; 4 Checking ' \ Image collection *S._Question-answer generation Training | - set .' ViVQA ! | CC Z2 dataset ' ' se \.3: Sơ đồ xây dựng bộ dữ liệu UIT-ViVQA UIT-ViVQA là bộ dữ liệu hỏi đáp trực quan trên tiến ø Việt được dựa trên dữ liệu tiếng Anh COCO-QA. UIT-ViVQA bao gồm 15000 cặp câu hỏi tiếng Việt và được chia thành 4 loại câu hỏi, đó là câu hỏi về số lượng, câu hỏi về địa điểm, câu hỏi về mau sac và câu hỏi vê màu sắc.
Trong quá trình xây dựng bộ dữ liệu này, Khánh và các cộng sự sử dụng phương pháp kết hợp giữa các công cụ dịch (Google translate và Microsoft translate) và người dịch. Các bản dịch tiếng Việt từ bộ dữ liệu tiếng Anh sẽ được tính độ tương đồng Cosine và chỉnh sửa các câu có độ tương đồng thấp trước khi đưa vào sử dụng. Khánh và các cộng sự sử dụng giới hạn cho độ tương đồng la 80% nhưng qua xem xét, chúng tôi còn phát hiện một sô cặp câu hỏi chưa chính xác. What is the color of the sign? Microsoft: Mau của dau hiệu là gi? Google: Mau của biên bao là gi? cosine: 89% | Hình 2.4: Ví dụ về lỗi của bộ dữ liệu UIT-ViVQA Trong hình vi dụ phía trên, khi dịch câu hỏi “What is the color of the sign?” sang tiếng Việt, các công cụ dịch đưa ra các bản dịch khác nhau.
Từ “the sign” có thể dich sang “dau hiệu” hoặc “biên báo” nhưng trong trường hợp này nó nên được dịch ra là “biên báo”. Ngoài ra, độ tương đồng cho 2 bản dịch là 89%, nó đã vượt qua giới hạn độ tương đồng của bộ dit liệu UIT-ViVQA do đó bản dịch này được chấp nhận. Image Anwe AJƑUEEIMM. The bus is red.5: Một số cặp câu hỏi trả lời trong bộ dữ liệu FM-IQA 2.
FM-IQA FM-IQA [3] là một trong những bộ dữ liệu đa ngôn ngữ đầu tiên do Gao và các cộng sự dé xuất. FM-IQA có khoảng 300000 cặp câu hỏi và câu trả lời tiếng Anh và tiếng Trung. Xây dựng bộ dữ liệu FM-IQA được bắt đầu từ việc thu thập hình ảnh từ bộ dữ liệu ảnh MS COCO [9]. Các câu hỏi và câu trả lời sẽ được thu thập từ các cộng đồng online Baidu.
Các annotator được tự đo hỏi bất kỳ loại câu hỏi nao liên quan đến hình ảnh. Do đó, FM-IQA là một bộ dữ liệu hỏi đáp trực quan đa ngôn ngữ freestyle. Đối với phần dir liệu tiếng Anh, Gao và các cộng sự chọn hướng sử dụng dịch máy dé tự động dịch từ tiếng Trung sang tiếng Anh. Tuy nhiên, sử dụng dịch máy vẫn còn nhiều bat cập, chưa có tính tự nhiên như các bản dịch của con người.
Trong công trình nay, mô hình mà Gao và các cộng sự dé xuất là mô hình CNN- LSTM. LSTM là một mô hình khá cũ so với hiện tại. Do thực hiện vào năm 2015 nên các tác giả chưa thể tiếp cận với các mô hình sau này hiện đại hơn như Hierarchical Co-attention hay BERT. What is the cat doing ? <BOA> Sitting on the umbrella ® @ ew, & Shared C) embedding TCI CIC ICICI LSTM Softmax C) O k2 L2) % Sitting on the umbrella <EOA> Hình 2.6: Mô hình CNN-LSTM được đề xuất bởi Gao và các cộng sự 2.
xGQA Skateboarder KTo neTraeT no He6y? tit ? EEA SI oss 3 US? Siapa yang sedang terbang melintasi langit? Hình 2.7: Vi du cho bộ dữ liệu xGQA với 8 loại ngôn ngữ khác nhau. Nam 2022, Jonas và các cộng sự [4] đã xuất bản một bộ đữ liệu hỏi đáp trực quan đa ngôn ngữ với số lượng ngôn ngữ khác nhau lên đến 8 loại. Đó là tiếng Anh, tiếng Đức, tiếng Bồ Đào Nha, tiếng Nga, Tiếng Indo, tiếng Bengal, tiếng Hàn, tiếng Trung. xGQA được phát triển dựa trên bộ dit liệu thuần tiếng Anh GQA [11].
Khoảng 12000 cặp câu hỏi câu trả lời tiếng Anh sẽ được dịch thủ công sang 7 loại ngôn ngữ còn lại. Qua các công trình liên quan chúng tôi nhận thấy các công trình có chứa tiếng Việt hay tiếng Nhật còn ít. Đặc biệt chưa có bộ dữ liệu đa ngôn ngữ nào có cả tiếng Nhật và tiếng Việt trong đó. Do đó chúng tôi quyết định lựa chọn đề tài này.