Xây Dựng Hệ Thống Truy Vấn Video Thông Qua Tương Tác Dựa Trên Nội Dung

Khóa luận tốt nghiệp nghiên cứu tốt nghiệp khoa học máy tính xây dựng hệ thống truy vấn video thông qua tương tác dựa trên nội dung, vận dụng lý thuyết vào thực tế, đề xuất giải

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2023

82
4
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN

1.1. Giới thiệu đề tài

1.2. Mục tiêu

1.3. Phạm vi

1.4. Đóng góp của khóa luận

1.5. Cấu trúc khóa luận

2. CHƯƠNG 2: KIẾN THỨC CƠ SỞ

2.1. Mở đầu

2.2. Các mô hình tham gia Video Browser Showdown 2021

2.3. An Interactive Video Search Tool (IVS)

2.4. Hệ thống truy vấn video

2.5. Các hướng tiếp cận

2.6. Tình hình nghiên cứu

2.7. Các kỹ thuật lập chỉ mục trong không gian đa chiều

3. CHƯƠNG 3: XÂY DỰNG HỆ THỐNG TRUY VẤN VIDEO TRÊN BỘ DỮ LIỆU HCMC AI CHALLENGE

3.1. Giới thiệu về bộ dữ liệu HCMC AI CHALLENGE 2022

3.2. Mô hình TransnetV2

3.3. Xây dựng mô đun Semantic search

3.4. Xây dựng mô đun object search

3.4.1. Mô hình Faster R-CNN

3.5. Xây dựng mô đun Scene-Text search

3.6. Xây dựng mô đun speech2text search

3.6.1. Mô hình Wav2Vec

3.6.2. Wav2Vec2 base Vietnamese 250h

3.7. Quá trình lập chỉ mục

4. CHƯƠNG 4: THỰC NGHIỆM VÀ ĐÁNH GIÁ

4.1. Mở đầu

4.2. Kết quả đánh giá trên truy vấn text KIS

4.3. Kết quả đánh giá trên truy vấn visual

4.4. Một câu text KIS hệ thống làm tốt

4.5. Một câu text KIS chưa tìm ra kết quả

4.6. Kết quả hệ thống trả về chưa hợp lí

5. CHƯƠNG 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

5.1. Kết luận

5.2. Hướng phát triển

TÀI LIỆU THAM KHẢO

DANH SÁCH HÌNH VẼ

DANH SÁCH BẢNG

DANH MỤC TỪ VIẾT TẮT

Tóm tắt

I. Tổng quan về Hệ Thống Truy Vấn Video Dựa Trên Nội Dung

Hệ thống truy vấn video dựa trên nội dung đang trở thành một giải pháp quan trọng trong việc tìm kiếm và truy xuất video. Với sự gia tăng nhanh chóng của nội dung video trên các nền tảng như YouTube và Facebook, nhu cầu về các hệ thống hiệu quả để tìm kiếm video ngày càng cao. Hệ thống này cho phép người dùng tìm kiếm video dựa trên các đặc trưng như hình ảnh, âm thanh và văn bản, từ đó nâng cao trải nghiệm người dùng.

1.1. Định nghĩa và Chức năng của Hệ Thống Truy Vấn Video

Hệ thống truy vấn video cho phép người dùng nhập các truy vấn tìm kiếm và nhận lại danh sách video liên quan. Các đặc trưng của video như màu sắc, âm thanh và nội dung văn bản được sử dụng để xác định sự phù hợp với truy vấn.

1.2. Lịch sử Phát Triển Hệ Thống Truy Vấn Video

Nghiên cứu về truy xuất video bắt đầu từ những ngày đầu của video kỹ thuật số. Các hệ thống ban đầu dựa trên văn bản đơn giản, nhưng với sự phát triển của công nghệ, các phương pháp truy xuất dựa trên nội dung đã ra đời, mở ra hướng đi mới cho lĩnh vực này.

II. Thách Thức Trong Việc Xây Dựng Hệ Thống Truy Vấn Video

Mặc dù có nhiều tiến bộ trong công nghệ, việc xây dựng hệ thống truy vấn video vẫn gặp nhiều thách thức. Các vấn đề như độ chính xác trong việc tìm kiếm, thời gian phản hồi và khả năng xử lý dữ liệu lớn là những yếu tố cần được giải quyết.

2.1. Độ Chính Xác Trong Truy Vấn Video

Độ chính xác là một trong những yếu tố quan trọng nhất trong hệ thống truy vấn video. Việc cải thiện độ chính xác đòi hỏi các phương pháp phân tích nội dung video hiệu quả và chính xác.

2.2. Thời Gian Phản Hồi và Tối Ưu Hóa

Thời gian phản hồi của hệ thống truy vấn video cần được tối ưu hóa để đảm bảo trải nghiệm người dùng tốt nhất. Các phương pháp như lập chỉ mục và phân đoạn video có thể giúp cải thiện tốc độ truy vấn.

III. Phương Pháp Xây Dựng Hệ Thống Truy Vấn Video Hiện Đại

Để xây dựng một hệ thống truy vấn video hiệu quả, cần áp dụng các phương pháp hiện đại trong xử lý hình ảnh và âm thanh. Các công nghệ như học sâu và phân tích ngữ nghĩa đang được sử dụng rộng rãi.

3.1. Sử Dụng Học Sâu Trong Truy Vấn Video

Học sâu đã chứng minh được hiệu quả trong việc phân tích và nhận diện các đặc trưng của video. Các mô hình như CNN và RNN được áp dụng để cải thiện độ chính xác trong việc truy xuất video.

3.2. Phân Tích Ngữ Nghĩa và Tương Tác Người Dùng

Phân tích ngữ nghĩa giúp hệ thống hiểu rõ hơn về nội dung video và truy vấn của người dùng. Tương tác người dùng cũng đóng vai trò quan trọng trong việc cải thiện độ chính xác của kết quả tìm kiếm.

IV. Ứng Dụng Thực Tiễn Của Hệ Thống Truy Vấn Video

Hệ thống truy vấn video có nhiều ứng dụng thực tiễn trong các lĩnh vực như giáo dục, giải trí và truyền thông. Việc áp dụng công nghệ này giúp nâng cao trải nghiệm người dùng và tối ưu hóa quy trình tìm kiếm.

4.1. Ứng Dụng Trong Giáo Dục

Trong giáo dục, hệ thống truy vấn video giúp sinh viên tìm kiếm các tài liệu học tập một cách nhanh chóng và hiệu quả. Điều này tạo điều kiện thuận lợi cho việc học tập và nghiên cứu.

4.2. Ứng Dụng Trong Giải Trí

Trong lĩnh vực giải trí, hệ thống này giúp người dùng tìm kiếm các video giải trí phù hợp với sở thích cá nhân, từ đó nâng cao trải nghiệm giải trí.

V. Kết Luận và Tương Lai Của Hệ Thống Truy Vấn Video

Hệ thống truy vấn video dựa trên nội dung đang phát triển mạnh mẽ và hứa hẹn sẽ mang lại nhiều giá trị cho người dùng. Tương lai của công nghệ này sẽ tiếp tục được cải thiện với sự phát triển của trí tuệ nhân tạo và học máy.

5.1. Xu Hướng Phát Triển Công Nghệ

Công nghệ truy vấn video sẽ tiếp tục phát triển với sự xuất hiện của các phương pháp mới trong học sâu và phân tích dữ liệu lớn. Điều này sẽ giúp cải thiện độ chính xác và tốc độ truy vấn.

5.2. Tương Lai Của Hệ Thống Truy Vấn Video

Tương lai của hệ thống truy vấn video sẽ tập trung vào việc cải thiện trải nghiệm người dùng và tối ưu hóa quy trình tìm kiếm. Các nghiên cứu và phát triển mới sẽ tiếp tục mở ra nhiều cơ hội trong lĩnh vực này.

10/07/2025
Khóa luận tốt nghiệp khoa học máy tính xây dựng hệ thống truy vấn video thông qua tương tác dựa trên nội dung

Trích đoạn nội dung tài liệu

Mở đầu Trước khi bắt đầu tìm hiểu về bài toán truy vấn video, tôi xin trình bày một số mô hình truy vấn video tương tác với người dùng dựa trên nội dung đã từng được công bố. Sau đó tôi sẽ giới thiệu tổng quát về hệ thống truy van video va các nghiên cứu gần đây đối với các bài toán cấu thành.2 Các mô hình tham gia Video Browser Showdown 2021 Để có thể xây dựng hệ thống, tôi tiến hành khảo sát những hệ thống trước đó đã được đánh giá và xây dựng trên bộ dữ liệu lớn. Đặc biệt, cuộc thi quốc tế Video Browser Showdown (VBS)[10] đã được tổ chức thường niên mục tiêu đánh giá các hệ thống truy van video tiên tiến nhất. Là một phan của hội nghị International Conference on MultiMedia Modeling (MMM) kể từ năm 2012, nó nhằm thúc đẩy nghiên cứu về các hệ thống truy xuất video quy mô lớn hiệu quả, nhanh chóng va dễ sử dụng cho các tình huống tìm kiếm nội dung thực sự có liên quan trong thực tế (ví dụ: tìm kiếm một bản tin về một họa sĩ đang phát 2.

Kiến thức cơ sở và các nghiên cứu liên quan biểu, đằng sau là một bức tranh màu vàng). Kể từ đó rất nhiều mô hình truy xuất video dựa trên nội dung đã được ra đời với nhiều cải tiến khác nhau.1 Mô hình IVOS [1] Đây là mô hình truy vấn video dựa trên vật thể có trong khung hình. Tại đây người dùng có thể tìm kiếm các khung hình chính có chứa một hoặc nhiều đối tượng, có thể được lọc thêm theo vị trí, màu sắc, kích thước tương đối và độ tin cậy phát hiện hình 2. Điều này cho phép người dùng thực hiện các truy vấn khám phá chang hạn như “một người ở bên trái” hoặc “một chiếc 6 tô nhỏ mau xanh lam ở đầu đường” Hệ thống đầu sau (back-end) sử dụng thông tin đối tượng được phát hiện nhờ mô hình YoloV4[1 1] được huấn luyện cho 80 lớp đối tượng trong bộ dữ liệu MS COCO [12], để phát hiện các đối tượng trong khung hình chính.

Mỗi đối tượng được phát hiện được lưu lại với tên, vị trí và kích thước của nó, và màu sắc chủ đạo của khung hình chứa đối tượng được trích xuất. Kiến thức cơ sở và các nghiên cứu liên quan 2.2 Visione [2] VISIONE cung cấp nhiều chức năng tim kiếm dé cho phép người dùng tim kiếm video bằng cách sử dụng các truy vấn văn bản hoặc hình ảnh mô tả nội dung của một cảnh trong video mục tiêu. Cụ thể, hệ thống hỗ trợ: * Người dùng có thể cung cấp mô tả văn ban bằng ngôn ngữ tự nhiên ví dụ như "một cô gái đang hát trong quán bar" như hình 2.2 « Tìm kiếm theo từ khóa: Người dùng có thể chỉ định các từ khóa liên quan đến cảnh mục tiêu (ví dụ: "cô gái, trong quán bar, hát") « Tìm kiếm theo vi trí đối tượng: Người dùng có thể vẽ trên một bang đơn giản để chỉ định các đối tượng xuất hiện trong cảnh mục tiêu và vị trí tọa độ của chúng * Tìm kiếm theo vị trí màu sắc: Người dùng có thé chỉ định một số màu sắc hiện có trong cảnh mục tiêu và vị trí không gian của chúng « Tìm kiếm theo ví dụ hình ảnh: Một hình ảnh có thể được sử dụng làm truy van để truy xuất các cảnh video tương tự về mặt hình ảnh. Hình ảnh có thể được chọn trong giao diện duyệt web như là một trong các kết quả của tìm kiếm trước đó hoặc được tải lên từ URL hoặc tệp cục bộ 2.

Kiến thức cơ sở và các nghiên cứu liên quan (Objects & Colors: ®MUST OSHOULD ) Paste image URL Upload an image 43 16:9 Sim Reorder 3roup by videc A girl singing in a bar| p» bar music* @ Clean All || Un-Clean All Hình 2.2: Hệ thống Visione. ! Nhóm tác giả đã công bố mô hình TERN[2] để có thể mã hóa dữ liệu dạng hình ảnh và văn bản nhờ đó có thể thực hiện phép so sánh trên đặc trưng đã được chuẩn hóa cho ra được mối tương quan giữa hình ảnh và văn bản hoặc giữa hình ảnh và hình ảnh. An Interactive Video Search Tool(IVS) IVS hỗ trợ các loại tìm kiếm khác nhau, bao gồm tìm kiếm dựa trên văn bản và tìm kiếm dựa trên hình ảnh (Hình 2. Để cho phép các loại tìm kiếm này, các siêu dữ liệu đa dạng được trích xuất bằng cách sử dụng các thuật toán tiên tiến nhất cho việc phát hiện vật thể, nhận dạng giọng nói, nhận dạng ký tự và các đặc trưng hình ảnh.

Kiến thức cơ sở và các nghiên cứu liên quan 8M2S 1= = 3 #==m =‹-.- = Interactive Search Panel Tìm kiếm hình ảnh phụ thuộc vào sự có sẵn của các thông tin hình ảnh phong phú mô tả các thuộc tính khác nhau của hình ảnh. Mà không mất tính tổng quát, IVS sử dụng các siêu dữ liệu sau đây như các mô tả cho bộ dữ liệu. s Phát hiện đối tượng: Một cách dé mô tả hình ảnh là xác định các đối tượng được chụp trong hình ảnh. Vì vậy, có thể sử dụng một số phương pháp học sâu cho nhận dạng hình ảnh và phát hiện đối tượng.

Mỗi khung hình chính trong tập dữ liệu được liên kết với một tập con của 1000 đối tượng có thể phát hiện được bởi mạng nơ-ron tích chập NASnet[13]. Với mỗi đối tượng được phát hiện, hệ thống xem xét chỉ 10 đối tượng có độ tự tin cao nhất để giảm ảnh hưởng của sai số phát hiện trong quá trình tìm kiếm. Hơn nữa, vì thuật toán NASnet chú thích đối tượng phát hiện được một cách tổng quát va trừu tượng (ví dụ, người). ° Khuôn mặt: Kho dữ liệu còn được bổ sung bằng thông tin các khuôn mặt con người đã được phát hiện thông qua Apple Image Core API3 !.

API trả về số lượng khuôn mặt được phát hiện (tức là không có khuôn mặt, một khuôn mặt, hai khuôn mặt, ba khuôn mặt, bốn khuôn mặt hoặc nhiều khuôn mặt). Vì việc phát hiện khuôn mặt ám chỉ sự tổn tại của một người, 'https://developer.com/documentation/coreimage/cifacefeature 2. Kiến thức cơ sở và các nghiên cứu liên quan IVS sử dụng siêu dữ liệu được trích xuất từ phân tích phát hiện khuôn mặt là các chỉ báo cho người trong phương pháp tìm kiếm. » Đặc trưng hình ảnh: Các khung chính của tập dữ liệu được trích xuất các đặc trưng hình ảnh bao gồm màu sắc và góc cạnh.

Ngoài ra, tác giả sử dụng một trong các phương pháp tiên tiến hiện nay (được gọi là regional maximum activations of convolutions (R-MAC) [14]), sử dụng mạng nơ- ron sâu để học các đặc trưng từ hình ảnh. R-MAC trích xuất một vector đặc trưng bao gồm 512 chiêu. ¢ Nhận diện văn bản: Nhận dạng ký tự quang hoc (OCR) cho phép trích xuất văn bản viết xuất hiện trong một số phần của hình ảnh (ví dụ, văn bản được viết trên biển báo giao thông hoặc trên cửa hàng được chụp trong hình ảnh). Với việc một phần của các khung chính của tập dữ liệu được gắn nhãn với một số hoặc nhiều văn bản (dựa trên kết quả phân tích thông qua Apple Image Core API để nhận dạng văn bản.

Tác giả đã trích xuất văn bản từ tập con này bằng cách sử dụng TesseractOCR [15]. Hơn nữa, vì một số đoạn ngắn của tập dữ liệu có chứa lời nói, những đoạn phim này đã được phân tích bằng Google Cloud Speech-to-Text API để trích xuất các từ khóa được nói để gắn thẻ chúng với các khung chính tương ứng của chúng.3 Hệ thông truy vấn video Sau khi tham gia khảo sát và nghiên cứu các mô hình được xây dựng và đánh giá thông qua cuộc thi VBS, tôi nhận thấy các mô hình truy vấn video thường được chia làm 2 giai đoạn(Hình 2.4): ‹ Tiền xử lí dữ liệu: Ở giai đoạn này, bộ dữ liệu dang video sẽ được tinh gon bằng các phương pháp trích xuất thông tin về thị giác, âm thanh, văn 10 2. Kiến thức cơ sở và các nghiên cứu liên quan bản,. Sau có các siêu dữ liệu này sẽ được lưu trữ và đánh chỉ mục.

Toàn bộ quá trình này mục tiêu nhắm tới là làm tăng độ chính xác và giảm thời gian truy vân. * Xây dựng hệ thống truy van: Sau khi đã có được các thông tin từ quá trình tiền xử lí dữ liệu, một hệ thống truy xuất là cần thiết để người dùng có thể thực hiện các thao tác truy van. Query đầu vào sẽ được ánh xạ với các thông tin có trong kho dữ liệu, từ đó trả về kết quả tương đồng nhất theo một độ đo cụ thể để trả về danh sách các video. Trích xuất h 4 Hệ thống truy vấn video thông tin Ƒ gu tương tác với người dùng dựa trên nội dung Hình 2.4: Các giai đoạn xây dựng hệ thống truy vấn video 2.4 Các hướng tiếp cận Hệ thống của tôi cung cấp 4 hướng tiếp cận đa dạng cho việc truy vấn video, bao gồm truy vân về cả âm thanh và thị giác: ¢ Hệ thống của tôi hỗ trợ truy vấn ngữ nghĩa hình ảnh để giúp người dùng tìm kiếm video bằng cách mô tả phân cảnh hoặc ý nghĩa của phân cảnh.

« Có thể sử dụng truy vấn vật thé để tìm kiếm video dựa trên các đối tượng xuất hiện trong đó. Kiến thức cơ sở và các nghiên cứu liên quan s Truy vấn chữ trong ngoại cảnh cho phép người dùng tìm kiếm video bằng cách nhập các từ khóa mô tả nội dung của văn bản có trong một khung hình của video. * Cuối cùng, người dùng có thể sử dụng truy vấn âm thanh để tìm kiếm video dựa trên nội dung âm thanh xuất hiện trong các video. Với những hướng tiếp cận đa dạng này, tôi hy vọng rằng hệ thống sẽ có thể hỗ trợ tim kiếm và truy cập dé dàng đến các video cần tìm kiếm.5 Tình hình nghiên cứu Phát hiện chuyển cảnh (Hình 2.5): là bài toán phát hiện các chuyển đổi trong video, chang hạn như chuyển từ cảnh này sang cảnh khác, chuyển zoom, pan hoặc chuyển động camera.

Điều này có thể giúp ích cho quá trình chia nhỏ video, lựa chọn khung hình chính nhằm nâng cao tốc độ xử lí cho mô hình truy vấn. Hiện nay, có rất nhiều phương pháp được sử dụng để phát hiện chuyển cảnh trong video. Các phương pháp này bao gồm cả phương pháp dựa trên cấu trúc cảnh (structure-based) và phương pháp dựa trên nội dung (content-based). Phương pháp cấu trúc cảnh chủ yếu dựa trên sự thay đổi trong cấu trúc của các cảnh, bao gồm điểm ảnh(Pixel-based) [16], góc canh(Edge-based)[17] va biểu đồ mau(Histogram-based)[18], các hướng tiếp cận trên thường sử dụng các thuật toán như đặt ngưỡng (thresholding), tính toán chênh lệch khung hình (frame differencing) và phát hiện góc cạnh (edge detection).

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề Hệ Thống Truy Vấn Video Dựa Trên Nội Dung: Giải Pháp Tương Tác Hiện Đại trình bày một giải pháp tiên tiến cho việc truy vấn video dựa trên nội dung, giúp người dùng tương tác một cách hiệu quả hơn với các video. Tài liệu nhấn mạnh tầm quan trọng của việc sử dụng công nghệ hiện đại để cải thiện trải nghiệm người dùng, từ việc tìm kiếm thông tin đến việc phân tích nội dung video. Những lợi ích mà tài liệu mang lại bao gồm khả năng tối ưu hóa quy trình tìm kiếm, nâng cao độ chính xác trong việc truy xuất thông tin và tạo ra những trải nghiệm tương tác phong phú hơn cho người dùng.

Để mở rộng thêm kiến thức về lĩnh vực này, bạn có thể tham khảo tài liệu Khóa luận tốt nghiệp kỹ thuật máy tính hệ thống phát hiện theo dõi người trên soc fpga, nơi cung cấp cái nhìn sâu sắc về các hệ thống phát hiện và theo dõi, một phần quan trọng trong việc phát triển các ứng dụng video thông minh. Những tài liệu này sẽ giúp bạn có cái nhìn toàn diện hơn về công nghệ và ứng dụng của nó trong thực tiễn.