Chương 1 Giới thiệu đề tài 1.1 Nhận diện hành vi trong videos Mạng xã hội và sự phát triển của các thiết bị kĩ thuật số đã thúc đẩy sự tăng lên đáng kể của dữ liệu video. Từ sự đa dạng và phong phú của dữ liệu video, việc phân tích và thấu hiều hành vi từ video đang trở thành một lĩnh vực nghiên cứu quan trọng trong thị giác máy tính (3|[20)(28)[31][33}. Có rat nhiều yếu tố ảnh hưởng đến việc nhận diện hành vi như độ phan giải, ánh sáng của môi trường xung quanh, tốc độ khung hình, đối tượng đang được quan sát có thể bị che khuất. Ngoài ra sự khác biệt về vóc dáng con người, kĩ thuật của nhân vật có thể tạo ra vô số biểu diễn cho một hành vi của con người ví dụ như một động viên chơi thể thao sẽ rất khác với một người bình thường cùng chơi môn thể thao đó.
Hay chỉ đơn giản là đổi góc của camera hay đổi từ camera màu thành camera chiều sâu cũng đã có thể tạo ra một biểu diễn khác của hành động (Hình [. Bài toán tổng quát yêu cầu xây dựng các hệ thống có khả năng giải quyết các vấn đề trên và tự động nhận diện và phân loại các hành vi hay hành động chọn lọc được yêu cầu nhận điện. Diều này bao gồm việc xử lý các video đầu vào, phát hiện các hành vi cụ thể từ một danh sách quan tâm của đối tượng trong video và gắn nhãn cho chúng. Mục tiêu là xác định được các hành vi và hoạt động đang diễn ra trong video một cách tự động và chính xác.
Cam04 Cam05 Cam06 PTZ04 PTZ06 ObjectThrow Hình 1.1: Mô ta mỗi hành vi có thể biểu diễn bằng nhiều góc nhìn khác nhau. Dữ liệu đầu vào thường là hình ảnh hoặc video được ghi từ các camera quan sát. Các đoạn video này có thể được cắt sẵn (trimed) hoặc chưa được cắt sẵn (untrimed). Đối với đoạn video cắt san chỉ chứa một hành động trong đoạn video và độ dài tương đối ngắn.
Hay nói cách khác, thời điểm trước khi xảy hay sau khi xảy ra hành động sẽ không bao gồm trong video mà không cần phải xác định thời điểm bắt đầu và kết thúc của hành động. Kết quả đầu ra của các video này là nhãn của hành vi nhận diện được cho toàn bộ video. Các nghiên cứu gần đây đã đạt được nhiều thành tựu đáng kể đối với loại video này BÌ: Tuy nhiên, trong thực tế, hay trong các video được ghi hình sẵn phần lớn dữ liệu video là chưa được cắt sẵn. Video chưa được cắt sin mặt khác là những đoạn video dài có thể chứa nhiều hành động (Hình [1.2] ), thời điểm trước hành động, chuyển giao giữa các hành động đều bao gồm trong đoạn video, ngoài ra độ dài của hành động cũng ngẫu nhiên có thể chỉ vài giây hoặc có thể kéo dài vài phút.
Ngoài ra hành vi đang được quan tâm có thể chiếm một phần rất nhỏ trong toàn bộ video. Kết quả đầu ra của video này sẽ là vị trí thời gian của hành động hay nói cách khác là No Action of Interest | Action Detected : Long Jump No Action of Interest ` Action Start AC Action End Time Action Instances of Various Lengths | Action 1 | | Action2 |! Action 3 Action 4 ä I Ỹ Ỹ Ỹ Ỹ Y tự HH Start End Start End Start End Start End) Dung: Hình 1.2: Mô ta bài toán đối với video chưa được cắt sẵn. Yêu cầu của bài toán là từ video đầu vào ngẫu nhiên, nhận diện được các hành động đang được quan tâm cùng với thời điểm bắt đầu và kết thúc của chúng. thời điểm bắt đầu và kết thúc cùng với nhãn của hành động.
Điều này dẫn đến bài toán nhận diện hành vi sử dụng video chưa cắt sẵn có độ phức tạp cao hơn nhiều so với bài toán nhận diện hành vi trong video đã cắt sẵn. Đề tài nghiên cứu này sẽ chủ yếu tập trung vào việc nhận diện hành vi dựa trên video chưa được cắt sẵn.2 Bài toán nhận diện hành vi mất tập trung của tài xế Bài toán nhận diện hành vi mất tập trung của tài xế là một trong những bài toán con của bài toán nhận diện hành vi trong videos với tập hợp các hành vi được quan tâm đến là các hành vi mất tập trung của tài xế (Hình Cuộc thi AT City nhắm đến việc sử dụng AI để cải thiện việc vận hành trong môi trường thực tế để có thể ứng dụng làm nền tảng để phát triển thành phố thông minh. Một trong những tac vu trong đó là cải thiện sự hiệu quả và an toàn khi tham gia giao thông bằng cách nhận diện các hành mất tập trung khi lái xe được giới thiệu lần đầu vào cuộc thi năm 2022 (29). Cuộc thi nay đã thu hút 508 đội vào năm 2023 tăng gấp đôi so với 254 đội vào năm 2022 từ 46 quốc gia khác Distracted: Phone (Left) Y Y oa Thời gian Bat dau Kết thúc.
Hành vi mat tập trung có thé có nhiều độ dài khác nhau và ở vị trí bất kì > M M v v M Bắt đầu Kết thúc. Bắt dau Kết thúc Bắt đầu Kết thúc Ti8i@=m nhau trên toàn thế giới cho thấy được sự quan tâm ngày càng tăng đối với nhu cầu này. Ngoài ra cuộc thi này cung cấp bộ dữ liệu thu thập từ 3 camera được bé trí ở 3 vị trí khác nhau xung quanh tài xế cung cấp một bộ dữ liệu ghi lại hành vi của tài xế ở nhiều góc độ khác nhau cho ta một cái nhìn tổng quát hơn so với một góc nhìn riêng biệt.Cuộc thi yêu cầu xác định thời điểm và nhận diện 16 hành vi mắt tập trung của tài xế (Hinh|1.3) ví dụ như nhắn tin, ăn, uống, nghe điện thoại. Từ việc giải quyết vấn đề nhận diện hành vi lái xe mất tập trung sẽ giúp chúng ta tạo ra các công cụ để theo dõi và đánh giá hành vi của tài xế một cách hiệu quả.
Điều này rất quan trọng trong việc sớm phát hiện các tài xế không tập trung, giúp đưa ra các cảnh báo kịp thời giúp đảm bảo an toàn trên đường. Các camera được lắp trên xe sẽ liên tục ghi lại hình ảnh và video về tài xế từ nhiều góc nhìn khác nhau giúp ta có thể nghiên cứu và phân tích hiệu quả hơn các hành vi mất tập trung có thể gây nguy hiểm cho việc tham gia giao thông. Thành công trong việc giải bài toán này không chỉ làm tăng an toàn giao thông mà còn có thể hỗ trợ việc phát triển các hệ thống cảnh báo sớm các hành vi nguy hiểm làm giảm nguy cơ tai nạn và bảo vệ tính mạng của nhiều người tham gia giao thông mỗi ngày.3 Các thách thức của bài toán nhận diện hành vi mat tập trung của tài xế Các thác thức chính của bài toán nhận diện hành vi mất tập trung của tài xế như sau: e Hệ thống phải nhận diện được một hoặc nhiều hành vi trong 1 đoạn clip chưa được rút gọn (untrim video) đòi hỏi các phương pháp rất phức tạp và khó có thể áp dụng vào thực tế ki. e Thông thường việc xác định thời gian xảy ra hành vi thường chỉ được sử dụng trên 1 góc nhìn của video dẫn đến mô hình có thể không nhận diện được hành vi trên những góc nhìn khác ngoài ra cần một phương pháp để tổng hợp thông tin từ các góc nhìn khác nhau.4|cho thấy ta cần một phương pháp thích hợp cho việc xử lý nhiễu từ dự đoán của mỗi camera.
e Góc nhìn của một camera có thể không nhận diện được đúng hành vi (Hình ngay cả việc gán nhãn thủ công vẫn khó có thể nhận biết được hành vi nào.7|ta có thể thấy được mỗi camera có thể nhận diện ra một kết quả khác nhau tùy thuộc vào độ bao quát của góc camera với hành vi. e Các hành vi của con người có thể rất mơ hồ hoặc nhiều biểu hiện khác nhau cho cùng hành vi dẫn đến việc khó nhận diện hay phân biệt được hành vi (Hình e Các hành vi mất tập trung diễn ra gần nhau rất khó có thể nhận diện được thời gian bắt đầu và kết thúc của hành vi, một phần thời lượng video là có chứa hành vi mất tập trung còn phần lớn thời gian là hành vi lái xe bình thường. Hình cho thấy được hành vi có thể ở bất kì thời điểm nào ở đoạn video và có thể có độ dài ngắn khác nhau. e Tập dữ liệu dùng để huấn luyện khá nhỏ so với số lượng hành vi cần nhận diện dẫn đến mô hình có thể dễ dàng gặp vấn đề học vẹt (overfit).
Chỉ khoảng 755 mẫu cho 16 hành vi tương đương với việc mỗi hành vi chỉ có khoảng 47 mẫu so với các bộ dữ liệu dùng để huấn luyện hành vi khác. b 0 Class Probabilities for Video ID: 8 - View: dash 08 _ 06 ne00 A Aa Boa ƒ\ — IIi. Label fi 20 TÏ 30 ot “ng Teas "a0 150 ra 180 190 1 1 } ' 1 1 si. ae | haa ' =z i] 1 i I max label =a = es SSS mm mm 0 10 20 ] 30 40 50 EM] 70 80 90 100 110 T1 130 140 150 160 h 170 180 190 10 lass Probabilitied for Video ID: 8 - View: dặn 08 ề = 06 8 Boa E 0 10 20 TU 30 40 50 60 † T0 80 110 = 130 140 150 160 L 170 180 190 02 A — aN 00 Label f 1 ! | te EU , BH 1 1 | max, a i} i] 1 1 I max label ms | a Co ee 0 10 203 4 50 V7 8 90 10 l6 l20g 130 1O 150160 ; 170 180 190 Fs Label f 1 † 120 14 130 150 160 † A 180 190 i] 1 1 ' 1 i 1 i] si, mm, ¡ Em.
mm, mm ' 1 F h max_label = = _ = Coe en summed a mm 2 1 ¬ — = : + 0 16 20230 46 50 ON 70 80 90 100 1O 120g 1320 140 130 l6O ÿ 170 l6 6O _———————== ————————— Hình 1.4: Mô tả minh họa tổng hợp thông tin từ nhiều góc nhìn cần được xử lý nhiễu do mỗi camera có thể có một dự đoán khác nhau. gt là dp ấn còn mazx_label là hành vi có độ tin cậy tốt nhất nhận diện được. Các khoảng trắng là hành vi lái xe bình thường.5: Thách thức trong việc nhận diện hành vi mất tập trung của tài xế với một góc nhìn camera. Ở video này khó có thể xác định được tài xế đang bấm điện thoại hay đang điều chỉnh bảng điều khiển vì tay bị che khuất Hình 1.