Tổng quan nghiên cứu

Vấn đề bạo lực học đường từ lâu đã trở thành mối bận tâm hàng đầu của ngành giáo dục, gia đình và toàn xã hội. Theo ước tính từ các cơ quan quản lý giáo dục, mỗi năm tại nhiều quốc gia vẫn ghi nhận hàng ngàn vụ xô xát giữa học sinh với tính chất ngày càng phức tạp. Căn cứ theo khoản 5 Điều 2 Nghị định 80/2017/NĐ-CP của Chính phủ, bạo lực học đường được xác định là hành vi hành hạ, ngược đãi, đánh đập, xâm hại thân thể, sức khỏe, lăng mạ, xúc phạm danh dự, cô lập và các hành vi cố ý khác gây tổn hại thể chất, tinh thần xảy ra trong cơ sở giáo dục.

Trong thực tế, việc giám sát an ninh học đường hiện nay phụ thuộc chủ yếu vào các hệ thống camera truyền thống kết hợp con người theo dõi thủ công. Phương thức này tiêu tốn 100% nhân lực túc trực liên tục nhưng hiệu quả cảnh báo không cao do tình trạng mỏi mắt, giảm tập trung và độ trễ phản ứng lớn của người giám sát. Luận văn thạc sĩ chuyên ngành Khoa học máy tính năm 2023 tại Trường Đại học Sư phạm Thành phố Hồ Chí Minh đã giải quyết bài toán cấp bách này thông qua đề tài xây dựng mô hình tự động phát hiện hành vi bạo lực trong học đường từ video camera giám sát.

Mục tiêu cụ thể của nghiên cứu là thiết kế giải pháp học sâu nhận diện chính xác các va chạm vật lý mang tính bạo lực trong nhóm đối tượng nhỏ dưới 7 người. Nghiên cứu tập trung xử lý dữ liệu video đa dạng điều kiện với độ phân giải từ 360p đến 1080p. Ý nghĩa thực tiễn của công trình thể hiện ở khả năng tự động hóa giám sát, giúp giảm trên 80% thời gian theo dõi thủ công và rút ngắn thời gian phát hiện sự cố xuống dưới 1 giây, tạo lập lá chắn công nghệ bảo vệ an toàn cho học sinh sau giai đoạn bình thường mới.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng trên nền tảng lý thuyết thị giác máy tính (Computer Vision), nhận dạng hành động (Action Recognition) và các kiến trúc học sâu (Deep Learning) hiện đại. Thống kê giai đoạn 2015 đến 2022 cho thấy xu hướng nghiên cứu phát hiện bạo lực đã có sự chuyển dịch rõ rệt: các thuật toán học máy truyền thống như Support Vector Machine (chiếm 24%), Random Forest (chiếm 7%), AdaBoost (chiếm 4%) và KNN (chiếm 2%) dần được thay thế bởi mạng nơ-ron học sâu vốn chiếm tới 43% tổng số công bố khoa học.

Mô hình nghiên cứu kế thừa và tích hợp ba trụ cột lý thuyết cốt lõi:

  1. Lý thuyết phát hiện đối tượng với thuật toán YOLOX: Sử dụng kiến trúc không chứa hộp neo (anchor-free) cùng đầu giải mã phân tách (decoupled head) trên nền tảng Darknet53, giúp loại bỏ các vùng đề xuất trùng lặp và tăng tốc độ suy luận.
  2. Lý thuyết ước lượng tư thế người với mạng HRNet: Mạng duy trì biểu diễn độ phân giải cao liên tục qua các nhánh song song, cho phép định vị chuẩn xác 17 điểm khớp nối cơ thể (keypoints) của từng cá nhân trong không gian nhiều người.
  3. Khung biểu diễn tư thế 3D Heatmap Volumes dựa trên PoseC3D: Chuyển đổi tọa độ các chi thành bản đồ nhiệt 2D Limb Pseudo Heatmaps với hàm khoảng cách phân phối chuẩn có tham số sigma bằng 0.6, xếp chồng theo thời gian tạo thành khối thể tích nhiệt 3D nhằm triệt tiêu hoàn toàn thông tin nền tĩnh gây nhiễu.
  4. Mạng nơ-ron hai luồng Two-Stream ConvLSTM: Luồng thứ nhất tiếp nhận bản đồ nhiệt không gian 3D Heatmap H kích thước 224x224x3 theo bảng màu viridis; luồng thứ hai tiếp nhận bản đồ vi sai Differences Heatmap biểu diễn biến thiên chuyển động thời gian. Hai luồng qua các lớp tích chập ConvLSTM 64 bộ lọc (kích thước đầu ra 7x7x64) trước khi kết hợp tại tầng hợp nhất (Fusion layer).

Phương pháp nghiên cứu

Nghiên cứu sử dụng nguồn dữ liệu thực nghiệm phong phú từ 5 bộ dữ liệu tiêu chuẩn quốc tế và 1 bộ dữ liệu tổng hợp:

  • Hockey Fight: Gồm 1000 đoạn video (500 video bạo lực, 500 video bình thường) độ phân giải 360x288 pixel.
  • Violence in Movies: Gồm 200 video độ phân giải 360x250 pixel trích xuất từ các bộ phim hành động.
  • Real life violence situations: Gồm 2000 video đời thực thu thập từ YouTube với bối cảnh đường phố phức tạp.
  • RWF-2000: Gồm 2000 video clip thời lượng 5 giây quay trực tiếp từ camera giám sát thực tế trong nhiều điều kiện thiếu sáng.
  • Violence detection: Gồm 350 video clip độ phân giải cao 1920x1080 pixel được ghi hình từ hai góc máy cam1 (120 video) và cam2 (230 video), chứa nhiều hành vi dễ gây nhầm lẫn như ôm, bắt tay, vỗ tay.

Về phương pháp chọn mẫu và tiền xử lý, nghiên cứu áp dụng kỹ thuật lấy mẫu đồng đều Uniform Sampling với T = 32 khung hình nhiệt trên mỗi video. Toàn bộ tập dữ liệu được phân chia theo tỷ lệ chuẩn: 70% dành cho huấn luyện (Train), 20% dành cho kiểm định (Validation) và 10% dành cho kiểm thử độc lập (Test). Lý do lựa chọn phân tích chuỗi bản đồ nhiệt 3D thay vì mạng đồ thị không gian - thời gian (ST-GCN) là do bản đồ nhiệt không bị tăng độ phức tạp tính toán tuyến tính theo số lượng người, đồng thời kháng nhiễu tọa độ keypoint tốt hơn. Quá trình thực nghiệm được triển khai trong 6 tháng trên môi trường phần cứng máy chủ Kaggle (CPU Intel Xeon 2.00GHz, 13GB RAM, GPU Tesla P100 16GB) và Google Colab (GPU Tesla T4 15GB) bằng ngôn ngữ Python 3.12 cùng thư viện TensorFlow.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình huấn luyện và kiểm thử đa diện trên các tập dữ liệu thực tế đã mang lại 4 phát hiện khoa học quan trọng:

Thứ nhất, việc kết hợp bộ phát hiện YOLOX và bộ trích xuất tư thế HRNet giúp nhận diện chuẩn xác 17 điểm mốc cơ thể ngay cả khi các đối tượng học sinh có hành vi di chuyển nhanh hoặc che khuất lẫn nhau. Cải tiến kiến trúc anchor-free của YOLOX giúp giảm trên 35% số lượng hộp bao (bounding box) trùng lặp so với các dòng R-CNN truyền thống, tạo đầu vào sạch cho giai đoạn ước lượng tư thế.

Thứ hai, việc sử dụng bản đồ nhiệt biểu diễn các chi (Limb Pseudo Heatmap) đem lại hiệu quả phân loại vượt trội so với bản đồ nhiệt điểm khớp (Joint Pseudo Heatmap). Khi mô phỏng các tương tác va chạm xô đẩy giữa 2 đến 6 người, liên kết dạng chi bảo toàn cấu trúc chuyển động hình thể, giúp mô hình duy trì độ chính xác nhận diện trên 90% ngay cả trên tập dữ liệu giám sát khắc nghiệt RWF-2000.

Thứ ba, kiến trúc mạng hai luồng Two-Stream ConvLSTM xử lý song song bản đồ nhiệt không gian và bản đồ vi sai thời gian đạt hiệu suất tương đương các mô hình hàng đầu thế giới. Trên bộ dữ liệu Hockey Fight, mô hình đạt độ chính xác xấp xỉ 98%, cạnh tranh trực tiếp với mức 99.27% của các nghiên cứu sử dụng mạng CNN-BiLSTM phức tạp, trong khi tiết kiệm tài nguyên tính toán đáng kể nhờ loại bỏ toàn bộ dữ liệu nền.

Thứ tư, phương pháp lấy mẫu Uniform Sampling cố định ở mức 32 khung hình nhiệt đã bao quát trọn vẹn diễn biến của một hành vi bạo lực trong các đoạn video 5 giây. Cơ chế này đảm bảo mô hình tiêu thụ dưới 4GB VRAM trong quá trình suy luận, đáp ứng tốt yêu cầu triển khai thực tế trên các thiết bị tính toán biên.

Thảo luận kết quả

Nguyên nhân cốt lõi giúp mô hình đạt hiệu năng cao là nhờ chiến lược loại bỏ hoàn toàn bối cảnh nền (background) trong video camera. Trong môi trường học đường, các yếu tố như bàn ghế, bảng đen, ánh sáng đổi hướng hay cây cối rung lắc thường tạo ra các đặc trưng quang sai gây đánh lừa các mạng CNN truyền thống. Bằng cách chỉ giữ lại chuyển động nhiệt của khung xương, mạng nơ-ron tập trung học sâu các đặc trưng động lực học của hành vi đấm, đá, xô đẩy.

So sánh với các phương pháp đồ thị như Spatial Temporal Graph Convolutional Networks (ST-GCN), phương pháp 3D Heatmap Volume giải quyết triệt để rào cản tính toán. Khi số lượng học sinh trong khung hình tăng từ 2 lên 6 người, độ phức tạp của ST-GCN tăng theo cấp số nhân, trong khi mô hình đề xuất vẫn duy trì kích thước tensor cố định 224x224x3.

Dữ liệu thực nghiệm của nghiên cứu có thể được trực quan hóa thông qua biểu đồ cột so sánh độ chính xác giữa các mạng trích xuất đặc trưng (như MobileNetV2 và Inception-V3) kết hợp với bảng ma trận nhầm lẫn (Confusion Matrix). Ma trận này phản ánh rõ năng lực phân biệt tinh tế của mô hình: các tình huống dễ nhầm lẫn như học sinh ôm nhau, nhảy múa ăn mừng hay vỗ tay nhanh trong bộ dữ liệu Violence detection đều được phân loại chính xác vào nhóm không bạo lực với tỷ lệ sai lệch dưới 8%.

Đề xuất và khuyến nghị

Dựa trên các kết quả đạt được, luận văn đưa ra 4 khuyến nghị và giải pháp công nghệ mang tính ứng dụng cao:

  1. Tích hợp trực tiếp mô hình vào hệ thống camera giám sát thông minh tại các trường học: Ban giám hiệu phối hợp cùng bộ phận kỹ thuật công nghệ thông tin triển khai cài đặt module AI phát hiện bạo lực với mục tiêu phát hiện và phát tín hiệu cảnh báo trong thời gian thực dưới 500 mili-giây. Lộ trình triển khai thí điểm dự kiến từ 3 đến 6 tháng tại các điểm nóng như hành lang, sân trường, khu vực cổng phụ.
  2. Xây dựng quy trình phản ứng nhanh chuẩn hóa trong nhà trường: Ban quản lý an ninh và đội ngũ giám thị thiết lập cơ chế tiếp nhận thông báo tự động từ hệ thống AI qua ứng dụng di động hoặc chuông cảnh báo nội bộ, đặt mục tiêu cắt giảm 70% thời gian tiếp cận hiện trường để can thiệp kịp thời các vụ xô xát ngay trong học kỳ mới.
  3. Mở rộng cơ sở dữ liệu video bạo lực học đường đặc thù tại Việt Nam: Các viện nghiên cứu, trường đại học chuyên ngành công nghệ phối hợp cùng Bộ Giáo dục và Đào tạo xây dựng tập dữ liệu quy chuẩn gồm trên 5000 video tình huống thực tế tại hơn 50 cơ sở giáo dục trong thời gian 12 tháng, phục vụ việc tinh chỉnh mô hình thích ứng với đồng phục, thể trạng học sinh Việt Nam.
  4. Ứng dụng kỹ thuật nén mô hình để tối ưu hóa phần cứng: Nhóm kỹ sư phát triển phần mềm áp dụng các giải pháp lượng tử hóa (Quantization) và cắt tỉa trọng số (Pruning) nhằm giảm 50% dung lượng mô hình, cho phép nhúng thuật toán trực tiếp lên các vi xử lý AI biên gắn trên camera an ninh trong quý tới.

Đối tượng nên tham khảo luận văn

Luận văn là tài liệu tham khảo học thuật và ứng dụng giá trị cho 4 nhóm đối tượng cụ thể:

  • Nhóm nghiên cứu và học viên cao học chuyên ngành Khoa học máy tính, Trí tuệ nhân tạo: Tiếp cận phương pháp luận hiện đại về kết hợp mô hình trích xuất khung xương HRNet, biểu diễn 3D Heatmap Volumes và mạng Two-Stream ConvLSTM cho bài toán nhận dạng hành động đa đối tượng.
  • Ban giám hiệu và cán bộ quản lý giáo dục tại các trường phổ thông, đại học: Nắm bắt giải pháp công nghệ tự động hóa kiểm soát an ninh, phục vụ xây dựng đề án trường học thông minh, an toàn và lành mạnh theo quy định của pháp luật.
  • Kỹ sư phần mềm thị giác máy tính và doanh nghiệp phát triển giải pháp IoT: Khai thác quy trình tiền xử lý, cấu trúc pipeline thực thi từ phát hiện người bằng YOLOX đến phân loại chuỗi khung hình phục vụ phát triển sản phẩm thương mại giám sát an ninh công cộng.
  • Cơ quan hoạch định chính sách giáo dục và an toàn học đường: Tham khảo bằng chứng thực nghiệm khoa học để đề xuất chính sách, quy chuẩn kỹ thuật cho hệ thống camera an ninh thế hệ mới tại các cơ sở giáo dục trên toàn quốc.

Câu hỏi thường gặp

Mô hình có phân biệt được hành vi học sinh đùa giỡn với bạo lực thực tế không? Mô hình hoàn toàn có khả năng phân biệt chính xác nhờ luồng vi sai thời gian Differences Heatmap ghi nhận biên độ gia tốc và hướng chuyển động của các chi. Trên tập dữ liệu Violence detection gồm 350 video chứa các hành vi đùa giỡn, nhảy múa và vỗ tay, hệ thống duy trì độ chính xác phân loại ổn định, hạn chế tối đa các cảnh báo giả.

Tại sao nghiên cứu chọn 3D Heatmap thay vì đồ thị khung xương ST-GCN? Biểu diễn 3D Heatmap Volume cố định kích thước tensor đầu vào ở mức 224x224x3 bất kể số lượng người trong khung hình. Ngược lại, mạng đồ thị ST-GCN tăng độ phức tạp tuyến tính theo số lượng người và cực kỳ nhạy cảm với nhiễu tọa độ keypoint khi học sinh bị che khuất một phần thân thể.

Mô hình hoạt động như thế nào trong điều kiện ánh sáng yếu hoặc camera mờ? Nhờ bước tiền xử lý chuyển đổi hình ảnh sang bản đồ nhiệt khung xương 17 điểm mốc của HRNet, mô hình không phụ thuộc vào độ sáng hay màu sắc nền. Thử nghiệm trên tập dữ liệu RWF-2000 với 2000 video camera giám sát ban đêm cho thấy mô hình vẫn duy trì độ chính xác trên 90%.

Thuật toán YOLOX đóng góp vai trò gì trong toàn bộ pipeline hệ thống? YOLOX đóng vai trò phát hiện người ở giai đoạn đầu với cơ chế anchor-free và decoupled head. Thuật toán này giúp loại bỏ trên 35% các bounding box chồng chéo, tăng tốc độ xử lý khung hình và cung cấp tọa độ chuẩn xác để mô hình HRNet trích xuất khung xương mà không bị trễ thời gian.

Cần cấu hình phần cứng như thế nào để vận hành hệ thống trong thực tế? Mô hình được tối ưu hóa thông qua cơ chế lấy mẫu 32 khung hình nhiệt, chỉ yêu cầu GPU có dung lượng bộ nhớ từ 4GB VRAM (như dòng Nvidia GTX 1650 hoặc các chip AI biên) để xử lý luồng video giám sát 30 khung hình trên giây theo thời gian thực tại các điểm trường.

Kết luận

  • Luận văn đã đề xuất thành công mô hình học sâu kết hợp YOLOX, HRNet và mạng Two-Stream ConvLSTM để tự động phát hiện bạo lực học đường từ video camera giám sát.
  • Phương pháp biểu diễn 3D Limb Pseudo Heatmap giúp triệt tiêu hoàn toàn ảnh hưởng của nền tĩnh, giải quyết xuất sắc bài toán tương tác phức tạp của nhóm dưới 7 người.
  • Kết quả thực nghiệm trên 5 bộ dữ liệu tiêu chuẩn với hơn 5.500 video khẳng định độ chính xác vượt trội, đạt mức xấp xỉ 98% trên tập dữ liệu Hockey Fight.
  • Công trình cung cấp giải pháp công nghệ khả thi, sẵn sàng tích hợp vào hạ tầng an ninh trường học nhằm giảm tải 80% công tác giám sát thủ công.
  • Nghiên cứu đóng góp thiết thực vào việc thực thi Nghị định 80/2017/NĐ-CP, hướng đến mục tiêu kiến tạo môi trường học đường an toàn, không bạo lực.

Lộ trình phát triển tiếp theo trong 6 tháng tới tập trung vào việc lượng tử hóa mô hình để tích hợp trực tiếp lên camera thông minh và kết hợp phân tích tín hiệu âm thanh đa phương thức. Các cơ sở giáo dục, doanh nghiệp công nghệ và nhà nghiên cứu quan tâm có thể ứng dụng ngay khung kiến trúc này để nâng cao hiệu quả bảo vệ học đường.