Tổng quan nghiên cứu

Căn tin trường học tại Việt Nam thường xuyên đối mặt với áp lực phục vụ từ 500 đến hơn 1000 học sinh chỉ trong khoảng thời gian nghỉ giải lao ngắn ngủi từ 15 đến 20 phút hoặc từ 5 đến 10 phút chuyển tiết. Tại hầu hết các cơ sở giáo dục, quy mô phục vụ chỉ có từ 1 đến 2 quầy bán cùng lượng nhân sự giới hạn từ 2 đến 4 người. Phương thức vận hành truyền thống dựa hoàn toàn vào việc nhân viên quan sát khay đồ ăn bằng mắt thường rồi tính tiền thủ công. Cách làm này không chỉ gây ùn tắc nghiêm trọng tại quầy vào giờ cao điểm mà còn dễ phát sinh sai sót trong quá trình cộng dồn chi phí. Khác với các sản phẩm đóng gói sẵn ở siêu thị có in mã vạch, các món ăn chế biến sẵn như bánh mì, phở, bún hoặc hộp cơm đều không thể dán mã vạch hay quét mã QR một cách tiện lợi.

Trước thực trạng đó, nghiên cứu Luận văn Thạc sĩ chuyên ngành Công nghệ Thông tin tại Trường Đại học Bà Rịa – Vũng Tàu hoàn thành vào tháng 09 năm 2023 đã phát triển giải pháp thanh toán tự động các món ăn học đường thông qua công nghệ nhận dạng hình ảnh. Mục tiêu trọng tâm của đề tài là xây dựng hệ thống thị giác máy tính có khả năng nhận diện chính xác 5 nhóm thực phẩm phổ biến từ camera tĩnh và tự động xuất hóa đơn thanh toán tức thì. Nghiên cứu tiến hành thử nghiệm trên tập dữ liệu thực tế gồm 798 ảnh chụp khay thức ăn tại một trường trung học ở địa phương. Giải pháp mang lại ý nghĩa kinh tế và vận hành thiết thực khi giúp giảm thiểu trên 60% thời gian chờ đợi của học sinh, tối ưu hóa hơn 50% chi phí nhân sự phục vụ tại quầy và nâng cao chất lượng sinh hoạt học đường.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng dựa trên nền tảng của mạng nơ-ron tích chập (Convolutional Neural Network - CNN), kỹ thuật mô tả đặc trưng HOG (Histogram of Oriented Gradients) và mô hình phát hiện đối tượng tiên tiến YOLOv5. Về mặt kiến trúc, YOLOv5 sử dụng mạng xương sống CSPDarknet53 kết hợp các khối phần dư nhằm hạn chế triệt để hiện tượng suy giảm độ dốc khi đào tạo qua nhiều tầng sâu, đồng thời tích hợp mô-đun kim tự tháp không gian SPP để tổng hợp đặc trưng đa tỉ lệ. Phần cổ của mạng ứng dụng mô hình tổng hợp đường dẫn PAN (Path Aggregation Network) với hai luồng truyền dữ liệu từ trên xuống và từ dưới lên, giúp kết hợp chặt chẽ các đặc trưng không gian cục bộ với thông tin ngữ cảnh toàn cục.

Mô hình vận dụng các khái niệm đánh giá chuẩn mực gồm tỷ lệ vùng giao trên tổng vùng IoU (Intersection over Union), độ chuẩn xác Precision, độ bao phủ Recall và chỉ số độ chính xác trung bình mAP. Hàm mất mát tổng quát trong YOLOv5 được xác lập từ ba thành phần sai số bình phương: mất mát phân loại lớp, mất mát vị trí hộp chứa với hệ số tọa độ bằng 5, và mất mát độ tin cậy đối tượng với hệ số vùng nền bằng 0.5 nhằm tối đa hóa khả năng định vị vật thể trên từng lưới ô vuông.

Phương pháp nghiên cứu

Nghiên cứu sử dụng nguồn dữ liệu thực nghiệm gồm 798 ảnh tĩnh với độ phân giải chuẩn hóa 640x480 pixel, được thu thập trực tiếp qua camera tại căn tin một trường trung học trên địa bàn tỉnh Bà Rịa – Vũng Tàu. Phương pháp lấy mẫu là chọn mẫu có chủ đích kết hợp phân tầng theo 5 nhóm đối tượng thực phẩm chính: hộp thức ăn (cơm, bún, mì hộp), hộp sữa (Milo, Yomost), tô thức ăn (phở, bún, hủ tiếu), chai nước (Sting, Coca, Pepsi 500 ml) và bánh mì. Mẫu ảnh được thu thập đa dạng ở cả trạng thái từng món đơn lẻ lẫn khay thức ăn hoàn chỉnh dưới nhiều góc nghiêng từ 45 độ đến 90 độ.

Nhằm khắc phục tình trạng học quá khớp (overfitting), tác giả áp dụng kỹ thuật tăng cường dữ liệu (Data Augmentation) và chủ động chèn thêm khoảng 10% ảnh nhiễu không chứa vật thể mục tiêu vào tập dữ liệu huấn luyện. Tác giả lựa chọn mô hình YOLOv5 thay vì các biến thể phức tạp như Faster R-CNN hay YOLOv8 vì mô hình này tối ưu hóa xuất sắc giữa độ chính xác nhận diện và tốc độ xử lý thời gian thực dưới 0.1 giây mỗi ảnh, hoàn toàn tương thích với phần cứng máy tính phổ thông tại các trường học.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình huấn luyện và thử nghiệm trên bộ dữ liệu 798 hình ảnh mang lại nhiều phát hiện có giá trị khoa học và thực tiễn cao. Thứ nhất, mô hình YOLOv5 nhận dạng chính xác toàn bộ 5 nhóm món ăn, trong đó các đối tượng có hình dạng chuẩn mực như chai nước 500 ml và hộp sữa đạt độ chuẩn xác Precision vượt mức 95%. Thứ hai, chỉ số mAP trung bình của hệ thống đạt mức trên 90% ở ngưỡng IoU tiêu chuẩn 0.5, chứng minh độ trùng khớp cao giữa hộp bao dự đoán và nhãn thực tế.

Thứ ba, khi thử nghiệm camera thời gian thực trên khay thức ăn chứa từ 3 đến 4 món cùng lúc, tốc độ xử lý của mô hình đạt mức ấn tượng từ 30 đến 45 khung hình mỗi giây (fps). Tốc độ này nhanh hơn từ 3 đến 5 lần so với các kiến trúc hai giai đoạn như Faster R-CNN. Thứ tư, việc bổ sung ảnh nhiễu đã giúp giảm tỷ lệ nhận diện sai đối với các đồ vật nằm ngoài danh mục xuống mức dưới 4.5%, duy trì tính ổn định vượt trội khi vận hành thực tế.

Thảo luận kết quả

Các kết quả thực nghiệm chứng minh tính khả thi vượt bậc của việc ứng dụng thị giác máy tính vào khâu thanh toán tự động. Dữ liệu huấn luyện được biểu diễn trực quan qua đồ thị đường cong Precision-Recall và F1-Confidence, cho thấy độ dốc duy trì trạng thái ổn định ở mức độ tin cậy từ 0.6 đến 0.8 mà không xảy ra hiện tượng dao động mạnh. Kết quả từ ma trận nhầm lẫn (Confusion Matrix) và bảng đối chiếu đơn giá ghi nhận tỷ lệ phân loại nhầm giữa nhóm hộp thức ăn và bánh mì chỉ chiếm khoảng 2.8%, chủ yếu do góc chụp bị sấp bóng hoặc bao bì bị che khuất một phần.

Nguyên nhân dẫn đến một số sai số nhỏ được xác định là do sự chồng lấn vật thể khi học sinh đặt đè các món ăn lên nhau, kết hợp hiện tượng khúc xạ ánh sáng trên vỏ chai nhựa trong suốt. So với các công trình nghiên cứu thị giác máy tính trước đây tại Việt Nam vốn chủ yếu tập trung vào điểm danh khuôn mặt hay giám sát giao thông, nghiên cứu này đã tạo ra bước tiến mới khi giải quyết thành công bài toán nhận dạng vật thể không có mã định danh trong môi trường căn tin học đường.

Đề xuất và khuyến nghị

Để đưa mô hình nhận dạng hình ảnh vào ứng dụng thực tế đồng bộ và hiệu quả, nghiên cứu đề xuất 4 giải pháp chiến lược:

  1. Chuẩn hóa góc quay camera và nguồn sáng cố định: Ban quản lý căn tin phối hợp với bộ phận kỹ thuật tiến hành lắp đặt hệ thống khung camera cố định chiếu vuông góc 90 độ từ trên xuống khay ăn, kết hợp đèn LED chiếu sáng chống lóa. Mục tiêu nâng tỷ lệ nhận diện khay thức ăn chính xác lên trên 98%, hoàn thành lắp đặt trong thời gian từ 1 đến 2 tháng.

  2. Mở rộng tập dữ liệu huấn luyện đa dạng: Nhóm phát triển phần mềm cần thu thập bổ sung từ 1500 đến 2000 hình ảnh mới, bao gồm các món ăn theo mùa, đồ uống dung tích nhỏ và các loại bao bì mới. Timeline thực hiện trong 3 tháng nhằm giúp mô hình nhận diện linh hoạt hơn 20 loại mặt hàng mở rộng mà không làm giảm tốc độ xử lý.

  3. Tích hợp thanh toán số và thẻ học sinh thông minh: Nhà trường chủ trì liên kết với các đơn vị ví điện tử để tích hợp cổng quét mã QR động hoặc đầu đọc thẻ từ NFC ngay cạnh màn hình nhận dạng. Giải pháp hướng tới mục tiêu rút ngắn toàn bộ thời gian nhận diện và trừ tiền xuống dưới 5 giây mỗi lượt, hoàn tất thử nghiệm trong 6 tháng.

  4. Ứng dụng mô hình tính toán biên Edge AI: Kỹ sư hệ thống cần tối ưu hóa mô hình mạng nơ-ron để nhúng trực tiếp vào các vi xử lý nhỏ gọn như Raspberry Pi hoặc Jetson Nano. Kế hoạch triển khai trong 4 tháng giúp giảm hơn 80% lưu lượng băng thông truyền tải mạng nội bộ và tiết kiệm 40% chi phí đầu tư thiết bị cho mỗi điểm bán.

Đối tượng nên tham khảo luận văn

Luận văn cung cấp nhiều hàm ý thực tiễn và giá trị học thuật sâu sắc cho 4 nhóm đối tượng:

  1. Ban giám hiệu và đơn vị quản trị căn tin trường học: Cung cấp giải pháp công nghệ tự động hóa khâu thu ngân, loại bỏ tình trạng ùn ứ giờ nghỉ và kiểm soát doanh thu minh bạch cho quy mô từ 500 đến hàng nghìn học sinh.

  2. Học viên cao học và sinh viên ngành Công nghệ Thông tin, Khoa học Máy tính: Cung cấp tài liệu tham khảo chi tiết về quy trình gán nhãn dữ liệu thực tế, kỹ thuật tối ưu hóa siêu tham số YOLOv5 và phương pháp xử lý hàm mất mát bounding box.

  3. Kỹ sư phần mềm và chuyên gia thị giác máy tính: Cung cấp kiến trúc đường ống xử lý ảnh hoàn chỉnh để xây dựng các ứng dụng kiểm đếm sản phẩm tự động, nhận diện mặt hàng không có mã vạch cho chuỗi bán lẻ và dịch vụ F&B.

  4. Các doanh nghiệp cung cấp giải pháp chuyển đổi số học đường: Khai thác mô hình phân loại đa đối tượng theo thời gian thực để tích hợp vào các ki-ốt bán hàng tự động tại các trường học, nhà máy và bếp ăn tập thể.

Câu hỏi thường gặp

  1. Tại sao nghiên cứu lại ưu tiên sử dụng YOLOv5 thay vì Faster R-CNN hay YOLOv8? YOLOv5 đảm bảo sự cân bằng hoàn hảo giữa tốc độ xử lý thời gian thực từ 30 đến 45 khung hình mỗi giây và độ chính xác mAP đạt trên 90%. Mô hình có dung lượng nhẹ, dễ dàng triển khai mượt mà trên hệ thống máy tính văn phòng sẵn có tại trường học mà không đòi hỏi phần cứng GPU chuyên dụng đắt tiền.

  2. Tập dữ liệu 798 ảnh thu thập tại một trường học có đảm bảo tính tổng quát hóa không? Bộ dữ liệu gồm 798 ảnh gốc được chụp ở nhiều góc độ từ 45 đến 90 độ, sau đó được mở rộng thông qua kỹ thuật tăng cường dữ liệu và bổ sung 10% ảnh nhiễu môi trường. Nhờ đó, mô hình đạt độ chuẩn xác phân loại trên 92% trong các điều kiện ánh sáng thực tế.

  3. Hệ thống xử lý thế nào khi học sinh đặt các món ăn chồng lấn lên nhau trên khay? Khi diện tích tiếp xúc bị che khuất vượt quá 60%, thuật toán có thể phát sinh sai số. Hệ thống sẽ phát tín hiệu cảnh báo trên màn hình để học sinh tách nhẹ các món ăn trong khoảng 1 đến 2 giây trước khi camera kích hoạt chụp ảnh và chốt hóa đơn.

  4. Giải pháp này giúp tiết kiệm bao nhiêu thời gian phục vụ tại quầy căn tin? Hệ thống chỉ mất từ 0.1 đến 0.3 giây để nhận diện và tính tổng tiền cho khay gồm 3 đến 4 món ăn. Nhờ vậy, tổng thời gian thanh toán giảm từ hơn 45 giây xuống còn khoảng 10 giây mỗi học sinh, giúp cắt giảm hơn 60% thời gian xếp hàng chờ đợi.

  5. Cơ chế tính tổng tiền tự động cho 5 nhóm món ăn hoạt động như thế nào? Mô hình tự động phân loại các vật thể vào 5 nhóm định giá chuẩn lưu sẵn trong cơ sở dữ liệu. Khi các hộp bao được xác định với độ tin cậy trên 70%, phần mềm sẽ tự động nhân số lượng từng nhóm với đơn giá niêm yết và xuất tổng tiền hiển thị trực tiếp lên màn hình.

Kết luận

Luận văn Thạc sĩ của tác giả Phạm Tấn Tuân đã giải quyết triệt để bài toán thanh toán nhanh món ăn không dùng mã vạch tại căn tin trường học với những đóng góp nổi bật:

  • Xây dựng thành công bộ dữ liệu thực nghiệm 798 ảnh chuẩn hóa 640x480 pixel cho 5 nhóm món ăn học đường tiêu biểu.
  • Tinh chỉnh mô hình học sâu YOLOv5 đạt độ chính xác mAP trên 90% cùng tốc độ xử lý thời gian thực từ 30 đến 45 khung hình mỗi giây.
  • Thiết lập quy trình tự động xuất hóa đơn tính tiền tức thì, cắt giảm hơn 60% thời gian chờ đợi trong các khung giờ cao điểm 15 đến 20 phút.
  • Hạn chế tối đa tình trạng nhận diện nhầm với tỷ lệ sai sót dưới 4.5% nhờ việc bổ sung mẫu ảnh nhiễu và tối ưu hóa hàm mất mát.
  • Đề xuất lộ trình tích hợp cổng thanh toán không tiền mặt và triển khai trên thiết bị Edge AI trong vòng 6 tháng tới.

Hãy tham khảo và ứng dụng ngay giải pháp nhận dạng thông minh này để hiện đại hóa hệ thống quản lý và nâng tầm trải nghiệm dịch vụ căn tin của bạn ngay hôm nay!