MỞ ĐẦU 1. Tính cấp thiết của nghiên cứu Võ cổ truyền là một môn thể thao, nghệ thuật thể hiện bản sắc dân tộc. Võ thuật giúp rèn luyện sức khỏe, tự vệ cho con người của mỗi dân tộc, mỗi đất nước. Võ cổ truyền đã có từ lâu đời với mỗi quốc gia, đồng thời gắn liền với lịch sử dựng nước và giữ nước [12]; Như võ cổ truyền Bình Định của Việt Nam [8]; Võ Judo, Karate, Kendo, Kyudo của người Nhật Bản [9]; Võ Kung Fu, TaiChi của người Trung Quốc [10].
Để bảo tồn và duy trì các bài võ cổ truyền đặc sắc và có giá trị văn hóa là một vấn đề quan trọng đối với các nhà quản lý, quốc gia [6], [8], [11]. Trước kia việc lưu trữ là truyền miệng, qua các hình vẽ các thế võ liên tục và đời trước dạy cho đời sau, nên các thế võ có thể bị biến tướng và không chuẩn xác. Ngày nay, việc ghi lại thành các video để lưu trữ là một hướng tiếp cận tốt. Ở Việt Nam từ năm 2016, các bài võ cổ truyền được đưa vào giảng dạy trong các trường phô thông để rèn luyện sức khỏe và tự vệ cho các em học sinh.
Nên việc xây dựng một mô hình chấm điểm các bài võ được truyền dạy trên lớp là điều cần thiết. Các mô hình này giúp học sinh phổ thông tự đánh giá các tư thế võ trong bài võ mà không cần phải nhờ đến các võ sư tại các võ đường. Tuy nhiên, các thế võ là các hành động nhanh, khó, quay bốn hướng mà các thiết bị ghi hình thường chỉ nằm ở một vị trí nên có nhiều tư thế bị che khuất. Nên thường để lưu giữ các bài võ thì phải quay từ nhiều góc khác nhau hoặc quay bằng nhiều camera đặt từ nhiều hướng.
Để bảo tồn, truyền, dạy các thế võ một cách trực quan thì việc phát hiện, ước lượng các thế võ ở các cảnh bị che khuất là việc làm cần thiết. Đồng thời xây dựng môi trường 3-D để trực quan hóa việc đào tạo và dạy võ cổ truyền là một vấn đề cần thiết để giảm thời gian, chi phí, công sức của các võ sư. Đặc biệt là tăng tính tự giác chủ động trong tập luyện và đánh giá luyện tập của các học sinh phổ thông. Để thu thập được các video phục vụ cho việc bảo tồn và duy trì các thế võ người ta thường sử dụng các cảm biến hình ảnh như các loại camera gắn trên các điện thoại thông minh, hay các loại camera chuyên dụng.
Đặc biệt, để xây dựng được khung cảnh (môi trường) 3-D về các tư thế võ người ta thường sử dụng các cảm biến có ảnh độ sâu như Kinect phiên bản 1 (Version 1 - V1), Kinect phiên bản 2 (Version 2 - V2), Real scene D435, vv. Trong đó, cảm biến Kinect V1 là một loại cảm biến rẻ tiền (giá ngoài thị trường chỉ khoảng 1 triệu Việt Nam đồng - 40 USD) như Hình 1 và chất lượng ảnh màu, ảnh độ sâu của cảm biến này là chấp nhận được. Với giá thành rẻ như vậy phù hợp với túi tiền của người Việt Nam và khả năng phổ dụng của loại cảm biến này là cao hơn so với các cảm biến khác. Cảm biến MS Kinect cũng có thể thu thập được dữ 1 luan an Hình 1 Cảm biến MS Kinect phiên bản 1.
Hình 2 Minh họa dữ liệu khung xương thu được từ cảm biến MS Kinect phiên bản 1 [36]. liệu khung xương các tư thế của con người như Hình 2. Tuy nhiên, dữ liệu khung xương thu được từ cảm biến MS Kinect v1 là bị mất rất nhiều. Như trong nghiên cứu của Wang và các cộng sự [37] đã cho thấy sự sai khác và thiếu dữ liệu rất lớn giữa cảm biến MS Kinect v1 và MS Kinect v2.
Do đó trước khi thực hiện xây dựng các mô hình đánh giá và chấm điểm các động tác võ được truyền dạy trên lớp thì cần thực hiện các nghiên cứu về ước lượng, khôi phục khung xương của người trong các video võ thuật cổ truyền. Trong nhiều năm trở lại đây có rất nhiều nghiên cứu về ước lượng các khớp xương, hành động trên cơ thể người trên một ảnh màu, ảnh độ sâu hoặc trên một chuỗi ảnh. Hầu hết các nghiên cứu đều sử dụng việc học các đặc trưng trên ảnh màu, độ sâu để học mô hình người, các hành động của người và sử dụng các bộ phân lớp cho việc dự đoán. Trước đây thì thường sử dụng các bộ phân lớp như SVM (Support Vector Machine) [39], Random decision forests (RDF) [40] cho việc học và dự đoán các khớp 2 luan an trên cơ thể người.
Ngày nay với sự phát triển mạnh mẽ của học sâu (Deep Learning) thì có rất nhiều mạng được thiết kế cho việc ước lượng các khớp xương trên cơ thể người [41], [48]. Dữ liệu thu được từ cảm biến Kinect v1 bao gồm ảnh màu và ảnh độ sâu, nếu thực hiện ước lượng các điểm đại diện và các khớp xương trên ảnh màu thì có rất nhiều trường hợp các khớp xương bị che khuất không thể ước lượng được. Khi thực hiện ước lượng trên ảnh độ sâu thì có một số trường hợp dữ liệu ảnh độ sâu bị thiếu hoặc mất dữ liệu nên cũng có nhiều điểm đại diện và khớp nối không ước lượng được. Tuy nhiên trên ảnh độ sâu chứa thông tin trong không gian thực (giá trị độ sâu) của người nên có thể ước lượng được các khớp xương trong trường hợp bị che khuất.
Nên luận án thực hiện kết hợp kết quả ước lượng trên ảnh màu và chiếu kết quả ước lượng vào không gian 3-D để có được kết quả ước lượng các điểm đại diện và các khớp xương cao hơn. Đặc biệt, khi ước lượng khung xương, tư thế người trong không gian 3-D có thể ước lượng được các khớp xương bị che khuất do dữ liệu thu được một phía nhìn thấy của người. Từ khớp xương đầy đủ có thể thể hiện được đầy đủ các động tác võ trong các video võ cổ truyền. Đây là một bước quan trọng trong việc tái tạo và ghi lại các tư thế võ cổ truyền của các võ sư và thực hành các động tác được truyền dạy của các em học sinh phổ thông.
Trong đó hệ thống chấm điểm các động tác võ cũng là một ứng dụng quan trọng trong việc đánh giá việc biểu diễn các tư thế, động tác võ đúng và chuẩn hay không. Trong võ thuật thì việc thể hiện đúng và chuẩn làm cho võ thuật phát huy được hết sức mạnh: tấn công mạnh, phòng thủ chắc chắn (như Hình 3 thể hiện việc dạy võ cổ truyền tại võ đường Nguyễn Thanh Vũ, thành phố Quy Nhơn, tỉnh Bình Định, Việt Nam). Các phương thức ước lượng khung xương, tư thế người trên ảnh màu và không gian 3-D gần đây thường sử dụng các mạng Nơ ron tích chập mới hiện nay cho việc huấn luyện mô hình ước lượng. Các kết quả được đánh giá trên cơ sở dữ liệu về các tư thế võ cổ truyền của Nhật Bản (Karate) và Trung Quốc (Tai Chi).
Đặc biệt, luận án cũng công bố bộ cơ sở dữ liệu về các thế võ cổ truyền Việt Nam do các em học sinh phổ thông biểu diễn và đánh giá các kết quả ước lượng các điểm đại diện và khớp xương trên cơ sở dữ liệu này trong không gian 2-D và 3-D để xây dựng hệ thống bảo tồn, giảng dạy, đánh giá các bài võ cổ truyền Việt Nam trực quan. Tóm lại, luận án tập trung cải tiến kết quả ước lượng các điểm đại diện và các khớp xương trong các trường hợp bị che khuất khi chỉ sử dụng một cảm biến MS Kinect v1 để thu thập dữ liệu từ môi trường. Kết quả này là sự kết hợp của mô hình ước lượng tốt trên không gian ảnh 2-D và ánh xạ trong môi trường 3-D để nâng cao kết quả ước lượng. Đây chính là ý tưởng trong luận án này, trong mô hình xây dựng ứng dụng của luận án bao gồm một số bước: (1) Từ dữ liệu đầu vào thu được từ cảm biến MS Kinect (ảnh màu, ảnh độ sâu); (2) Sử dụng các mạng nơ ron tích chập đã được thiết kế để 3 luan an Hình 3 Một lớp dạy võ cổ truyền tại thành phố Quy Nhơn, tỉnh Bình Định, Việt Nam.
huấn luyện mô hình ước lượng trên ảnh màu và ảnh độ sâu; (3) Kết hợp kết quả ước lượng trong không gian 2-D và 3-D, biểu diễn kết quả trong không gian 3-D, trong đó các khớp xương của người trong video được ước lượng và khôi phục đầu đủ; (4) từ đó xây dựng mô hình chấm điểm các động tác võ cổ truyền áp dụng cho các em học sinh phổ thông có thể tự đánh giá bài võ của mình. Trong đó bước (2) là bước quan trọng nhất trong mô hình này. Mục tiêu, đối tượng, phương pháp và phạm vi nghiên cứu Mục tiêu của luận án: - Đề xuất hướng tiếp cận để ước lượng và phục hồi khung xương trong không gian 3-D và để xây dựng một hệ thống tái tạo môi trường 3-D của các video biểu diễn võ thuật và ước lượng khung xương, tư thế của người trong video. Phương thức này được kết hợp giữa ước lượng các điểm đại diện và các khớp nối trên ảnh màu (không gian 2-D) và ước lượng trong không gian 3-D để có được kết quả ước lượng các khớp xương tốt, đặc biệt là khôi phục được các khớp xương trong trường hợp các bộ phận của người bị che khuất.
Khi có ước lượng khung xương trong không gian 3-D tốt có nghĩa là giá trị khoảng cách lỗi giữa các điểm đại diện trên khung xương ước lượng được và khung xương gốc nhỏ. Từ đó thể hiện chính xác tư thế của người trong các động tác võ. Mô hình ước lượng các điểm đại diện trên không gian 2-D được chọn từ nghiên cứu so sánh cho bài toán ước lượng các điểm đại diện trong không gian 2-D, sử dụng các mạng nơ ron tích chập và huấn luyện trên các bộ cơ sở dữ liệu chuẩn (benchmark). Đồng thời 4 luan an Hình 4 Khung xương, tư thế của người được ước lượng (các điểm màu xanh là các điểm xương và các khớp nối màu vàng) và môi trường được xây dựng lại trong không gian 3-D (thế giới thực).
việc ước lượng khung xương, tư thế người trong không gian 2-D, 3-D được đánh giá trên bộ cơ sở dữ liệu đã công bố về võ cổ truyền của nước ngoài và võ cổ truyền Việt Nam thu thập được. Hình 4 thể hiện mô hình khung xương, tư thế của người trong video biểu diễn võ thuật được ước lượng và dựng lại môi trường trong không gian 3-D (trong thế giới thực).