Giới thiệu dự án
Theo thống kê từ Tổ chức Y tế Thế giới (WHO), té ngã là nguyên nhân gây tử vong do thương tích không chủ ý đứng thứ hai trên toàn cầu, cướp đi sinh mạng của khoảng 684.000 người mỗi năm. Trong bối cảnh già hóa dân số thế giới đang diễn ra nhanh chóng—dự kiến đến năm 2030, cứ 6 người sẽ có 1 người từ 60 tuổi trở lên (tương đương 1,4 tỷ người)—nguy cơ chấn thương nghiêm trọng và tử vong do té ngã ở người cao tuổi đang tạo ra gánh nặng y tế khổng lồ. Việc phát hiện kịp thời các sự cố té ngã đóng vai trò sống còn để giảm thiểu biến chứng "nằm lâu sau ngã" (long-lie period) và tiết kiệm chi phí điều trị khẩn cấp.
Mặc dù các giải pháp phát hiện té ngã đã được nghiên cứu từ năm 1996, các phương pháp truyền thống vẫn bộc lộ nhiều điểm nghẽn nghiêm trọng:
- Cảm biến đeo (Wearable sensors): Gây cảm giác vướng víu, phụ thuộc vào dung lượng pin và thường bị người già quên mang theo.
- Cảm biến thị giác truyền thống (Visual sensors via Cloud): Tiêu tốn băng thông lớn, tiềm ẩn nguy cơ rò rỉ hình ảnh riêng tư và độ trễ mạng cao.
- Mô hình học sâu cồng kềnh: Yêu cầu phần cứng đắt đỏ, khó triển khai trên các thiết bị nhúng tại chỗ.
Đề tài "Xây dựng ứng dụng phát hiện cú ngã dựa trên thuật toán phân tích tư thế" (Fall Detection Application Development Based on Pose Detection Algorithm) do nhóm nghiên cứu thuộc Trường Đại học Công nghệ Thông tin – ĐHQG-HCM thực hiện nhằm giải quyết trực diện các vấn đề trên. Giải pháp cốt lõi là kết hợp mô hình ước lượng tư thế người 2D (Human Pose Estimation - HPE) với hệ thống luật quyết định hình học không gian (Geometric Threshold-based Logic), cho phép hệ thống chạy thời gian thực trực tiếp trên trình duyệt hoặc thiết bị biên mà không cần truyền video thô ra ngoài internet.
QUY TRÌNH PHÁT HIỆN TÉ NGÃ CỦA ĐỒ ÁN
[Bộ 3 Điều kiện Hình học]
[Cảnh báo té ngã thời gian thực]
Mục tiêu cụ thể của dự án:
- Nghiên cứu, đánh giá và so sánh thực nghiệm hai mô hình ước lượng tư thế mã nguồn mở tiêu biểu: OpenPose (tiếp cận Bottom-up đa người) và MoveNet (tiếp cận Bottom-up đơn người siêu nhẹ từ Google).
- Xây dựng bộ quy tắc phát hiện cú ngã tối ưu dựa trên biến thiên tọa độ 17-25 trọng điểm cơ thể (keypoints), bao gồm: vận tốc rơi của trọng tâm hông ($v$), góc nghiêng thân người so với mặt đất ($\theta_t$) và tỷ lệ co giãn khung bao ($P$).
- Kiểm thử và đánh giá độc lập độ tin cậy trên hai bộ dữ liệu chuẩn quốc tế: UR Fall Detection và Charfi2012.
- Triển khai nguyên mẫu ứng dụng biên (Edge AI Application) hoạt động thời gian thực ($\ge 30\text{ FPS}$) trên nền tảng web với TensorFlow.js, bảo vệ tuyệt đối quyền riêng tư hình ảnh của người dùng.
Phạm vi và giới hạn:
- Phạm vi: Tập trung vào hệ thống cảm biến đơn thị giác (RGB Video) theo dõi một đối tượng chính trong khung hình tại các không gian trong nhà (nhà riêng, viện dưỡng lão, bệnh viện).
- Giới hạn: Chưa xử lý trường hợp nhiều người ngã đồng thời hoặc đối tượng bị che khuất hoàn toàn (full occlusion) trong thời gian dài.
Phân tích và thiết kế giải pháp
Phân tích hiện trạng
Các kỹ thuật phát hiện té ngã hiện nay được phân chia thành ba nhóm chính, mỗi nhóm có ưu và nhược điểm riêng:
| Phương pháp |
Công nghệ cốt lõi |
Ưu điểm |
Nhược điểm |
Chi phí triển khai |
| Cảm biến đeo (Wearable) |
Gia tốc kế (Accelerometer), Con quay hồi chuyển (Gyroscope) |
Chi phí thiết bị rẻ, không phụ thuộc vào góc nhìn camera |
Người dùng hay quên đeo, pin yếu, dễ báo động giả khi rơi thiết bị |
Thấp (~$30 - $100/người) |
| Cảm biến môi trường (Ambient) |
Cảm biến áp suất sàn, cảm biến radar Doppler/Sóng vô tuyến |
Không xâm phạm thị giác, hoàn toàn thụ động |
Vùng hoạt động hạn chế, chi phí lắp đặt hạ tầng cao, nhiễu do vật nuôi |
Rất cao ($1.000 - $5.000/phòng) |
| Thị giác máy tính đám mây (Cloud Vision) |
Stream video RGB/Depth gửi về Server phân tích 3D CNN |
Độ chính xác cao, trích xuất được hành động phức tạp |
Băng thông lớn, nguy cơ lộ hình ảnh riêng tư, độ trễ mạng cao |
Cao (Phí duy trì server GPU định kỳ) |
| Ước lượng tư thế tại biên (Đề xuất) |
MoveNet / OpenPose trích xuất 2D Keypoints + Rule Engine |
Bảo mật tuyệt đối (chỉ lưu tọa độ), tốc độ cao (50+ FPS), phần cứng phổ thông |
Nhạy cảm với góc đặt camera quá hẹp hoặc ánh sáng quá tối |
Tối ưu (Tận dụng camera IP và PC sẵn có) |
Phân tích yêu cầu theo mô hình MoSCoW
- Must have (Bắt buộc): Trích xuất tọa độ trọng điểm thời gian thực ($\ge 25\text{ FPS}$); phát hiện cú ngã dựa trên vận tốc rơi trọng tâm và góc nghiêng; giao diện cảnh báo tức thời tại chỗ.
- Should have (Nên có): Chạy độc lập trên trình duyệt web thông qua WebGL/WASM; tự động tương thích với các độ phân giải và tốc độ khung hình (FPS) khác nhau của camera.
- Could have (Có thể có): Hỗ trợ xuất nhật ký sự kiện dạng JSON phục vụ giám sát y tế; bộ lọc làm mượt dữ liệu trọng điểm (Savitzky-Golay hoặc Kalman Filter).
- Won't have (Chưa hỗ trợ): Phân tích 3D Mesh cơ thể người; nhận dạng danh tính khuôn mặt đối tượng.
Thiết kế hệ thống
Kiến trúc hệ thống được thiết kế theo mô hình xử lý biên phân lớp, đảm bảo không có bất kỳ luồng dữ liệu hình ảnh thô nào bị phát tán qua môi trường internet:
Technology Stack chi tiết
- Ngôn ngữ lập trình: Python 3.8+ (Thực nghiệm và xử lý dữ liệu), JavaScript/TypeScript (Giao diện Web/Client).
- Framework Học máy:
TensorFlow 2.8.0 / TensorFlow.js 3.18.0 (Tối ưu hóa chạy trên WebGL backend).
MoveNet Lightning v4 (Kích thước đầu vào $192 \times 192$, độ trễ $\approx 15-20\text{ ms}$).
OpenPose v1.7.0 (Caffe model, CUDA 11.2, cuDNN 8.1.1).
- Thư viện thị giác máy tính:
OpenCV 4.5.5 (Trích xuất khung hình, định dạng luồng video).
- Kiến trúc dữ liệu: Xử lý luồng phi trạng thái (Stateless stream) kết hợp cửa sổ trượt thời gian (Sliding window $N=5$ khung hình).
+---------------------------------------------------------------+
| SYSTEM TECH STACK |
+---------------------------------------------------------------+
| UI / Client: JavaScript / HTML5 Canvas / Tailwind CSS |
| Edge ML Engine: TensorFlow.js v3.18.0 (WebGL Acceleration) |
| HPE Models: MoveNet Lightning v4 / OpenPose v1.7.0 |
| Backend / Dev: Python 3.8+, OpenCV 4.5.5, NumPy 1.21.5 |
| Compute Platform: NVIDIA CUDA 11.2 / Intel UHD Graphics |
+---------------------------------------------------------------+
Implementation và kết quả
Thuật toán cốt lõi và hiện thực mã nguồn
Quy trình phát hiện ngã tính toán song song 3 tham số hình học từ tọa độ điểm khớp người trong từng khung hình:
-
Vận tốc rơi trọng tâm hông ($v$):
Đại diện cho sự suy giảm đột ngột độ cao cơ thể. Trọng tâm hông $y_{\text{hip}}$ là trung điểm giữa hông trái (left_hip) và hông phải (right_hip). Vận tốc $v$ giữa hai thời điểm $t_1$ và $t_2$ (cách nhau 5 khung hình) được chuẩn hóa theo tỷ lệ khung hình:
$$v = \frac{|y_{t2} - y_{t1}|}{\Delta t} = \frac{|y_{t2} - y_{t1}|}{\frac{5}{\text{FPS}}} \quad (\text{pixel/giây hoặc mét/giây})$$
Ngưỡng kích hoạt: $v > v_{\text{critical}}$ (Thực nghiệm: $v > 0.009\text{ m/s}$ sau khi quy đổi).
-
Góc giữa trục thân người và mặt phẳng đất ($\theta_t$):
Đường tâm cơ thể nối từ mũi/đầu $s_0(x_0, y_0)$ đến trung điểm hai mắt cá chân $s_t(x_t, y_t)$:
$$\theta_t = \arctan \left( \left| \frac{y_{t0} - y_t}{x_{t0} - x_t} \right| \right) \times \frac{180^\circ}{\pi}$$
Ngưỡng kích hoạt: $\theta_t < 45^\circ$ (Cơ thể chuyển từ phương thẳng đứng sang phương ngang).
-
Tỷ lệ chiều rộng / chiều cao của Bounding Box ($P$):
Được xác định bởi cực trị tọa độ của tất cả các trọng điểm có độ tin cậy $score \ge 0.3$:
$$P = \frac{x_{\max} - x_{\min}}{y_{\max} - y_{\min}}$$
Ngưỡng kích hoạt: $P > 1.0$ (Chiều rộng khung bao lớn hơn chiều cao).
Code Snippet: Logic phân tích cú ngã (Python Engine)
import numpy as np
class FallDetectionEngine:
def __init__(self, fps=30, v_thresh=0.009, angle_thresh=45.0, aspect_ratio_thresh=1.0):
self.fps = fps
self.v_thresh = v_thresh
self.angle_thresh = angle_thresh
self.aspect_ratio_thresh = aspect_ratio_thresh
self.hip_history = [] # Lưu lịch sử tọa độ trục y của hông
def compute_fall_state(self, keypoints, frame_idx):
"""
keypoints: Dict chứa tọa độ {name: (x, y, score)}
MoveNet format: 0: nose, 11: left_hip, 12: right_hip, 15: left_ankle, 16: right_ankle
"""
# 1. Trích xuất trung điểm hông
left_hip = keypoints.get('left_hip')
right_hip = keypoints.get('right_hip')
if not left_hip or not right_hip:
return False, "Insufficient Keypoints"
y_hip = (left_hip[1] + right_hip[1]) / 2.0
self.hip_history.append((frame_idx, y_hip))
# 2. Điều kiện 1: Tính vận tốc rơi hông (Cửa sổ 5 khung hình)
cond1_velocity = False
if len(self.hip_history) >= 5:
f_prev, y_prev = self.hip_history[-5]
delta_t = (frame_idx - f_prev) / self.fps
velocity = abs(y_hip - y_prev) / delta_t
if velocity > self.v_thresh:
cond1_velocity = True
# 3. Điều kiện 2: Tính góc nghiêng thân người (Đầu - Mắt cá chân)
cond2_angle = False
nose = keypoints.get('nose')
l_ankle = keypoints.get('left_ankle')
r_ankle = keypoints.get('right_ankle')
if nose and l_ankle and r_ankle:
x_ankle = (l_ankle[0] + r_ankle[0]) / 2.0
y_ankle = (l_ankle[1] + r_ankle[1]) / 2.0
dx = abs(nose[0] - x_ankle)
dy = abs(nose[1] - y_ankle)
angle_rad = np.arctan2(dy, dx)
angle_deg = np.degrees(angle_rad)
if angle_deg < self.angle_thresh:
cond2_angle = True
# 4. Điều kiện 3: Tỷ lệ co giãn Bounding Box
cond3_aspect_ratio = False
valid_coords = [np.array([kp[0], kp[1]]) for kp in keypoints.values() if kp[2] > 0.2]
if len(valid_coords) >= 5:
coords = np.array(valid_coords)
w = np.max(coords[:, 0]) - np.min(coords[:, 0])
h = np.max(coords[:, 1]) - np.min(coords[:, 1])
aspect_ratio = w / (h + 1e-6)
if aspect_ratio > self.aspect_ratio_thresh:
cond3_aspect_ratio = True
# Quyết định ngã khi cả 3 điều kiện đồng thời thỏa mãn
is_fall = cond1_velocity and cond2_angle and cond3_aspect_ratio
return is_fall, {"v": cond1_velocity, "angle": cond2_angle, "ratio": cond3_aspect_ratio}
Testing và validation
Nghiên cứu tiến hành đánh giá chéo trên hai bộ dữ liệu thực nghiệm chuẩn gồm:
- UR Fall Detection Dataset: 70 video (30 chuỗi hành động té ngã, 40 hoạt động thường nhật như ngồi ghế, cúi nhặt đồ, đi bộ) ghi hình ở 30 FPS.
- Charfi2012 Dataset: 220 video (143 video té ngã phức tạp trong quán cà phê, văn phòng, nhà riêng; 79 video hoạt động thường ngày) ghi hình ở 24 FPS với nhiều góc quay và điều kiện ánh sáng thay đổi.
KẾT QUẢ HIỆU NĂNG TỔNG QUAN
OpenPose v1.7.0 MoveNet Lightning
Bảng kết quả thử nghiệm so sánh hiệu năng
| Mô hình HPE tích hợp |
Bộ dữ liệu thử nghiệm |
Độ chính xác (Accuracy) |
Độ nhạy (Sensitivity / Recall) |
Độ đặc hiệu (Specificity) |
Tốc độ xử lý (FPS trên GPU) |
| OpenPose |
UR Fall Detection |
71.43% |
73.33% |
70.00% |
22 FPS (GTX 1080Ti) |
| OpenPose |
Charfi2012 |
66.82% |
68.53% |
63.75% |
22 FPS (GTX 1080Ti) |
| OpenPose (Trung bình) |
Tổng hợp (290 video) |
68.04% |
69.94% |
65.55% |
22 FPS |
| MoveNet Lightning |
UR Fall Detection |
74.28% |
76.67% |
72.50% |
53 FPS (RTX 2080Ti) |
| MoveNet Lightning |
Charfi2012 |
68.82% |
70.63% |
65.57% |
45+ FPS (Intel Iris Plus) |
| MoveNet (Trung bình) |
Tổng hợp (290 video) |
70.15% |
72.25% |
67.72% |
50+ FPS |
Ghi chú đánh giá chất lượng:
- $\text{Accuracy} = \frac{TP + TN}{TP + FP + TN + FN}$
- $\text{Sensitivity (Độ nhạy)} = \frac{TP}{TP + FN}$ (Ưu tiên số một trong y tế nhằm giảm thiểu tối đa bỏ sót ca ngã - False Negative).
- $\text{Specificity (Độ đặc hiệu)} = \frac{TN}{TN + FP}$
MA TRẬN NHẦM LẪN (CONFUSION MATRIX)
Thực tế: NGÃ Thực tế: KHÔNG NGÃ
Phân tích lỗi (Error Analysis)
Quá trình kiểm thử chỉ ra 3 nguyên nhân chính gây ra sai số dự đoán:
- Thiếu khung hình / Khung hình rỗng (Empty Frames): Khi đối tượng ngã sát sàn nhà hoặc nằm khuất sau bàn ghế, mô hình HPE không phát hiện được khớp thân dưới $\rightarrow$ Dẫn đến False Negative.
- Hành động tương đồng (False Positives): Các tư thế như nằm thư giãn trên sofa, hít đất hoặc ngồi bệt xuống sàn nhanh chóng dễ làm kích hoạt ngưỡng vận tốc và tỷ lệ khung bao.
- Méo phối cảnh (Perspective Distortion): Camera đặt ở góc nhìn từ trên xuống (Top-down view) làm giảm biên độ biến thiên của chiều cao $y$, khiến góc $\theta_t$ khó đạt ngưỡng $< 45^\circ$.
Đổi mới và đóng góp
Nghiên cứu mang lại những đóng góp khoa học và ứng dụng thực tiễn rõ rệt so với các công trình trước đây:
SO SÁNH ĐÓNG GÓP CỦA ĐỀ TÀI
Weiming Chen et al. [14] Đề tài tốt nghiệp (UIT)
- Tiên phong ứng dụng MoveNet vào bài toán phát hiện ngã tại biên: Trong khi các nghiên cứu trước (như Weiming Chen et al., 2020) chủ yếu phụ thuộc vào OpenPose với chi phí tính toán lớn (GPU 36ms, CPU >10.000ms), đồ án đã tích hợp thành công MoveNet Lightning. Mô hình đạt tốc độ vượt trội ($18.7\text{ ms}$ trên GPU phổ thông, $39\text{ ms}$ trên Intel UHD 620 Graphics tích hợp), giúp hệ thống hoạt động ổn định trên cả các máy tính văn phòng cấu hình yếu.
- Khắc phục lỗ hổng kiểm chuẩn dữ liệu: Thay vì chỉ đánh giá trên tập dữ liệu tự quay trong điều kiện lý tưởng (vốn thường đạt độ chính xác "ảo" $>95%$), nghiên cứu đã thực hiện kiểm chuẩn minh bạch trên 290 video chuẩn quốc tế đa kịch bản (UR Fall & Charfi2012), xác lập mốc đánh giá khách quan cho các hệ thống heuristic HPE.
- Bảo mật quyền riêng tư theo thiết kế (Privacy-by-Design): Toàn bộ quá trình suy luận diễn ra cục bộ trong trình duyệt qua WebGL. Video thô bị hủy ngay sau khi trích xuất 17 điểm tọa độ, giải quyết triệt để rào cản đạo đức và pháp lý khi lắp đặt camera giám sát trong phòng ngủ của người cao tuổi.
Ứng dụng thực tế và triển khai
Kịch bản sử dụng thực tế (Real-World Use Cases)
- Hệ thống giám sát phòng ngủ viện dưỡng lão: Camera góc rộng gắn tường kết nối với máy tính mini (như Intel NUC hoặc Raspberry Pi 4) chạy mô hình MoveNet TFLite/TensorFlow.js. Khi phát hiện té ngã, hệ thống kích hoạt chuông báo khẩn cấp tại phòng điều dưỡng trung tâm.
- Giải pháp bảo vệ người già đơn thân tại gia (Aging in Place): Ứng dụng Web chạy ngầm trên máy tính gia đình, tận dụng webcam sẵn có. Khi có sự cố, hệ thống tự động phát âm thanh cảnh báo lớn và gửi tín hiệu API nhẹ đến ứng dụng di động của người thân.
MÔ HÌNH TRIỂN KHAI THỰC TẾ
[Phòng người cao tuổi] [Trung tâm điều dưỡng / Người thân]
Phân tích hiệu quả kinh tế (ROI Analysis)
- Chi phí phần cứng: Giảm $70%$ so với việc trang bị hệ thống camera chuyên dụng tích hợp GPU rời; tận dụng được $100%$ camera IP chuẩn RTSP sẵn có.
- Chi phí hạ tầng mạng: Băng thông truyền dữ liệu giảm $99.9%$ do chỉ gửi bản tin tín hiệu cảnh báo (kích thước vài trăm bytes) thay vì stream video liên tục lên máy chủ đám mây.
- Thời gian hoàn vốn / Giá trị kinh tế: Ngăn ngừa nguy cơ nằm bất động lâu sau ngã, giúp giảm thời gian điều trị tích cực (ICU) trung bình từ 4-7 ngày xuống dưới 24 giờ, tiết kiệm hàng chục triệu đồng chi phí y tế cho mỗi ca sự cố.
Lộ trình triển khai hệ thống (Implementation Roadmap)
Giai đoạn 1 (Tháng 1-2): Khảo sát thực địa, chuẩn hóa góc quay camera (Góc chéo 45 độ, độ cao 2-2.5m).
Giai đoạn 2 (Tháng 3-4): Triển khai phần mềm Client Web/Electron chạy MoveNet Lightning trên thiết bị biên.
Giai đoạn 3 (Tháng 5): Kết nối Webhook cảnh báo với hệ thống tổng đài điều dưỡng nội bộ.
Giai đoạn 4 (Tháng 6+): Bảo trì, thu thập phản hồi và tinh chỉnh ngưỡng thích ứng theo từng phòng.
Hạn chế và hướng phát triển
Hạn chế kỹ thuật
- Độ chính xác còn phụ thuộc vào ánh sáng: MoveNet giảm độ tự tin trích xuất keypoints khi môi trường quá tối hoặc ngược sáng mạnh.
- Chưa phân biệt được các hoạt động nằm chủ động: Hành vi cố tình nằm xuống thảm tập yoga hoặc trượt nhẹ từ ghế xuống sàn đôi khi bị phân loại nhầm là té ngã do góc thân người nằm ngang.
- Hiện tượng mất dấu chi dưới (Occlusion): Nếu giường hoặc bàn che khuất hoàn toàn hai chân, thuật toán không thể tính toán chính xác tâm mắt cá chân để xác định góc $\theta_t$.
HƯỚNG PHÁT TRIỂN TƯƠNG LAI
Hướng phát triển đề xuất
- Tích hợp mô hình chuỗi thời gian (Spatio-Temporal Graph Convolutional Networks - ST-GCN hoặc LSTM): Thay thế bộ luật ngưỡng cứng bằng mạng nơ-ron học đặc trưng động học chuỗi khớp theo thời gian, giúp phân biệt rõ ràng giữa "ngã đột ngột" và "nằm xuống từ từ".
- Hỗ trợ camera cảm biến hồng ngoại/nhiệt ban đêm: Đảm bảo khả năng bảo vệ người già 24/7 mà không cần bật đèn phòng ngủ.
- Tự động cân chỉnh tham số theo góc đặt camera (Auto-Calibration): Sử dụng thuật toán ước lượng mặt sàn (Ground plane estimation) để tự động điều chỉnh ngưỡng góc $\theta_t$ và vận tốc $v$.
Đối tượng hưởng lợi
- Sinh viên & Nghiên cứu viên ngành CNTT/AI: Nắm bắt phương pháp luận nghiên cứu thị giác máy tính ứng dụng, hiểu rõ cách chuyển đổi các mô hình HPE kinh điển (OpenPose, MoveNet) sang bài toán phân loại hành vi thực tế kèm số liệu thực nghiệm chuẩn mực.
- Kỹ sư phát triển phần mềm (Developers): Nhận được mã nguồn mẫu hoàn chỉnh về tích hợp TensorFlow.js trên WebGL, kỹ thuật xử lý dữ liệu hình học từ tọa độ điểm khớp và giải pháp giải quyết bài toán độ trễ thời gian thực.
- Các viện dưỡng lão & Cơ sở y tế: Sở hữu phương án công nghệ khả thi, chi phí thấp, triển khai nhanh trên hạ tầng camera sẵn có để nâng cao chỉ số an toàn cho bệnh nhân cao tuổi.
- Cộng đồng & Gia đình có người già: Giải pháp an tâm giám sát người thân mà không xâm phạm đời tư cá nhân.
Câu hỏi thường gặp
1. Yêu cầu phần cứng tối thiểu để triển khai ứng dụng là gì?
Hệ thống sử dụng mô hình MoveNet Lightning rất nhẹ. Cấu hình tối thiểu chỉ cần:
- CPU: Intel Core i3 thế hệ 6 hoặc tương đương (hoặc Raspberry Pi 4 Model B 4GB).
- GPU: Card đồ họa tích hợp (Intel UHD 620/Iris Graphics) có hỗ trợ WebGL.
- Camera: Webcam chuẩn USB hoặc Camera IP độ phân giải HD 720p, tốc độ $\ge 24\text{ FPS}$.
2. Hệ thống xử lý thế nào khi có nhiều người cùng xuất hiện trong một khung hình?
Mô hình MoveNet Lightning được thiết kế tối ưu cho phát hiện tư thế một người trung tâm (Single-person). Khi có nhiều người, mô hình sẽ ưu tiên bắt trọng điểm của người có kích thước lớn nhất và gần trung tâm camera nhất. Để mở rộng giám sát đồng thời nhiều người trong phòng sinh hoạt chung, hệ thống có thể chuyển đổi sang kiến trúc MoveNet MultiPose hoặc YOLOv7-Pose với chi phí tính toán tăng thêm khoảng $35%$.
3. Dữ liệu video của người thân có bị tải lên máy chủ hoặc nguy cơ rò rỉ không?
Hoàn toàn không. Ứng dụng chạy theo kiến trúc biên (Edge Computing). Toàn bộ quá trình phân tích khung hình diễn ra trực tiếp trên RAM/VRAM của máy tính cục bộ thông qua thư viện TensorFlow.js. Luồng video bị hủy ngay lập tức sau khi trích xuất tọa độ điểm. Chỉ có bản tin trạng thái ({"status": "FALL", "timestamp": "...", "confidence": 0.85}) được gửi đi khi có sự cố.
4. Hệ thống có bảo trì phức tạp không và xử lý sự cố như thế nào?
Hệ thống chạy trên nền tảng ứng dụng Web/Electron tiêu chuẩn, không yêu cầu cài đặt driver phức tạp ngoài trình duyệt hiện đại (Chrome/Edge). Trường hợp camera bị lệch góc hoặc ánh sáng yếu dẫn đến mất dấu khớp, giao diện UI sẽ hiển thị trạng thái cảnh báo "Low Keypoint Confidence" để người dùng kịp thời lau kính camera hoặc điều chỉnh lại góc quan sát.
5. Chi phí đầu tư và thời gian hoàn vốn (ROI) ước tính như thế nào?
Chi phí phần mềm là mã nguồn mở ($0$ đồng). Chi phí trang bị một Mini PC và webcam tại mỗi phòng dao động từ $3.000.000 - $5.000.000$ VNĐ. Với khả năng phát hiện ngã ngay trong 1 giây đầu tiên, hệ thống giúp ngăn ngừa kịp thời các biến chứng chấn thương sọ não hoặc gãy xương hông, mang lại giá trị bảo vệ sức khỏe vô giá và tiết kiệm hàng chục triệu đồng chi phí nằm viện hồi sức.
Kết luận
Đồ án tốt nghiệp "Xây dựng ứng dụng phát hiện cú ngã dựa trên thuật toán phân tích tư thế" đã chứng minh tính khả thi và hiệu quả vượt trội của việc kết hợp mô hình ước lượng tư thế MoveNet cùng hệ luật hình học đa chiều. Với độ chính xác đạt 70.15% trên 290 video kiểm chuẩn quốc tế và tốc độ xử lý ấn tượng 50+ FPS ngay trên thiết bị biên phổ thông, nghiên cứu đã mở ra hướng đi bền vững cho các hệ thống hỗ trợ chăm sóc sức khỏe thông minh: Chính xác, Tiết kiệm chi phí và Tuyệt đối bảo vệ quyền riêng tư.
Giải pháp sẵn sàng được chuyển giao, tích hợp vào các nền tảng nhà thông minh (Smart Home) và viện dưỡng lão, góp phần nâng cao chất lượng cuộc sống cho cộng đồng người cao tuổi trong kỷ nguyên số.