Chương 1 Tổng quan 1.1 Vấn đề dữ liệu đối với hệ thống quan trắc Dữ liệu quan trắc là dữ liệu được thu thập từ các phương tiện quan trắc, thiết bị cảm biến, thiết bị đo lường, hoặc hệ thống giám sát nhằm ghi lại các yếu tố trong môi trường, hệ thống, hoặc quá trình nào đó. Các yếu tố này có thể bao gồm chất lượng không khí, chất lượng nước, nhiệt độ, độ ẩm, áp suất,. Hiện nay, với sự phát triển của khoa học công nghệ đặc biệt dựa trên nền tảng Internet of Things thì việc thu thập dữ liệu và truyền về máy chủ tập trung đã trở nên dễ dàng hơn, đáp ứng được các yêu cầu cơ bản của việc giám sát thông tin như: giám sát được dữ liệu thời gian thực, hoạt động tự động,. Tuy nhiên, dữ liệu IoT cũng có thể chứa các giá trị bất thường, không chính xác làm sai lệch các thông tin thu thập được từ bên ngoài.
Một số nguyên nhân dẫn đến việc không chính xác đó có thể được biết đến như: • Lỗi cảm biến: Cảm biến có thể bị hư hỏng, mất điện hoặc quá cũ dẫn đến hoạt động sai lệch, làm cho dữ liệu thu thập được không chính xác. • Lỗi phần mềm: Phần mềm thu thập và xử lý dữ liệu có thể bị lỗi, dẫn đến dữ liệu bị sai lệch hoặc mất mát. • Lỗi do các yếu tố khác: Cảm biến có thể bị sai lệch do biến động của môi trường làm cho các thông số hóa học, vật lý của vùng quan trắc thay đổi đột ngột. Một số hình ảnh minh họa cho dự liệu thu thập từ sensor được biểu thị như trong các hình dưới đây: Luận văn Thạc Sĩ 2 Trường Đại Học Bách Khoa Tp.Hồ Chí Minh Khoa Khoa Học & Kỹ Thuật Máy Tính Hình 1.1: Dữ liệu thu thập bình thường [1] Hình 1.2: Dữ liệu bị mất trong quá trình thu thập [1] Hình 1.3: Một hoặc nhiều điểm ngoại lệ xuất hiện trong dữ liệu [1] Một bài toán quan trọng hay được đề cập đến trong lĩnh vực thu thập dữ liệu quan trắc là phát hiện những điểm bất thường (anomaly detection) của dữ liệu hay còn được gọi là phát hiện điểm ngoại lai (outlier detection).
Đây là một bài toán không chỉ quan trọng mà còn đầy thách thức, bởi dữ liệu thường được thu thập từ nhiều nguồn khác nhau và có thể chứa các biến thể không mong muốn hoặc không phản ánh đúng sự thật. Các thuật toán phát hiện bất thường đóng vai Luận văn Thạc Sĩ 3 Trường Đại Học Bách Khoa Tp.Hồ Chí Minh Khoa Khoa Học & Kỹ Thuật Máy Tính trò như những trạm kiểm tra, giúp phân tích dữ liệu ở nhiều giai đoạn khác nhau trong quá trình thu thập và xử lý, từ các thiết bị IoT cho đến các trung tâm lưu trữ dữ liệu quy mô lớn. Trong môi trường của các trung tâm dữ liệu, nhu cầu về khả năng phát hiện và loại bỏ dữ liệu không đáng tin cậy là vô cùng quan trọng. Việc này giúp tăng tính đáng tin cậy của dữ liệu, từ đó đảm bảo rằng các quyết định dựa trên dữ liệu là chính xác và đáng tin cậy.
Đồng thời, việc làm sạch và phân loại dữ liệu cũng là bước quan trọng trong quá trình chuẩn bị dữ liệu cho việc phân tích và sử dụng trong các ứng dụng khác nhau Hầu hết các thuật toán học máy thường không hoạt động với các giá trị bị thiếu, do đó đối với các thuật toán này, giá trị bị thiếu cần phải được loại bỏ hoặc chuyển đổi thành số. Việc xử lý giá trị bị thiếu nên được thực hiện trước khi xây dựng mô hình. Nhiều yếu tố có thể gây ra dữ liệu bị thiếu: • Thiếu sót trong cấu trúc dữ liệu • Kết hợp với các bộ dữ liệu khác • Sự kiện ngẫu nhiên • Lỗi đo lường, v. Thời gian gần đây, mặc dù lĩnh vực nghiên cứu về việc phát hiện bất thường đang đạt được nhiều thành công, tuy nhiên vẫn còn nhiều thách thức cần phải giải quyết để có thể đưa được các hệ thống trên vào ứng dụng thực tế như: • Làm thế nào một hệ thống phát hiện được các dữ liệu bất thường trong các ngữ cảnh thực tế khác nhau với độ chính xác cao để có thể sử dụng cho các ứng dụng cảnh báo • Các mô hình đơn lẻ thực tế chỉ xem xét một trong hai yếu tố thời gian hoặc không gian nên việc ứng dụng trong thực tế sẽ còn nhiều bất cập hạn chế.
• Các vấn đề về việc bổ sung dữ liệu lỗi theo thời gian thực cũng đang được quan tâm để tăng độ cường độ chính xác của dữ liệu thời gian • Đặc biệt dữ liệu quan trắc thường có kích thước lớn và tốc độ thay đổi nhanh chóng. Điều này khiến cho việc phát hiện lỗi trong thời gian thực trở cực kì khó khăn, vì các thuật toán phát hiện lỗi cần phải xử lý một lượng lớn dữ liệu trong một khoảng thời gian ngắn. Luận văn Thạc Sĩ 4 Trường Đại Học Bách Khoa Tp.Hồ Chí Minh Khoa Khoa Học & Kỹ Thuật Máy Tính Độ phức tạp của việc xử lý lỗi trong thời gian thực được thể hiện ở hai khía cạnh chính: • Yêu cầu về độ chính xác của kết quả: Các lỗi trong dữ liệu quan trắc có thể gây ra những hậu quả nghiêm trọng, do đó việc xử lý lỗi trong thời gian thực cần có độ chính xác cao. Điều này đòi hỏi các thuật toán xử lý lỗi phải có khả năng phân loại chính xác các dữ liệu lỗi.
• Thời gian phản hồi: Việc xử lý lỗi trong thời gian thực cần được thực hiện nhanh chóng để có thể ngăn chặn các hậu quả nghiêm trọng của lỗi. Điều này đòi hỏi các thuật toán xử lý lỗi phải có thời gian phản hồi thấp.2 Mục tiêu nghiên cứu Mục tiêu nghiên cứu của tôi sẽ tập trung vào viêc xây dựng mô hình học sâu để đạt được những yêu cầu sau: • Nhận biết bất thường của dữ liệu quan trắc: Phát hiện ra những vấn đề của dữ liệu như dữ liệu thiếu, thiết bị thu thập bị lỗi.gây ảnh hưởng đến chất lượng dữ liệu. • Sửa chữa lỗi của dữ liệu bất thường: Xác định và triển khai các phương pháp tự động để sửa lỗi dữ liệu, nhằm cải thiện độ tin cậy và chính xác của dữ liệu đang được sử dụng. Sẽ có hai bài toán cần quan tâm trong nghiên cứu: • Bài toán 1: Phát hiện bất thường của bộ dữ liệu thời gian thực • Bài toán 2: Hiệu chỉnh dữ liệu tại thời điểm xảy ra bất thường Qua những phân tích trên, tôi sẽ giới hạn phạm vi nghiên cứu trong những mục sau: • Nghiên cứu sẽ giới hạn phạm vi của mình vào việc giải quyết vấn đề nhận biết và sửa lỗi trong dữ liệu IoT liên quan đến chất lượng nước.
Sự chú ý sẽ được tập trung vào việc xử lý dữ liệu từ các cảm biến đo chất lượng nước, và các thông số khác có ảnh hưởng đáng kể đến môi trường và sức khỏe. • Nghiên cứu sẽ tập trung vào phân tích, đánh giá, và chọn lựa giải pháp để giái quyết bài toán số 1 trước, sau đó sẽ vận dụng để đưa vào thực tế với bài toán số 2. Luận văn Thạc Sĩ 5 Trường Đại Học Bách Khoa Tp.Hồ Chí Minh Khoa Khoa Học & Kỹ Thuật Máy Tính 1.3 Các hướng tiếp cận và giải quyết bài toán Hai phương pháp tiếp cận phổ biến để giải quyết bài toán phát hiện bất thường là dựa trên tập hợp các quy tắc được định nghĩa trước (Rule-based de- tection) hoặc nhận dạng dựa trên các hoạt động dữ liệu (Data-Driven Detection) [3].1 Nhận dạng dựa trên các quy tắc định nghĩa trước Phương pháp này xác định các sự kiện hoặc hành vi bất thường trong dữ liệu dựa trên một tập hợp các quy tắc được định nghĩa trước. Các quy tắc này thường được xây dựng dựa trên kiến thức chuyên môn, hiểu biết sâu sắc về hệ thống và môi trường hoạt động sau đó sử dụng suy luận logic để mô tả mẫu hoặc đặc điểm của các hoạt động bình thường và bất thường.
Cách thức chung đối với phương pháp nhận dạng hoạt động loại này bao gồm: • Dựa trên các quy tắc có sẵn, xác định các quy tắc và nguyên tắc mà hệ thống thường tuân thủ khi hoạt động ổn định, bao gồm việc mô tả các biểu hiện bình thường, giới hạn cho các giá trị thực, hoặc quy luật về mối quan hệ giữa các tham số. • Tạo các quy tắc dựa trên những điều kiện và nguyên tắc đã xác định. Quyết định cách hệ thống sẽ nhận dạng và xử lý các trạng thái không bình thường. • Thực hiện các suy diễn logic để trích xuất và giải thích được các quan sát.
Ưu điểm của cách tiếp cận này là: • Các quy tắc dễ hiểu và cho phép giải thích rõ ràng tại sao một bất thường được phát hiện. • Phương pháp thường đơn giản và nhanh chóng khi xử lý các trường hợp được quy tắc bao phủ. • Các quy tắc cụ thể có thể dẫn đến độ chính xác cao trong việc phát hiện các bất thường đã biết. Tuy nhiên, hệ thống này còn chưa một số hạn chế quan trọng: Bao gồm việc đòi hỏi các kiến thức chuyên sâu từ các chuyên gia về hệ thống, việc tự động cập Luận văn Thạc Sĩ 6 Trường Đại Học Bách Khoa Tp.Hồ Chí Minh Khoa Khoa Học & Kỹ Thuật Máy Tính nhật các quy tắc trở nên không khả thi do dữ liệu đầu vào thường không có cấu trúc và liên tục biến động.
Hệ thống cũng thiếu khả năng xử lý thông tin tạm thời một cách linh hoạt và không rõ ràng. Vì lí do này, phương pháp này có vẻ ít được sử dụng trong thực tế.2 Nhận dạng hoạt động dựa trên dữ liệu Phương pháp này sử dụng mô hình học máy hoặc học sâu để tự động học và nhận biết các biểu hiện bất thường dựa trên dữ liệu đầu vào. Mô hình sẽ được huấn luyện trên dữ liệu lịch sử để học được mô hình hành vi bình thường của hệ thống. Phương pháp này liên quan đến việc tạo ra các mô hình hoạt động dựa trên xác suất hoặc thống kê, kết hợp với các quy trình học và huấn luyện.
Cách thức chung đối với phương pháp nhận dạng hoạt động loại này bao gồm: • Thu thập dữ liệu từ các nguồn, tiến hành loc, xử lý và chuẩn hóa để phù hợp với thuật toán học máy. Xác định tập dữ liệu huấn luyện và dữ liệu kiểm thử. • Huấn luyện mô hình trên dữ liệu huấn luyện để học các đặc điểm và mối quan hệ trong dữ liệu. Đánh giá độ chính xác của mô hỉnh dựa trên dữ liệu kiểm thử.