CHƯƠNG 1. GIỚI THIỆU ĐỀ TÀI chính xác cho bài toán dự báo [4].2 Mục tiêu nghiên cứu Với những tiềm năng đầy hứa hẹn của các mạng nơ-ron học sâu, trong nghiên cứu này chúng tôi sẽ áp dụng ưu thế của mạng nơ-ron học sâu trong bài toán dự báo, và dựa vào đó để phát hiện chuỗi con bất thường trên dữ liệu chuỗi thời gian. Để giải quyết được bài toán đề ra, chúng tôi sẽ xây mô hình học sâu, trọng tâm sử dụng mạng nơ-ron học sâu LSTM, vì các tập dữ liệu đều có sự tương quan giữa giá trị lịch sử tới giá trị hiện tại. Mặt khác, trong những năm gần đây, các nhà nghiên cứu đã sử dụng mạng nơ-ron học sâu LSTM trong các bài toán dự đoán giá trị của chuỗi thời gian và đạt kết quả tốt so với các kỹ thuật khác.
Một bước tiến xa là các kết quả nghiên cứu này còn có thể được sử dụng trong các ứng dụng thực tế. Kế thừa nghiên cứu của Malhotra và các cộng sự [3], chúng tôi sẽ xây dựng mạng nơ-ron học sâu LSTM xếp chồng cho bài toán dự báo và sử dụng giải thuật phân phối sai số dự báo [20] cho bài toán phát hiện chuỗi con bất thường. Bên cạnh đó, kỹ thuật dự báo nhiều bước (multi-step ahead prediction) cũng sẽ được chúng tôi áp dụng để tăng tính hiệu quả cho chặng dự báo của công tác phát hiện bất thường [2]. Nghiên cứu sẽ sử dụng những bộ dữ liệu mẫu từ các công trình đi trước.
Những bộ dữ liệu này đã được đánh dấu chuỗi con bất thường. Nghiên cứu sẽ sử dụng những chuỗi con bất thường này để huấn luyện và đánh giá. Ngoài ra, nghiên cứu cũng so sánh với giải thuật HOT SAX, một phương pháp nhận dạng chuỗi con bất thường được nhiều nhà nghiên cứu ưa chuộng. Chúng tôi sẽ so sánh về độ chính xác của các chuỗi con bất thường được phát hiện.
Từ những kết luận rút ra được, chúng ta sẽ biết được phương pháp nào hiệu quả hơn trong công tác phát hiện chuỗi con bất thường trên dữ liệu chuỗi thời gian. Những điều này là những yếu tố quan trong khi sử dụng trong thực tế. GIỚI THIỆU ĐỀ TÀI 1.3 Ý nghĩa đề tài Với nghiên cứu về phương pháp phát hiện bất thường bằng dự báo, đặc biệt là dựa vào ưu thế của mạng nơ-ron học sâu LSTM, đề tài có những ý nghĩa sau đây. Ý nghĩa thực tiễn: • Góp phần tìm ra tiềm năng của mạng nơ-ron học sâu LSTM trong khai phá dữ liệu chuỗi thời gian.
• So sánh, đánh giá hiệu suất của phương pháp phát hiện bất thường bằng dự báo (mô hình để xuất) và phương pháp phát hiện bất thường bằng cửa sổ trượt (giải thuật HOTSAX). • Xây dựng được mô hình dự báo và phát hiện bất thường trên các bộ dữ liệu thuộc nhiều lĩnh vực. Ý nghĩa khoa học: • Góp phần đưa ra một mô hình, ứng dụng phương pháp học sâu vào bài toán phát hiện bất thường trên dữ liệu chuỗi thời gian. • Mở ra một hướng mới về phát hiện bất thường bằng dự báo dựa trên sự bùng nổ của phương pháp học sâu và mạng nơ-ron học sâu LSTM.4 Kết quả đạt được Trong nghiên cứu này, chúng tôi đề xuất mô hình dựa trên phương pháp phát hiện bất thường bằng dự báo để phát hiện bất thường trên các bộ dữ liệu thuộc nhiều lĩnh vực, đồng thời so sánh phương pháp này với phương pháp phát hiện bất thường dựa trên cửa sổ trượt, đại diện là giải thuật HOTSAX.
Chúng tôi đề xuất xây dựng một mô hình dự báo có kiến trúc LSTM xếp chồng để tận dụng khả năng ghi nhớ thông tin của mạng nơ-ron học sâu LSTM. Ngoài ra, chúng tôi sử dụng kỹ thuật dự báo nhiều bước để nâng cao khả năng dự báo của mô hình. Trong thực nghiệm, chúng tôi sử dụng 07 bộ dữ liệu thuộc nhiều lĩnh vực khác nhau để phát hiện bất thường, các bộ dữ liệu này đã được đánh dấu sẵn chuỗi con bất thường bởi các chuyên gia. Chúng tôi cài đặt 7 CHƯƠNG 1.
GIỚI THIỆU ĐỀ TÀI mô hình đề xuất và giải thuật HOTSAX để tiến hành các kịch bản thực nghiệm, so sánh và đánh giá kết quả thực nghiệm trên các bộ dữ liệu này. Kết quả thực nghiệm cho thấy, mô hình đề xuất đã khắc phục được hạn chế của giải thuật HOTSAX khi dựa vào kích thước cửa sổ trượt. Nhưng bên cạnh đó, mô hình đề xuất cũng gặp phải nhiều cảnh báo sai đối với bộ dữ liệu có ít dữ liệu huấn luyện, do mô hình dự báo có nhiều sai số dự báo.5 Cấu trúc của luận văn Cấu trúc của báo cáo được tổ chức như sau: • Chương 1 - Giới thiệu vấn đề: nhằm giới thiệu tổng quan về bài toán phát hiện bất thường dựa vào dự báo và phương pháp giải quyết. • Chương 2 - Cơ sở lý thuyết: trình bày những lý thuyết liên quan được sử dụng trong bài nghiên cứu.
• Chương 3 - Các nghiên cứu liên quan: bao gồm các công trình nghiên cứu liên quan đến bài toán phát hiện bất thường, ứng dụng của bài toán phát hiện bất thường và các kỹ thuật dự báo nhiều bước trong chuỗi dữ liệu thời gian. • Chương 4 - Phương pháp nghiên cứu: phân tích đặc điểm của các bộ dữ liệu và trình cụ thể mô hình đề xuất và cách thức mô hình hoạt động. • Chương 5 - Kết quả thực nghiệm: là kết quả đánh giá của mô hình đề xuất và so sánh với giải thuật HOTSAX • Chương 6 - Kết luận: nêu ra các kết luận đúc kết được trong quá trình nghiên cứu và hướng phát triển tiếp theo trong tương lai. 8 Chương 2 Cơ sở lý thuyết Chương này sẽ giải thích về chuỗi thời gian và chuỗi con bất thường ở mục 2.2, các phương pháp dùng trong giải thuật HOTSAX ở mục 2.
Tiếp theo trình bày chi tiết về lý thuyết về các kiến trúc mạng nơ-ron được chúng tôi áp dụng để nghiên cứu, cũng như cách xây dựng mô hình mạng nơ-ron học sâu LSTM xếp chồng trong các mục 2. Các cơ sở lý thuyết này sẽ được sử dụng để xây dựng một mạng nơ-ron học sâu LSTM xếp chồng nhằm mục đích dự báo dữ liệu chuỗi thời gian và phát hiện bất thường.1 Chuỗi thời gian và dự báo chuỗi thời gian Chuỗi thời gian (Time Series): Chuỗi thời gian T = t1 ,.,tm là tập hợp m các giá trị thực được đo đạc tại những điểm thời gian cách đều nhau.1 minh họa một chuỗi thời gian theo dõi quá trình đo nhiệt độ tại một địa phương Hình 2.1: Chuỗi thời gian 9 CHƯƠNG 2. CƠ SỞ LÝ THUYẾT Trong thực tế, có rất nhiều loại dữ liệu chuỗi thời gian như sự theo dõi biến động giá chứng khoán, dữ liệu điện tâm đồ, dữ liệu theo dõi sự truy cập các trang web của người dùng,. Thông thường, các loại dữ liệu chuỗi thời gian này là rất lớn, được đo và lưu trữ lại trong một khoảng thời gian dài cho nên việc khai phá dữ liệu này thường tốn kém chi phí thời gian.
Do đó việc sử dụng các công cụ khai phá dữ liệu này được áp dụng trên nền máy tính đã thu hút sự quan tâm, nghiên cứu và ứng dụng trong rất nhiều các lĩnh vực trong những năm gần đây. Một số vấn đề có thể xảy ra khi khai phá dữ liệu chuỗi thời gian: • Khối lượng dữ liệu: Một trong những đặc trưng của chuỗi thời gian là dữ liệu rất lớn. Đây là một trong những vấn đề thách thức trong quá trình phân tích, tính toán và xử lý dữ liệu chuỗi thời gian trong việc tạo ra kết quả được chính xác trong thời gian hợp lý? • Phụ thuộc yếu tố chủ quan: Trong thực tế, các kết quả dữ liệu chuỗi thời gian thu được chịu ảnh hưởng yếu tố chủ quan của người đo dữ liệu, điều kiện và các công cụ đo. • Dữ liệu không đồng nhất: Quá trình thu thập dữ liệu chuỗi thời gian được đo trên những định dạng khác nhau, số lượng và tần số lấy mẫu không đồng nhất cũng ảnh hưởng đến tính toàn vẹn của dữ liệu.
Thêm vào đó quá trình đo đạc không chính xác do nhiễu, thiếu một vài giá trị hay dữ liệu không sạch. Dữ liệu chuỗi thời gian được phân ra thành 2 nhóm chính: • Chuỗi thời gian đơn biến: như tên gọi của nó, là một chuỗi có một biến phụ thuộc thời gian duy nhất. Ví dụ như: năng lượng tiêu thụ trong một tuần, giá trị điện tâm đồ,. • Chuỗi thời gian đa biến: chuỗi thời gian có nhiều hơn một biến phụ thuộc vào thời gian.
Mỗi biến không chỉ phụ thuộc vào các giá trị trong quá khứ của nó mà còn có một số phụ thuộc vào các biến khác. Sự phụ thuộc này được sử dụng để dự báo các giá trị trong tương lai. Ví dụ như: giá trị cỗ phiếu từng ngày trong một tuần,.2 Chuỗi con và chuỗi con bất thường 2.1 Chuỗi con Chuỗi con (Subsequence) : Cho một chuỗi thời gian T có độ dài m, một chuỗi con C của T là một mẫu (sample) có độ dài n ≤ m lấy từ T, nghĩa là C = tp ,.2 Chuỗi con bất thường Một mẫu bất thường trên dữ liệu chuỗi thời gian là một chuỗi con mà rất khác so với chuỗi con tương tự với nó nhất. Tuy nhiên, những chuỗi con mà khớp (tương tự) với một chuỗi con cho trước thường có khuynh hướng gần sát với vị trí của chuỗi con đang xét.
Thí dụ, một chuỗi con có vị trí bắt đầu tại điểm thứ p có chuỗi con tương tự với nó nhiều nhất bắt đầu tại điểm thứ q mà q chỉ cách xa p khoảng vài điểm. Những sự trùng khớp với nhau như vậy được gọi là trùng khớp tầm thường (trivial matches) và không đáng quan tâm trong quá trình phát hiện bất thường. Định nghĩa 1: (Trùng khớp không tầm thường) Một chuỗi thời gian T cho trước có chứa chuỗi con C chiều dài n bắt đầu tại vị trí p và một chuỗi con M trùng khớp với nó bắt đầu tại vị trí q, ta bảo M là trùng khớp không tầm thường (non-trivial match) của C nếu |p – q | ≥ n. Định nghĩa 2: (Chuỗi con bất thường nhất – time series discord) Cho chuỗi thời gian T, chuỗi con C có chiều dài n bắt đầu tại vị trí p được gọi là chuỗi con bất thường nhất của T nếu C có khoảng cách lớn nhất đến chuỗi con trùng khớp không tầm thường lân cận với nó nhất.