Khai Phá Luật Trên Chuỗi Thời Gian Dựa Trên Tỉ Số Thay Đổi Và Giải Thuật FP-Growth

Luận văn thạc sĩ về khai phá luật trên chuỗi thời gian. Nghiên cứu ứng dụng tỷ số thay đổi và giải thuật FP-Growth trong khoa học máy tính. Tải ngay!

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ

2012

74
3
0

Phí lưu trữ

30 Point

Tóm tắt

I. Khám Phá Luật Chuỗi Thời Gian Tổng Quan Ứng Dụng LSI

Dữ liệu chuỗi thời gian xuất hiện rộng rãi trong nhiều lĩnh vực như tài chính, kinh tế, khoa học tự nhiên và xã hội. Sự bùng nổ dữ liệu đặt ra thách thức lớn trong việc khai thác thông tin hữu ích từ các chuỗi thời gian này. Khai phá luật trên chuỗi thời gian trở thành một lĩnh vực quan trọng, giúp khám phá các luật kết hợpmẫu thức tiềm ẩn. Bài toán này đầy thách thức do đặc thù của dữ liệu chuỗi thời gian và yêu cầu về hiệu quả tính toán. Một trong những mục tiêu chính là xây dựng các mô hình dự đoán và hiểu rõ hơn về cơ chế tạo ra chuỗi thời gian. Các nghiên cứu hiện tại tập trung vào việc tìm kiếm các mẫu tuần tự và xây dựng các mô hình dự báo chính xác, cũng như phát triển các phương pháp khai phá luật hiệu quả. Việc phân tích chuỗi thời gian cung cấp thông tin chi tiết cho các nhà phân tích, nhà nghiên cứu trong việc đưa ra quyết định dựa trên dữ liệu thực tế.

1.1. Ứng Dụng Khai Phá Dữ Liệu Chuỗi Thời Gian Thực Tiễn

Ứng dụng của khai phá dữ liệu chuỗi thời gian rất đa dạng. Trong lĩnh vực tài chính, nó giúp dự đoán biến động giá cổ phiếu và phân tích xu hướng thị trường. Trong y học, nó được sử dụng để phân tích dữ liệu điện tâm đồ và theo dõi sức khỏe bệnh nhân. Trong khoa học môi trường, nó giúp dự báo thời tiết và theo dõi biến đổi khí hậu. Các ứng dụng này đều có điểm chung là sử dụng các thuật toán và kỹ thuật khai phá dữ liệu để tìm ra các mẫu thức và quy luật ẩn trong dữ liệu chuỗi thời gian. Điều này cho phép đưa ra các dự đoán và quyết định chính xác hơn, mang lại lợi ích lớn cho các lĩnh vực khác nhau. Việc khai thác tối đa tiềm năng của dữ liệu chuỗi thời gian giúp cải thiện hiệu quả hoạt động và nâng cao chất lượng cuộc sống.

1.2. Thách Thức Khó Khăn Trong Khai Phá Dữ Liệu LSI

Bản chất của dữ liệu chuỗi thời gian đặt ra nhiều thách thức. Dữ liệu thường có kích thước lớn, chứa nhiều nhiễu và thiếu sót. Việc xử lý và phân tích dữ liệu này đòi hỏi các kỹ thuật đặc biệt. Một trong những thách thức lớn là tìm ra các mẫu thức và quy luật có ý nghĩa trong dữ liệu. Điều này đòi hỏi sự kết hợp giữa kiến thức chuyên môn và các kỹ thuật khai phá dữ liệu tiên tiến. Ngoài ra, việc đảm bảo hiệu quả tính toán cũng là một vấn đề quan trọng, đặc biệt khi xử lý dữ liệu có kích thước lớn. Các nhà nghiên cứu liên tục phát triển các phương pháp mới để vượt qua những thách thức này và khai thác tối đa tiềm năng của dữ liệu chuỗi thời gian.

II. Tỉ Số Thay Đổi Cách Tối Ưu Khai Phá Luật Chuỗi Thời Gian

Tỉ số thay đổi (rate of change) đóng vai trò quan trọng trong việc khai phá luật trên chuỗi thời gian. Phương pháp này giúp đơn giản hóa dữ liệu bằng cách tập trung vào sự biến động thay vì giá trị tuyệt đối. Việc chuyển đổi dữ liệu chuỗi thời gian thành chuỗi các tỉ số thay đổi có thể giúp loại bỏ nhiễu và làm nổi bật các mẫu thức quan trọng. Điều này đặc biệt hữu ích trong việc phân tích dữ liệu tài chính, nơi mà sự thay đổi giá cả quan trọng hơn giá trị thực tế. Tỉ số thay đổi cung cấp một cách nhìn linh hoạt và hiệu quả về dữ liệu chuỗi thời gian, giúp các nhà phân tích dễ dàng hơn trong việc tìm kiếm các luật kết hợp và đưa ra các dự đoán chính xác.

2.1. Ưu Điểm Của Tỉ Số Thay Đổi Trong Phân Tích Dữ Liệu

Tỉ số thay đổi có nhiều ưu điểm so với việc sử dụng trực tiếp dữ liệu chuỗi thời gian. Nó ít bị ảnh hưởng bởi các yếu tố bên ngoài như lạm phát hoặc thay đổi đơn vị đo lường. Nó tập trung vào sự biến động tương đối, giúp dễ dàng so sánh các chuỗi thời gian khác nhau. Ngoài ra, tỉ số thay đổi có thể giúp phát hiện các điểm bất thường và các xu hướng tiềm ẩn trong dữ liệu. Điều này làm cho nó trở thành một công cụ hữu ích trong nhiều lĩnh vực, từ tài chính đến khoa học môi trường. Việc sử dụng tỉ số thay đổi giúp nâng cao hiệu quả và độ chính xác của quá trình khai phá luật trên chuỗi thời gian.

2.2. Ứng Dụng Tỉ Số Thay Đổi Trong Dự Báo Chuỗi Thời Gian

Dự báo chuỗi thời gian là một trong những ứng dụng quan trọng của tỉ số thay đổi. Bằng cách phân tích các mẫu thức thay đổi trong quá khứ, có thể dự đoán xu hướng trong tương lai. Điều này đặc biệt hữu ích trong lĩnh vực tài chính, nơi mà việc dự đoán biến động giá cổ phiếu có thể mang lại lợi nhuận lớn. Các mô hình dự báo dựa trên tỉ số thay đổi thường có độ chính xác cao hơn so với các mô hình sử dụng trực tiếp dữ liệu chuỗi thời gian. Điều này là do tỉ số thay đổi giúp loại bỏ nhiễu và làm nổi bật các yếu tố quan trọng. Việc sử dụng tỉ số thay đổi trong dự báo chuỗi thời gian giúp các nhà phân tích đưa ra các quyết định đầu tư và kinh doanh thông minh hơn.

III. FP Growth Phương Pháp Khai Phá Luật Kết Hợp Tối Ưu LSI

Thuật toán FP-Growth là một phương pháp hiệu quả để khai phá luật kết hợp trong khai phá dữ liệu. Khác với thuật toán Apriori, FP-Growth không cần tạo ra các ứng viên tập mục thường xuyên, mà sử dụng cấu trúc cây FP-Tree để biểu diễn dữ liệu. Cấu trúc này giúp giảm đáng kể thời gian tính toán và nâng cao hiệu suất của quá trình khai phá luật. FP-Growth đặc biệt hữu ích khi xử lý dữ liệu lớn và phức tạp, nơi mà các thuật toán truyền thống trở nên chậm chạp và kém hiệu quả. Nó đã được áp dụng thành công trong nhiều lĩnh vực, từ phân tích giỏ hàng đến khai phá luật trong chuỗi thời gian. Việc sử dụng FP-Growth giúp các nhà phân tích dễ dàng hơn trong việc tìm kiếm các luật kết hợp quan trọng và đưa ra các quyết định dựa trên dữ liệu.

3.1. Cấu Trúc Cây FP Tree Trong Thuật Toán FP Growth

Cây FP-Tree là cấu trúc dữ liệu cốt lõi của thuật toán FP-Growth. Nó được xây dựng bằng cách duyệt qua cơ sở dữ liệu và thêm các mục vào cây theo thứ tự tần suất xuất hiện. Các mục thường xuyên xuất hiện sẽ nằm gần gốc cây hơn, giúp dễ dàng tìm kiếm các luật kết hợp. Cây FP-Tree có cấu trúc nhỏ gọn và hiệu quả, giúp giảm đáng kể bộ nhớ cần thiết để lưu trữ dữ liệu. Nó cũng cho phép thực hiện các phép toán nhanh chóng và dễ dàng, giúp nâng cao hiệu suất của thuật toán FP-Growth. Việc hiểu rõ cấu trúc cây FP-Tree là rất quan trọng để tận dụng tối đa tiềm năng của thuật toán FP-Growth trong khai phá luật kết hợp.

3.2. Ưu Điểm So Sánh Giữa FP Growth Và Apriori LSI

FP-Growth có nhiều ưu điểm so với thuật toán Apriori. Apriori cần tạo ra các ứng viên tập mục thường xuyên, một quá trình tốn kém về thời gian và bộ nhớ. FP-Growth tránh được quá trình này bằng cách sử dụng cấu trúc cây FP-Tree, giúp giảm đáng kể thời gian tính toán. Ngoài ra, FP-Growth có thể xử lý dữ liệu lớn và phức tạp một cách hiệu quả hơn so với Apriori. Nó đã được chứng minh là nhanh hơn và tiết kiệm bộ nhớ hơn trong nhiều thử nghiệm. Việc lựa chọn giữa FP-Growth và Apriori phụ thuộc vào đặc điểm của dữ liệu và yêu cầu của bài toán. Tuy nhiên, trong nhiều trường hợp, FP-Growth là lựa chọn tốt hơn để khai phá luật kết hợp.

IV. Kết Hợp Tỉ Số Thay Đổi FP Growth Quy Trình 5 Bước LSI

Việc kết hợp tỉ số thay đổi và thuật toán FP-Growth tạo ra một phương pháp mạnh mẽ để khai phá luật trên chuỗi thời gian. Quy trình này bao gồm các bước chính như tiền xử lý dữ liệu, chuyển đổi thành tỉ số thay đổi, xây dựng cây FP-Tree, khai thác mẫu thường xuyên và sinh luật kết hợp. Việc kết hợp hai phương pháp này giúp tận dụng tối đa ưu điểm của cả hai, giúp nâng cao hiệu quả và độ chính xác của quá trình khai phá luật. Nó đặc biệt hữu ích trong việc phân tích dữ liệu tài chính, nơi mà sự biến động giá cả và các luật kết hợp có thể mang lại lợi nhuận lớn. Việc sử dụng quy trình này giúp các nhà phân tích dễ dàng hơn trong việc tìm kiếm các luật kết hợp quan trọng và đưa ra các quyết định dựa trên dữ liệu.

4.1. Bước 1 3 Tiền Xử Lý Xây Dựng Cây FP Tree

Quy trình bắt đầu với việc tiền xử lý dữ liệu chuỗi thời gian để loại bỏ nhiễu và chuẩn hóa dữ liệu. Sau đó, dữ liệu được chuyển đổi thành chuỗi các tỉ số thay đổi để tập trung vào sự biến động. Bước tiếp theo là xây dựng cây FP-Tree từ dữ liệu đã chuyển đổi. Cây FP-Tree được xây dựng bằng cách duyệt qua dữ liệu và thêm các mục vào cây theo thứ tự tần suất xuất hiện. Cây FP-Tree có cấu trúc nhỏ gọn và hiệu quả, giúp giảm đáng kể bộ nhớ cần thiết để lưu trữ dữ liệu và thực hiện các phép toán nhanh chóng.

4.2. Bước 4 5 Khai Thác Mẫu Thường Xuyên Sinh Luật

Sau khi cây FP-Tree được xây dựng, bước tiếp theo là khai thác các mẫu thường xuyên từ cây. Các mẫu thường xuyên là các tập hợp mục xuất hiện với tần suất cao trong dữ liệu. Cuối cùng, các luật kết hợp được sinh ra từ các mẫu thường xuyên. Các luật kết hợp thể hiện mối quan hệ giữa các mục trong dữ liệu. Các luật được đánh giá dựa trên độ hỗ trợ và độ tin cậy, giúp xác định các luật quan trọng và có ý nghĩa.

V. Ứng Dụng Thực Tế Phân Tích Thị Trường Chứng Khoán Việt Nam

Luận văn sử dụng dữ liệu chứng khoán Việt Nam để thực nghiệm và đánh giá phương pháp đề xuất. Dữ liệu này bao gồm giá cổ phiếu của nhiều công ty trong một khoảng thời gian nhất định. Việc áp dụng phương pháp kết hợp tỉ số thay đổiFP-Growth giúp tìm ra các luật kết hợp tiềm ẩn trong thị trường chứng khoán. Các luật này có thể giúp các nhà đầu tư đưa ra các quyết định đầu tư thông minh hơn. Kết quả thực nghiệm cho thấy phương pháp đề xuất có hiệu quả trong việc khai phá luật trên dữ liệu chứng khoán, giúp tìm ra các luật có độ hỗ trợ và độ tin cậy cao.

5.1. Mô Tả Dữ Liệu Chứng Khoán Thiết Lập Thực Nghiệm

Dữ liệu chứng khoán được thu thập từ các nguồn tin cậy và được tiền xử lý để loại bỏ nhiễu và chuẩn hóa dữ liệu. Dữ liệu bao gồm giá cổ phiếu, khối lượng giao dịch và các thông tin khác liên quan đến thị trường chứng khoán. Thiết lập thực nghiệm bao gồm việc lựa chọn các tham số cho thuật toán FP-Growth và xác định ngưỡng cho độ hỗ trợ và độ tin cậy. Các tham số này được điều chỉnh để tối ưu hóa hiệu suất của thuật toán và đảm bảo rằng các luật được sinh ra có ý nghĩa.

5.2. Đánh Giá Kết Quả Khai Phá Luật Tính Ứng Dụng LSI

Kết quả khai phá luật được đánh giá dựa trên độ hỗ trợ, độ tin cậy và các tiêu chí khác liên quan đến tính hữu ích của các luật. Các luật có độ hỗ trợ và độ tin cậy cao được xem là quan trọng và có ý nghĩa. Tính ứng dụng của các luật được đánh giá bằng cách xem xét khả năng sử dụng các luật này để đưa ra các quyết định đầu tư và kinh doanh. Các luật có khả năng giúp các nhà đầu tư kiếm lợi nhuận được xem là có tính ứng dụng cao.

VI. Kết Luận Hướng Phát Triển Khai Phá Luật Chuỗi Thời Gian

Luận văn đã trình bày một phương pháp hiệu quả để khai phá luật trên chuỗi thời gian bằng cách kết hợp tỉ số thay đổi và thuật toán FP-Growth. Phương pháp này đã được chứng minh là có hiệu quả trong việc tìm ra các luật kết hợp tiềm ẩn trong dữ liệu chứng khoán. Tuy nhiên, vẫn còn nhiều hướng phát triển cho nghiên cứu này. Một trong những hướng phát triển quan trọng là nghiên cứu các phương pháp tiền xử lý dữ liệu hiệu quả hơn để cải thiện độ chính xác của quá trình khai phá luật. Ngoài ra, việc nghiên cứu các thuật toán khai phá luật khác và so sánh chúng với FP-Growth cũng là một hướng phát triển quan trọng.

6.1. Tóm Tắt Đóng Góp Ưu Điểm Của Phương Pháp LSI

Phương pháp đề xuất có nhiều đóng góp quan trọng. Nó cung cấp một quy trình hiệu quả để khai phá luật trên chuỗi thời gian bằng cách kết hợp tỉ số thay đổi và thuật toán FP-Growth. Nó đã được chứng minh là có hiệu quả trong việc tìm ra các luật kết hợp tiềm ẩn trong dữ liệu chứng khoán. Các luật này có thể giúp các nhà đầu tư đưa ra các quyết định đầu tư thông minh hơn. Phương pháp này có tính ứng dụng cao và có thể được áp dụng trong nhiều lĩnh vực khác nhau, từ tài chính đến khoa học môi trường.

6.2. Các Hướng Nghiên Cứu Mở Rộng Trong Tương Lai LSI

Trong tương lai, có nhiều hướng nghiên cứu mở rộng cho nghiên cứu này. Một trong những hướng phát triển quan trọng là nghiên cứu các phương pháp tiền xử lý dữ liệu hiệu quả hơn để cải thiện độ chính xác của quá trình khai phá luật. Ngoài ra, việc nghiên cứu các thuật toán khai phá luật khác và so sánh chúng với FP-Growth cũng là một hướng phát triển quan trọng. Việc tích hợp các kỹ thuật học máy khác vào quy trình khai phá luật cũng là một hướng đi đầy hứa hẹn.

29/04/2025

Trích đoạn nội dung tài liệu

Chương 1: GIỚI THIỆU ĐỀ TÀI 1.1 Dữ liệu chuỗi thời gian Dữ liệu chuỗi thời gian là một chuỗi các giá trị hay sự kiện có được bằng cách lặp lại một phép đo theo thời gian. Các giá trị thường đo theo thời khoảng (mili giây, giây, phút, giờ, ngày, tuần, tháng, năm). Dữ liệu chuỗi thời gian phổ biến trong nhiều ứng dụng như phân tích thị trường chứng khoán, phân tích ngân sách, các hiện tượng tự nhiên (nhiệt độ, gió, khí hậu, động đất, .), chữa bệnh,… Dữ liệu chuỗi thời gian thường có kích thước rất lớn, có thể lên đến nhiều gigabyte trong vòng một ngày (như dữ liệu chứng khoán), thậm chí trong vòng một phút (dữ liệu từ không gian NASA). Như vậy, bằng cách nào chúng ta có thể tìm được mối liên hệ trong dữ liệu chuỗi thời gian, bằng cách nào chúng ta có thể phân tích một lượng dữ liệu lớn như vậy để có thể tìm ra các mẫu tương tự hay thường xuyên, các xu hướng, bất thường một cách hiệu quả? Điều này trở thành một vấn đề quan trọng và đầy thử thách cho các nhà phân tích dữ liệu.1: Biểu diễn một loại dữ liệu chuỗi thời gian [37] 1.2 Khai phá luật trên dữ liệu chuỗi thời gian Dữ liệu chuỗi thời gian xuất hiện một cách tự nhiên trong hầu hết các lĩnh vực tự nhiên, xã hội cũng như nhiều ngành khác.

Khối dữ liệu này chứa nhiều thông tin hữu ích cho các nhà nghiên cứu của từng lĩnh vực tương ứng. Trong nghiên cứu khí tượng, dữ liệu chuỗi thời gian có thể được khai thác để dự báo khí hậu. Trong kinh tế, các nhà kinh tế muốn xác định xu hướng thay đổi trong thu nhập gia đình theo thời gian; các nhà đầu tư muốn dự đoán giá của một loại cổ phiếu nào đó sẽ thay đổi như thế nào theo thời gian… Từ đây ta thấy rằng việc phân tích dữ liệu chuỗi thời gian để khám phá các luật biến đổi trong dữ liệu chuỗi thời gian có ý nghĩa rất quan trọng trong nhiều lĩnh vực của đời sống. Khai phá luật trên dữ liệu chuỗi thời gian là một công việc quan trọng trong khai phá dữ liệu chuỗi thời gian vì đầu ra của nó thường nhắm vào con người, cung cấp cho người dùng một cái nhìn sâu sắc hơn về dữ liệu.

10 Khai phá luật trên chuỗi thời gian dựa trên tỉ số thay đổi và giải thuật FP-Growth Khai phá luật là một công việc điển hình trong khai phá dữ liệu. Khai phá luật kết hợp (Agrawal và các cộng sự [3]) là một trong những thuật toán nổi tiếng nhất. Tuy nhiên, nó chỉ tập trung vào các ký hiệu tượng trưng (symbolic) trong các phiên làm việc. Vì thế, nhiều nhà nghiên cứu đã đề xuất ra nhiều thuật toán mới hoặc được cải tiến nhằm khai phá luật trong dữ liệu chuỗi thời gian.

Hướng tiếp cận thông thường là đầu tiên sẽ rời rạc hóa dữ liệu chuỗi thời gian thành những đoạn và chuyển những đoạn này thành ký tự. Sau đó, các luật có thể được khai phá trong miền ký tự vừa được chuyển đổi. Das và các cộng sự [9] gom cụm các chuỗi con để tìm ra các ký tự, và sau đó áp dụng một thuật toán khai phá luật đơn giản để tìm ra luật. Last và các cộng sự [23] tập trung vào việc khám phá các luật kết hợp mờ, nó dựa vào nguyên lý tính toán tri thức (perception) và các kỹ thuật xử lý tín hiệu.

Leigh và các cộng sự [30] phát triển phương pháp khám phá luật thuộc về lĩnh vực tài chính, sử dụng kỹ thuật “bull flag”. Nhóm nghiên cứu của Hoppner [13] đã quan tâm tới thời khoảng và phát triển một framework để khám phá ra các luật thời gian, các luật này được hình thành từ một tập các mẫu thường xuyên trong một chuỗi trạng thái. Framework biểu diễn các đoạn của chuỗi thời gian bằng các thuộc tính (tăng, giá trị cao, cực trị cao) và khám phá ra các mối quan hệ thời khoảng được mô tả theo mẫu của logic thời khoảng. Một nhóm nghiên cứu khác của Hetland và Seatrom [24] đưa ra một phương pháp khai phá luật dựa trên lập trình di truyền và phần cứng chuyên dụng.

Họ cũng kiểm tra vai trò của rời rạc hóa khi rút ra các luật tiên đoán trên chuỗi thời gian. Cotofrei và Stoffel [25] đề xuất một phương pháp dựa trên logic vị từ cho việc khai phá luật. Theo hướng tiếp cận này, đầu tiên sẽ biến đổi chuỗi dữ liệu ban đầu thành chuỗi các sự kiện, sau đó rút ra các luật thời gian bằng cách sử dụng cây phân lớp.3 Mục tiêu đề tài Mục tiêu của đề tài là phát triển một giải thuật khai phá luật trên dữ liệu chuỗi thời gian nhằm khám phá ra đúng được các mẫu thức thời gian thường xuyên và luật từ dữ liệu chuỗi thời gian và có ý nghĩa hơn với người sử dụng. Các dạng mẫu thức thời gian và luật này vẫn chưa được đầu tư nhiều trong các công trình hiện tại về bài toán khai phá luật trên dữ liệu chuỗi thời gian.

Hiệu suất của giải thuật cũng được quan tâm để nâng cao hiệu quả của quá trình khai phá luật. Đề tài sẽ cải tiến giải thuật FP-Growth để nâng cao hiệu quả của quá trình khai phá ra các mẫu thường xuyên, từ đó cải thiện quá trình khai phá luật, áp dụng quan hệ thời gian Allen vào quá trình khai phá luật làm cho các luật được sinh ra sẽ dễ hiểu hơn và gần gũi hơn với người dùng.4 Phạm vi đề tài Đề tài hiện thực quá trình khai phá luật theo dạng: VT →t VP(s, c) (1) Ở đây, VT chỉ phần đầu của luật, VP là kết quả của luật và quan hệ thời gian t ở đây dựa trên các phép toán quan hệ thời gian của Allen; s,c là độ hỗ trợ và độ tin cậy tương ứng của luật. 11 Khai phá luật trên chuỗi thời gian dựa trên tỉ số thay đổi và giải thuật FP-Growth Trong giới hạn thời gian được phép, đề tài chỉ tập trung khai phá luật theo dạng luật (1) trên chuỗi thời gian và đánh giá kết quả đạt được. Vì dữ liệu chuẩn cho bài toán khai phá luật trên chuỗi thời gian chưa phổ biến nên luận văn sử dụng dữ liệu chứng khoán của thị trường chứng khoán Việt Nam làm dữ liệu thực nghiệm.5 Ý nghĩa của đề tài 1.

Ý nghĩa khoa học: - Giải thuật khai phá luật trên dữ liệu chuỗi thời gian mới được định nghĩa dựa trên sự cải tiến của giải thuật FP-growth. Giải thuật được kiểm chứng là khai phá ra đúng được các mẫu thức thường xuyên và luật; đồng thời hiệu quả hơn giải thuật brute-force. - Đề tài hiện thực một quá trình khai phá luật trên dữ liệu chuỗi thời gian. Luật được khai phá có quan tâm nhiều đến yếu tố thời gian làm cho các luật được khai phá ra dễ hiểu hơn do đó có ý nghĩa hơn với người dùng.

Ý nghĩa thực tiễn: - Kết quả của quá trình khai phá có thể áp dụng trên nhiều miền dữ liệu khác nhằm khai phá ra các thông tin có ý nghĩa trên nhiều miền dữ liệu khác nhau. Kết quả này có thể áp dụng vào các hệ thống dự đoán giá trị tương lai cho các loại dữ liệu chuỗi thời gian như: trong chứng khoán có thể dự đoán giá cổ phiếu của một loại cổ phiếu nào đó biến đổi như thế nào (tăng, giảm, ổn định) trong tương lai hoặc dự đoán sau khoảng thời gian t bao lâu thì giá của một cổ phiếu nào đó là tăng, giảm hay ổn định, kết quả này giúp cho các nhà đầu tư có thêm cơ sở để đưa ra quyết định đầu tư vào loại cổ phiếu nào là có lợi cho họ. Kết quả này cũng có thể áp dụng cho các miền dữ liệu chuỗi thời gian khác như với dữ liệu về thời tiết, kết quả khai phá giúp các nhà dự báo thời tiết có thể dự đoán thời tiết sẽ biến động như thế nào trong tương lai hoặc là ứng với thời tiết hiện như vậy thì sau bao lâu sẽ xảy ra bão, hạn hán, động đất,… 12 Khai phá luật trên chuỗi thời gian dựa trên tỉ số thay đổi và giải thuật FP-Growth Chương 2: TỔNG QUAN VỀ CÁC CÔNG TRÌNH LIÊN QUAN Kết quả của việc phát triển các kỹ thuật tự động thu thập và lưu trữ dữ liệu lớn là chúng ta đang sống trong thời đại bùng nổ dữ liệu. Có rất nhiều ứng dụng tạo ra một lượng lớn dữ liệu chuỗi thời gian như dữ liệu về chứng khoán, dữ liệu điện tâm đồ, các hiện tượng tự nhiên, ….

Việc khai phá luật trên các tập dữ liệu này tạo ra một thách thức lớn cho các nhà phân tích dữ liệu. Người ta thường quan tâm đến việc phân tích dữ liệu chuỗi thời gian vì hai lý do: - Mô hình chuỗi thời gian: để có được cái nhìn sâu hơn vào cơ chế tạo ra chuỗi thời gian. - Dự đoán chuỗi thời gian: để dự đoán giá trị tương lai của biến chuỗi thời gian. Theo truyền thống, người ta xây dựng các mô hình cho dữ liệu chuỗi thời gian và sau đó đưa các giá trị quan sát thực tế vào những mô hình này.

Nếu một mô hình thành công trong việc giải thích chuỗi thời gian quan sát được thì giá trị tương lai của chuỗi thời gian có thể được tiên đoán. Khai phá luật trên dữ liệu chuỗi thời gian là tìm ra các quy luật thể hiện mối liên hệ kết hợp, tương quan giữa các mẫu thức trên tập chuỗi thời gian. Phần này sẽ trình bày về quá trình khai phá luật và các công trình liên quan của quá trình này.1 Tiền xử lý Dữ liệu chuỗi thời gian thường được thu thập từ nhiều nguồn khác nhau, dữ liệu thu được thường là dữ liệu thô và có thể không nhất quán do nhiều nguyên nhân như thiết bị đo thiếu chính xác, ảnh hưởng của các yếu tố tự nhiên,… Khi đó, nếu thực hiện phân tích trên tập dữ liệu này sẽ cho ra những kết quả thiếu chính xác, và không có ý nghĩa, do vậy, trước khi đưa dữ liệu này vào phân tích cần phải thực hiện một số thao tác tiền xử lý để chuẩn hóa dữ liệu này trước. Tiền xử lý dữ liệu chuỗi thời gian đòi hỏi phải có các phương pháp đặc biệt để kết hợp với chiều thời gian.

Một bước quan trọng trong quá trình này là giảm nhiễu, việc lọc nhiễu có thể thực hiện bằng cách dùng các bộ lọc kỹ thuật số [27] hoặc wavelet thresholding. Các kỹ thuật tách giá trị đặc trưng được dùng để chuyển chuỗi giá trị gốc sang nhiều miền giá trị có ý nghĩa khác hoặc là để cung cấp thêm thông tin.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tóm tắt luận văn "Khai Phá Luật trên Chuỗi Thời Gian: Ứng Dụng Tỉ Số Thay Đổi và FP-Growth":

Luận văn này tập trung vào việc khai phá các luật quan trọng ẩn chứa trong dữ liệu chuỗi thời gian bằng cách sử dụng tỉ số thay đổi để biểu diễn dữ liệu và thuật toán FP-Growth để khai phá các luật kết hợp. Phương pháp này giúp xác định các mối quan hệ và xu hướng tiềm ẩn trong dữ liệu chuỗi thời gian, từ đó hỗ trợ ra quyết định trong nhiều lĩnh vực như tài chính, y tế, và công nghiệp. Việc sử dụng tỉ số thay đổi giúp chuẩn hóa dữ liệu và làm nổi bật các biến động quan trọng, còn thuật toán FP-Growth cho phép khai phá luật hiệu quả ngay cả với dữ liệu lớn. Nếu bạn quan tâm đến việc tìm kiếm các mẫu (motif) lặp đi lặp lại trong chuỗi thời gian, hãy xem thêm: Luận văn thạc sĩ hcmute tìm kiếm motif trên chuỗi thời gian bằng giải thuật scrimp, đây là một hướng tiếp cận khác để khám phá thông tin từ chuỗi thời gian. Ngoài ra, để hiểu rõ hơn về các phương pháp dự báo chuỗi thời gian, bạn có thể tham khảo Luận văn thạc sĩ hcmute dự báo trên chuỗi thời gian dựa trên so trùng mẫu sử dụng nhiều độ đo. Cuối cùng, nếu bạn muốn khám phá cách Deep Learning có thể được áp dụng trong dự báo chuỗi thời gian, hãy đọc Chuyên đề thực tập ứng dụng deep learning trong dự báo chuỗi thời gian.