Dự Báo Dữ Liệu Chuỗi Thời Gian Sử Dụng Giải Thuật K-Lân Cận Gần Nhất

Luận văn thạc sĩ nghiên cứu máy tính dự báo dữ liệu chuỗi thời gian bằng một tập hợp giải thuật k lân cận gần nhất, khảo sát thực trạng, phân tích nguyên nhân, đề xuất giải pháp

Trường đại học

Đại học Bách Khoa, ĐHQG TP.HCM

Chuyên ngành

Khoa học Máy tính

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ

2015

77
3
0

Phí lưu trữ

30 Point

Tóm tắt

I. Tổng Quan Dự Báo Chuỗi Thời Gian K Lân Cận Gần Nhất

Dự báo dữ liệu chuỗi thời gian là một lĩnh vực quan trọng trong khai phá dữ liệu, nhằm dự đoán các giá trị tương lai dựa trên các quan sát quá khứ. Trong bối cảnh mà dữ liệu được thu thập liên tục theo thời gian, việc dự báo trở nên vô cùng cần thiết để hỗ trợ ra quyết định trong nhiều lĩnh vực. Một trong những phương pháp dự báo phổ biến và dễ triển khai là sử dụng giải thuật K-lân cận gần nhất (k-NN). Phương pháp này dựa trên nguyên tắc là các điểm dữ liệu gần nhau trong không gian đặc trưng có xu hướng có giá trị tương tự. Tuy nhiên, k-NN cũng tồn tại những hạn chế nhất định, đặc biệt là độ nhạy cảm với các tham số đầu vào. Các tham số như số lượng lân cận gần nhất (k), hàm trọng số, tầm vực dự báo hay chiều dài vector truy vấn đều có thể ảnh hưởng đáng kể đến độ chính xác của dự báo. Việc lựa chọn tham số tối ưu trở thành một thách thức lớn.

1.1. Ứng dụng Dự Báo Chuỗi Thời Gian trong Thực Tế

Dự báo chuỗi thời gian được ứng dụng rộng rãi trong nhiều ngành. Trong lĩnh vực kinh tế, nó giúp dự đoán xu hướng thị trường chứng khoán, doanh số bán hàng, hoặc tỷ giá hối đoái. Trong lĩnh vực năng lượng, nó có thể dự báo nhu cầu điện, giá dầu, hoặc hiệu suất của các hệ thống năng lượng tái tạo. Ngành khí tượng thủy văn sử dụng để dự báo thời tiết, lượng mưa, mực nước sông, giúp phòng tránh thiên tai và hỗ trợ sản xuất nông nghiệp. Nghiên cứu của Hoàng Trung Hiếu đã chỉ ra tầm quan trọng của nó trong việc hỗ trợ ra quyết định nhanh chóng và chính xác.

1.2. Ưu điểm và Nhược điểm của K NN trong Dự Báo

Giải thuật k-NN nổi bật với sự đơn giản, dễ hiểu và dễ triển khai. Không yêu cầu giả định về phân phối dữ liệu. Tuy nhiên, nó có một số hạn chế. Việc lựa chọn số lượng lân cận gần nhất (k) phù hợp là một thách thức. K-NN còn nhạy cảm với dữ liệu nhiễu và có thể tốn kém về mặt tính toán khi kích thước dữ liệu lớn. Bài toán lựa chọn tham số tối ưu, đặc biệt là tham số k, là một vấn đề cần được giải quyết.

II. Vấn Đề Với Tham Số Trong Dự Báo K Lân Cận Gần Nhất

Một trong những thách thức lớn nhất khi sử dụng k-NN cho dự báo chuỗi thời gian là độ nhạy cảm của nó đối với các tham số đầu vào. Tham số quan trọng nhất là số lượng lân cận gần nhất (k). Việc lựa chọn một giá trị k phù hợp có thể ảnh hưởng đáng kể đến độ chính xác của dự báo. Nếu k quá nhỏ, mô hình có thể dễ bị ảnh hưởng bởi dữ liệu nhiễu. Nếu k quá lớn, mô hình có thể bỏ qua các xu hướng cục bộ quan trọng. Nghiên cứu của Yankov và cộng sự (2006) đã chỉ ra sự cần thiết của việc tìm kiếm một phương pháp lựa chọn k tối ưu hoặc sử dụng một tập hợp các mô hình k-NN với các giá trị k khác nhau.

2.1. Ảnh Hưởng của Số Lượng Lân Cận k Đến Độ Chính Xác

Giá trị 'k' có ảnh hưởng trực tiếp đến kết quả dự báo. k nhỏ dẫn đến dự báo nhạy cảm hơn với nhiễu. k lớn làm mượt dự báo nhưng có thể bỏ qua các biến động nhỏ. Tìm 'k' tối ưu là bài toán quan trọng. Các phương pháp như cross-validation time series có thể được sử dụng để ước lượng giá trị 'k' phù hợp.

2.2. Tầm Quan Trọng Của Hàm Trọng Số Trong K NN Dự Báo

Hàm trọng số xác định mức độ ảnh hưởng của mỗi lân cận đến dự báo cuối cùng. Một số hàm trọng số phổ biến bao gồm trọng số đều (mỗi lân cận có ảnh hưởng như nhau) và trọng số nghịch đảo khoảng cách (lân cận gần hơn có ảnh hưởng lớn hơn). Việc lựa chọn hàm trọng số phù hợp có thể cải thiện đáng kể độ chính xác dự báo. Cần xem xét các đặc tính của dữ liệu để chọn hàm trọng số phù hợp.

2.3. Chiều Dài Vector Truy Vấn Ảnh Hưởng Thế Nào Tới Dự Báo

Chiều dài của vector truy vấn (query vector) ảnh hưởng đến khả năng tìm kiếm các mẫu tương tự trong lịch sử. Vector truy vấn quá ngắn có thể không nắm bắt được các xu hướng quan trọng. Vector truy vấn quá dài có thể làm tăng độ phức tạp tính toán và giảm độ chính xác. Nên lựa chọn chiều dài vector truy vấn phù hợp với tính chất của chuỗi thời gian và mục tiêu dự báo.

III. Phương Pháp Tập Hợp K NN Giải Pháp Cho Độ Nhạy Tham Số

Để khắc phục nhược điểm về độ nhạy cảm tham số của k-NN, một phương pháp tiếp cận hiệu quả là sử dụng tập hợp giải thuật k-NN. Thay vì chỉ sử dụng một mô hình k-NN duy nhất với một giá trị k cố định, phương pháp này xây dựng một tập hợp các mô hình k-NN với các giá trị k khác nhau. Sau đó, kết quả dự báo từ các mô hình khác nhau được kết hợp để tạo ra một dự báo tổng hợp. Phương pháp này có thể giảm độ nhạy cảm với các tham số đầu vào và cải thiện độ chính xác dự báo.

3.1. Xây Dựng Tập Hợp Các Mô Hình K NN Đa Dạng

Quá trình xây dựng tập hợp k-NN bao gồm việc huấn luyện nhiều mô hình k-NN với các tham số khác nhau (ví dụ: giá trị k khác nhau, hàm trọng số khác nhau). Các mô hình này được huấn luyện trên cùng một tập dữ liệu hoặc các tập con khác nhau của dữ liệu. Sự đa dạng của các mô hình trong tập hợp là yếu tố quan trọng để đảm bảo tính ổn định và độ chính xác của dự báo tổng hợp.

3.2. Kết Hợp Kết Quả Dự Báo Từ Nhiều Mô Hình K NN

Có nhiều phương pháp để kết hợp kết quả dự báo từ các mô hình k-NN trong tập hợp. Một phương pháp đơn giản là tính trung bình các dự báo. Các phương pháp phức tạp hơn bao gồm sử dụng các mô hình học máy để học cách kết hợp các dự báo một cách tối ưu. Việc lựa chọn phương pháp kết hợp phù hợp phụ thuộc vào đặc tính của dữ liệu và mục tiêu dự báo. Nghiên cứu của Yankov và cộng sự (2006) đã đề xuất sử dụng một tập hợp gồm hai bộ dự báo con {k1-NN, k2-NN} để cải thiện độ chính xác.

3.3. Ưu Điểm Của Phương Pháp Tập Hợp So Với K NN Đơn Lẻ

Phương pháp tập hợp k-NN có một số ưu điểm so với k-NN đơn lẻ. Nó ít nhạy cảm hơn với các tham số đầu vào. Nó có thể cải thiện độ chính xác dự báo, đặc biệt là trong các trường hợp dữ liệu phức tạp hoặc không ổn định. Nó cung cấp một ước lượng về độ không chắc chắn của dự báo, giúp người dùng đưa ra quyết định sáng suốt hơn. Dù vậy phương pháp tập hợp có thể phức tạp hơn so với K-NN đơn lẻ, đòi hỏi chi phí tính toán cao hơn.

IV. Các Bước Triển Khai Dự Báo Chuỗi Thời Gian Với K NN

Để triển khai dự báo chuỗi thời gian bằng k-NN, cần thực hiện một số bước cơ bản. Đầu tiên, cần tiền xử lý dữ liệu để loại bỏ nhiễu và chuẩn hóa dữ liệu. Sau đó, cần lựa chọn các tham số phù hợp cho mô hình k-NN, chẳng hạn như số lượng lân cận gần nhất (k), hàm trọng số, và độ dài vector truy vấn. Tiếp theo, cần huấn luyện mô hình k-NN trên tập dữ liệu lịch sử. Cuối cùng, cần đánh giá hiệu suất của mô hình trên tập dữ liệu kiểm tra và tinh chỉnh các tham số nếu cần thiết.

4.1. Tiền Xử Lý Dữ Liệu Bước Quan Trọng Để Tăng Độ Chính Xác

Data preprocessing time series bao gồm làm sạch dữ liệu (xử lý giá trị thiếu, loại bỏ ngoại lệ), chuẩn hóa dữ liệu (đảm bảo các biến có cùng thang đo), và trích xuất các đặc trưng phù hợp (ví dụ: tính các thống kê mô tả, sử dụng feature engineering time series để tạo các biến mới). Bước này có thể cải thiện đáng kể độ chính xác và độ ổn định của mô hình k-NN. Việc phân tách seasonal decomposition of time series và xử lý trend analysis time series là các bước quan trọng.

4.2. Lựa Chọn Tham Số Cho Mô Hình K NN Hướng Dẫn Chi Tiết

Việc lựa chọn tham số phù hợp là rất quan trọng. Sử dụng cross-validation time series để tìm kiếm các tham số tối ưu. Thử nghiệm với các giá trị k khác nhau và các hàm trọng số khác nhau. Sử dụng các forecasting accuracy metrics như mean absolute error (MAE), root mean squared error (RMSE), và mean absolute percentage error (MAPE) để đánh giá hiệu suất của các cấu hình tham số khác nhau.

4.3. Đánh Giá và Tinh Chỉnh Mô Hình Để Đạt Hiệu Quả Tối Ưu

Sau khi huấn luyện mô hình, cần đánh giá hiệu suất của mô hình trên tập dữ liệu kiểm tra. Sử dụng các forecasting accuracy metrics để đánh giá độ chính xác của dự báo. Nếu hiệu suất không đạt yêu cầu, cần tinh chỉnh các tham số của mô hình hoặc thử nghiệm với các phương pháp tiền xử lý dữ liệu khác nhau. Vòng lặp đánh giá và tinh chỉnh này giúp đảm bảo rằng mô hình k-NN hoạt động tốt trên dữ liệu mới.

V. Ứng Dụng Thực Tế Dự Báo Năng Lượng Bằng Giải Thuật K NN

Luận văn của Hoàng Trung Hiếu đã áp dụng phương pháp dự báo dữ liệu chuỗi thời gian bằng tập hợp giải thuật K-lân cận gần nhất vào bài toán dự báo nhu cầu năng lượng ở Ý. Dữ liệu này thể hiện sự biến động của nhu cầu điện theo thời gian, chịu ảnh hưởng bởi nhiều yếu tố như thời tiết, mùa vụ, và hoạt động kinh tế. Kết quả thực nghiệm cho thấy việc sử dụng tập hợp giải thuật k-NN có thể cải thiện độ chính xác dự báo so với việc chỉ sử dụng một giải thuật k-NN đơn lẻ.

5.1. Phân Tích Dữ Liệu Nhu Cầu Năng Lượng ở Ý Với K NN

Phân tích dữ liệu nhu cầu năng lượng ở Ý bằng k-NN đòi hỏi phải hiểu rõ đặc điểm của dữ liệu, như tính mùa vụ, xu hướng, và các yếu tố ngẫu nhiên. Việc phân tích này giúp lựa chọn các tham số phù hợp cho mô hình k-NN và đánh giá khả năng dự báo của mô hình.

5.2. Kết Quả Thực Nghiệm và So Sánh Với Phương Pháp K NN Đơn Lẻ

Kết quả thực nghiệm cho thấy việc sử dụng tập hợp giải thuật k-NN có thể giảm sai số dự báo so với phương pháp k-NN đơn lẻ. Cụ thể, luận văn đã sử dụng một tập hợp gồm hai giải thuật k-NN với các giá trị k khác nhau và kết hợp kết quả dự báo từ hai giải thuật này để tạo ra một dự báo tổng hợp.

5.3. Đánh Giá Ưu Nhược Điểm của K NN trong Bài Toán Dự Báo Năng Lượng

Trong bài toán dự báo năng lượng, k-NN có ưu điểm là dễ triển khai và không yêu cầu giả định về phân phối dữ liệu. Tuy nhiên, nó cũng có một số nhược điểm, như độ nhạy cảm với tham số k và chi phí tính toán cao khi kích thước dữ liệu lớn. Cần cân nhắc kỹ lưỡng các ưu nhược điểm này khi lựa chọn phương pháp dự báo.

VI. Kết Luận và Hướng Phát Triển Dự Báo K NN Chuỗi Thời Gian

Phương pháp dự báo chuỗi thời gian bằng giải thuật k-NN là một công cụ hữu ích trong nhiều lĩnh vực. Tuy nhiên, để đạt được hiệu quả tốt nhất, cần chú ý đến việc lựa chọn tham số, tiền xử lý dữ liệu, và đánh giá hiệu suất mô hình. Các nghiên cứu gần đây đã tập trung vào việc cải thiện độ chính xác và độ ổn định của k-NN thông qua các phương pháp tập hợp, deep learning for time series và kết hợp với các mô hình khác.

6.1. Tóm Tắt Những Kết Quả Đạt Được và Đóng Góp Của Đề Tài

Đề tài đã nghiên cứu và triển khai thành công phương pháp dự báo chuỗi thời gian bằng tập hợp giải thuật k-NN. Kết quả thực nghiệm cho thấy phương pháp này có thể cải thiện độ chính xác dự báo so với phương pháp k-NN đơn lẻ. Đề tài cũng đã đưa ra một số khuyến nghị về việc lựa chọn tham số và tiền xử lý dữ liệu để đạt được hiệu quả tốt nhất.

6.2. Hướng Phát Triển Tiềm Năng Cho Nghiên Cứu Tiếp Theo

Các hướng phát triển tiềm năng bao gồm: Nghiên cứu các phương pháp lựa chọn tham số k tối ưu cho từng loại dữ liệu. Kết hợp k-NN với các mô hình khác, chẳng hạn như ARIMA models hoặc exponential smoothing models, để tận dụng ưu điểm của cả hai phương pháp. Áp dụng k-NN vào các bài toán dự báo chuỗi thời gian phức tạp hơn, chẳng hạn như dự báo giá chứng khoán hoặc dự báo thời tiết. Nghiên cứu việc sử dụng machine learning for time series, ví dụ như recurrent neural networks (RNN), long short-term memory (LSTM), hoặc convolutional neural networks (CNN time series).

28/05/2025
Luận văn thạc sĩ khoa học máy tính dự báo dữ liệu chuỗi thời gian bằng một tập hợp giải thuật k lân cận gần nhất

Trích đoạn nội dung tài liệu

CHƯƠNG I: GIỚI THIỆU ĐỀ TÀI Chương này sẽ giới thiệu vấn đề, mục tiêu và động lực để thực hiện đề tài nghiên cứu này cũng như tóm lược những kết quả đạt được. Cuối cùng là cấu trúc toàn cục của luận văn 1. Giới thiệu vấn đề: Ngày nay, khi xã hội ngày càng phát triển thì thông qua các hoạt động công nghệ hằng ngày thì lượng thông tin cũng như dữ liệu ngày càng bùng nổ và tăng lên một cách nhanh chóng. Lượng dữ liệu khổng lồ này đến từ nhiều nguồn khác nhau như, y tế, tài chính, kinh tế, giáo dục, khoa học kỹ thuật… và cũng là một nguồn tài nguyên vô cùng quý giá nếu chúng ta có thể phát hiện và khai thác những thông tin trong lượng dữ liệu đó để qua đó có thể hỗ trợ việc đưa ra những quyết định một cách nhanh chóng và chính xác nhất có thể.

Và từ những nhu cầu thực tế này, rất nhiều các nhà khoa học đã và đang phát triển những phương pháp cũng như hệ thống khai phá dữ liệu.Và một trong những hướng nghiên cứu khai phá dữ liệu phổ biến hiện nay chính là kỹ thuật khai phá dữ liệu chuỗi thời gian. Ngày nay, chúng ta có thể dễ dàng nhìn thấy dữ liệu chuỗi thời gian ở khắp các phương tiện thông tin, từ internet, sách báo, truyền hình… và nguồn phát sinh dữ liệu chuỗi thời gian cũng rất đa dạng và phổ biến (từ tài chính, kinh tế, những số liệu chứng khoán, số liệu khí tượng thủy văn, môi trường…). Qua đó có thể thấy được rằng dữ liệu chuỗi thời gian phổ biến như thế nào trong thống kê tại thời điểm hiện tại. Và các nhà đầu tư cần phải có công cụ hỗ trợ để dự báo được những nhu cầu cũng như biến động của thị trường để có phương hướng, chính sách, chiến lược phù hợp cho thời gian tới.

Vậy chuỗi thời gian là gì? Đó là một tập hợp dữ liệu mà các giá trị của nó được quan sát và đo được một cách tuần tự theo những khoảng thời gian bằng nhau. Hiện tại có rất nhiều kỹ thuật khai phá dữ liệu chuỗi thời gian, và một trong những kỹ thuật phổ biến nhất chính là dự báo dữ liệu chuỗi thời gian.Các phương pháp dự Hoàng Trung Hiếu 1 Dự báo dữ liệu chuỗi thời gian bằng tập hợp giải thuật k lân cận gần nhất báo dữ liệu chuỗi thời gian rất có ý nghĩa trong nhiều lĩnh vực khác nhau. Ví dụ như trong lĩnh vực kinh tế, việc dự báo các chỉ số chứng khoán có thể hỗ trợ cho việc ra quyết định cho các nhà đầu tư; hay trong lĩnh vực khí tượng thủy văn có thể dự báo lượng mưa tăng hay giảm so với những năm trước để qua đó hỗ trợ thông tin cho ngành nông nghiệp có những dự trù phù hợp cho việc canh tác… 1. Mục tiêu và nhiệm vụ nghiên cứu Hiện nay có rất nhiều kỹ thuật, phương pháp cũng như giải thuật rất hữu hiệu cho việc dự báo dữ liệu chuỗi thời gian mà có thể kể đến như: Mô hình ARIMA (Auto Regressive Integrate Moving Average); Làm trơn hàm mũ, Mạng nơ-ron, k lân cận gần nhất.

+ Những phương pháp làm trơn hàm mũ [9] (Exponential Smoothing Methods) gồm những phương pháp  Làm trơn hàm mũ bậc một (Single Exponential Smoothing) dùng cho những chuỗi thời gian không có tính xu hướng và không có tính mùa.  Làm trơn hàm mũ bậc 2 (Double Exponential Smoothing) dùng cho chuỗi thời gian có tính xu hướng và không có tính mùa.  Mô hình Winter’s dùng cho những chuỗi thời gian vừa có tính xu hướng và có tính mùa. + Mô hình ARIMA (Auto Regressive Integrated Moving Average) [9] được dùng cho chuỗi thời gian không có tính dừng (non-stationary) nhưng được làm cho có tính dừng (stationary) bằng cách tính toán sự khác nhau giữa các điểm dữ liệu.

+ Dự báo chuỗi thời gian với mạng Nơ-ron nhân tạo (ANN) [9] là mô hình sử dụng ANN để dự báo điểm dữ liệu Xt+1 với những node input của ANN là s điểm dữ liệu trước đó (Xt-s … Xt) của nó. + k-NN là phương pháp sử dụng khoảng cách Euclid để xác định những lân cận của câu truy vấn qua đó tìm ra giá trị dự báo tương ứng. Hoàng Trung Hiếu 2 Dự báo dữ liệu chuỗi thời gian bằng tập hợp giải thuật k lân cận gần nhất Trong số những phương pháp nói trên thì phương pháp dùng k-NN để dự báo chuỗi thời gian là một phương pháp khá đơn giản và dễ hiện thực nên rất phổ biến trong các hệ thống dự báo. Tuy nhiên, phương pháp này lại có một hạn chế [1] đáng lưu ý, đó là nó khá nhạy cảm với sự thay đổi của những tham số nhập vào; chẳng hạn như: số lân cận gần nhất, hàm lựa chọn trọng số, tầm vực dự báo, chiều dài của câu truy vấn.

Nhận ra được sự ảnh hưởng đáng kể của tham số k lân cận gần nhất của phương pháp k lân cận gần nhất truyền thống, Yankov và các cộng sự năm 2006[2] đã đề xuất một phương pháp Dự báo dữ liệu chuỗi thời gian dựa vào một tập hợp giải thuật k-lân cận gần nhất nhằm mục đích cải thiện được độ chính xác của phương pháp dự báo so với phương pháp k-lân cận gần nhất đơn lẻ. Trong bài báo nêu trên, Yankov và các cộng sự đã để mở một số vấn đề của phương pháp này, đó là: i. làm cách nào để phân lớp những mẫu truy vấn chuỗi thời gian thành 2 lớp sao cho ứng với mỗi lớp mẫu truy vấn đó được dự báo tốt hơn với một trong hai bộ dự báo con ki-NN trong tập hợp {k1-NN, k2-NN}. làm cách nào để xác định hai tham số k1 và k2 của hai bộ dự báo con Và trong phạm vi đề tài này, chúng tôi ứng dụng phương pháp dự báo dữ liệu chuỗi thời gian dựa vào một tập hợp giải thuật k lân cận gần nhất do Yankov và các cộng sự đề xuất, giải quyết 2 vấn đề còn tồn đọng trong phương pháp này, và so sánh sự hữu hiệu của phương pháp này với phương pháp dự báo dữ liệu chuỗi thời gian sử dụng giải thuật k-NN đơn lẻ.

* Nội dung nghiên cứu của đề tài bao gồm các công việc sau: + Phân đoạn dữ liệu chuỗi thời gian thành những chuỗi con dựa vào phương pháp những điểm cực trị quan trọng (important extreme points), đề xuất bởi Pratt và Fink [3] + Tìm hiểu giải thuật gom cụm K-means để gom cụm các phân đoạn chuỗi thời gian thành 2 cụm khác nhau qua đó tìm ra 2 chuỗi con trung tâm trong 2 nhóm các phân đoạn của chuỗi thời gian. Hoàng Trung Hiếu 3 Dự báo dữ liệu chuỗi thời gian bằng tập hợp giải thuật k lân cận gần nhất + Tìm hiểu phương pháp dự báo dữ liệu chuỗi thời gian dùng giải thuật k-NN (k Nearest Neighbor). + Hiện thực một chương trình dự báo dữ liệu chuỗi thời gian bằng cách sử dụng một tập hợp gồm 2 giải thuật k-NN. Sơ lược về kết quả thu được Như đã nói ở trên, mục đính chính của luận văn chính là hiện thực một hệ thống dự báo dữ liệu chuỗi thời gian bằng một tập hợp giải thuật k-NN và so sánh với phương pháp dự báo chỉ sử dụng k-NN đơn lẻ.

Và trong suốt quá trình nghiên cứu và thử nghiệm, chúng tôi thấy được một số ưu điểm của phương pháp dùng tập hợp giải thuật k-NN so với phương pháp chỉ dùng một giải thuật k-NN đơn chính là + Kết quả dự báo chính xác hơn. + Có thể dự báo tốt đối với dữ liệu chuỗi thời gian có tính biến động cao 1. Cấu trúc của luận văn Phần còn lại của luận văn bao gồm những phần sau: Chương II chúng tôi trình bày lý thuyết tổng quan về dữ liệu chuỗi thời gian cùng với đó là giới thiệu một số phương pháp dự báo thường gặp; sử dụng giải thuật k-NN trong việc dự báo chuỗi thời gian; và một số khái niệm, lý thuyết có sử dụng trong bài luận văn. Chương III chúng tôi giới thiệu một số công trình có liên quan: những công trình về giải thuật Chương IV sẽ đề xuất một phương pháp mới của chúng tôi và các bước hiện thực để giải quyết bài toán Chương V chúng tôi trình bày những kết quả đạt được sau khi hiện thực và thử nghiệm trên một số bộ dữ liệu mẫu.

Chương VI trình bày một số kết luận sau khi thực hiện đề tài. Hoàng Trung Hiếu 4 Dự báo dữ liệu chuỗi thời gian bằng tập hợp giải thuật k lân cận gần nhất CHƯƠNG II: CƠ SỞ LÝ THUYẾT Chương này sẽ giới thiệu một cách tổng quan về dữ liệu chuỗi thời gian cùng các thành phần của chuỗi thời gian và một số phương pháp dự báo chuỗi thời gian thường gặp. Ứng dụng giải thuật k-lân cận gần nhất trong bài toán dự báo chuỗi thời gian cùng một số định nghĩa cũng như lý thuyết có liên quan đến đề tài. Dữ liệu chuỗi thời gian Dữ liệu chuỗi thời gian (Time Series Data) là dữ liệu bao gồm tập hợp các điểm dữ liệu được đo được bằng cách quan sát, đo đạc một cách tuần tự theo những khoảng thời gian rời rạc và cách đều nhau.

Ví dụ: dữ liệu về lượng mưa trung bình theo từng năm của một quốc gia, vùng lãnh thổ; hay dữ liệu doanh thu hằng tháng, quý, năm của một doanh nghiệp; chỉ số chứng khoán của công ty… và dữ liệu thường được biểu diễn dưới dạng chuỗi thời gian.1 minh họa một ví dụ về dữ liệu chuỗi thời gian Hình 2.1: Ví dụ về dữ liệu chuỗi thời gian Hoàng Trung Hiếu 5 Dự báo dữ liệu chuỗi thời gian bằng tập hợp giải thuật k lân cận gần nhất Các thành phần của một chuỗi thời gian: Về lý thuyết, bất kỳ chuỗi thời gian nào cũng có 4 thành phần [9][10][11] ảnh hưởng trực tiếp lên giá trị của chuỗi thời gian, đó là các thành phần: + Xu hướng (trend) + Mùa (seasonal) + Chu kỳ (cycle) + Bất thường (irregular) Việc xác định những thành phần này rất quan trọng trong những bài toán dự báo chuỗi thời gian, giúp cho ta lựa chọn mô hình dự báo phù hợp. - Thành phần xu hướng: Tính xu hướng của chuỗi thời gian tồn tại khi cho một sự tăng hoặc giảm trong một thời gian dài của dữ liệu. Đường xu hướng không cần phải tuyến tính.2 minh họa thành phần xu hướng của chuỗi thời gian (đường màu xanh lá) Hình 2.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề "Dự Báo Dữ Liệu Chuỗi Thời Gian Bằng Giải Thuật K-Lân Cận Gần Nhất" cung cấp cái nhìn sâu sắc về việc sử dụng giải thuật K-Lân Cận Gần Nhất (KNN) trong việc dự đoán dữ liệu chuỗi thời gian. Tác giả phân tích cách mà KNN có thể được áp dụng để cải thiện độ chính xác trong dự đoán, đồng thời nêu bật những lợi ích của việc sử dụng phương pháp này, như khả năng xử lý dữ liệu lớn và tính linh hoạt trong các ứng dụng thực tiễn.

Để mở rộng kiến thức của bạn về lĩnh vực này, bạn có thể tham khảo thêm tài liệu "Luận văn thạc sĩ khoa học máy tính phân lớp dữ liệu chuỗi thời gian dựa vào phép biến đổi sax và mô hình không gian véc tơ", nơi trình bày về phân lớp dữ liệu chuỗi thời gian bằng các phương pháp biến đổi khác nhau. Ngoài ra, tài liệu "Luận văn thạc sĩ khoa học máy tính gom cụm dữ liệu chuỗi thời gian với giải thuật kmedoids cải tiến và độ đo xoắn thời gian động cải tiến pruneddtw" sẽ giúp bạn hiểu rõ hơn về việc gom cụm dữ liệu trong chuỗi thời gian. Cuối cùng, tài liệu "Luận văn thạc sĩ khoa học máy tính phân lớp dữ liệu chuỗi thời gian dựa vào một tổ hợp phân lớp 1nn với các độ đo khoảng cách khác nhau và công nghệ gpu" sẽ cung cấp thêm thông tin về các phương pháp phân lớp hiện đại trong lĩnh vực này. Những tài liệu này không chỉ mở rộng kiến thức của bạn mà còn cung cấp nhiều góc nhìn khác nhau về các kỹ thuật phân tích dữ liệu chuỗi thời gian.