Luận án TS. Nghiêm Văn Tính: Nâng cao độ chính xác dự báo chuỗi thời gian mờ

Luận án tiến sĩ ngành máy tính trình bày các phương pháp nâng cao độ chính xác dự báo trong mô hình chuỗi thời gian mờ, góp phần phát triển nghiên cứu.

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

luận án tiến sĩ

2022

157
2
0

Phí lưu trữ

45 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

1. CHƯƠNG 1: NHỮNG KIẾN THỨC LIÊN QUAN

1.1. Các khái niệm về chuỗi thời gian

1.2. Chuỗi thời gian

1.3. Bài toán dự báo chuỗi thời gian

1.4. Chuỗi thời gian mờ và các mô hình dự báo chuỗi thời gian mờ

1.5. Một số khái niệm về tập mờ

1.6. Chuỗi thời gian mờ và các định nghĩa liên quan

1.7. Các thành phần của mô hình dự báo FTS

1.7.1. Giai đoạn huấn luyện (Xây dựng mô hình dự báo)

1.7.2. Giai đoạn kiểm thử (Giai đoạn dự báo)

1.8. Một số mô hình chuỗi thời gian mờ cơ bản

1.8.1. Mô hình dự báo của Song và Chissom

1.8.2. Mô hình dự báo của Chen

1.8.3. Mô hình dự báo của Yu

1.9. Tiêu chuẩn đánh giá độ chính xác của các mô hình dự báo

1.10. Một số phương pháp liên quan đến phân khoảng tập nền

1.10.1. Thuật toán phân cụm K-means

1.10.2. Thuật toán phân cụm mờ Fuzzy C-means

1.10.3. Thuật toán tối ưu bầy đàn (PSO)

1.11. Đại số gia tử

1.12. Kết luận Chương 1

2. CHƯƠNG 2: XÂY DỰNG CÁC MÔ HÌNH DỰ BÁO CHUỖI THỜI GIAN MỜ VỚI NHÓM QUAN HỆ MỜ PHỤ THUỘC THỜI GIAN

2.1. Nhóm quan hệ mờ phụ thuộc thời gian (NQHM-PTTG)

2.2. Các định nghĩa về nhóm quan hệ mờ phụ thuộc thời gian

2.3. Thuật toán tạo NQHM-PTTG bậc m

2.4. Các mô hình chuỗi thời gian mờ một nhân tố và hai nhân tố đề xuất

2.4.1. Mô hình dự báo chuỗi thời gian mờ một nhân tố (FTS-1NT)

2.4.2. Mô hình dự báo chuỗi thời gian mờ hai nhân tố (FTS-2NT)

2.5. Các phương pháp phân khoảng dữ liệu trong tập nền

2.5.1. Phân khoảng dữ liệu

2.5.2. Các phương pháp phân khoảng dữ liệu

2.5.2.1. Phân khoảng với độ dài bằng nhau
2.5.2.2. Phân khoảng với độ dài khác nhau

2.5.3. Các phương pháp phân khoảng đề xuất

2.5.3.1. Phân khoảng sử dụng phân cụm K-means
2.5.3.2. Phân khoảng sử dụng Đại số gia tử

2.6. Tổ chức thực nghiệm và so sánh đánh giá cho các mô hình FTS đề xuất và các phương pháp phân khoảng

2.6.1. Mô tả dữ liệu

2.6.2. Kết quả thực nghiệm của mô hình FTS một nhân tố (FTS-1NT)

2.6.2.1. Kết quả thực nghiệm của mô hình FTS-1NT trên tập dữ liệu tuyển sinh
2.6.2.2. Kết quả thực nghiệm của mô hình FTS-1NT trên tập dữ liệu thị trường chứng khoán (TAIFEX)

2.6.3. Kết quả thử nghiệm của mô hình FTS hai nhân tố (FTS-2NT)

2.6.4. Kết quả thực nghiệm trên mô hình FTS-1NT sử dụng hai phương pháp phân khoảng HA và K-means

2.6.4.1. So sánh đánh giá giữa hai phương pháp phân khoảng HA và K-means với các phương pháp phân khoảng khác trên cùng mô hình FTS-1NT
2.6.4.2. So sánh đánh giá mô hình FTS-1NT sử dụng phương pháp phân khoảng HA và K-means với các mô hình dự báo khác dựa trên QHM bậc 1
2.6.4.3. So sánh đánh giá mô hình FTS-1NT sử dụng phương pháp phân khoảng HA và K-means với các mô hình dự báo khác dựa trên QHM bậc cao

2.7. Kết luận Chương 2

3. CHƯƠNG 3: NÂNG CAO HIỆU QUẢ CỦA MÔ HÌNH DỰ BÁO SỬ DỤNG CÁC KỸ THUẬT TÍNH TOÁN MỀM

3.1. Các mô hình dự báo chuỗi thời gian mờ đề xuất

3.1.1. Mô hình chuỗi thời gian mờ một nhân tố (FTS-1NT) kết hợp giữa FCM và PSO

3.1.2. Mô hình chuỗi thời gian mờ hai nhân tố (FTS-2NT) sử dụng FCM và PSO

3.2. Tổ chức thực nghiệm và đánh giá hiệu quả của các mô hình dự báo được đề xuất

3.2.1. Đánh giá hiệu quả của mô hình FTS một nhân tố FTS1NT-CMPSO

3.2.1.1. Mô tả các chuỗi dữ liệu thời gian
3.2.1.2. Thiết lập các tham số của mô hình FTS1NT-CMPSO cho các tập dữ liệu
3.2.1.3. Áp dụng dự báo tuyển sinh đại học của trường đại học Alabama
3.2.1.4. Áp dụng dự báo thị trường chứng khoán Đài Loan TAIFEX
3.2.1.5. Áp dụng dự báo tai nạn ô tô tại Bỉ

3.2.2. Đánh giá hiệu quả của mô hình FTS hai nhân tố FTS2NT-CMPSO

3.2.2.1. Áp dụng dự báo trên tập dữ liệu nhiệt độ
3.2.2.2. Áp dụng dự báo trên tập dữ liệu thị trường chứng khoán

3.3. Kết luận Chương 3

KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

DANH MỤC CÁC CÔNG TRÌNH KHOA HỌC CỦA TÁC GIẢ LIÊN QUAN ĐẾN LUẬN ÁN

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về luận án tiến sĩ ngành máy tính và mô hình chuỗi thời gian mờ

Luận án tiến sĩ ngành máy tính với chủ đề "Một số phương pháp nâng cao độ chính xác dự báo trong mô hình chuỗi thời gian mờ" tập trung vào việc cải thiện độ chính xác của các mô hình dự báo. Mô hình chuỗi thời gian mờ là một công cụ mạnh mẽ trong việc phân tích và dự đoán các biến động trong dữ liệu theo thời gian. Nghiên cứu này không chỉ giúp nâng cao hiệu quả dự báo mà còn mở ra hướng đi mới cho các ứng dụng trong nhiều lĩnh vực khác nhau.

1.1. Khái niệm về mô hình chuỗi thời gian mờ

Mô hình chuỗi thời gian mờ (FTS) là một phương pháp dự báo dựa trên lý thuyết tập mờ, cho phép xử lý các dữ liệu không chắc chắn và biến thiên. FTS giúp cải thiện độ chính xác dự báo bằng cách sử dụng các hàm thuộc mờ để mô hình hóa các mối quan hệ phức tạp trong dữ liệu.

1.2. Tầm quan trọng của dự báo trong ngành máy tính

Dự báo chính xác là yếu tố quyết định trong nhiều lĩnh vực như kinh doanh, tài chính và khoa học. Việc áp dụng các mô hình chuỗi thời gian mờ giúp các tổ chức đưa ra quyết định đúng đắn hơn, từ đó tối ưu hóa quy trình hoạt động và giảm thiểu rủi ro.

II. Thách thức trong việc nâng cao độ chính xác dự báo chuỗi thời gian mờ

Mặc dù mô hình chuỗi thời gian mờ có nhiều ưu điểm, nhưng vẫn tồn tại một số thách thức lớn trong việc nâng cao độ chính xác dự báo. Các vấn đề như dữ liệu không đầy đủ, tính không chắc chắn và sự biến thiên mạnh của dữ liệu là những yếu tố cần được giải quyết.

2.1. Vấn đề dữ liệu không đầy đủ

Dữ liệu không đầy đủ có thể dẫn đến những sai lệch trong kết quả dự báo. Việc thu thập và xử lý dữ liệu một cách chính xác là rất quan trọng để đảm bảo tính chính xác của mô hình.

2.2. Tính không chắc chắn trong dữ liệu

Tính không chắc chắn trong dữ liệu có thể ảnh hưởng đến độ chính xác của các mô hình dự báo. Các phương pháp như phân tích mờ có thể giúp giảm thiểu ảnh hưởng này, nhưng vẫn cần có các giải pháp bổ sung.

III. Phương pháp nâng cao độ chính xác dự báo trong mô hình chuỗi thời gian mờ

Để nâng cao độ chính xác của các mô hình chuỗi thời gian mờ, nhiều phương pháp đã được đề xuất. Các phương pháp này bao gồm việc sử dụng các thuật toán tối ưu hóa, phân cụm và các kỹ thuật học máy.

3.1. Sử dụng thuật toán tối ưu hóa PSO

Thuật toán tối ưu bầy đàn (PSO) là một trong những phương pháp hiệu quả để tối ưu hóa các tham số trong mô hình chuỗi thời gian mờ. PSO giúp cải thiện độ chính xác dự báo bằng cách tìm kiếm các giá trị tối ưu cho các tham số của mô hình.

3.2. Phân cụm dữ liệu với K means

Phân cụm K-means là một kỹ thuật hữu ích trong việc tổ chức dữ liệu và xác định các nhóm tương đồng. Việc áp dụng K-means trong mô hình chuỗi thời gian mờ giúp cải thiện độ chính xác dự báo bằng cách tối ưu hóa cách thức xử lý dữ liệu.

IV. Ứng dụng thực tiễn của mô hình chuỗi thời gian mờ

Mô hình chuỗi thời gian mờ đã được áp dụng rộng rãi trong nhiều lĩnh vực như tài chính, y tế và quản lý sản xuất. Những ứng dụng này không chỉ giúp nâng cao độ chính xác dự báo mà còn mang lại giá trị thực tiễn cho các tổ chức.

4.1. Dự báo thị trường chứng khoán

Mô hình chuỗi thời gian mờ đã được sử dụng để dự báo biến động của thị trường chứng khoán, giúp các nhà đầu tư đưa ra quyết định đầu tư chính xác hơn.

4.2. Dự báo nhu cầu sản phẩm

Trong lĩnh vực sản xuất, mô hình này giúp dự báo nhu cầu sản phẩm, từ đó tối ưu hóa quy trình sản xuất và giảm thiểu lãng phí.

V. Kết luận và hướng phát triển tương lai của mô hình chuỗi thời gian mờ

Luận án đã chỉ ra rằng mô hình chuỗi thời gian mờ có tiềm năng lớn trong việc nâng cao độ chính xác dự báo. Hướng phát triển tương lai có thể tập trung vào việc cải thiện các thuật toán và áp dụng công nghệ mới để tối ưu hóa mô hình.

5.1. Cải tiến thuật toán dự báo

Cần nghiên cứu và phát triển các thuật toán mới để cải thiện độ chính xác của mô hình chuỗi thời gian mờ, đặc biệt là trong bối cảnh dữ liệu lớn và phức tạp.

5.2. Tích hợp công nghệ mới

Việc tích hợp các công nghệ mới như trí tuệ nhân tạo và học sâu vào mô hình chuỗi thời gian mờ có thể mở ra nhiều cơ hội mới cho việc nâng cao độ chính xác dự báo.

22/07/2025
Luận án tiến sĩ ngành máy tính một số phương pháp nâng cao độ chính xác dự báo trong mô hình chuỗi thời gian mờ

Trích đoạn nội dung tài liệu

MỞ ĐẦU Những thành tựu đạt được trong các hoạt động của con người được đặc trưng bởi các quá trình ra quyết định hiệu quả của họ. Để giúp quá trình ra quyết định được chính xác, tiết kiệm được thời gian và giảm các chi phí không cần thiết thì bài toán dự báo đóng vai trò rất quan trọng. Dự báo là một công cụ trợ giúp cần thiết cho việc ra quyết định và lập kế hoạch để quản lý hiệu quả các tổ chức hiện đại. Ví dụ, dự báo bán hàng luôn đóng một vai trò nổi bật trong hoạt động kinh doanh.

Nó cung cấp cho các doanh nghiệp những chỉ dẫn đáng tin cậy về chi phí công việc và phân bổ ngân sách cho một khoảng thời gian sắp tới. Các nhà khoa học cũng phải đối mặt với thách thức quan trọng trong việc dự báo các sự kiện xảy ra trong tương lai như nhiệt độ, lượng mưa, tăng trưởng nền kinh tế,. Để dự báo các sự kiện này với độ chính xác 100% là không thể, nhưng rất nhiều lợi ích có thể thu được từ kết quả dự báo cũng như một bức tranh về tương lai đó. Một trong các hướng nghiên cứu nâng cao độ chính xác của các bài toán dự báo là nghiên cứu dữ liệu chuỗi thời gian.

Chuỗi thời gian (TS – time series) là một chuỗi các giá trị số hoặc chuỗi các từ trong ngôn ngữ tự nhiên được ghi lại tại các thời điểm liên tiếp trong một khoảng thời gian, thường được đo cách nhau tại các thời điểm thống nhất: hàng ngày, hàng tuần, hàng tháng, hàng quý hoặc hàng năm. Nói một cách đơn giản, một chuỗi thời gian là một chuỗi dữ liệu lịch sử được thu thập một cách đều đặn. Phân tích chuỗi thời gian để xây dựng các mô hình dự báo chuỗi thời gian hiệu quả là một trong các khâu quan trọng trong việc tạo ra các công cụ dự báo tốt nhằm giải quyết các bài toán thực tế. Một loạt các phương pháp đã được đề xuất để giải quyết những bài toán này, thông dụng hơn cả là mô hình tự hồi quy (autoregression model - AR), trung bình trượt (moving average - MA) và kết hợp của chúng thành mô hình ARMA và ARIMA do Box và Jenkins [1] phát triển năm 1976.

Các mô hình dự báo nêu trên được xây dựng cho chuỗi thời gian tuyến tính và dừng. Bên cạnh các mô hình chuỗi thời gian dừng thì các mô hình ARCH [2] (Autoregressive Conditionally Hestoroscedastic) và GARCH [3] (Generalize Autoregressive Conditionally Hestoroscedastic) được xây dựng để giải quyết các chuỗi thời gian không dừng hay chuỗi thời gian có phương sai thay đổi. Để áp dụng các mô hình dự báo chuỗi thời gian trên với độ chính xác khả quan đòi hỏi một số ràng buộc chặt chẽ như: chuỗi thời gian phải là tuyến tính hay cần một số lượng dữ liệu lớn. Trong thực tế, việc đòi hỏi các chuỗi thời gian là dừng và tuyến tính không phải lúc nào cũng đáp ứng được, thậm chí chúng còn mang tính không chắc chắn và biến thiên mạnh.

Việc áp dụng các mô hình nêu trên đối với chuỗi dữ liệu thời gian ngắn hay phi tuyến là không phù hợp và kết quả dự báo đạt được chưa cao. Để khắc phục các hạn chế đó, một số tác giả đã sử dụng mạng nơron để xây dựng mô hình dự báo chuỗi 13 thời gian dựa trên tính phi tuyến và linh hoạt của chúng. Donaldson và công sự [4] đã đề xuất mô hình chuỗi thời gian sử dụng mạng nơron nhân tạo (Artificial Neural Network – ANN) để dự báo sự biến động của thị trường chứng khoán Mỹ, Canada, Nhật Bản và Anh. Hansen và Nelson [5] cũng sử dụng mạng nơron để xây dựng mô hình dự báo doanh thu từ thuế.

Quan sát thấy rằng, phương pháp sử dụng mạng nơron đạt được độ chính xác cao hơn so với các mô hình truyền thống. Mặt khác, một số nghiên cứu đã sử dụng suy luận mờ dựa trên mạng nơron [6] (Adaptive Neuro-Fuzzy Inference System-ANFIS) để nâng cao độ chính xác dự báo của mô hình chuỗi thời gian. Khác so với mạng ANN, hệ này có khả năng thích nghi với môi trường cao hơn trong quá trình huấn luyện. Do đó, đã có nhiều công trình áp dụng hệ ANFIS trong sự báo TS và thu được những kết quả nhất định.

Tuy nhiên, các mô hình tiên tiến sử dụng mạng nơron đơn lẻ vẫn phải đối mặt với một số vấn đề như cần giả định một số lượng dữ liệu lớn trong quá trình huấn luyện mạng, phụ thuộc vào kinh nghiệm trong việc chọn nút mạng và không có phương pháp rõ ràng để phân tích mối quan hệ giữa đầu vào và đầu ra trong mạng. Hơn nữa, trong cuộc sống hàng ngày, con người thường quan sát, phân tích các sự vật, hiện tượng và các sự kiện xảy ra trong thế giới thực và đưa ra các quyết định của mình dưới dạng ngôn ngữ tự nhiên. Với bài toán dự báo chuỗi thời gian, dữ liệu có thể được biểu diễn dưới dạng các từ trong ngôn ngữ tự nhiên và dễ dàng mô tả cách con người thực hiện quá trình dự báo dưới dạng ngôn ngữ trong thực tế. Thật vậy, khi con người quan sát dữ liệu chuỗi thời gian, họ nhanh chóng chuyển các biến động của chuỗi thời gian sang dạng ngôn ngữ và lập luận trong suy nghĩ theo một cách nào đó dựa trên quan hệ giữa các hạng từ trong chuỗi thời gian để ước lượng kết quả dự báo dưới dạng ngôn ngữ.

Trong ngữ cảnh như vậy, các phương pháp thống kê nêu trên chỉ được sử dụng để giải quyết chuỗi thời gian số (Numerical time series - NTS) mà không thể sử dụng để giải quyết một cách hiệu quả các bài toán ra quyết định như vậy. Vì vậy, chuỗi thời gian mờ ra đời nhằm giải quyết các bài toán dự báo với chuỗi số liệu được biểu diễn dưới dạng ngôn ngữ. Chuỗi thời gian mờ (Fuzzy time series - FTS) được Song và Chissom giới thiệu lần đầu tiên vào năm 1993, dựa trên lý thuyết tập mờ của Zadeh [7], trong đó các tập mờ được xem như là ngữ nghĩa của các hạng từ ngôn ngữ. Theo cách tiếp cận này, Song và Chissom đã đề xuất hai mô hình FTS [8, 9] để dự báo số lượng sinh viên nhập học của trường Đại học Alabama.

Tuy nhiên, mô hình của Song và Chissom còn tồn tại một số hạn chế như mất nhiều thời gian tính toán do thực hiện phép hợp thành max – min phức tạp đối với ma trận quan hệ mờ 𝑅(𝑡 − 1, 𝑡) lớn và thiếu sự thuyết phục trong việc xác định độ dài của khoảng chia tập nền. Để khắc phục hạn chế trên, Chen [10] đã đề xuất nhóm quan hệ mờ và sử dụng các phép toán số học đơn giản trong quá trình giải mờ. 14 Mặc dù các mô hình này đã chứng tỏ những ưu việt khi áp dụng cho chuỗi dữ liệu thời gian tổng quát nhưng độ chính xác dự báo còn khá thấp. Đây là cơ sở để mở ra một hướng nghiên cứu mới và thu hút được nhiều công bố cả về cải tiến phương pháp luận lẫn nghiên cứu ứng dụng.

Vì điểm trên, nhiều nghiên cứu đã cải tiến mô hình của Chen nhằm nâng cao độ chính xác của kết quả dự báo theo các hướng sau: 1) xác định tập nền và tìm độ dài khoảng phù hợp [11- 28]; 2) xây dựng các mối quan hệ mờ và nhóm quan hệ mờ trên cơ sở dữ liệu được mờ hóa [18, 24, 29-31] và 3) cải tiến các quy tắc giải mờ cho dự báo đầu ra [13, 18, 32-33]. Trước hết, việc phân khoảng tập nền: làm thế nào để phân tập nền chứa dữ liệu lịch sử thành các khoảng với độ dài thích hợp và bao nhiêu khoảng là phù hợp? Bắt đầu từ công trình nền tảng [11], Huarng đã xác định rằng độ dài của khoảng chia tập nền là một yếu tố quan trọng và ảnh hưởng đáng kể đến độ chính xác dự báo của mô hình. Từ quan điểm này, Huarng đã đưa ra hai phương pháp chọn độ dài khoảng tập nền theo phân bố và độ dài trung bình. Các phương pháp của Huarng đã đạt được độ chính xác tốt hơn so với một số mô hình dự báo trước đó.

Yolcu và cộng sự [22] đưa ra một cách tiếp cận mới dựa trên việc tối ưu tỷ lệ để xác định độ dài của các khoảng chia bằng hàm “fminbnd” trong MATLAB. Trong những năm gần đây, các kỹ thuật tính toán mềm và các phương pháp tối ưu tiến hóa được sử dụng rộng rãi để xác định phân khoảng tối ưu trong mô hình FTS. Chen & Chung đưa ra hai mô hình chuỗi thời gian mờ bậc nhất [15] và bậc cao [16] dựa trên thuật toán di truyền để phân tập nền thành các khoảng có độ dài phù hợp và áp dụng cho dự báo tuyển sinh tại trường Đại học Alabama. Lee và cộng sự [34] áp dụng thuật toán tôi luyện (Simulated Annealing - SA) để xác định độ dài khoảng thích hợp trong mô hình FTS bậc cao cho dự báo thị trường chứng khoán Đài Loan (TAIFEX).

Eren Bas và cộng sự [35] đã đề xuất một thuật toán di truyền cải tiến (MGA) để tránh những phán đoán chủ quan trong việc xác định độ dài của mỗi khoảng tập nền trong mô hình FTS để dự báo tai nạn xe hơi ở Bỉ và tuyển sinh vào trường Đại học Alabama. Bên cạnh đó, nhiều thuật toán tối ưu được lấy cảm hứng từ các loài sinh vật học cũng được sử dụng cho mục đích phân khoảng nhằm nâng cao độ chính xác dự báo của mô hình FTS như: tối ưu bầy đàn (Particle Swarm Optimization - PSO) [14, 18, 30 - 33, 35], tối ưu đàn kiến (Ant Colony Optimization - ACO) [36] và tối ưu dựa trên sự di chuyển của đàn ngỗng( Geese Movement Based Optimization- GMBO) [37]. Cùng mục đích sử dụng PSO để hiệu chỉnh độ dài khoảng tập nền, một số tác giả khác đã đề xuất các mô hình FTS dựa trên quan hệ mờ bậc cao [35, 38] và quan hệ mờ hai nhân tố [39- 41] để áp dụng dự báo các bài toán khác nhau. Ngoài ra, Chen và cộng sự [42] đã áp dụng PSO để tối ưu đồng thời các khoảng chia và các trọng số trên mỗi nhóm quan hệ mờ cho dự báo TAIFEX và tỷ giá NTD / USD.

Song song với kỹ thuật tối ưu, thì các phương 15 pháp phân cụm như: phân cụm mờ C-mean [28, 43], phân cụm tự động [17] cũng được sử dụng cho mục đích phân khoảng nhằm giảm thiểu sai số dự báo trong mô hình chuỗi thời gian mờ.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ