Khóa luận tốt nghiệp: Dự báo tiền mã hóa và chứng khoán qua phân tích cảm xúc và học máy

Khóa luận tốt nghiệp nghiên cứu tốt nghiệp hệ thống thông tin dựa trên phân tích cảm xúc và học máy xây dựng mô hình dự báo tiền mã, vận dụng lý thuyết vào thực tế, đề xuất giải

Người đăng

Ẩn danh

Thể loại

Khóa luận tốt nghiệp

2023

58
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: KIẾN TRÚC ĐỀ TÀI

2. CHƯƠNG 2: CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN

2.1. Lý thuyết chuỗi thời gian

2.2. Các thành phần của chuỗi thời gian

2.3. Các lý thuyết và kỹ thuật

2.4. Các thuật toán trí tuệ nhân tạo

3. CHƯƠNG 3: SENTIMENT ANALYSIS

3.1. Thu thập dữ liệu tweets

3.2. Tiền xử lý và làm sạch dữ liệu

3.3. Phân tích cảm xúc với VADER

4. CHƯƠNG 4: NỘI DUNG VÀ PHƯƠNG PHÁP

4.1. Tổng quan và tiền xử lý

4.2. Các giai đoạn chính

4.2.1. Pharse 1 — Học mô hình dự báo

4.2.2. Pharse 2 — Quy trình xây dựng hệ thống API

4.2.3. Pharse 3 — Triển khai hệ thống API lên Server Cloud Linux

4.2.4. Pharse 4 — Xây dựng giao diện và giao tiếp API

5. CHƯƠNG 5: THỰC NGHIỆM VÀ ĐÁNH GIÁ

5.1. Dữ liệu sử dụng

5.2. Chia bộ dữ liệu

5.3. Thông số đánh giá

5.4. Kết quả và thảo luận

5.4.1. Sentiment Analysis và các trường hợp dự đoán dựa trên Ensemble Learning

5.4.2. Trường hợp dự đoán dựa trên mô hình thống kê

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Dự báo tiền mã hóa và chứng khoán

Dự báo tiền mã hóadự báo chứng khoán là hai lĩnh vực quan trọng trong tài chính hiện đại. Nghiên cứu này tập trung vào việc sử dụng phân tích cảm xúchọc máy để xây dựng các mô hình dự đoán giá trị tương lai của tiền mã hóachứng khoán. Các mô hình này không chỉ dựa trên dữ liệu lịch sử mà còn kết hợp với phân tích dữ liệu cảm xúc từ các nguồn như Twitter, giúp tăng độ chính xác của dự báo.

1.1. Phân tích cảm xúc trong dự báo

Phân tích cảm xúc đóng vai trò quan trọng trong việc dự đoán biến động thị trường. Nghiên cứu này sử dụng phân tích dữ liệu cảm xúc từ các tweet liên quan đến Bitcoin (BTC), Tesla (TSLA), và Twitter (TWTR). Các tweet được thu thập từ năm 2015 đến 2022, sau đó được làm sạch và phân tích bằng công cụ VADER để xác định mức độ tích cực, tiêu cực hoặc trung lập của thông tin. Kết quả phân tích được tích hợp vào các mô hình học máy để cải thiện độ chính xác của dự báo.

1.2. Ứng dụng học máy trong dự báo

Học máy là công cụ mạnh mẽ trong việc xử lý dữ liệu tài chínhdữ liệu thị trường. Nghiên cứu này sử dụng các thuật toán như Linear Regression, LSTM, GRU, và Ensemble Learning để dự đoán giá trị tương lai của tiền mã hóachứng khoán. Các mô hình này được huấn luyện trên dữ liệu lịch sử và kết hợp với phân tích cảm xúc để đưa ra dự báo chính xác hơn. Kết quả cho thấy, các mô hình kết hợp có độ chính xác cao hơn so với mô hình đơn lẻ.

II. Phương pháp và kỹ thuật phân tích

Nghiên cứu này áp dụng nhiều phương pháp phân tích dữ liệukỹ thuật học máy để xây dựng các mô hình dự báo. Các phương pháp bao gồm phân tích chuỗi thời gian, phân tích xu hướng, và phân tích tâm lý thị trường. Các kỹ thuật như Bagging, Boosting, và Stacking được sử dụng để cải thiện hiệu suất của các mô hình.

2.1. Phân tích chuỗi thời gian

Phân tích chuỗi thời gian là phương pháp quan trọng trong việc dự đoán giá trị tương lai của tiền mã hóachứng khoán. Nghiên cứu này sử dụng các mô hình như ARIMA, TBATS, và GARCH để phân tích dữ liệu lịch sử. Các thành phần của chuỗi thời gian như xu hướng, mùa vụ, và chu kỳ được xác định và mô hình hóa để hiểu rõ hơn về biến động thị trường.

2.2. Kỹ thuật học máy nâng cao

Các kỹ thuật học máy nâng cao như LSTMGRU được sử dụng để xử lý dữ liệu chuỗi thời gian phức tạp. Nghiên cứu này cũng áp dụng Ensemble Learning để kết hợp các mô hình khác nhau, giúp giảm thiểu sai số và tăng độ chính xác của dự báo. Kết quả thực nghiệm cho thấy, các mô hình kết hợp có hiệu suất vượt trội so với các mô hình đơn lẻ.

III. Thực nghiệm và đánh giá

Nghiên cứu này tiến hành thực nghiệm trên dữ liệu lịch sử của Bitcoin, Tesla, và Twitter từ năm 2015 đến 2022. Các mô hình được đánh giá dựa trên các chỉ số như RMSE, MAE, và . Kết quả cho thấy, các mô hình kết hợp phân tích cảm xúchọc máy có độ chính xác cao hơn so với các mô hình truyền thống.

3.1. Kết quả dự báo

Kết quả thực nghiệm cho thấy, các mô hình dự báo giá Bitcoinchứng khoán đạt độ chính xác cao khi kết hợp phân tích cảm xúchọc máy. Các mô hình như LSTMGRU cho kết quả tốt nhất với RMSE thấp và cao. Điều này chứng tỏ rằng, việc kết hợp phân tích dữ liệu cảm xúc vào các mô hình dự báo có thể cải thiện đáng kể hiệu suất của chúng.

3.2. Đánh giá hiệu suất

Các mô hình được đánh giá dựa trên các chỉ số như RMSE, MAE, và . Kết quả cho thấy, các mô hình kết hợp BaggingBoosting có hiệu suất tốt hơn so với các mô hình đơn lẻ. Điều này khẳng định giá trị của việc sử dụng Ensemble Learning trong dự báo tiền mã hóachứng khoán.

21/02/2025

Trích đoạn nội dung tài liệu

ĐẠI HỌC QUOC GIA TP. HO CHÍ MINH TRUONG DAI HQC CONG NGHE THONG TIN KHOA HE THONG THONG TIN NGUYEN THI VIET HUONG - 19521595 KHOA LUAN TOT NGHIEP DỰA TREN PHAN TÍCH CAM XUC VA HOC MAY XÂY DUNG MO HÌNH DỰ BAO TIEN MA HOÁ VÀ CHUNG KHOAN BASED ON SENTIMENT ANALYSIS AND MACHINE LEARNING: BUILDING FORECASTING MODELS FOR CRYPTOCURRENCY AND STOCK PRICES CU NHAN NGANH THUONG MAI DIEN TU GIANG VIEN HUONG DAN PGS.TS NGUYEN ĐÌNH THUAN TP. HO CHi MINH, 2023 LỜI CẢM ƠN Lời đầu tiên, chúng em xin được cảm ơn trường Đại học Công nghệ Thông tin - Đại học Quốc gia Thành phố Hồ Chí Minh đã tạo điều kiện tốt nhất để chúng em có thể học tập và phát triển. Học tập tại đây, chúng em đã gặp được rất nhiều những thầy cô, những người bạn, và những con người tuyệt vời, song song đó là những cơ hội quý giá để phát triển ban thân trong sự nghiệp lẫn cuộc sống.

Đề hoàn hoàn thành khóa luận này, chúng em xin được gửi lời cảm ơn đặc biệt đến những người sau đây. Chúng em xin trân trọng gửi lời cảm ơn tới thầy PGS.TS Nguyễn Đình Thuân và KS. Nguyễn Minh Nhựt, những người đã hết lòng giúp đỡ chúng em trong con đường nghiên cứu lẫn học tập. Thầy Thuan là một nguồn cảm hứng to lớn cho em có thể tự tin và vượt qua vô số thử thách trên con đường học tập và nghiên cứu trong suốt thời gian qua.

Tiếp theo, chúng em muốn dành lời cảm ơn đến những thầy cô trong trường, đã dạy dỗ và truyền đạt những kinh nghiệm, kiến thức quý báu trong suốt những năm học. Bên cạnh đó, chúng em muốn gửi lời cảm ơn các thay cô trong khoa Hệ Thống Thông Tin đã tạo nhiều cơ hội dé chúng em có thé phát triển. Chúng em cũng muốn cảm ơn những anh chị và những người bạn đã luôn đồng hành cùng chúng em trong suốt hành trình học đại học, đặc biệt là các bạn ở lớp TMCL2019 và các bạn ở nhóm nghiên cứu FTISU. Cuối cùng, chúng em muốn gửi lời cảm ơn đến bố mẹ, gia đình cùng những người thân của chúng em, những người đã luôn đồng hành, tin tưởng, ủng hộ, và quan tâm giúp đỡ chúng em trong những lúc khó khăn nhất.

Không có mọi người, chúng em đã không thể có được như ngày hôm nay. Mục tiêu của để tài. Đối tượng và phạm vi nghiên CỨU. Đối tượng nghiên cứu.

Phạm vi nghiên cỨU.-¿--- -- +52 2 E*EE2% 2 EEk£k*EESEkEkEEx kg re4 1. Kiến trúc đề tài. ch ng HT HT ngàn6 CHƯƠNG 2: CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN. Lý thuyết chuỗi thời gian 3.

Định nghĩa chuỗi thời gian .--¿-5¿5+25t‡2xt2Ext2EveEEverxrerrerrrsrrrrrrrek 10 3. Các thành phần của chuỗi thời gian. Các lý thuyết và kỹ thuật 3. Làn HH HH HH HH H00 HH HH HH Hàn 17 3.

1S kSnH HH HH HH HH HH TH HH 21 E5. Án HH HT HT HT HH TH HH HH 23 3. Các thuật toán trí tuệ nhân tạO. Linear ÑegT€SSiOI.

222L 110004 HH HH HH HH HH 24 3. cá HT TH TH HH HH TH Hi 26 3. LSTM VN 0w cac. ÁCL LH HH HH HH TH ky 26 3.

TR ee MOO a LG. HH rà, 28 CHƯƠNG 4: NỘI DUNG VÀ PHƯƠNG PHAP. Tổng quan và tiền xử lý. Các giai đoạn chính.

Pharse 1 — Học mô hình dự báo. Pharse 2 — Quy trình xây dựng hệ thống API. Thiết kế thành phần chức năng. Thiết kế thành phần dit liệu.

Pharse 3 — Triển khai hệ thống API lên Server Cloud Linux. Pharse 4 — Xây dựng giao diện và giao tiếp API.-------©cccccsscsrx 4I CHƯƠNG 5. THỰC NGHIỆM VÀ ĐÁNH GIÁ 5. Dữ Liệu Sử Dụng.---- ¿+11 TT nh TH TH nh Hàn nh Hàn re 45 5.

Chia BO Dit ma. Thông Số Đánh Gid. Kết Quả Và Thảo Luận. Sentiment Analysis Và Các Trường Hợp Dự Đoán Dựa Trên Ensemble Learning.

Trường Hợp Dự Doan Dựa Trên Mô Hình Thong Kê. TONG KET VA HƯỚNG PHAT TRIEN. Han Chế Và Công Việc Trong Tương Laii. c2 22tvv 21212 1 1221 tr HH re 63 TÀI LIEU THAM KHẢO.--22222222222222222222E222EE222212222211 22221 2E re 64 DANH MỤC HÌNH ẢNH Hình 1.

Kiến trúc hệ thống.---¿- 22 22©+£+2E+22EEE2EEEE222122221227312711222122211 22x e2 5 Hình 3. Biểu đồ thể hiện giá (USD) của Bitcoin theo thời gian. Các thành phần của chuỗi thời gian trong Decomposition of time series Hình 3. Các bước dé tiền xử lý và làm sạch một tweet Hình 3.

Các bước chính của kỹ thuật Bagging cho bài toán hồi quy. Các bước chính của kỹ thuật Boosting cho bài toán Hồi quy. Cấu trúc cơ bản của mô hình LSTM. Cấu trúc cơ bản của mô hình GRU.¿¿¿22vv+++22vvvvrssrrrrerrree 28 Hình 4.

Minh họa tổng quan về quá trình xử lý tổng thể và các thuật toán được sử dụng trong thực nghiệm này Hình 4. Trang web dùng để download dữ liệu Bitcoin Hình 4. Đồ thị về Closing Price theo thời gian của indexes BTC, TSLA, và TWTR 34 Hình 4.Usecase tổng quan hệ thống dự báo và khuyến nghị BTC, TWTR, và TSLA. Class diagram hệ thống.

¿+ ©2+¿2©2++2E+++EE+++EE+tSEEErerxrerrrrerrrrrrs 37 Hình 4. Sequence Diagram Dự báo giá BTC, TWTR, và TSLA. File cấu hình crontab. API auto crawl data tại €OrItFOÏÏ€T.

Hàm auto crawl data tại S€TVIC€.1 *2 v9 1xx rrrriyn 4I Hình 4. Màn hình tổng quan Home .--- 2 2£©+£+2E+£+EE+£+EEE2zx+tzrxzerrsrsrx 42 Hình 4. Màn hình tổng quan Ethereum. Màn hình xem lịch sử giá BitCoin.---- ee ences ee k Street 4 Hình 4.

Màn hình lựa chọn thuật toán và dự báo.Cross Validation được minh hoa với k= Hình 5. Trực quan hóa kết quả của các thuật toán tốt nhất cho các mô hình chi số BTC 52 Hình 5. Trực quan hóa kết qua của các thuật toán tốt nhất cho các mô hình chi số TSLA 55 Hình 5. Trực quan hóa kết quả của các thuật toán tốt nhất cho các mô hình chỉ số DANH MỤC TỪ VIẾT TÁT Số thứ tự | Thuật ngữ Mô tả 1 AI Artificial Intelligence 2 API Application Programming Interface 3 CPU Central Processing Unit 4 DL Deep Learning 5 GPU Graphics Processing Unit 6 ML Machine Learning 7 RAM Random-Access Memory 8 NLP Natural Language Processing 9 IR Information Retrieval 10 QA Question Answering 11 NLI Natural Language Inference Nhận thay tam quan trong của van đề, khoá luận này đề xuất và xây dựng một hệ thống cung cấp cho người dùng hai dịch vụ chính là sử dụng các mô hình thống kê trong dự đoán thời gian dài và đề xuất thêm các kĩ thuật Sentiment Analysis dựa trên tweets của người dùng để tăng khả năng dự đoán và kết hợp thêm Ensemble Learning trong dự đoán thời gian ngắn.

Mục tiêu của đề tài Mục tiêu đề tài bao gồm: e Mô tả các đặc tinh của các mô hình dự báo chuỗi thời gian, trí tuệ nhân tạo từ đó đánh giá sự phù hợp của mô hình đề xuất và áp dụng vào dự báo. e_ Sử dụng dữ liệu trong quá khứ thông qua mô hình dự báo chuỗi thời gian và thuật toán trí tuệ nhân tạo dé dự báo giá trị và đưa ra các quyết định trong tương lai. e Tim hiểu cách hoạt động và kết hợp giữa các mô hình dự báo như: LR, EN, AB, GB, LSTM, GRU, AR, ES, NNETAR, TBATS, GARCH, và phương pháp kết hợp Boosting, Bagging. e Đề xuất và xây dựng website dự báo giá (tiền mã hoa và chứng khoán) bằng các thuật toán đề xuất, thông qua trang web: https://finance.

e Phân tích quan điểm của các người dùng tiền mã hoá, chứng khoán và những người có ảnh hưởng lớn. Đối tượng và phạm vỉ nghiên cứu 1. Đối tượng nghiên cứu © Nghién cứu dữ liệu giá tiền mã hoá (BTC) va chứng khoán (TWTR, TSLA) từ năm 2015 — 2022. e Binh luận của người dùng và người có ảnh hưởng lớn từ năm 2015 — 2022.

Phạm vi nghiên cứu Trong đề tài này, phạm vi nghiên cứu hướng đến: © Mô hình thống kê: AR, ES, NNETAR, TBATS, GARCH. e Mô hình trí tuệ nhân tao: LR, EN, AB, GB, LSTM, GRU. ¢ _ Các mô hình kết hợp: Boosting, Bagging. ¢ Bộ dữ liệu về lịch sử giá (tiền mã hoá và chứng khoán): crawl từ website Yahoo!Finance.

¢ Ngôn ngữ lập trình sử dung: Python, Java Springboot, Nextjs, các framework và thu vién lién quan. e Phương pháp crawl dữ liệu thong qua API của Twitter: Thư viện Scrapy, Tweepy ¢ Kiến thức xây dung Website. Kiến trúc dé tài | L PART 1. TEST MODEL FORECAST.

BUILDING API SERVER ‘Sentiment Analyse 1 ae, +, Choose Best Modet————> (PubliefModel State Models KN Vetuang PART 3. BUILDING CLIENT xa Linux Server ora MySOL Jayaseipt oss) Nexis HTML Hinh 1. Kién tric hé thong Mô tả kiến trúc đề tài (Hình 1.1) gồm 4 pharse cơ bản như sau: e Triển khai Pharse 1: Học trên các mô hình dự báo, sau đó chọn ra mô hình dự báo tốt nhất đề tiền hành dự báo. Từ PART /, tat cả mô hình máy học được đưa vào PART 2 thư mục public.

Triển khai Pharse 2: Xây dựng các API clone dữ liệu từ Website BTC, TWTR và TSLA về, xây dựng các Controller, kiến trúc CSDL. Triển khai Pharse 3: Giai đoạn đưa API lên Cloud Server Linux, dùng cơ chế CRON Schedule của hệ điều hành Linux cho các hoạt động định thời chạy các mô hình máy học hoặc lấy dữ liệu từ Website Data BTC/TWTR/ TSLA. Triển khai Pharse 4: Ở PART 3, xây dựng Website Client để người dùng có thé thây giá trị dự báo. Các đóng góp Xây dựng các mô hình dự đoán giá tiền mã hoá và chứng khoán thông qua phân tích cảm xúc, thực nghiệm kiểm thử.

Xây dựng cơ chế CRON chạy mô hình theo thời gian thực. Xây dựng Controller phù hợp cho mô hình dựa trên Framework của nhóm nghiên cứu. Cấu hình Dynamic Param cho từng ngày. Hỗ trợ thiết kế giao diện.

Coding thành phan giao diện Component. Quản lý bảo trì hệ thống chạy ồn định. CHƯƠNG 2: CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN Dựa trên các đặc điểm, từ khóa liên quan về các thử nghiệm liên quan đến dự đoán, học máy, học sâu, phân tích tình cảm, v. chúng tôi đã tìm kiếm các bài báo liên quan trong những năm gần đây và dựa vào những bài toán đó dé thực hiện nghiên cứu này và thể hiện chỉ tiết qua Bảng 2.

Những thành công của trí tuệ nhân tạo trong những năm gần đây đã làm cho các nghiên cứu về dự báo giá chứng khoán được cải thiện về độ chính xác và hiệu suất. Việc kết hợp các mô hình không chỉ hạn chế sai số từ mô hình đơn thông thường mà còn khai thác được thế mạnh tiềm ẩn bên trong các mô hình. Với mục tiêu đó, Subhajit Chakrabarty et al. [1] đã áp dụng các mô hình bao gồm Support Vector Regression, Decision Tree Regression, Gradient Boosted Regression, Rvàom Forest Regression, Ada Boost, Extreme gradient boost (XGBoost), Light Gradient Boosted Machine (LightGBM), Long Short-Term Memory (LSTM) va Stacked Generalization ensemble để dự đoán giá chứng khoán S&P 500 với bộ dữ liệu khoảng 29 năm.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Dự báo tiền mã hóa và chứng khoán bằng phân tích cảm xúc và học máy" cung cấp một cái nhìn sâu sắc về việc ứng dụng phân tích cảm xúc và các kỹ thuật học máy để dự đoán biến động thị trường tiền mã hóa và chứng khoán. Nghiên cứu này không chỉ giúp nhà đầu tư hiểu rõ hơn về cách thức cảm xúc thị trường ảnh hưởng đến giá cả mà còn đề xuất các mô hình học máy hiệu quả để cải thiện độ chính xác của dự báo. Đây là một tài liệu hữu ích cho những ai quan tâm đến lĩnh vực tài chính và công nghệ, đặc biệt là trong bối cảnh thị trường biến động mạnh như hiện nay.

Để mở rộng kiến thức về các phương pháp học máy và phân tích dữ liệu, bạn có thể tham khảo thêm Luận văn thạc sĩ khoa học máy tính so sánh hai phương pháp thu gọn tập huấn luyện rhc và naive ranking trong phân lớp dữ liệu chuỗi thời gian, Luận văn thạc sĩ khoa học máy tính cải tiến giải thuật kmeans cho bài toán gom cụm dữ liệu chuỗi thời gian, và Luận án tiến sĩ khoa học máy tính tìm kiếm tương tự trên chuỗi thời gian dạng luồng. Những tài liệu này sẽ giúp bạn hiểu sâu hơn về các kỹ thuật xử lý dữ liệu chuỗi thời gian, một yếu tố quan trọng trong dự báo tài chính.