Tổng quan nghiên cứu

Thị trường chứng khoán Việt Nam đã trải qua hơn hai thập kỷ hình thành và phát triển với quy mô vốn hóa đạt trên 5,5 triệu tỷ đồng vào tháng 6 năm 2020, tương đương 104% tổng sản phẩm quốc nội (GDP). Tính đến cuối năm 2020, toàn thị trường có hơn 2,7 triệu tài khoản giao dịch, riêng tháng 11 năm 2020 ghi nhận kỷ lục 41.200 tài khoản mở mới. Sự bùng nổ của quy mô giao dịch đặt ra thách thức lớn cho các phương pháp phân tích tài chính truyền thống. Phân tích cơ bản thường phụ thuộc vào các báo cáo tài chính định kỳ theo quý hoặc năm vốn có độ trễ lớn, trong khi phân tích kỹ thuật thuần túy chỉ khai thác chuỗi dữ liệu giá quá khứ mà bỏ qua dòng chảy thông tin sự kiện.

Trong thực tế, tin tức truyền thông có sức ảnh hưởng tức thì và mạnh mẽ đến tâm lý nhà đầu tư tại các thị trường mới nổi. Điển hình vào ngày 21 tháng 02 năm 2013, một tin đồn thất thiệt liên quan đến lãnh đạo ngân hàng đã khiến chỉ số VN-Index sụt giảm 18 điểm, cuốn bay 29.000 tỷ đồng vốn hóa thị trường chỉ trong một phiên giao dịch. Với hơn 700 mã cổ phiếu niêm yết và hàng trăm bài báo xuất bản mỗi ngày, một người bình thường với tốc độ đọc trung bình 300 từ mỗi phút không thể bao quát toàn bộ thông tin. Luận văn tập trung giải quyết bài toán ứng dụng kỹ thuật khai phá văn bản kết hợp học máy để dự báo xu hướng biến động chỉ số VN-Index trong giai đoạn từ năm 2001 đến năm 2021. Mục tiêu trọng tâm là xây dựng quy trình tự động hóa từ thu thập, làm sạch, trích xuất đặc trưng ngôn ngữ đến dự báo xu hướng giá, giúp nhà đầu tư giảm thiểu rủi ro tâm lý và nâng cao hiệu suất đầu tư.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng dựa trên nền tảng của Giả thuyết Thị trường Hiệu quả (Efficient Market Hypothesis - EMH) cùng các lý thuyết tài chính hành vi hiện đại. Lý thuyết EMH phân chia thị trường thành ba cấp độ: dạng yếu, dạng bán mạnh và dạng mạnh. Trong đó, dạng bán mạnh khẳng định giá chứng khoán phản ánh toàn bộ thông tin công khai trong quá khứ lẫn tin tức hiện tại. Tuy nhiên, sự tồn tại của các dị biệt thị trường như hiệu ứng quy mô doanh nghiệp nhỏ, hiệu ứng tháng Giêng và hiện tượng đảo chiều giá đã mở ra không gian cho các mô hình định lượng khai thác thông tin từ văn bản để tìm kiếm lợi nhuận thặng dư.

Bên cạnh lý thuyết kinh tế, khung nghiên cứu tích hợp sâu rộng các nguyên lý Khoa học Dữ liệu và Khai phá Văn bản (Text Mining). Dữ liệu ngôn ngữ phi cấu trúc được chuẩn hóa sang không gian vector nhiều chiều thông qua phương pháp đo lường tần suất từ kết hợp nghịch đảo tần suất văn bản (TF-IDF). Trọng số TF-IDF đánh giá chính xác tầm quan trọng của từng từ ngữ tài chính đối với toàn bộ kho ngữ liệu. Để giải quyết bài toán phân loại ba trạng thái thị trường, nghiên cứu ứng dụng lý thuyết học máy có giám sát với các mô hình tiêu biểu: Cây quyết định (Decision Tree), Rừng ngẫu nhiên (Random Forest), K-Láng giềng gần nhất (K-Nearest Neighbor - KNN) và Máy vector hỗ trợ (Support Vector Machine - SVM). Trong đó, thuật toán SVM tối ưu hóa rủi ro cấu trúc thông qua việc thiết lập siêu phẳng phân tách có khoảng cách lề lớn nhất, kết hợp các hàm biến đổi phi tuyến để xử lý không gian dữ liệu vượt trên 1.000 chiều.

Phương pháp nghiên cứu

Nghiên cứu sử dụng phương pháp chọn mẫu toàn bộ đối với các tin tức tài chính, chứng khoán được xuất bản trực tuyến tại Việt Nam trong khung thời gian 20 năm, từ năm 2001 đến năm 2021. Tổng cỡ mẫu văn bản thu thập đạt 69.947 bài viết từ 4 kênh thông tin uy tín hàng đầu: Trang thông tin điện tử CafeF đóng góp 46.374 bài viết (giai đoạn 2008 - 2021), Báo điện tử VnExpress đóng góp 16.915 bài viết (giai đoạn 2001 - 2021), Cổng thông tin Vietstock đóng góp 4.596 bài viết (giai đoạn 2016 - 2021) và Báo Thanh Niên đóng góp 2.062 bài viết (giai đoạn 2013 - 2021). Nguồn dữ liệu số tương ứng là chuỗi chỉ số giá đóng cửa lịch sử của VN-Index được trích xuất đồng bộ từ nền tảng Investing.com.

Quy trình phân tích thực nghiệm được thiết kế qua năm giai đoạn chặt chẽ:

  • Thu thập dữ liệu: Ứng dụng thư viện Beautiful Soup 4 trên nền tảng Python để tự động bóc tách mã HTML và trích xuất nội dung văn bản cốt lõi.
  • Tiền xử lý ngôn ngữ tiếng Việt: Sử dụng biểu thức chính quy để loại bỏ ký tự nhiễu, chuẩn hóa chữ thường, thực hiện tách từ phức bằng thư viện Underthesea với độ chính xác nhận diện câu đạt 90%, sau đó đối chiếu từ điển tiếng Việt của Đại học Leipzig để lọc bỏ hoàn toàn các từ dừng (stop words).
  • Gán nhãn dữ liệu tự động: Toàn bộ tin tức xuất bản trong ngày t được gộp thành một tài liệu duy nhất và gắn nhãn theo tỷ lệ phần trăm thay đổi giá của VN-Index tại ngày t+1 theo 3 trạng thái: Tăng (nhãn 0), Giảm (nhãn 1), Không đổi (nhãn 2).
  • Trích xuất đặc trưng: Phương pháp ma trận TF-IDF được áp dụng để chọn lọc 1.024 từ đặc trưng tiêu biểu nhất nhằm tránh bẫy chiều dữ liệu cao.
  • Huấn luyện và kiểm định mô hình: Dữ liệu được phân chia theo tỷ lệ 70% dành cho huấn luyện (training set) và 30% dành cho kiểm thử độc lập (test set) trên bốn thuật toán SVM, Random Forest, Decision Tree và KNN thông qua thư viện Scikit-learn.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thực nghiệm trên 69.947 văn bản tin tức tài chính đã mang lại bốn phát hiện trọng tâm:

  • Sự kết hợp giữa tin tức tài chính và thuật toán học máy mang lại khả năng định hướng xu hướng VN-Index vượt trội so với xác suất ngẫu nhiên 33,3% của bài toán phân loại ba trạng thái. Dữ liệu văn bản phản ánh tâm lý thị trường tức thì, tạo tiền đề dự báo chính xác biến động chỉ số trước khi phản ánh vào số liệu kỹ thuật.
  • Mô hình Máy vector hỗ trợ (SVM) và Rừng ngẫu nhiên (Random Forest) đạt hiệu suất phân loại vượt trội so với các thuật toán phân loại tuyến tính và phân cụm thông thường. Trong khi mô hình KNN và Cây quyết định đơn lẻ chỉ đạt mức độ chính xác quanh ngưỡng 50% đến 55%, thuật toán SVM với kỹ thuật tối ưu hóa chuỗi tối thiểu (SMO) duy trì độ chính xác cao nhờ khả năng xử lý không gian vector 1.024 thuộc tính mà không bị ảnh hưởng bởi hiện tượng quá khớp.
  • Phương pháp gộp toàn bộ tin tức từ 4 nguồn báo chí trong cùng một ngày xuất bản giúp cải thiện hiệu suất dự báo thêm khoảng 8% đến 12% so với việc chỉ sử dụng dữ liệu đơn lẻ từ một trang báo. Việc đa dạng hóa nguồn tin giúp hạn chế sai lệch từ góc nhìn chủ quan của từng tòa soạn.
  • Quy trình tiền xử lý bằng Underthesea kết hợp chọn lọc 1.024 từ đặc trưng thông qua TF-IDF giúp giảm hơn 85% dung lượng nhiễu trong dữ liệu thô, tối ưu hóa tốc độ huấn luyện mô hình trên môi trường Scikit-learn và duy trì tính ổn định của hệ số phân tách siêu phẳng.

Thảo luận kết quả

Thực tế giao dịch trên thị trường chứng khoán Việt Nam cho thấy nhà đầu tư cá nhân chiếm tới hơn 80% giá trị giao dịch toàn thị trường. Nhóm đối tượng này có xu hướng phản ứng rất nhạy cảm và tức thì trước các luồng thông tin truyền thông đại chúng. Điều này giải thích tại sao nội dung báo chí lại có mối tương quan nhân quả mạnh mẽ với chiều hướng dao động của chỉ số VN-Index trong ngắn hạn.

Khi so sánh với các công bố học thuật quốc tế, kết quả của luận văn tương thích với phát hiện của Schumaker và Chen khi đạt độ chính xác 57% trên chỉ số S&P 500 thông qua khai phá 9.111 bài báo tài chính, cũng như nghiên cứu của Tien Thanh Vu đạt độ chính xác 82% trên nhóm cổ phiếu công nghệ Mỹ. Tại Việt Nam, nghiên cứu tạo ra bước đột phá khi giải quyết triệt để bài toán xử lý chuỗi ngôn ngữ tiếng Việt phức hợp, khắc phục hoàn toàn nhược điểm chậm trễ của các mô hình kinh tế lượng chuỗi thời gian như ARIMA hay GARCH vốn chỉ dựa vào giá đóng cửa quá khứ.

Về mặt trực quan hóa, toàn bộ kết quả phân loại được tổng hợp qua ma trận nhầm lẫn (Confusion Matrix) kích thước 3x3, phản ánh chi tiết số lượng dự báo chính xác cho các xu hướng tăng (TU), xu hướng giảm (TD), xu hướng đi ngang (TN) cùng các trường hợp dự báo sai (FU, FD, FN). Biểu đồ so sánh đường cong ROC-AUC giữa bốn mô hình minh chứng rõ nét sự vượt trội về độ nhạy và tính đặc hiệu của thuật toán SVM so với các mô hình còn lại trên tập dữ liệu kiểm thử 30%.

Đề xuất và khuyến nghị

  • Tích hợp các kiến trúc học sâu tiên tiến: Các quỹ đầu tư và công ty chứng khoán cần đầu tư triển khai các mạng nơ-ron hồi quy như LSTM, GRU hoặc các mô hình ngôn ngữ lớn chuyên sâu về tài chính nhằm nâng cao độ chính xác dự báo lên mức 75% đến 80% trong lộ trình từ 12 đến 18 tháng tới.
  • Phát triển hệ thống giám sát tâm lý thị trường thời gian thực: Khuyến nghị các định chế tài chính xây dựng công cụ cào dữ liệu và phân loại cảm xúc tự động với chu kỳ quét dưới 5 phút ngay khi tin tức xuất bản, giúp rút ngắn độ trễ phân tích xuống dưới 15 phút để kịp thời tái cơ cấu danh mục trước biến động bất ngờ.
  • Xây dựng từ điển thuật ngữ tài chính tiếng Việt chuẩn hóa: Các trường đại học khối kinh tế phối hợp cùng viện nghiên cứu công nghệ phát triển bộ từ điển chuyên ngành chứng khoán với quy mô trên 5.000 thuật ngữ chuẩn hóa trong vòng 6 tháng, tạo cơ sở dữ liệu mở phục vụ phân tích ngôn ngữ tự nhiên.
  • Tăng cường kiểm soát và minh bạch thông tin thị trường: Cơ quan quản lý như Ủy ban Chứng khoán Nhà nước cần đẩy mạnh ứng dụng AI để phát hiện sớm các hành vi thao túng thông tin, đồng thời thực thi nghiêm ngặt các quy định công bố thông tin theo Luật Chứng khoán năm 2019 (có hiệu lực từ ngày 01 tháng 01 năm 2021) nhằm giảm thiểu tác động tiêu cực của các tin đồn vô căn cứ.

Đối tượng nên tham khảo luận văn

  • Nhà đầu tư cá nhân và tổ chức: Nắm bắt phương pháp khoa học để lượng hóa thông tin báo chí, loại bỏ yếu tố cảm tính và xây dựng chiến lược giao dịch chủ động trước các biến động vĩ mô.
  • Chuyên viên phân tích và môi giới chứng khoán: Sử dụng quy trình khai phá dữ liệu văn bản để tự động hóa khâu tổng hợp tin tức thị trường hàng ngày, tiết kiệm tới 70% thời gian đọc báo cáo và nâng cao chất lượng khuyến nghị đầu tư cho khách hàng.
  • Doanh nghiệp Công nghệ Tài chính (Fintech) và Công ty Chứng khoán: Ứng dụng mã nguồn và quy trình tiền xử lý văn bản để phát triển các tính năng đo lường chỉ báo tâm lý đám đông (Market Sentiment) trực tiếp trên nền tảng ứng dụng giao dịch.
  • Học viên cao học, giảng viên và nhà nghiên cứu: Tài liệu tham khảo học thuật giá trị về sự kết hợp liên ngành giữa Kinh tế lượng, Tài chính định lượng và Xử lý ngôn ngữ tự nhiên (NLP) cho tiếng Việt.

Câu hỏi thường gặp

Kỹ thuật khai phá văn bản đem lại lợi thế gì so với phân tích kỹ thuật truyền thống trong dự báo ngắn hạn? Phân tích kỹ thuật chỉ dựa trên chuỗi giá lịch sử nên luôn có độ trễ nhất định và không thể dự báo các sự kiện bất thường. Khai phá văn bản lượng hóa trực tiếp các tin tức sự kiện ngay khi phát hành, cho phép nắm bắt phản ứng tâm lý thị trường tức thì, điển hình như việc phản ánh sự sụt giảm 18 điểm của VN-Index trước các biến cố truyền thông lớn.

Bộ dữ liệu thực nghiệm của nghiên cứu có quy mô và nguồn gốc như thế nào? Nghiên cứu sử dụng kho ngữ liệu khổng lồ gồm 69.947 bài báo tài chính được trích xuất từ 4 kênh truyền thông lớn là CafeF, VnExpress, Vietstock và Thanh Niên trong suốt 20 năm (2001 - 2021), kết hợp chuỗi dữ liệu biến động chỉ số VN-Index tương ứng từ Investing.com để đảm bảo tính khách quan toàn diện.

Thuật toán học máy nào thể hiện độ chính xác và khả năng tổng quát hóa cao nhất? Thuật toán Máy vector hỗ trợ (SVM) và Rừng ngẫu nhiên (Random Forest) đạt hiệu suất cao nhất nhờ khả năng tối ưu hóa khoảng cách lề trên không gian 1.024 thuộc tính TF-IDF, vượt trội hoàn toàn so với mô hình KNN và Cây quyết định đơn lẻ vốn rất dễ bị nhiễu dữ liệu văn bản tác động.

Công cụ nào được ứng dụng để xử lý rào cản ngữ pháp của tiếng Việt? Nghiên cứu ứng dụng công cụ Word_tokenizer thuộc thư viện Underthesea với độ chính xác phân đoạn câu tiếng Việt đạt 90%, kết hợp lọc từ dừng chuyên sâu bằng từ điển Đại học Leipzig để chuyển đổi văn bản thô thành các từ ghép có ý nghĩa kinh tế rõ ràng.

Quy trình gán nhãn tự động cho tập dữ liệu huấn luyện được thực hiện ra sao? Chương trình tự động đối chiếu ngày xuất bản tin tức ở thời điểm t với tỷ lệ biến động phần trăm của chỉ số VN-Index tại ngày giao dịch kế tiếp t+1. Nếu chỉ số tăng thì gắn nhãn 0, giảm gắn nhãn 1, và đi ngang gắn nhãn 2, giúp tiết kiệm hàng nghìn giờ gán nhãn thủ công.

Kết luận

  • Luận văn đã chứng minh mối quan hệ nhân quả chặt chẽ giữa nội dung thông tin báo chí tài chính và xu hướng biến động của chỉ số VN-Index trong suốt 20 năm phát triển của thị trường chứng khoán Việt Nam.
  • Thiết lập thành công quy trình tự động hóa toàn diện từ thu thập 69.947 bài báo, tiền xử lý ngôn ngữ tiếng Việt đạt độ chính xác 90% bằng Underthesea đến trích xuất 1.024 thuộc tính đặc trưng qua TF-IDF.
  • Khẳng định thuật toán Máy vector hỗ trợ (SVM) và Rừng ngẫu nhiên là hai mô hình tối ưu nhất cho bài toán phân loại ba trạng thái thị trường dựa trên dữ liệu văn bản đa nguồn.
  • Kế hoạch nghiên cứu tiếp theo sẽ tập trung mở rộng mô hình sang mạng nơ-ron học sâu Transformer và phân tích chi tiết từng nhóm ngành cổ phiếu cụ thể trong giai đoạn 2022 - 2025.
  • Các nhà đầu tư định lượng, chuyên gia tài chính và doanh nghiệp công nghệ nên chủ động tích hợp phương pháp khai phá văn bản vào quy trình quản trị rủi ro và tối ưu hóa danh mục đầu tư ngay hôm nay.