CHƯƠNG 1.1 Tổng quan Trong chương này, chúng tôi sẽ trình bày sơ lược qua về bối cảnh chọn đề tài, lý do chọn đề tài, mục tiêu và phạm vi của nghiên cứu, ý nghĩa khoa học và thực tiễn mà đề tài.1 Bối cảnh Trong thời đại ngày nay, việc tham gia vào môi trường kinh doanh tài chính và đưa ra quyết định đầu tư dễ dàng hơn đối với người dùng, ngay cả khi họ chưa có quá nhiều kiến thức cũng như kinh nghiệm trong lĩnh vực, môi trường này. Một trong những vấn đề mà họ gặp phải trong trường hợp này là thiếu đi những thông tin cần thiết cũng như việc đánh giá chính xác các ảnh hưởng của các thông tin đến thị trường. Để hỗ trợ người dùng trong việc đưa ra quyết định đầu tư, chúng tôi đề xuất cung cấp thêm thông tin cho người dùng bằng cách phân tích xúc cảm nhiều khía cạnh trong tin tức tài chính. Để dự đoán mức độ tác động của một tin tức, bài báo đối với các khía cạnh tài chính được nhắc đến cần thực hiện một quá trình phân tích cẩn thận về nội dung bài viết.
Bao gồm việc xác định thông tin chính, nguồn tin, ngữ cảnh thị trường và các tài sản tài chính khác liên quan hay được đề cập, nhắc đến trong nội dung bài báo, tin tức. Điều này giúp người đọc đánh giá được mức độ quan trọng của các thông tin trong bài báo đối với việc định hình quyết định đầu tư và các hành động có liên quan tác động đến thị trường tài chính. Hiện nay, sự phổ biến của công nghệ và Internet đã thay đổi cách thức người dùng tiếp cận với các thông tin kinh tế. Họ có thể dễ dàng truy cập, tìm kiếm các thông tin từ nhiều nguồn khác nhau thông qua các công cụ, thiết bị di động, mạng xã hội và các trang web tin tức.vn, số liệu từ Trung tâm lưu ký Chứng khoán Việt Nam (VSD), lũy kế cả năm 2022, nhà đầu tư cá nhân trong nước đã mở mới gần 2,6 triệu tài khoản chứng khoán.
Đây là con số kỷ lục trong 22 năm hoạt động [1]. Tuy nhiên cùng với sự tiện lợi và phổ biến đó, là việc có quá nhiều thông tin mà người dùng cần tiếp nhận đòi hỏi người dùng phải có sự hiểu biết và một lượng kiến thức nhất định về tài chính để có thể hiểu được chính xác những Phạm Minh Tuấn – 19469421 1 Trương Nguyễn Duy Tân – 19485441 Khóa luận tốt nghiệp chuyên ngành Khoa Học Dữ Liệu tác động của Phạm Minh Tuấn – 19469421 2 Trương Nguyễn Duy Tân – 19485441 Khóa luận tốt nghiệp chuyên ngành Khoa Học Dữ Liệu những thông tin trên đối với nền kinh tế, đa số các nhà đầu tư mới chỉ tập trung vào phân tích kỹ thuật, điều này khiến nhà đầu tư không nắm rõ thông tin về cổ phiếu đang đầu tư và dẫn đến những phán đoán thiếu cơ sở. Để tránh rủi ro này, cần phải áp dụng kết hợp thông minh cả phân tích kỹ thuật và phân tích cơ bản [17], sử các nguồn thông tin truyền thống và trực tuyến để có cái nhìn tổng quan và đảm bảo tính chính xác của các thông tin kinh tế để đưa ra các quyết định đúng đắn. Các tác động, ảnh hưởng mạnh mẽ của các tin tức đối với nền kinh tế, thị trường tài chính.
Điển hình như các tin tức tích cực thường thúc đẩy sự đầu tư và tạo tin tưởng trong thị trường, trong khi đó tin tức tiêu cực dễ dàng có thể gây nên các biến động và làm giảm lòng tin của nhà đầu tư đối với thị trường. Sự lan truyền của thông tin qua các phương tiện truyền thông và mạng xã hội diễn ra một cách nhanh chóng và mạnh mẽ đã làm cho thị trường trở nên nhạy cảm hơn với sự biến động và tạo ra môi trường đầu tư phức tạp. Vì thế, việc xây dựng một công cụ để có thể xác định chính xác các tác động, ảnh hưởng của từng khía cạnh trong tin tức kinh tế đóng vai trò rất quan trọng trong việc hỗ trợ hình thành quyết định đầu tư và quản lý rủi ro trong môi trường kinh doanh hiện nay.2 Lý do chọn đề tài Như đã đề cập ở bối cảnh trước đó, do sự dễ dàng tiếp cận thị trường đầu tư, chúng tôi mong muốn mang đến một công cụ hữu ích để giúp, hỗ trợ người dùng dễ dàng hơn trong việc tiếp cận và đưa ra những quyết định đầu tư hợp lý. Số lượng thông tin các bài báo kinh tế hiện tại có rất nhiều tuy nhiên việc phân tích các khía cạnh để khai thác các ảnh hưởng của bài báo đấy đến thị trường lại ít được phổ biến và khai thác đối với các tin tức kinh tế ở Việt Nam.2 Mục tiêu nghiên cứu Tìm hiểu về kiến trúc mô hình Recurrent Neural Network (RNN), Gated Recurrent Unit (GRU), Long-Short Term Memory (LSTM) trong bài toán xử lý ngôn ngữ tự nhiên.
Tìm hiểu về các mô hình xử lý ngôn ngữ tự nhiên (NLP) áp dụng các mô hình học máy (RNN, GRU, LSTM) cho nhiệm vụ xử lý ngôn ngữ tiếng Việt ở lĩnh vực tài chính. Phạm Minh Tuấn – 19469421 3 Trương Nguyễn Duy Tân – 19485441 Khóa luận tốt nghiệp chuyên ngành Khoa Học Dữ Liệu Tìm hiểu về kỹ thuật Supervised Learning. Tìm hiểu về các công cụ hỗ trợ chat GPT. Áp dụng kết hợp công cụ chat GPT trong việc xử lý nhãn dữ liệu, sau đó đưa vào mô hình LSTM để thực hiện quá trình huấn luyện đối với các tin tức của các bài báo kinh tế ở Việt Nam.
Đề xuất phương pháp xây dựng mô hình dự đoán mức độ tác động tin tức tài chính trên nhiều khía cạnh để giải quyết vấn đề cung cấp thêm thông tin từ tin tức tài chính cho quyết định đầu tư.3 Phạm vi nghiên cứu Kiến thức và hiểu biết về các phương pháp phân tích thống kê để áp dụng trong việc xử lý dữ liệu. Kiến thức và hiểu biết về các mô hình Recurrent Neural Network, Gated Recurrent Unit, Long-Short Term Memory. Nguồn dữ liệu được sử dụng để nghiên cứu được thu thập từ các trang báo về tin tức kinh tế của các công ty hoạt động ở Việt Nam cũng như các công ty có ảnh hưởng đến thị trường Việt Nam.4 Ý nghĩa khoa học và thực tiễn Ý nghĩa khoa học: đề xuất mô hình phân tích các khía cạnh của bài báo. Ý nghĩa thực tế: cung cấp giải pháp giúp nhà đầu tư có cái nhìn tổng quan và rõ ràng hơn về các khía cạnh và ảnh hưởng của các khía cạnh đó trong bài báo, từ đó hỗ trợ đưa ra quyết định cho nhà đầu tư.
Mở rộng: Nghiên cứu này góp phần làm tiền đề cho nghiên cứu về bài toán ABSA trong tin tức & dự đoán tài chính. Phạm Minh Tuấn – 19469421 4 Trương Nguyễn Duy Tân – 19485441 Khóa luận tốt nghiệp chuyên ngành Khoa Học Dữ Liệu CHƯƠNG 2.1 Bài toán Chúng tôi tiến hành trình bày tổng quát về bài toán xử lý ngôn ngữ tự nhiên về phân tích xúc cảm trong lĩnh vực tài chính đối với ngôn ngữ tiếng Việt.1 Khái niệm Phân tích xúc cảm (SA) là nhiệm vụ phân loại nhãn/dự đoán giá trị xúc cảm dựa theo một đoạn văn bản. Ví dụ, một đoạn văn bản bình luận trên mạng xã hội có thể được phân loại thành nhãn “tích cực”, “tiêu cực”, “bình thường” hay một giá trị thực cụ thể trong khoảng từ -1 đến 1 [16].2 Các nghiên cứu trước đó Nhiệm vụ nghiên cứu và phân tích xúc cảm (SA) trong văn bản hiện nay đóng vai trò hết sức quan trọng và rất cần thiết trong lĩnh vực xử lý ngôn ngữ tự nhiên (NLP) và phát triển trí tuệ nhân tạo. Mục tiêu là trích xuất thông tin có giá trị liên quan đến các khía cạnh được đề cập trong nhận xét của người dùng.
Vấn đề này có thể được chia thành ba nhiệm vụ phụ: trích xuất thuật ngữ, phát hiện khía cạnh và phát hiện phân cực. Ở nghiên cứu của Minh-Hao Nguyen và cộng sự đã thực hiện đối với hai nhiệm vụ phụ là phát hiện khía cạnh và phát hiện phân cực trong nhận xét của người dùng [14]. Hay ở nghiên cứu của Quang-Linh Tran và cộng sự đã sử dụng các mô hình học sâu như Bi-GRU, Bi-LSTM để xây dựng mô hình phân loại khía cạnh của đánh giá và phân loại cảm tính của từng khía cạnh trong lĩnh vực thương mại điện tử đối với các đánh giá sản phẩm của người dùng [18]. Còn đối với lĩnh vực tài chính, ở nghiên cứu của Hitkul Jangid và cộng sự cũng đã sử dụng các mô hình học sâu như LSTM để phân tích khía cạnh trong văn bản, nhưng có sự chọn lọc trong các khía cạnh để tập trung vào một lĩnh vực cụ thể [8].
Tuy nhiên, đối với tiếng Việt, các mô hình dùng cho phân tích các khía cạnh tài chính vẫn chưa được áp dụng rộng rãi mặc dù lượng thông tin tài chính ở Việt Nam rất phổ biến và số lượng người dùng đầu tư vào thị trường tài chính ngày càng tăng. Vì thế, sẽ rất hứa hẹn khi áp dụng một mô hình học sâu để có thể phân tích được những khía Phạm Minh Tuấn – 19469421 5 Trương Nguyễn Duy Tân – 19485441 Khóa luận tốt nghiệp chuyên ngành Khoa Học Dữ Liệu cạnh, yếu tố ảnh hưởng của các tin Phạm Minh Tuấn – 19469421 6 Trương Nguyễn Duy Tân – 19485441 Khóa luận tốt nghiệp chuyên ngành Khoa Học Dữ Liệu tức tài chính ở Việt Nam, giúp hỗ trợ người dùng trong việc đưa ra các quyết định trong đầu tư.1 Tokenization Tokenization là quá trình chia nhỏ văn bản thành các đơn vị được gọi là “token”, tương ứng với mỗi token có thể là một từ, một cụm từ hay đoạn văn tuỳ vào cách thực hiện của tokenization. Đây là một quá trình quan trọng và cần thiết để chuẩn bị xây dựng đầu vào cho mô hình máy học trong nhiệm vụ xử lý ngôn ngữ tự nhiên [9], cho phép hệ thống có thể hiểu được và xử lý một cách hiệu quả hơn. Mô tả cách thức hoạt động của tokenization.2 Stop Words Removal Kỹ thuật Stop Words Removal là quá trình loại bỏ các từ không có quá nhiều ý nghĩa trong văn bản, các từ ngữ phổ biến không mang lại, đóng góp nhiều thông tin.
Ví dụ: và", "hay", "hoặc", "nếu",. Mục tiêu của việc áp dụng kỹ thuật trên là để cải thiện hiệu quả của mô hình bằng cách đào tạo tập trung vào các từ khoá hiệu quả hơn và cũng để giảm kích thước của tập dữ liệu đào tạo.