Đặt vấn đề Chúng ta thường lựa chọn dựa trên quan điểm và kinh nghiệm, nên cảm xúc đóng một vài trò quan trọng trong hành vi của con người. Sự quan tâm của dư luận về một vấn đề xã hội nào đó có thê trở thành một xu hướng trong tương lai. Ý kiến của công chúng về một sản phẩm, dịch vụ nào đó đối với các nhãn hàng là rất quan trọng, giúp các doanh chủ có chiến lược tiếp thị, sản xuất, kinh doanh, điều hành được tốt hơn. Nếu như trước kia việc lay y kiến khảo sát được thực hiện dựa trên các phiếu giấy, vừa tốn nhân lực thu thập, cách đặt câu hỏi nếu không khéo cũng không lại kết qua phản ánh đúng điều mà các tô chức, doanh nghiệp cần.
Ngoài ra việc làm thủ công sẽ mat nhiều thời gian, dẫn đến chỉ phí cơ hội bị bỏ lỡ. Thời đại bùng nỗ thông tin, tất cả các ngành nghề gần như đều sử dụng công nghệ dé tương tác và tiếp cận khách hàng, hành vi của người dùng cũng vì thé thay đổi rất nhiều. Vì thế việc thu thập các ý kiến khách hàng, các bình luận công chúng được thực hiện thông qua sự hỗ trợ của các phần mềm, công cụ tin học. 11 You're ana*s.
e (nguồn ảnh từ: hps:⁄/writingcooperative.com/how-not-to-take-hate-comments- personally-as-a-creator-5750086181ae ) Mục tiêu chính của đề tài này là xây dựng một công cụ hỗ trợ nhận diện các bình luận tích cực và tiêu cực liên quan tới sản phẩm/dịch vụ, tần suất thu thập dữ liệu mới là mỗi 5 phút, đối với dang bài toán này với khoảng thời gian đó xem như phù hợp. Ngoài ra, mục tiêu phụ của dé tài là áp dụng các kỹ thuật có thể xử lý được dữ liệu tăng lên nhanh chóng (dữ liệu trong đề tài không nhất thiết phải là đữ liệu lớn vì hạn chế của việc tiếp cận dữ liệu) và thời gian nhận hồi đáp nhanh chóng. Kỳ — —+ Target system (ecommerce) Crawl, Model Results: Hình 2 - Mô ta bài toán dạng tông quát 12 1. Mục tiêu nghiên cứu Mục tiêu nghiên cứu của luận văn này là xây dựng công cụ phân loại bình luận trên trang thương mại điện tử ứng dụng thuật toán Machine Learning và Deep Learning.
Các bước xây dựng hệ thống: - __ Thu thập dé liệu: dữ liệu được thu thập trực tuyến thông qua kết nói tới hệ thong thương mại điện tử. - _ Tiền xử lý dữ liệu: kiểm tra, chuẩn hóa đữ liệu, loại bỏ những thông tin ít giá trị trong dữ liệu. - Xây dựng mô hình phân loại: sử dụng kỹ thuật xử lý dữ liệu lớn kết hợp xử lý ngôn ngữ tự nhiên dé đưa ra nhận định phi hợp. - Hiển thị dữ liệu: kết qua phân loại được hién thị dưới dang biểu đồ, trên nền tảng web.
Cập nhật dữ liệu: dit liệu được cập nhật tự động khi hệ thống được vận hành. Phân tích và đưa ra phân loại: dựa trên các loại bình luận cùng với số lượng bình luận để các bên liên quan, bao gồm cả khách hàng và chủ nhãn hàng có những hành động phù hợp với chiến lược của mình. Đối tượng và phạm vi nghiên cứu Đối tượng nghiên cứu của luận văn là kỹ thuật phân loại bình luận và cách tạo ra công cụ để hiện thực kỹ thuật phân loại bình luận này. Phạm vi nghiên cứu là một số thuật toán phân loại bình luận Machine Learning (Logistic Regression, Support Vector Machine, Naive Bayes, Decision Tree) và Deep Learning (LSTM, CNN), kỹ thuật trong hệ sinh thai Big Data (Spark, Kafka, PySpark), trên tập dữ liệu thu thập từ website thương mai điện tử Tiki, với mặt hang là sách tiếng Việt thuộc lĩnh vực kinh tế.
Phương pháp nghiên cứu Phương pháp nghiên cứu của luận văn là dựa trên khảo sát các công trình, bài báo nghiên cứu trước đó để tìm các thuật toán và độ chính xác mà các tác giả đạt được. Thực nghiệm khảo sát trên thị trường thông qua internet đề tìm kiếm sản phẩm tương tự từ các doanh nghiệp để học hỏi. Sau đó thử nghiệm các thuật toán với bộ dữ liệu thu thập, tiến hành tinh chỉnh các tham số trong thuật toán, dé đánh giá và lựa chọn thuật toán phù hợp. Cuối cùng là xây dựng công cụ xử lý bài toán.
Câu hỏi khi nghiên cứu Câu hỏi 1: Tại sao phải làm luận văn này trong khi có rất nhiều nghiên cứu, ứng dụng trước đó và bài này đã có rất nhiều năm? Trả lời 1: Các ứng dụng được các doanh nghiệp phát triển dé phục vụ nhu cầu nội bộ, họ không chia sẻ phương pháp làm, nên minh cần làm dé giải quyết bài toán của mình. Các nghiên cứu khoa học về mảng này có rất nhiều, nhưng phan lớn tập trung vào cải tiến mô hình để tăng độ chính xác, và tập dữ liệu luận văn làm khác với của họ. Câu hói 2: Tiêu đề luận văn đề cập tới thời gian thực và dữ liệu lớn, vậy nó thé hiện như thế nào trong luận văn? Trả lời 2: Thời gian thực theo cách hiểu của em khi làm đề tài, không phải là đữ liệu phát sinh liên tục như trong dữ liệu chứng khoán, mà thực ở đây là khi có phát sinh 14 trên hệ thống đích, sau một khoảng thời gian ngắn, có thể là vài phút đến vài chục phút, công cụ có thé quét lại dé cập nhật vào bảng kết quả. Van đề dữ liệu lớn, trong luận văn đang sử dụng là ý muốn dùng kỹ thuật dành cho xử ly dé liệu lớn, chứ không phải dữ liệu của luận văn đủ tiêu chuân lớn, điều này do hạn chế không phải là chủ trang nên không thể kéo nhiều được.
Câu hỏi 3: Đóng góp của luận văn này là gì? Trả lời 3: mặc dù luận văn không mang lại điểm mới trong học thuật, nhưng hướng tới kỹ thuật xây dựng bài toán và giải quyết bài toán, đồng thời thực nghiệm trên một số thuật toán để đưa ra nhận định lựa chọn thuật toán phù hợp cho dạng bài toán này. Công việc cần làm e Phân tích yêu cầu, khảo sát tình hình thị trường, tình hình nghiên cứu và hệ thống các nghiên cứu đó. e Thu thập, làm sạch, xử lý dữ liệu. e Xây dựng model phân loại, thiết kế mô hình phần mềm/công cụ.
e Thử nghiệm bộ di liệu trên với các model. e Dua model vào phần mém/céng cụ. e Kết luận, nhận định đề tài, những đóng góp của nghiên cứu, các hạn chế và hướng phát triển. © Gửi bài tới một hội thảo dé có thêm kênh đánh giá.
Tình hình nghiên cứu 2. Tình hình nghiên cứu trong nước STT Bài báo Kết quả 1 Mô hình khai phá ý kiến và phân | Bài báo thực hiện phân tích cảm xúc khách tích cảm xúc khách hàng trực | sau khi mua hàng trên website Foody.vn, tuyến trong ngành hàng thực | sử dụng một phương pháp học máy có phẩm (2020) - Đại học Mở giám sát như Decision Tree, Naïve Bayes, 15 Logistic Regression. Độ chính xác lên tới 90%, cho các nhận diện bình luân tích cực và tiêu cực. Nghiên cứu giải pháp phát hiện Thu thập thông tin trên mạng xã hội tin gia trên mạng xã hội bằng facebook thông qua một số nhóm lớn, và ngôn ngữ tiếng Việt (2022) - CTU đối chiếu tin với các trang tin tức chính thống tại Việt Nam, để so sánh mức độ giả của tin, dựa trên phương pháp phân tích TF — IDF, so sánh độ tương đồng cosine và thu được mức độ chính xác khi phát hiện tin giả lên đến 70%.
Phương pháp phân loại dữ liệu Thu thập và phân loại bình luận 15 mặt bình luận của khách hàng trực hàng trên 5 website thương mại điện tử tuyến Việt Nam dựa vào học máy khác nhau, áp dụng 4 phương pháp học có giám sát (2022) - TNU máy như SVM, Naïve Bayes, Neural Network và Decision Tree, độ chính xác trung bình cao nhất lên đến 80%. From Aspect-Based Sentiment Xây dựng bộ dữ liệu các phản hồi tiếng Analysis to Social Listening Việt trên smartphone, áp dụng kiến trúc System for Business Intelligence Bi-LSTM với fastText word embeddings, (2021) — UIT [6] kết quả F1-score đối với phân loại cảm xúc lên 63.03% và nhận diện khía cạnh lên tới 84.48%, hon han giá tri Fl-score khi thực hiện với các phương pháp như Naïve Bayes, SVM, Random Forest, CNN, LSTM Hate Speech Detection on Sử dụng học sâu dựa trên Bi-GRU-LSTM- Vietnamese Social Media Text CNN để phân lớp, giá trị Fl-score thu using the Bi-GRU-LSTM-CNN được lên tới 70. Model (2019) - UIT [5] Bang I - Tình hình nghiên cứu trong nước 2. Tình hình nghiên cứu trên thế giới STT Bài báo Kết qua 1 Big Data-Deep Learning for Bài báo nhân mạnh sử dụng Deep financial sentiment analysis [1S] Learning đê phân tích bình luận tài chính.
LSTM, Word2vec và CNN là các kỹ thuật được dùng, bộ dataset trong đề tài là StockTwits. A Novel Machine Learning Sử dung kết hop SVM va fine-tuning Approach for Sentiment Analysis ULM (gọi là ULMFiT-SVM), trên các bộ on Twitter Incorporating the dữ liệu Twitter, IMDB và GOP Debate, Universal Language Model Fine- thu được độ chính xác lên tới 99. Tuning and SVM Monolith Real Time Xây dựng giải pháp thực hiện online Recommendation System with training, phục vụ hệ thống hỗ trợ ra quyết Collisionless Embedding Table. định với thời gian thực [7] The impact of Big Data Quality Phan tich 7 gia tri cua Big Data anh huong on Sentiment Analysis tới các phân tích bình luận, ở các mức độ Approaches khác nhau Review Sentiment Analysis Kiên trúc unsupervised Deep neural Based on Deep Learning.
[16] network được phát triển để phân tích bình 17 luận, và so sánh nó tốt hơn so với SVM trên cùng bộ dataset Bảng 2 - Tình hình nghiên cứu thé giới 2. Nhận định về các nghiên cứu Theo góc nhìn chủ quan của tôi sau khi khảo sát qua tình hình nghiên cứu trong và ngoài nước, các tác giả tập trung phan lớn vào thuật toán và có gắng cai tiễn mô hình nhằm làm tăng độ chính xác, hàm lượng học thuật cao, chứ chưa chú trọng nhiều tới khả năng áp dụng vào thực tiễn, đặc biệt là kha năng triển khai đơn giản, dé mở rộng cũng như khi vận hành. Trên thị trường, cũng có nhiều phần mềm nhận diện và phân loại bình luận, nhưng phần lớn phục vụ bộ phận Back-Office của doanh nghiệp hoặc chỉ chạy trong một khoảng thời gian ngắn của sự kiện, và thông tin tôi tìm hiểu cũng chỉ qua người quen, nghe họ đánh giá chứ chưa kiêm nghiệm được những góp ý nay. 18 CHƯƠNG 2: KIÊN THỨC NÈN TÁNG 1.
Machine learning Theo định nghĩa từ IBM, Machine Learning là một nhánh của Artificial Intelligence (AD) và khoa học máy tính, tập trung vào sử dụng dữ liệu và thuật toán nhằm bắt chước cách con người học, dần dần cải thiện độ chính xác của thuật toán đó.