CHƯƠNG I: BÀI TOÁN PHÁT HIỆN LẬP TRƯỜNG 1.1 Giới thiệu bài toán phát hiện lập trường Internet đã trở thành một phần không thể thiếu trong cuộc sống hàng ngày của mỗi người trên thế giới ngày nay và đóng một vai trò đặc biệt trong việc thúc đẩy sự phát triển mạnh mẽ của các kênh truyền thông mạng xã hội,diễn đàn, website tin tức. Tại Việt Nam, các kênh truyền thông mạng xã hội (MXH) ngày càng trở nên gần gũi và thân thuộc với rất nhiều người, kể cả đối với thanh, thiếu niên và người già. Theo báo cáo thường niên “Digital 2021” được công bố bởi WeAreSocial và Hootsuite, Việt Nam có 68.72 triệu người dùng Internet chiếm 70.3% dân số và 72 triệu người dùng mạng xã hội chiếm khoảng 73. Các kênh truyền thông MXH được sử dụng phổ biến bao gồm: Facebook, YouTube, Instagram, Zalo,Twitter… ALEXA cũng thông báo top 10 trang web có lượng truy cập nhiều tại Việt Nam, ngoài các website phổ biến nằm đầu danh sách như Facebook, Youtube, các loại website tin tức cũng chiếm phần lớn trong danh sách này bao gồm vnexpress.
Các diễn đàn như Webtretho, Beat.vn…cũng thu hút số lượng thành viên đông đảo và có tác động mạnh mẽ đến cộng đồng và dư luận xã hội ở Việt Nam. Thực tế cho thấy, internet và các kênh kể trên đem tới cho người dùng rất nhiều tiện ích nhờ tốc độ thông tin nhanh, gần như tức thời, nội dung phong phú, hình thức sinh động, hấp dẫn. Điều này cũng tạo điều kiện cho mỗi cá nhân chia sẻ kiến thức, thảo luận, trao đổi những ý kiến về các chủ đề cùng quan tâm, đồng thời cũng là những kênh thông tin quan trọng góp phần đưa các chủ trương, đường lối của Đảng, chính sách, pháp luật của nhà nước đến với nhân dân nhanh chóng, kịp thời. [3] Tại đây cơ quan chức năng các cấp có thể nắm bắt thường xuyên thái độ của người sử dụng mạng xã hội đối với các vấn đề, sự kiện đang được dư luận xã hội quan tâm.
[4] Như vậy dựa vào việc tổng hợp và phân loại ý kiến của dư luận trên nhiều kênh có thể là một nguồn tài nguyên quan trong việc phân tích, nghiên cứu tình hình và xu hướng của dư luận xã hội. Nhìn vào bối cảnh trên, lập trường (stance) có thể hiểu là một ý kiến được thể hiện bởi một cá nhân hướng tới chủ đề hoặc sự kiện hoặc nhân vật nào đó. [5]Bài toán phát hiện lập trường thu hút rất nhiều sự chú ý của các nhà nghiên cứu bởi nó Luan van 4 mang lại rất nhiều ứng dụng thiết thực. Một trong những ứng dụng phổ biến nhất trong đó là khảo sát, thăm dò ý kiến được thực hiện trên các văn bản nội dung trực tuyến với các chủ đề khác nhau bao gồm các cuộc tranh luận chính trị, tư tưởng, xã hội, đánh giá sản phẩm và bầu cử, trưng cầu dân ý.
[2] Ví dụ chúng ta có thể lấy ý kiến dư luận về một vấn đề chính trị - xã hội như hợp pháp hóa việc phá thai ở một số quốc gia. Dựa vào tự động hóa phát hiện lập trường, chúng ta có thể tồng hợp và phân loại ra có bao nhiêu người tán thành và không tán thành với vấn đề này. Một ứng dụng quan trọng khác của phát hiện lập trường cũng thu hút nhiều sự chú ý là phát hiện tin giả. Đánh giá tính xác thực của một bài tin là một công việc phức tạp và cồng kềnh, ngay cả đối với các chuyên gia được đào tạo [6].
Mục tiêu áp dụng bài toán lập trường cho phát hiện tin tức giả là để hỗ trợ kiểm tra tính xác thực của thông tin giúp họ nhanh chóng thu thập thông tin cần thiết để đưa ra đánh giá của mình. Một bài toán phát hiện lập trường tốt sẽ cho phép người kiểm tra tính xác thực của thông tin nhập một tuyên bố hay tiêu đề và ngay lập tức họ nhận được các truy xuất về các bài báo: đồng ý, không đồng ý hoặc thảo luận về tuyên bố/tiêu đề được đề cập. Sau đó, họ có thể xem xét các lập luận ủng hộ và chống lại tuyên bố, đồng thời sử dụng khả năng phán đoán và lập luận của mình để đánh giá tính hợp lệ của tuyên bố được đề cập. Một công cụ như vậy sẽ cho phép người kiểm tra thực tế nhanh chóng và hiệu quả.
[7] Ngoài ra phát hiện lập trường còn áp dụng nhiều ứng dụng khác như: phân loại tin đồn, phân tích, dự báo xu hướng và thị trường, tạo hệ thống khuyến nghị, hỗ trợ giám sát sức khỏe cộng đồng, truy xuất thông tin, khảo sát ý kiến góp ý người tiêu dùng.2 Một số nghiên cứu liên quan Trong những năm gần đây, đã có rất nhiều nghiên cứu về lĩnh vực Xử lý Ngôn ngữ Tự nhiên (Natural language processing - NLP) liên quan đến lĩnh vực phát hiện lập trường. Phát hiện lập trường nhằm mục đích xác định lập trường của tác giả văn bản đối với mục tiêu (một thực thể, khái niệm, sự kiện, ý tưởng, ý kiến, tuyên bố, chủ đề, v. Các nghiên cứu ban đầu về phát hiện lập trường tính đến năm 2013 chủ yếu tập trung vào các cuộc tranh luận trong quốc hội [Thomas et al. 2006]; các cuộc thảo luận nội bộ công ty [Murakami và Raymond 2010]; các cuộc tranh luận xã hội ,chính Luan van 5 trị và các hệ tư tưởng trực tuyến [Anand et al.
2011; Somasundaran and Wiebe 2010; Walker et al. 2012a]; các cuộc tranh luận trực tuyến về sản phẩm [Somasundaran và Wiebe 2009]. Các công trình sau năm 2013 được thực hiện trên các bài luận của sinh viên [Faulkner 2014], và trên các tweet [Rajadesingan và Liu 2014]. Những chủ đề phổ biến được lấy trên các cuộc tranh luận trực tuyến ấy cho các mục tiêu lập trường (stance targets) bao gồm sự tiến hóa, quyền sử dụng súng, quyền của người đồng tính, phá thai, chăm sóc sức khỏe, án tử hình và sự tồn tại của Chúa[ Dilek Küçük và Fazli Can.
Các cách phân loai lập trường trong các nghiên cứu đó cũng rất đa dạng, thay vì sử sụng bộ phân loại lập trường (Favor, Against) các nhà nghiên cứu còn sử dụng một số bộ khác như (Support, Oppose), (Pro, Con), và (Pro, Anti). Các phương pháp được được sử dụng bao gồm thuật toán dựa trên quy tắc ( rule-based algorithms) như JRip) [Anand et al. 2011; Murakami và Raymond 2010; Walker et al. 2012a, 2012b]; các thuật toán giám sát ( supervised algorithms ) SVM [Hasan và Ng 2013; Somasundaran và Wiebe 2010; Thomas et al.
2006; Walker et al. 2012b], naïve Bayes [Anand et al.2011; Hasan và Ng 2013; Rajadesingan và Liu 2014; Walker et al. 2012b], boosting [Levow et al.2014], cây quyết định (decision tree) và random forest [Misra và Walker 2013], Hidden Markov Models (HMM) và trường điều kiện ngẫu nhiên (Conditional Random Fields -CRF) [Hasan và Ng 2013]; thuật toán đồ thị (graph algorithms) MaxCut [Murakami và Raymond 2010; Walker et al. 2012a], và các cách tiếp cận khác như quy hoạch tuyến tính (Integer Linear Programming -ILP) [Somasundaran và Wiebe 2009] [2].
Bên cạnh đó, các cuộc thi về phát hiện lập trường cũng thu hút rất nhiều sự quan tâm. Theo như tìm hiểu thì cho đến hiện tại có 3 cuộc thi liên quan về chủ đề trên như (1) SemEval-2016 Task 6: phát hiện lập trường trong các tweet tiếng Anh, (2) phát hiện lập trường trong các blog nhỏ của Trung Quốc tại NLPCC-ICCPOL- 2016 , (3) Phát hiện lập trường trên các Tweet tiếng Tây Ban Nha và Catalan tại IberEval-2017. Các cuộc thi đó cung cấp chi tiết các hướng dẫn chú thích, tập dữ liệu chú thích, chỉ số đánh giá và mô tả về các tác phẩm tham gia. Cuộc thi thứ nhất gồm 2 nhiệm vụ: nhiệm vụ A và nhiệm vụ B.
Nhiệm vụ A gồm tập dữ liệu đào tạo có chú thích gồm 2.814 tweet và tập dữ liệu thử nghiệm gồm 1.249 tweet được cung cấp cho tổng số năm mục tiêu. Nhiệm vụ B gồm tập dữ liệu đào tạo không được gắn nhãn (khoảng 78.000 tweet) và tập dữ thử nghiệm nhỏ hơn Luan van 6 (khoảng 707 tweet) cho một mục tiêu khác được cung cấp cho những người tham gia mà không có bất kỳ dữ liệu đào tạo nào được chú thích. Kết quả của cuộc thi như sau: đối vơi nhiệm vụ A hệ thống tốt nhất dựa trên Mạng nơ-ron hồi quy (RNN - Recurrent Neural Network) đạt F-score là 67,82%, nhiệm vụ B hệ thống tốt nhất dựa trên Mạng nơ-ron tích chập (Convolutional Neural Networks -CNN) đạt F-score là 56. Cuộc thi thứ hai cũng tương tự như cuộc thi SemEval-2016 với hai nhiệm vụ.
Đối với nhiệm A: 4.000 blog nhỏ được gắn nhãn thủ công cho năm mục tiêu và 75% trong số đó được sử dụng làm tập dữ liệu đào tạo trong khi phần còn lại 25% trong số chúng được sử dụng làm tập dữ liệu thử nghiệm. Kết quả của cuộc thi như sau: hệ thống đạt F-score cao nhất (71.06%) với các phân loại được sử dụng dựa trên SVM and random forest trong khi hệ thống đạt F-score cao nhất của nhiệm vụ B chỉ đạt 46. Điều này là do người tham gia sử dụng nhiều cách phân loại và sử dụng hệ thống phân tích cảm tính hiệu suất cao có thể không đảm bảo hiệu suất phát hiện lập trường được cải thiện. Cuộc thi thứ ba cũng tương tự với 5,400 tweets tiếng Tây Ban Nha and 5,400 tweets tiếng Catalan.
Hệ thống hoạt động tốt nhất việc phát hiện lập trường trên các tweet của Tây Ban Nha dựa trên cách tiếp cận dựa trên SVM với sự kết hợp của các tính năng khác nhau. Trong khi hệ thống hoạt động tốt nhất trên các tweet của Catalan dựa trên hồi quy logistic.3 Tính thời sự của bài toán Phát hiện lập trường là một chủ đề mới nổi trong lĩnh vực Xử lý Ngôn ngữ Tự nhiên (Natural language processing - NLP) thu hút rất nhiều sự quan tâm của các nhà nghiên cứu bởi các ứng dụng thực tế. Các nhà nghiên cứu hiện nay chủ yếu tiếp cận vấn đề phát hiện lập trường bằng tiếng Anh. Nhận thấy tầm quan trọng của chủ đề cùng với việc phát hiện lập trường cho tiếng Việt chưa được quan tâm nhiều, đã thôi thúc chúng tôi chọn nghiên cứu đề tài “Phát hiện lập trường cho tiếng Việt sử dụng kỹ thuật học sâu”.
Ngoài ra lý do cần phải phát triển một hệ thống riêng cho Tiếng Việt là bởi Tiếng Anh và tiếng Việt có nhiều điểm khác biệt (do loại hình ngôn ngữ, do nền văn hoá,…). Khác về ngữ âm học, hình vị, ranh giới từ, sự từ vựng hoá (như: ox – bò đực, anh – elder brother ,…), từ loại, trật tự từ, kết cấu câu. [8] Trong tiếng Anh và nhiều ngôn ngữ khác, các từ được phân tách với nhau bằng dấu cách.