Chương 1. TỔNG QUAN 12 Trong chương này, chúng tôi giới thiệu về một số đặc điểm của bộ dit liệu được sử dụng trong khóa luận, các mô hình sử dụng, các mô hình liên quan và phương pháp đánh giá mô hình. Cùng với đó là quy trình thử nghiệm các mô hình để so sánh. Chương 4: Kết quả Trong chương này, chúng tôi sẽ trình bày phân tích kết quả đạt được từ hai bài toán và các lỗi gặp phải.
Chương 5: Kết luận và hướng phát triển Trong chương này, chúng tôi sẽ chỉ ra sự đóng góp, các vấn dé khó khăn gặp phải và hướng phát triển của khóa luận 1.6 Tính ứng dung của đề tài Trong khoá luận này, chúng tôi sẽ làm rõ liệu tách từ theo từ hay tách từ theo âm tiết sẽ mang lại kết quả tốt hơn cho các bài toán nhận diện chuỗi. Cụ thể hơn, đó là hai bài toán đọc hiểu tự động và phân tích cảm xúc dựa trên khía cạnh. Chúng tôi thực hiện đẻ tài này với mục đích: * Tạo tiền dé cơ sở cho các nghiên cứu để lựa chọn phương pháp tách từ phù hợp với mô hình thực hiện hơn. Tránh việc phải thử nghiệm nhiều lần, lãng phí thời gian và chi phí.
se Góp phần nâng cao độ chính xác dựa trên sự lựa chọn phương pháp tách từ phù hợp với mô hình đang thực hiện.7 Kếtluận Tom lại, trong khoá luận này, chúng tôi thực hiện nghiên cứu kỹ thuật tach từ nào sẽ phù hợp cho bài toán nhận dạng chuỗi trên tiếng Việt. Tổng quan khoá luận được thể hiện như hình 4. ˆ- Âm tiết Nhận dạng chuỗi mang ý nghĩa cảm xúc Am tiết: [Hôm, nay, bầu, trời, thật, trong, xanh, và, đẹp] Pin trâurosrnvr đó nhưng điện iöại Khẩ Tă ñặñg.:oarn: hơn nữa màu sắc không đẹp limvecative Nhận dạng đơn chuỗi Bài toán hệ thống hỏi đáp. BÀI TOÁN NHAN Nhận dạng chuỗi chứa cảm xúc theo khía cạnh [DẠNG CHUOI TREN TIENG VIET Pin trauearrery đó nhưng điệ8 ffi6ậï KiẩTä ñặñg;:arua: hơn nữa màu sắc không đẹp lắmzrroawAxce Nhận dạng đa chuỗi Bài toán phân tích cảm xúc phân cực Pin trâunArrraysrosrnvr đó nhưng Riệñff68ïKfiẩlWfiặfB::¬rusrsx:oArr: hơn nữa mầu sắc không đẹp lắmzraroswaxcezxroarivr Từ Nhận dạng chuỗi mang ý nghĩa khía cạnh Từ: [Hôm_ nay, bầu_trời, thât, trong_ xanh, và, đẹp] 11 HINH 1.5: Tổng quan khoá luận.
CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN Trong thời gian gần đây, việc phát triển chóng mặt của các trang mạng xã hội cũng như các trang thương mại điện tử giúp cho các doanh nghiệp có thể tìm hiểu được nhiều hơn thông tin đánh giá của khách hàng dành cho sản phẩm của mình. Tuy nhiên, cùng với lợi ích trên thì các doanh nghiệp cũng đang phải đối mặt với "cơn lũ" dữ liệu. Việc khai thác được triệt để những dữ liệu này là điểm mau chốt dé các doanh nghiệp có thể triển khai nhanh chóng các quyết định, cải thiện sản phẩm của mình giúp cho doanh thu cao hơn khi đưa sản phẩm ra thị trường. Vẫn đề được đặt ra là có quá nhiều thông tin để xử lý không thể sử dụng nguồn lực con người để đọc và phân tích đánh giá.
Tuy nhiên hầu hết các dữ liệu đánh giá sản phẩm của người dùng đều là dữ liệu phi cấu trúc. Để giải quyết bài toán trên, những năm trước đây, người ta sẽ sử dụng các bài toán nhận diện cảm xúc (sử dụng phương pháp phân lớp theo câu - Text Classification). Tuy nhiên phương pháp này cũng mang đến rất nhiều van dé cần quan tâm như việc nó sẽ dễ nhận diện sai khi bình luận của khách hàng mang nhiều ý nghĩa khác nhau. Ví dụ đối với câu bình luận: "Máy xài khá ổn đấy.
Tuy nhiên màn hình của nó có vẻ hơi nhỏ nhưng được cái pin khá trâu.", néu là bài toán phân tích cảm xúc sẽ rat khó để có thể đánh giá bình luận trên là tích cực hay tiêu cực. Vì thế mà những năm gần đây các bài toán nhận dạng chuỗi trở nên được chú ý hơn hẳn bởi độ tiện dụng của nó. Bài toán nhận dạng chuỗi gồm hai loại chính là: Nhận dạng đơn chuỗi (Single Span Detection) và Nhận dạng đa chuỗi (Mutil Chương 2. CÔNG TRÌNH NGHIÊN CUU LIÊN QUAN 15 Span Detection).
Bài toán nhận dạng đơn chuỗi được ứng dụng nhiều trong thực tế như các hệ thống hỏi đáp, đọc hiểu tự động,. Bài toán nhận dạng đa chuỗi cũng được quan tâm rất nhiều trong những năm gan đây, có thể kể đến bài toán nhận diện đoạn văn bản mang ý nghĩa cảm xúc khía cạnh giải quyết được các vấn đề bắt cập được kể trên. Ví dụ đối với ví dụ đề cập ở trên, bài toán có thể cho kết quả (Máy xài khá ổn- GENERAL#NEUTRAL, màn hình của nó có vẻ hơi nho-SCREEN#NEGATIVE, pin khá trâu-BATTERY#POSITIVE). Có thể thấy nó khắc phục được nhược điểm nhập nhằng, hơn thế nữa còn có thể trích xuất đoạn văn bản mang ý nghĩa cảm xúc.
Hai bài toán được đề cập ở trên tuy rằng ứng dụng rất tốt trong các ứng dụng thực tế nhưng hiện tại hiệu suất của nó trên các bộ dữ liệu tiếng Việt vẫn chưa được đánh giá cao. Bài toán Nhận diện cảm xúc theo khía cạnh đạt 45,70% [27]. Vì thế mà chúng tôi nghiên cứu tầm ảnh hưởng của tách từ đối với hai bài toán này với mục tiêu đưa ra được một phương pháp tách từ hiệu quả giúp cải thiện hiệu suất cho bài toán nhận dạng chuỗi. Cụ thể là bài toán phân tích cảm xúc khía cạnh và bài toán đọc hiểu máy 2.1 Công trình trên thê giới 2.1 Bài toán phân tích cảm xúc dựa trên khía cạnh Phân tích cảm xúc dựa trên khía cạnh (ABSA) bao gồm ba nhiệm vụ cơ bản: trích xuất cụm từ khía cạnh, trích xuất cụm từ ý kiến và phân loại tình cảm ở cấp độ khía cạnh.
Phân tích cảm xúc dựa trên khía cạnh đã được nghiên cứu và giới thiệu bởi Hu và các cộng sự vào năm 2004 [10], về các khía cạnh đánh giá sản phẩm áp dụng một bộ quy tắc dựa trên các quan sát các số liệu thống kê. Bài toán Phân Chương 2. CÔNG TRÌNH NGHIÊN CUU LIÊN QUAN 16 tích khía cạnh cảm xúc bắt đầu được biết đến từ cuộc thi SemEval 2015 task 12 va SemEval 2016. Trong đánh giá ngữ nghĩa SemEval2014 [22], phân tích cảm xúc dựa trên khía cạnh lần đầu tiên được giới thiệu như một nhiệm vụ chung đối với các bài đánh giá tiếng Anh ở cấp độ câu cho hai lĩnh vực là nhà hàng và khách sạn.
Trong nhiệm vụ 12 của SemEval2015 (SE-ABSA15) [20], phân tích cảm xúc dựa trên khía cạnh ở cấp độ văn bản, có ba tác vụ dành cho người tham gia: ® Nhận diện khía cạnh. © Biểu hiện mục tiêu ý kiến (Opinion Target Expression-OTE). e Nhận diện cảm xúc. Ở tác vụ 1 và tác vụ 3, hệ thống phải có khả năng trích xuất các danh mục khía cạnh và xác định cảm xúc đồi với từng khía cạnh trong các câu hoặc bài đánh giá.
Trong SemEval2015 Task 12 tập dữ liệu đã được xây dựng dựa trên SemEval2014 Task 14 (SE-ABSA14). Trong SE-ABSA15 mô tả danh mục khía cạnh của nó như một loại thực thể được kết hợp với một loại thuộc tính (ví dụ:Food#Style.) Trong task 5 của SemEval2016 [21]: Phân tích cảm xúc dựa trên khía cạnh. Bài báo này mô tả nhiệm vụ được chia sẻ của SemEval 2016 về phân tích cảm xúc dựa trên khía cạnh (ABSA), sự tiếp nối của các nhiệm vụ tương ứng của năm 2014 và 2015. Trong năm thứ ba, nhiệm vụ đã cung cấp 19 tập dữ liệu dao tạo và 20 tập dit liệu thử nghiệm cho 7 lĩnh vực (Khách sạn, Điện tử gia dụng, Viễn thông, Bảo tàng,.) và 8 ngôn ngữ khác (tiếng Hà Lan, tiếng Pháp, tiếng Nga, tiếng Tây Ban Nha, tiếng Thổ Nhĩ Kỳ và tiếng Ả Rập,.) cũng như một thủ tục đánh giá chung.
Từ các bộ dữ liệu này, 25 cho cấp độ câu và 14 cho ABSA cấp van bản; cái sau được giới thiệu lần đầu tiên dudi dang nhiệm vụ con trong SemEval. Nhiệm vụ thu hút 245 bài dự thi từ 29 đội. Với sự gia tăng của nội dung do người dùng cung cấp, với sự quan tâm đến cảm xúc và ý kiến phản hồi, lượng dữ liệu khai thác được từ văn bản đã tăng Chương 2. CÔNG TRÌNH NGHIÊN CUU LIÊN QUAN 17 lên nhanh chóng, cả trong học thuật và kinh doanh.
Tuy nhiên, phần lớn các phương pháp tiếp cận hiện tại cố gắng phát hiện tính tích cực tổng thể của một câu, đoạn văn hoặc khoảng văn bản, bắt kể các thực thể được đề cập (ví dụ: máy tính xách tay, pin, màn hình) và các thuộc tính của chúng (vi dụ: giá cả, thiết kế, chất lượng). Nhiệm vụ phân tích cảm xúc dựa trên các khía cạnh của SemEval- 2015 (SE-ABSA15) là sự tiếp nối của Nhiệm vụ 4 của SemEval-2014 (SE-ABSA14). Trong phân tích tình cảm dựa trên khía cạnh, mục đích là xác định các khía cạnh của các thực thể và tình cảm được thể hiện cho từng khía cạnh. Mục tiêu cuối cùng là có thể tạo ra các bản tóm tắt liệt kê tất cả các khía cạnh và cực tổng thể của chúng.
Phân tích cảm xúc dựa trên khía cạnh nhận được nhiều sự quan tâm. Chứng kiến sự phát triển nhanh chóng của nghiên cứu trong Xử lý ngôn ngữ tự nhiên các công việc ban đầu chỉ tập trung vào việc giải quyết một trong những nhiệm vụ phụ này một cách riêng lẻ. Một sO công việc gần đây tập trung vào việc giải quyết sự kết hợp của hai nhiệm vụ phụ, ví dụ: trích xuất các thuật ngữ khía cạnh cùng với các phân cực tình cảm hoặc trích xuất các thuật ngữ khía cạnh và ý kiến một cách khôn ngoan. Gần đây hơn, nhiệm vụ trích xuất bộ ba đã được đề xuất, tức là trích xuất bộ ba (thuật ngữ khía cạnh, thuật ngữ quan điểm, phân cực cảm xúc) từ một câu.
Tuy nhiên, các cách tiếp cận trước đây không giải quyết được tất cả các nhiệm vụ con trong một khuôn khổ thống nhất. Năm 2021, Mao và các cộng sự [14] đã giới thiệu nhiệm vụ trích xuất bộ ba.2 Bài toán đọc hiểu tự động Khái niệm đọc hiểu máy hay đọc hiểu tự động (MRC) xuất hiện từ rất sớm từ những năm 1970. Nhưng đến năm 2015, các nhà nghiên cứu DeepMind [9] đã dé xuất một giải pháp mới để tạo dữ liệu có giám sát với quy mô lớn để học các mô hình MRC. Đánh dấu sự hồi sinh của bài toán MRC, với sự xuất hiện hàng loạt Chương 2.
CÔNG TRÌNH NGHIÊN CUU LIÊN QUAN 18 của các bộ đữ liệu lớn dựa trên giải pháp mới. Đầu tiên là Bộ dir liệu CNN [8]. Họ cũng dé xuất một mô hình Neural Network-mô hình LSTM dựa trên Attention- based có tên là Attentive Reader [8].