HO CHI MINH CITY NATIONAL UNIVERSITY UNIVERSITY OF TECHNOLOGY FACULTY OF COMPUTER SCIENCE AND ENGINEERING GRADUATE THESIS ASPECT BASED SENTIMENT ANALYSIS FOR TEXT DOCUMENTS Major: Computer Science Council: KHMT 5 Supervisor: Dr. Le Thanh Van Examiner: Dr. Nguyen Quang Hung Students: Tran Cong Toan Tri 1713657 Nguyen Phu Thien 1713304 Ho Chi Minh, December 2021 ĐẠI HỌC QUỐC GIA TP.HCM CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM ---------- Độc lập - Tự do - Hạnh phúc TRƯỜNG ĐẠI HỌC BÁCH KHOA KHOA:KH & KT Máy tính NHIỆM VỤ LUẬN ÁN TỐT NGHIỆP BỘ MÔN:Hệ thống & Mạng ____ Chú ý: Sinh viên phải dán tờ này vào trang nhất của bản thuyết trình HỌ VÀ TÊN: TRẦN CÔNG TOÀN TRÍ MSSV: 1713657 HỌ VÀ TÊN: NGUYỄN PHÚ THIỆN MSSV: 1713304 NGÀNH: KHOA HỌC MÁY TÍNH LỚP: MTKH03 1. Đầu đề luận án: Phân tích cảm xúc theo khía cạnh từ dữ liệu văn bản Aspect based sentiment analysis for text documents 2.
Nhiệm vụ (yêu cầu về nội dung và số liệu ban đầu): - Tìm hiểu về đặc điểm của bài toán phân tích cảm xúc theo khía cạnh từ dữ liệu văn bản. - Tìm hiểu các công trình liên quan. - Nghiên cứu và đề xuất mô hình có thể nhận biết được khía cạnh và cảm xúc của khía cạnh từ dữ liệu văn bản. - Thu thập dữ liệu để huấn luyện và kiểm thử mô hình.
- Hiện thực mô hình đề xuất, thực nghiệm, so sánh và đánh giá. Ngày giao nhiệm vụ luận án: 30/08/2021 4. Ngày hoàn thành nhiệm vụ: 31/12/2021 5. Họ tên giảng viên hướng dẫn: Phần hướng dẫn: 100% 1) TS.
Lê Thanh Vân __________________________________________________________ Nội dung và yêu cầu LVTN đã được thông qua Bộ môn. CHỦ NHIỆM BỘ MÔN GIẢNG VIÊN HƯỚNG DẪN CHÍNH (Ký và ghi rõ họ tên) (Ký và ghi rõ họ tên) Lê Thanh Vân PHẦN DÀNH CHO KHOA, BỘ MÔN: Người duyệt (chấm sơ bộ): ________________________ Đơn vị: _______________________________________ Ngày bảo vệ:___________________________________ Điểm tổng kết: _________________________________ Nơi lưu trữ luận án: _____________________________ TRƯỜNG ĐẠI HỌC BÁCH KHOA CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM KHOA KH & KT MÁY TÍNH Độc lập - Tự do - Hạnh phúc ---------------------------- Ngày 27 tháng 12 năm 2021 PHIẾU CHẤM BẢO VỆ LVTN (Dành cho người hướng dẫn/phản biện) 1. Họ và tên SV: Trần Công Toàn Trí, Nguyễn Phú Thiện MSSV: 1713657, 1713304 Ngành (chuyên ngành): Khoa học máy tính 2. Đề tài: Phân tích cảm xúc theo khía cạnh từ dữ liệu văn bản 3.
Họ tên người hướng dẫn/phản biện: TS. Lê Thanh Vân 4. Tổng quát về bản thuyết minh: Số trang: 88 Số chương: 7 (bao gồm 1 chương phụ lục) Số bảng số liệu: 16 Số hình vẽ: 38 Số tài liệu tham khảo: Phần mềm tính toán: Hiện vật (sản phẩm) 5. Tổng quát về các bản vẽ: - Số bản vẽ: Bản A1: Bản A2: Khổ khác: - Số bản vẽ vẽ tay Số bản vẽ trên máy tính: 6.
Những ưu điểm chính của LVTN: Luận văn hướng đến việc đề xuất mô hình phân tích cảm xúc theo khía cạnh từ dữ liệu văn bản. Để đạt được mục tiêu của đề tài, nhóm sinh viên đã thực hiện tốt những việc sau: -! Tìm hiểu các đặc điểm của bài toán phân tích cảm xúc nói chung và theo khía cạnh nói riêng từ dữ liệu văn bản. -! Tìm hiểu các công trình nghiên cứu liên quan nổi bật trong những năm gần đây. -! Chủ động liên hệ các nhóm nghiên cứu VLSP và UIT để thu thập các tập dữ liệu mẫu để xây dựng tập dữ liệu huấn luyện và kiểm thử.
Xây dựng công cụ crawler để thu thập dữ liệu từ trang booking.com để có dữ liệu thực tế phục vụ đánh giá mô hình đề xuất. -! Tìm hiểu và phân tích tốt ưu điểm của các mô hình xử lý ngôn ngữ tự nhiên như BERT, PhoBert, các mô hình về tích hợp các lớp tiềm ẩn và mô hình phân loại phân cấp theo entity, aspect và sentiment, mô hình dựng câu bổ trợ dựa trên Bert. -! Ứng dụng mô hình NLI-B dựng câu bổ trợ dựa trên PhoBert cho ngôn ngữ tiếng Việt. -! Đề xuất mô hình HSUM-HC là sự kết hợp và tận dụng tốt các ưu điểm của PhoBert, các lớp ẩn của mô hình để tăng khả năng nhận biết ngữ nghĩa và tích hợp với mô hình phân loại phân cấp.
-! Đánh giá thực nghiệm NLI-B, HSUM-HC 4 lớp tiềm ẩn và HSUM-HC 8 lớp tiềm ẩn với 3 tập dữ liệu VLSP, UIT và Booking.com cho 2 miền dữ liệu là nhà hàng và khách sạn. Thực nghiệm cho kết quả tốt hơn ở đa số trường hợp khi so sánh với Linear SVM, Multilayer Perceptron, CNN, BiLSTM+CNN, PhoBert và viBErt. Thêm vào đó, mô hình có các độ đo đánh giá cao khi dữ liệu biểu diễn ở mức document vì nhận biết tốt sự liên kết về mặt ngữ nghĩa giữa các câu. Ngoài ra, khi nhận thấy mô hình mang lại kết quả đánh giá tốt, trong giai đoạn cuối thực hiện, luận văn đã được đề xuất bổ sung thêm một ứng dụng đơn giản hỗ trợ tìm kiếm cho phép người dùng nhập vào một yêu cầu bất kì về khách sạn mà không theo tiêu chí định trước như các trang đặt phòng hiện tại.
Ứng dụng sẽ phân tích yêu cầu, nhận biết yêu cầu và trả ra kết quả các khách sạn ứng với các tiêu chí cần tìm kiếm. Ứng dụng này nhằm thể hiện tính ứng dụng thực tế của bài toán đề xuất và sẽ được phát triển hoàn thiện hơn trong hệ thống gợi ý thực hiện bởi các nhóm đề tài sau. Bên cạnh đó, nhóm sinh viên cũng đã viết bài báo khoa học “HSUM- HC: Integrating Bert-based hidden aggregation to hierarchical classifier for Vietnamese aspect-based sentiment analysis” được chấp thuận và đã trình bày tại hội nghị IEEE, 2021 8th NAFOSTED Conference on Information and Computer Science (NICS) vào ngày 21/12/2021, Hà Nội, Việt Nam. Những thiếu sót chính của LVTN: Một số câu trong báo cáo luận văn quá dài, nên tách ý ra để rõ nghĩa và đọc dễ hiểu hơn.
Đề nghị: Được bảo vệ ! Bổ sung thêm để bảo vệ o Không được bảo vệ o 9. 3 câu hỏi SV phải trả lời trước Hội đồng: a. Đánh giá chung (bằng chữ: giỏi, khá, TB): Giỏi Điểm : 10 /10 Ký tên (ghi rõ họ tên) Lê Thanh Vân VT姶云PI"A萎K"J窺E"DèEJ"MJQC E浦PI"JñC"ZÊ"J浦K"EJ曳"PIJ C XK烏V"PCO MJQC"MJ"("MV"Oè["VëPJ A瓜e"n壱r"/"V詠"fq"/"J衣pj"rj¿e //////////////////////////// Pi {"44"vjƒpi"34"p<o"4243 RJK蔭W"EJ遺O"D謂Q"X烏"NXVP *F pj"ejq"pi⇔ぜk"j⇔ずpi"fdp1rjVp"dkうp+ 30"J丑"x "v‒p"UX<"VT井P"EðPI"VQÉP"VTë OUUX<"3935879 Pi pj"*ejw{‒p"pi pj+<"Mjqc"j丑e"oƒ{"v pj J丑"x "v‒p"UX<"PIW[右P"RJò"VJK烏P OUUX<"3935526 Pi pj"*ejw{‒p"pi pj+<"Mjqc"j丑e"oƒ{"v pj 40"A隠"v k<"Rj¤p"v ej"e違o"z¿e"vjgq"mj c"e衣pj"v瑛"f英"nk羽w"x<p"d違p"*Curgev"dcugf"ugpvkogpv"cpcn{uku"hqt"vgzv fqewogpvu+ 50"J丑"v‒p"pi逢運k j逢噂pi"f磯p1rj違p"dk羽p<"VU0"Piw{宇p"Swcpi J́pi 60"V鰻pi"swƒv"x隠"d違p"vjw{院v"okpj< U嘘"vtcpi<"9: U嘘"ej逢挨pi<"28 U嘘"d違pi"u嘘"nk羽w<"38 U嘘"j·pj"x胤<"5: U嘘"v k"nk羽w"vjco"mj違q<"49 Rj亥p"o隠o"v pj"vqƒp< Jk羽p"x壱v"*u違p"rj育o+ 70"V鰻pi"swƒv"x隠"eƒe"d違p"x胤< /"U嘘"d違p"x胤< D違p"C3< D違p"C4< Mj鰻"mjƒe< /"U嘘"d違p"x胤"x胤"vc{ U嘘"d違p"x胤"vt‒p"oƒ{"v pj< 80"Pj英pi"逢w"8k吋o"ej pj"e栄c"NXVP< / E違 jck ukpj xk‒p vj吋 jk羽p m悦 p<pi n o xk羽e pj„o v嘘v. 8丑e jk吋w v k nk羽w vk院pi Cpj v嘘v.
xk院v nw壱p x<p d茨pi pi»p"pi英"Vk院pi"Cpj"v嘘v0 / Nw壱p x<p vj吋 jk羽p jck ukpj xk‒p e„ mj違 p<pi pijk‒p e泳w mjqc j丑e. 8« e»pi d嘘 x vt·pj d { 23 d k dƒq v衣k j瓜k"pij鵜"PKEU"42430 / Pj„o ukpj xk‒p e„ m悦 p<pi z¤{ f詠pi d k vqƒp pijk‒p e泳w. v·o jk吋w e»pi pij羽 x o» j·pj j丑e oƒ{ v瑛 8„ e違k vk院p ejq tc o» j·pj o噂k *JUWO/JE+ e„ mj違 p<pi v嘘v j挨p f詠c vt‒p RjqDgtv ƒr f映pi ejq d k vqƒp Curgev Dcugf Ugpvkogpv Cpcn{uku *CDUC+ vk院pi Xk羽v n o瓜v vj¿ x鵜0 Pj„o ukpj xk‒p e„ 8ƒpj ikƒ 8吋 mk吋o ej泳pi o» j·pj"JUWO/JE"8隠"zw医v"x "8衣v"8逢嬰e"v嘘v"j挨p"mjk"uq"uƒpj"x噂k"eƒe"e»pi"vt·pj"mjƒe0 90"Pj英pi"vjk院w"u„v"ej pj"e栄c"NXVP< / O» j·pj RjqDgtv n 8« e„ u鰯p mjƒ p鰻k vk院pi v瑛 m院v sw違 pijk‒p e泳w e栄c XkpCK0 Nw壱p x<p f瑛pi n衣k 荏 xk羽e z¤{ f詠pi eƒe n噂r vt‒p e栄c RtqDgtv 8吋 v衣q tc o» j·pj o噂k JUWO/JE rj́ j嬰r x噂k 8隠 v k nw壱p x<p *d k vqƒp CDUC+0 E»pi xk羽e p { 荏 o泳e 8瓜 nw壱p x<p A衣k j丑e jq p vq p ej医r pj壱p 8逢嬰e0 Nw壱p x<p j挨k vjk‒p x隠 f衣pi n o"8隠"v k"pijk‒p"e泳w"j挨p"8隠"v k"nw壱p"x<p"v嘘v"pijk羽r0 / Mjk 8逢c o» j·pj JUWO/JE x q d k vqƒp vj詠e v院 VtcxgnNkpm *f英 nk羽w pj壱p zfiv v瑛 Dqqmkpi0eqo+ vj· e”p pjk隠w j衣p ej院0 Vtcpi ygd ikcq fk羽p VtcxgnNkpm swƒ u挨 u k. vjk院w eƒe rj¤p v ej {‒w e亥w v瑛 rj c pi逢運k f́pi 8院p vjk院v m院 j羽 vj嘘pi0 X医p 8隠 mk吋o vj穎 rj亥p o隠o ej逢c 8衣v0 X f映< Pj„o ukpj xk‒p ej雨 f瑛pi n衣k 荏 xk羽e n医{ # mk院p pj壱p zfiv x ej医o 8k吋o x噂k o瓜v u嘘 d衣p ukpj xk‒p e栄c vƒe ik違 *p‒p m院v sw違 ejq mjƒ v嘘v+0 Xk羽e u逸r z院r m院v sw違"v·o"mk院o"ej逢c"vj詠e"u詠"j嬰r"n#0"Eƒe"o磯w"e¤w"vtw{"x医p"e”p"j衣p"ej院"ej逢c"rj́"j嬰r"vj詠e"v院0 :0"A隠"pij鵜<"A逢嬰e"d違q"x羽 餅 D鰻"uwpi"vj‒o"8吋"d違q"x羽 Mj»pi"8逢嬰e"d違q"x羽 ;0"5"e¤w"j臼k"UX"rj違k"vt違"n運k"vt逢噂e"J瓜k"8欝pi< c0"Ukpj"xk‒p"j«{"n#"ik違k"x·"ucq"f詠c"vt‒p"RjqDgtv."p院w"mj»pi"e„"RjqDgtv"vj·"u胤"違pj"j逢荏pi"m院v"sw違"nw壱p"x<p pj逢"vj院"p qA d0"Uq"uƒpj"m院v"sw違"v·o"mk院o"f詠c"vt‒p"eqoogpv"e栄c"nw壱p"x<p"vt‒p"VtcxgnNkpm"x噂k"m院v"sw違"v·o"mk院o"f詠c"vt‒p"v瑛 mjqƒ"x "e„"zfiv"{院w"v嘘"mjq違pi"eƒej"e„"mjƒe"pj逢"vj院"p qA"X "f映<"swƒp"<p"piqp"i亥p"vt逢運pi"AJDM"x "e„"ej厩 8壱w"zg0 320"Aƒpj"ikƒ"ejwpi"*d茨pi"ej英<"ik臼k."VD+<"Ik臼k Ak吋o"<"""""""";.7"1"32 M#"v‒p"*ijk"t "j丑"v‒p+ VU0"Piw{宇p"Swcpi"J́pi DEDICATION We, Tran Cong Toan Tri and Nguyen Phu Thien, declare that this thesis titled "Sen- timent Analysis of User Comments" and the work presented in it are our own and that, to the best of our knowledge and belief, it contains no material previously published or written by another person (except where explicitly defined in the acknowledgments), nor material which to a substantial extent has been submitted for the award of any other degree or diploma of a university or other institution of higher learning.
Acknowledgements It gives us great pleasure and satisfaction in presenting our thesis on “Aspect based sentiment analysis for text documents”. This would be our last project as bachelor students in university, this project reflects what we have learned and the skills we acquire during the years at the University of Technology. For that reason, we would like to express our deepest sense of gratitude towards our guidance teacher, Dr. Le Thanh Van for allowing us to work on this project, for her continuous support throughout our study and research, and for the amount of patience, motivation, and knowledge that she has given us.
We could not have imagined a better advisor and mentor for our thesis. Besides our advisor, we would like to say thank you for all the knowledge, experience, and support of the teachers and staff of the Computer Science and Engineering Faculty that has been given to us in our time at university, their teachings have helped us acquire the foundational knowledge for this thesis. Lastly, we would like to thank all of our friends and family who have motivated us every step of the way, we would not have been able to finish this without them, and we are grateful for everything we have been given till this day. Abstract In today’s world, customers and their feedback are vital to any business’s survival.
Competition is harsh on every market, the competitor who understands and pleases their customer the most will be more successful. For that to happen, businesses need to gather information about their customers’ opinions on a large scale. ABSA is a method for them to achieve this, it has been studied rigorously by researchers in the past, and since the creation of Bert, ABSA methods are getting more and more advance, showing better and better results in recent years. However for Vietnamese, ABSA is still not as developed, due to the limited resources and the nuances of the language.
In our work, we want to improve the capabilities of Vietnamese ABSA, we use the Vietnamese SOTA pre-trained PhoBert and built two models from it. One has a custom classifier, made from a combination of previous methods that proved effective, and the other is made to utilize Bert’s sequence pair feature, constructing auxiliary sentences and turning ABSA into a question-answering problem.