Lời Cảm Ơn và Tóm Tắt Khóa Luận Tốt Nghiệp Ngành Khoa Học Dữ Liệu

Khóa luận trình bày hệ thống dự đoán thời gian thực và học trực tuyến cho bài toán phát hiện tin tuyển dụng bất thường trong tiếng Việt.

Chuyên ngành

Khoa học dữ liệu

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2024

89
3
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: GIỚI THIỆU

1.1. Cấu trúc khoá luận

1.2. Các công trình nghiên cứu liên quan

1.2.1. Tình hình nghiên cứu trên thế giới

1.2.2. Tình hình nghiên cứu tại Việt Nam

1.3. Tổng quan đề tài

1.3.1. Định nghĩa bài toán

1.3.2. Thách thức đề tài

1.3.3. Tính ứng dụng và tính mới của đề tài

2. CHƯƠNG 2: PHƯƠNG PHÁP THỰC NGHIỆM

2.1. Bộ dữ liệu sử dụng cho thực nghiệm

2.1.1. Nguồn gốc bộ dữ liệu

2.1.2. Định nghĩa bộ dữ liệu

2.1.3. Phân tích bộ dữ liệu

2.1.4. Tiền xử lý dữ liệu

2.2. Kiến trúc mô hình dựa trên phương pháp học chuyển tiếp kết hợp học sâu

2.2.1. Các phương pháp học chuyển tiếp

2.2.2. Các phương pháp học sâu

2.3. Phương pháp học trực tuyến

2.3.1. Thiết kế các thí nghiệm học trực tuyến

2.3.2. Mô hình sinh ngôn ngữ

2.3.3. Các thang đo đánh giá

2.3.3.1. Thang đo đánh giá cho tác vụ phân lớp và ACSA
2.3.3.2. Thang đo đánh giá cho tác vụ tạo giải thích

3. CHƯƠNG 3: KẾT QUẢ THỰC NGHIỆM

3.1. Kết quả sử dụng phương pháp học chuyển tiếp kết hợp học sâu

3.1.1. Tác vụ phân tích khía cạnh

3.1.2. Tác vụ sinh câu giải thích

3.2. Kết quả sử dụng phương pháp học trực tuyến

3.2.1. Tác vụ phân tích khía cạnh

3.2.2. Tác vụ sinh câu giải thích

4. CHƯƠNG 4: XÂY DỰNG HỆ THỐNG DỰ ĐOÁN THEO THỜI GIAN THỰC

4.1. Tổng quan hệ thống

4.2. Xây dựng tiện ích mở rộng trình duyệt Chrome

4.3. Xây dựng các bộ phận xử lý

4.3.1. Module xử lí dữ liệu người dùng

4.3.2. Module dự đoán luồng dữ liệu streaming

4.3.3. Module học trực tuyến

4.3.4. Bộ phận lưu trữ dữ liệu

4.4. Thử nghiệm và phân tích

5. CHƯƠNG 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN TRONG TƯƠNG LAI

5.1. Kết luận

5.2. Hướng phát triển trong tương lai

5.2.1. Áp dụng các kiến trúc mô hình mới

5.2.2. Cải thiện hệ thống và hiệu suất thực thi

5.2.3. Khám phá và phát triển các ứng dụng mới

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng Quan Về Lời Cảm Ơn Trong Khóa Luận Tốt Nghiệp

Lời cảm ơn trong khóa luận tốt nghiệp ngành khoa học dữ liệu không chỉ là một phần hình thức mà còn thể hiện sự tri ân đối với những người đã hỗ trợ trong quá trình học tập và nghiên cứu. Việc viết lời cảm ơn đúng cách có thể tạo ấn tượng tốt với người đọc và thể hiện sự chuyên nghiệp của tác giả. Đặc biệt, trong ngành khoa học dữ liệu, nơi mà sự chính xác và chi tiết là rất quan trọng, lời cảm ơn cũng cần được trình bày một cách rõ ràng và mạch lạc.

1.1. Ý Nghĩa Của Lời Cảm Ơn Trong Khóa Luận

Lời cảm ơn thể hiện sự tôn trọng và tri ân đối với những người đã hỗ trợ trong quá trình học tập. Nó không chỉ là một phần của văn bản mà còn là một cách để ghi nhận những đóng góp của người khác.

1.2. Cách Viết Lời Cảm Ơn Đúng Chuẩn

Viết lời cảm ơn cần phải ngắn gọn, súc tích và thể hiện được cảm xúc chân thành. Cần nêu rõ tên và vai trò của từng người được cảm ơn để tăng tính cá nhân hóa.

II. Tóm Tắt Khóa Luận Tốt Nghiệp Ngành Khoa Học Dữ Liệu

Tóm tắt khóa luận là phần quan trọng giúp người đọc nắm bắt nhanh chóng nội dung chính của nghiên cứu. Trong ngành khoa học dữ liệu, tóm tắt cần phải rõ ràng, cô đọng và thể hiện được các kết quả chính. Việc trình bày tóm tắt một cách logic sẽ giúp người đọc dễ dàng theo dõi và hiểu được mục tiêu nghiên cứu.

2.1. Cấu Trúc Tóm Tắt Khóa Luận

Tóm tắt nên bao gồm các phần như mục tiêu nghiên cứu, phương pháp thực hiện, kết quả đạt được và ý nghĩa của nghiên cứu. Mỗi phần cần được trình bày một cách ngắn gọn và rõ ràng.

2.2. Tầm Quan Trọng Của Tóm Tắt Trong Nghiên Cứu

Tóm tắt không chỉ giúp người đọc hiểu nội dung mà còn tạo ấn tượng ban đầu về chất lượng nghiên cứu. Một tóm tắt tốt có thể thu hút sự chú ý và khuyến khích người đọc tìm hiểu sâu hơn.

III. Vấn Đề Trong Việc Viết Lời Cảm Ơn và Tóm Tắt Khóa Luận

Việc viết lời cảm ơn và tóm tắt khóa luận có thể gặp nhiều khó khăn, đặc biệt là trong việc lựa chọn từ ngữ và cách diễn đạt. Nhiều sinh viên thường cảm thấy khó khăn trong việc thể hiện cảm xúc chân thành mà không bị lặp lại hay quá dài dòng. Điều này có thể dẫn đến việc không truyền tải được thông điệp mong muốn.

3.1. Những Khó Khăn Thường Gặp

Nhiều sinh viên gặp khó khăn trong việc diễn đạt cảm xúc một cách tự nhiên và chân thành. Họ có thể không biết cách bắt đầu hoặc kết thúc lời cảm ơn.

3.2. Cách Khắc Phục Những Khó Khăn

Để khắc phục, sinh viên nên tham khảo các mẫu lời cảm ơn và tóm tắt từ các khóa luận trước đó. Việc thực hành viết nhiều lần cũng giúp cải thiện kỹ năng.

IV. Phương Pháp Viết Lời Cảm Ơn và Tóm Tắt Hiệu Quả

Để viết lời cảm ơn và tóm tắt hiệu quả, cần có một phương pháp rõ ràng. Việc lập dàn ý trước khi viết sẽ giúp tổ chức ý tưởng và đảm bảo không bỏ sót thông tin quan trọng. Ngoài ra, việc đọc lại và chỉnh sửa cũng rất cần thiết để hoàn thiện văn bản.

4.1. Lập Dàn Ý Trước Khi Viết

Lập dàn ý giúp tổ chức các ý tưởng một cách logic và rõ ràng. Điều này cũng giúp tiết kiệm thời gian khi viết.

4.2. Đọc Lại và Chỉnh Sửa

Sau khi viết xong, việc đọc lại và chỉnh sửa là rất quan trọng. Điều này giúp phát hiện lỗi và cải thiện chất lượng văn bản.

V. Kết Luận Về Lời Cảm Ơn và Tóm Tắt Khóa Luận Tốt Nghiệp

Lời cảm ơn và tóm tắt khóa luận là hai phần không thể thiếu trong một khóa luận tốt nghiệp. Chúng không chỉ thể hiện sự tri ân mà còn giúp người đọc hiểu rõ hơn về nội dung nghiên cứu. Việc viết chúng một cách chỉn chu sẽ góp phần nâng cao giá trị của khóa luận.

5.1. Tầm Quan Trọng Của Việc Viết Đúng Cách

Việc viết lời cảm ơn và tóm tắt đúng cách không chỉ thể hiện sự chuyên nghiệp mà còn tạo ấn tượng tốt với người đọc.

5.2. Hướng Tương Lai Trong Việc Viết Khóa Luận

Trong tương lai, việc áp dụng các công nghệ hỗ trợ viết có thể giúp sinh viên cải thiện kỹ năng viết của mình, từ đó nâng cao chất lượng khóa luận.

10/07/2025
Khóa luận tốt nghiệp khoa học dữ liệu hệ thống dự đoán theo thời gian thực và học trực tuyến cho bài toán phát hiện tin tuyển dụng bất thường trên tiếng việt

Trích đoạn nội dung tài liệu

Chương 1: GIỚI THIỆU - Trong chương này chúng tôi sẽ trình bày tong quan về đề tài hệ thống dự đoán Real-time và Online-learning cho bài toán phân loại tin tuyển dụng. * Chương 2: PHƯƠNG PHAP THUC NGHIỆM - Chúng tôi tiến hành thực nghiệm các phương pháp học sâu và học chuyển tiếp, cũng như học trực tuyến cho bài toán trên bộ dữ liệu đã được xây dựng. Đồng thời đưa ra các phương pháp đánh giá. ¢ Chương 3: KET QUA THUC NGHIEM- Trinh bay các kết qua thực nghiệm thu được ở chương 3.

* Chương 4: XÂY DỰNG HE THONG DU DOAN THEO THỜI GIAN THỰC - Chương này trình bày tổng quan cũng cách thức xây dựng hệ thống. * Chương 5: KET LUẬN VÀ HƯỚNG PHÁT TRIEN TRONG TƯƠNG LAI - Cuối cùng chúng tôi trình bày các kết quả đã thực hiện và thu được trong khoá luận lần này. Các mặt hạn chế của dé tài cũng như hướng phat triển trong tương lai.2 Đặt vấn dé Phân loại văn bản là một bài toán cơ bản và vô cùng phổ biến trong xử lý ngôn ngữ tự nhiên (Natural Language Processing). Bài toán này có nhiều ứng dụng rộng rãi, chẳng hạn như phát hiện thư rác, phân tích cảm xúc, và nhận diện cảm xúc trong bình luận của người dùng.

Tuy nhiên, việc áp dụng chúng trong lĩnh vực phân loại tin tuyển dụng vẫn chưa được khám phá nhiều do tính phức tạp và đa dạng của các quảng cáo tuyển dụng. Điều này dẫn đến sự gia tăng của các tin tuyển dụng không đáng tin cậy. Những tin này thường chứa thông tin giả mạo hoặc lôi kéo người tìm việc vào các công việc không tôn tại, với mục đích lợi dụng hoặc chiêm đoạt thông 1 tin cá nhân của ứng viên. Hậu quả là người tìm việc bị lừa đảo, mất thời gian và công sức, thậm chí mất mát tài sản.000 nạn nhân bị lừa đảo tuyển dụng trực tuyến.

Bên cạnh đó, các nhà tuyển dụng bị mất uy tín và gặp khó khăn trong việc thu hút ứng viên chất lượng. Cùng với sự phát triển mạnh mẽ của các phương tiện truyền thông xã hội, số lượng các tin tuyển dụng không đáng tin cậy cũng tăng lên đến mức khó kiểm soát. Điều này làm nổi bật sự cần thiết của việc phát triển các công cụ và tiến hành các nghiên cứu về đặc điểm của tin tuyển dụng từ người dùng. Mục tiêu là tối ưu hóa quá trình tuyển dụng và bảo vệ quyền lợi của các bên tham gia.

Để thực hiện được các nhiệm vụ nêu trên, chúng tôi tiến hành nghiên cứu và đặt ra hai mục tiêu chính. Trước tiên, nghiên cứu sẽ tập trung vào xây dựng và thử nghiệm các mô hình học sâu (Deep Learning) trên bộ dữ liệu có sẵn về tin tuyển dụng để đạt được kết quả tốt nhất. Tiếp theo, phát triển một hệ thống dự đoán theo thời gian thực sử dụng kỹ thuật học trực tuyến (Online learning). Hệ thống này sẽ liên tục cập nhật và phân tích các dữ liệu mới nhất từ các tin tuyển dụng, từ đó đưa ra đánh giá nhanh chóng về tính đáng tin cậy của từng tin đăng.

Điều này giúp người tìm việc và nhà tuyển dụng có thể dễ dàng nhận biết và tránh những tin tuyển dụng không đáng tin cậy, giảm thiểu các rủi ro và lãng phí thời gian trong quá trình tìm kiếm việc làm và tuyển dụng. Nghiên cứu này hứa hẹn góp phần nâng cao hiệu quả và độ tin cậy trong lĩnh vực tuyển dụng trực tuyến.3 Các công trình nghiên cứu liên quan 1.1 Tinh hình nghiên cứu trên thé giới Năm 2017, Vidros và cộng sự [1] đã tiến hành một nghiên cứu chi tiết về các quảng cáo việc làm gian lận bằng cách sử dung dữ liệu từ "Employment Scam Aegean Dataset" (EMSCAD). Dataset nay gồm 17,880 tin tuyển dụng, trong đó có 866 tin lừa đảo. Các tiêu chí phân loại dựa trên các hoạt động đáng ngờ của khách hàng, thông tin sai lệch hoặc các khiếu nại của ứng viên.

Nghiên cứu này sử dụng các mô hình học máy như Logistic Regression, Naive Bayes, và Random Forest để phân loại các tin tuyển dụng và đạt được những kết quả đáng kể. Cho đến năm 2022, Cheekati Srikanth và cộng sự [2] đã so sánh hiệu suất của các kỹ thuật học máy và đặc trưng hóa trên tập dữ liệu EMSCAD, đạt độ chính xác cao nhất với mô hình Bagging classifier là 98.85% và F1 score là 0.88 trên tập dữ liệu mất cân bằng. Trên tập dữ liệu cân bằng, XgBoost đạt độ chính xác 97.89% và F1 score là 0. Bên cạnh đó, Singh và cộng sự [3] cũng nghiên cứu sử dụng bộ dữ liệu EMSCAD và triển khai nhiều phương pháp khai thác dữ liệu và thuật toán phân loại khác nhau, bao gồm K- Nearest Neighbors, Decision Tree, Support Vector Machine, Deep Neural Network (DNN), v.

Kết quả nổi bật là DNN đạt được độ chính xác phân loại 98%, cho thay hiệu suất cao trong việc phát hiện các tin tuyển dụng giả. Trong bối cảnh các hình thức lừa đảo trực tuyến ngày càng tinh vi và thay đổi nhanh chóng, việc áp dụng phương pháp học trực tuyến (Online learning) [4] là vô cùng cần thiết. Tuy nhiên, hiện tại chưa có nghiên cứu nào áp dụng trực tiếp phương pháp này cho vấn đề trên. Mặc dù học trực tuyến có kha năng cho phép mô hình cập nhật liên tục khi có dữ liệu mới, thay vì phải tái huấn luyện từ đầu.

Nhưng việc học dữ liệu mới có thể khiến mô hình đã huấn luyện quên những kiến thức ở các lớp cũ và giảm mạnh hiệu suất trên dữ liệu trong tương lai. Hoc gia tang[5] (Incremental Learning) là một phần của học trực tuyến. Phương pháp này đòi hỏi thời gian dai để huấn luyện mô hình mỗi khi dữ liệu mới được thêm vào và không xem xét các quan sát mới của các lớp cũ. Năm 2020, He và cộng sự [6] đề xuất một khung học gia tăng có thể hoạt động trong kịch bản học trực tuyến đầy thách thức, đồng thời xử lý dif liệu của các lớp mới và các quan sát mới của các lớp cũ.

Kết quả đạt được vượt trội hơn so với các phương pháp học gia tăng trên bộ dữ liệu CIFAR-100 và ImageNet-1000 (ILSVRC 2012). Đến năm 2021, Nicola và cộng sự [7] đã nghiên cứu học gia tăng cho bài toán phân tích cảm xúc và kết quả cho thấy phương pháp này không chỉ cải thiện độ chính xác của mô hình mà còn duy trì hiệu suất tổng thể của hệ thống, đáp ứng tốt nhu cầu và sự hài lòng của khách hàng. Cùng năm, Ramya va cộng sự [8] đã áp dụng học gia tăng để cải thiện mô hình phân loại cảm xúc và xác định người dùng có ảnh hưởng một cách hiệu quả, giúp hệ thống phản ứng tốt hơn với dữ liệu động và nâng cao hiệu suất tổng thể. Cũng trong năm 2021, Londhe và cộng sự [9] cải thiện độ chính xác của quá trình phân loại bằng cách triển khai một khung công việc mới dựa trên học gia tắng và đạt độ chính xác 76%.2 Tinh hình nghiên cứu tại Việt Nam Việt Nam ngày càng phát triển, đã có nhiều bộ dữ liệu chất lượng được phát triển cho nhiều vấn đề khác nhau, đặc biệt trong lĩnh vực phân loại văn bản và phân tích cảm xúc.

Tuy nhiên, các nghiên cứu về lừa đảo tuyển dụng vẫn còn khá hạn chế. Phần lớn các nguồn thông tin hiện có như Cấm Nang Nhận Diện Và Phòng Chống Lita Đảo Trực Tuyến! do Bộ Thông tin và Truyền thông” cung cấp chỉ dừng lại ở việc hướng dẫn và đưa ra các tiêu chí để nhận biết các dấu hiệu của tin tuyển dụng lừa đảo. Cũng trong khuôn khổ phát triển các nguồn thông tin hữu ích, Trung Tâm Giám Sát An Toàn Không Gian Mạng Quốc Gia? (NCSC) đã phối hợp với Google? để thiết lập website giúp người dùng nhận biết về lừa đảo trực tuyến. NCSC cũng đã thực hiện các chiến dịch tuyên truyền và giáo dục cộng đồng về các nguy cơ và biện pháp phòng chống lừa đảo trực tuyến, góp phần nâng cao nhận thức và an toàn thông tin cho người dùng mạng.

Mặc dù đã có nhiều nỗ lực nhằm ngăn chặn các hoạt động lừa đảo, tình trạng này vẫn tiếp diễn, phần lớn là do thiếu hiểu biết của nhiều người. Do đó, việc phát triển một giải pháp có khả năng phân loại các tin tuyển dụng không đáng tin cậy trở nên hết sức cần thiết. Để thực hiện được những điều nêu trên, chúng tôi cần một bộ dữ liệu tiếng Việt đủ lớn và chính xác. Tại Trường Đại học Công nghệ Thông tin - Đại học Quốc gia Thành phố Hồ Chí MinhŠ, nhóm nghiên cứu do Quốc va cộng sự dẫn đầu đã tiến hành phát triển một bộ dữ liệu tin tuyển dụng không đáng tin cậy, được tổng hợp từ trang web muaban.

Bộ dữ liệu này được gan nhãn bởi đội ngũ có kinh nghiệm dựa trên các tiêu chí đánh giá kỹ lưỡng để nâng cao chất lượng và tính ứng dụng của dữ liệu. Chúng tôi hy vọng rằng từ bộ dữ liệu này, chúng tôi có thể đạt được kết quả tốt hơn trong việc phát hiện và phân loại các tin tuyển dụng lừa đảo, góp phần giảm thiểu tình trạng lừa đảo trực tuyến.vn/d6/news/Cam-nang-nhan-dien-va-phong-chong-lua-dao-truc-tuyen-6-215- 120955.aspx ?https://mic.vn/ 3https://ncsc.vn/ *https://www.com/ Shttps://uit.vn 5https://muaban.4 Tổng quan đề tài 1.1 Dinh nghĩa bài toán Chúng tôi sử dụng các tin tuyển dụng bán cấu trúc với nhiều khía cạnh khác nhau cho bài toán phân loại tin tuyển dụng không đáng tin cậy. Mục tiêu của nghiên cứu này là xác định nhãn tổng quát cho các tin tuyển dụng. Ngoài ra, nhóm còn kết hợp thêm tác vụ phân tích tiêu chí của từng khía cạnh (ACSA) và tạo giải thích chỉ tiết cho việc phân tích đó, điều này giúp người dùng có cái nhìn khách quan hơn.

Đầu vào và dau ra của bài toán được nhóm thiết kế như hình 1. Tác vụ 1: Phân loại tin tuyển dụng , Tin tuyển d Tac vụ 3: 1n tuyên dụng _—————> Tác vụ 2: ——— Tạo câu giải thích Phân tích tiêu chí của khía cạnh Đâu vào Đầu ra Hình 1. Đầu vào và đầu ra của bài toán phân loại tin tuyển dụng.2 Thách thức đề tài Một trong những khó khăn chính trong nghiên cứu phát hiện tin tuyển dụng không đáng tin cậy là sự thiếu hụt các bộ dữ liệu tiếng Việt trên lĩnh vực này. Hiện tại, chưa có bộ dữ liệu nào được công bố đủ chất lượng để phục vụ cho nghiên cứu về tính chất này.

Ngoài ra, việc định nghĩa một tin tuyển dụng không đáng tin cậy là rất khó khăn do sự tinh vi của nhiều hành vi lừa đảo. Nhiéu tin tuyển dụng giả mao trông rất chuyên nghiệp và không khác gì tin tuyển dụng thật, khiến việc đánh giá và đưa ra hướng dẫn gán nhãn trở nên vô cùng nan giải.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ