Chương 1: GIỚI THIỆU - Trong chương này chúng tôi sẽ trình bày tong quan về đề tài hệ thống dự đoán Real-time và Online-learning cho bài toán phân loại tin tuyển dụng. * Chương 2: PHƯƠNG PHAP THUC NGHIỆM - Chúng tôi tiến hành thực nghiệm các phương pháp học sâu và học chuyển tiếp, cũng như học trực tuyến cho bài toán trên bộ dữ liệu đã được xây dựng. Đồng thời đưa ra các phương pháp đánh giá. ¢ Chương 3: KET QUA THUC NGHIEM- Trinh bay các kết qua thực nghiệm thu được ở chương 3.
* Chương 4: XÂY DỰNG HE THONG DU DOAN THEO THỜI GIAN THỰC - Chương này trình bày tổng quan cũng cách thức xây dựng hệ thống. * Chương 5: KET LUẬN VÀ HƯỚNG PHÁT TRIEN TRONG TƯƠNG LAI - Cuối cùng chúng tôi trình bày các kết quả đã thực hiện và thu được trong khoá luận lần này. Các mặt hạn chế của dé tài cũng như hướng phat triển trong tương lai.2 Đặt vấn dé Phân loại văn bản là một bài toán cơ bản và vô cùng phổ biến trong xử lý ngôn ngữ tự nhiên (Natural Language Processing). Bài toán này có nhiều ứng dụng rộng rãi, chẳng hạn như phát hiện thư rác, phân tích cảm xúc, và nhận diện cảm xúc trong bình luận của người dùng.
Tuy nhiên, việc áp dụng chúng trong lĩnh vực phân loại tin tuyển dụng vẫn chưa được khám phá nhiều do tính phức tạp và đa dạng của các quảng cáo tuyển dụng. Điều này dẫn đến sự gia tăng của các tin tuyển dụng không đáng tin cậy. Những tin này thường chứa thông tin giả mạo hoặc lôi kéo người tìm việc vào các công việc không tôn tại, với mục đích lợi dụng hoặc chiêm đoạt thông 1 tin cá nhân của ứng viên. Hậu quả là người tìm việc bị lừa đảo, mất thời gian và công sức, thậm chí mất mát tài sản.000 nạn nhân bị lừa đảo tuyển dụng trực tuyến.
Bên cạnh đó, các nhà tuyển dụng bị mất uy tín và gặp khó khăn trong việc thu hút ứng viên chất lượng. Cùng với sự phát triển mạnh mẽ của các phương tiện truyền thông xã hội, số lượng các tin tuyển dụng không đáng tin cậy cũng tăng lên đến mức khó kiểm soát. Điều này làm nổi bật sự cần thiết của việc phát triển các công cụ và tiến hành các nghiên cứu về đặc điểm của tin tuyển dụng từ người dùng. Mục tiêu là tối ưu hóa quá trình tuyển dụng và bảo vệ quyền lợi của các bên tham gia.
Để thực hiện được các nhiệm vụ nêu trên, chúng tôi tiến hành nghiên cứu và đặt ra hai mục tiêu chính. Trước tiên, nghiên cứu sẽ tập trung vào xây dựng và thử nghiệm các mô hình học sâu (Deep Learning) trên bộ dữ liệu có sẵn về tin tuyển dụng để đạt được kết quả tốt nhất. Tiếp theo, phát triển một hệ thống dự đoán theo thời gian thực sử dụng kỹ thuật học trực tuyến (Online learning). Hệ thống này sẽ liên tục cập nhật và phân tích các dữ liệu mới nhất từ các tin tuyển dụng, từ đó đưa ra đánh giá nhanh chóng về tính đáng tin cậy của từng tin đăng.
Điều này giúp người tìm việc và nhà tuyển dụng có thể dễ dàng nhận biết và tránh những tin tuyển dụng không đáng tin cậy, giảm thiểu các rủi ro và lãng phí thời gian trong quá trình tìm kiếm việc làm và tuyển dụng. Nghiên cứu này hứa hẹn góp phần nâng cao hiệu quả và độ tin cậy trong lĩnh vực tuyển dụng trực tuyến.3 Các công trình nghiên cứu liên quan 1.1 Tinh hình nghiên cứu trên thé giới Năm 2017, Vidros và cộng sự [1] đã tiến hành một nghiên cứu chi tiết về các quảng cáo việc làm gian lận bằng cách sử dung dữ liệu từ "Employment Scam Aegean Dataset" (EMSCAD). Dataset nay gồm 17,880 tin tuyển dụng, trong đó có 866 tin lừa đảo. Các tiêu chí phân loại dựa trên các hoạt động đáng ngờ của khách hàng, thông tin sai lệch hoặc các khiếu nại của ứng viên.
Nghiên cứu này sử dụng các mô hình học máy như Logistic Regression, Naive Bayes, và Random Forest để phân loại các tin tuyển dụng và đạt được những kết quả đáng kể. Cho đến năm 2022, Cheekati Srikanth và cộng sự [2] đã so sánh hiệu suất của các kỹ thuật học máy và đặc trưng hóa trên tập dữ liệu EMSCAD, đạt độ chính xác cao nhất với mô hình Bagging classifier là 98.85% và F1 score là 0.88 trên tập dữ liệu mất cân bằng. Trên tập dữ liệu cân bằng, XgBoost đạt độ chính xác 97.89% và F1 score là 0. Bên cạnh đó, Singh và cộng sự [3] cũng nghiên cứu sử dụng bộ dữ liệu EMSCAD và triển khai nhiều phương pháp khai thác dữ liệu và thuật toán phân loại khác nhau, bao gồm K- Nearest Neighbors, Decision Tree, Support Vector Machine, Deep Neural Network (DNN), v.
Kết quả nổi bật là DNN đạt được độ chính xác phân loại 98%, cho thay hiệu suất cao trong việc phát hiện các tin tuyển dụng giả. Trong bối cảnh các hình thức lừa đảo trực tuyến ngày càng tinh vi và thay đổi nhanh chóng, việc áp dụng phương pháp học trực tuyến (Online learning) [4] là vô cùng cần thiết. Tuy nhiên, hiện tại chưa có nghiên cứu nào áp dụng trực tiếp phương pháp này cho vấn đề trên. Mặc dù học trực tuyến có kha năng cho phép mô hình cập nhật liên tục khi có dữ liệu mới, thay vì phải tái huấn luyện từ đầu.
Nhưng việc học dữ liệu mới có thể khiến mô hình đã huấn luyện quên những kiến thức ở các lớp cũ và giảm mạnh hiệu suất trên dữ liệu trong tương lai. Hoc gia tang[5] (Incremental Learning) là một phần của học trực tuyến. Phương pháp này đòi hỏi thời gian dai để huấn luyện mô hình mỗi khi dữ liệu mới được thêm vào và không xem xét các quan sát mới của các lớp cũ. Năm 2020, He và cộng sự [6] đề xuất một khung học gia tăng có thể hoạt động trong kịch bản học trực tuyến đầy thách thức, đồng thời xử lý dif liệu của các lớp mới và các quan sát mới của các lớp cũ.
Kết quả đạt được vượt trội hơn so với các phương pháp học gia tăng trên bộ dữ liệu CIFAR-100 và ImageNet-1000 (ILSVRC 2012). Đến năm 2021, Nicola và cộng sự [7] đã nghiên cứu học gia tăng cho bài toán phân tích cảm xúc và kết quả cho thấy phương pháp này không chỉ cải thiện độ chính xác của mô hình mà còn duy trì hiệu suất tổng thể của hệ thống, đáp ứng tốt nhu cầu và sự hài lòng của khách hàng. Cùng năm, Ramya va cộng sự [8] đã áp dụng học gia tăng để cải thiện mô hình phân loại cảm xúc và xác định người dùng có ảnh hưởng một cách hiệu quả, giúp hệ thống phản ứng tốt hơn với dữ liệu động và nâng cao hiệu suất tổng thể. Cũng trong năm 2021, Londhe và cộng sự [9] cải thiện độ chính xác của quá trình phân loại bằng cách triển khai một khung công việc mới dựa trên học gia tắng và đạt độ chính xác 76%.2 Tinh hình nghiên cứu tại Việt Nam Việt Nam ngày càng phát triển, đã có nhiều bộ dữ liệu chất lượng được phát triển cho nhiều vấn đề khác nhau, đặc biệt trong lĩnh vực phân loại văn bản và phân tích cảm xúc.
Tuy nhiên, các nghiên cứu về lừa đảo tuyển dụng vẫn còn khá hạn chế. Phần lớn các nguồn thông tin hiện có như Cấm Nang Nhận Diện Và Phòng Chống Lita Đảo Trực Tuyến! do Bộ Thông tin và Truyền thông” cung cấp chỉ dừng lại ở việc hướng dẫn và đưa ra các tiêu chí để nhận biết các dấu hiệu của tin tuyển dụng lừa đảo. Cũng trong khuôn khổ phát triển các nguồn thông tin hữu ích, Trung Tâm Giám Sát An Toàn Không Gian Mạng Quốc Gia? (NCSC) đã phối hợp với Google? để thiết lập website giúp người dùng nhận biết về lừa đảo trực tuyến. NCSC cũng đã thực hiện các chiến dịch tuyên truyền và giáo dục cộng đồng về các nguy cơ và biện pháp phòng chống lừa đảo trực tuyến, góp phần nâng cao nhận thức và an toàn thông tin cho người dùng mạng.
Mặc dù đã có nhiều nỗ lực nhằm ngăn chặn các hoạt động lừa đảo, tình trạng này vẫn tiếp diễn, phần lớn là do thiếu hiểu biết của nhiều người. Do đó, việc phát triển một giải pháp có khả năng phân loại các tin tuyển dụng không đáng tin cậy trở nên hết sức cần thiết. Để thực hiện được những điều nêu trên, chúng tôi cần một bộ dữ liệu tiếng Việt đủ lớn và chính xác. Tại Trường Đại học Công nghệ Thông tin - Đại học Quốc gia Thành phố Hồ Chí MinhŠ, nhóm nghiên cứu do Quốc va cộng sự dẫn đầu đã tiến hành phát triển một bộ dữ liệu tin tuyển dụng không đáng tin cậy, được tổng hợp từ trang web muaban.
Bộ dữ liệu này được gan nhãn bởi đội ngũ có kinh nghiệm dựa trên các tiêu chí đánh giá kỹ lưỡng để nâng cao chất lượng và tính ứng dụng của dữ liệu. Chúng tôi hy vọng rằng từ bộ dữ liệu này, chúng tôi có thể đạt được kết quả tốt hơn trong việc phát hiện và phân loại các tin tuyển dụng lừa đảo, góp phần giảm thiểu tình trạng lừa đảo trực tuyến.vn/d6/news/Cam-nang-nhan-dien-va-phong-chong-lua-dao-truc-tuyen-6-215- 120955.aspx ?https://mic.vn/ 3https://ncsc.vn/ *https://www.com/ Shttps://uit.vn 5https://muaban.4 Tổng quan đề tài 1.1 Dinh nghĩa bài toán Chúng tôi sử dụng các tin tuyển dụng bán cấu trúc với nhiều khía cạnh khác nhau cho bài toán phân loại tin tuyển dụng không đáng tin cậy. Mục tiêu của nghiên cứu này là xác định nhãn tổng quát cho các tin tuyển dụng. Ngoài ra, nhóm còn kết hợp thêm tác vụ phân tích tiêu chí của từng khía cạnh (ACSA) và tạo giải thích chỉ tiết cho việc phân tích đó, điều này giúp người dùng có cái nhìn khách quan hơn.
Đầu vào và dau ra của bài toán được nhóm thiết kế như hình 1. Tác vụ 1: Phân loại tin tuyển dụng , Tin tuyển d Tac vụ 3: 1n tuyên dụng _—————> Tác vụ 2: ——— Tạo câu giải thích Phân tích tiêu chí của khía cạnh Đâu vào Đầu ra Hình 1. Đầu vào và đầu ra của bài toán phân loại tin tuyển dụng.2 Thách thức đề tài Một trong những khó khăn chính trong nghiên cứu phát hiện tin tuyển dụng không đáng tin cậy là sự thiếu hụt các bộ dữ liệu tiếng Việt trên lĩnh vực này. Hiện tại, chưa có bộ dữ liệu nào được công bố đủ chất lượng để phục vụ cho nghiên cứu về tính chất này.
Ngoài ra, việc định nghĩa một tin tuyển dụng không đáng tin cậy là rất khó khăn do sự tinh vi của nhiều hành vi lừa đảo. Nhiéu tin tuyển dụng giả mao trông rất chuyên nghiệp và không khác gì tin tuyển dụng thật, khiến việc đánh giá và đưa ra hướng dẫn gán nhãn trở nên vô cùng nan giải.