Khóa Luận Tốt Nghiệp Ngành Khoa Học Dữ Liệu Tại Trường Đại Học Công Nghệ Thông Tin

Khóa luận trình bày phương pháp phân loại và xác định yếu tố bất thường trong tin tuyển dụng tiếng Việt, ứng dụng khoa học dữ liệu.

Chuyên ngành

Khoa Học Dữ Liệu

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2024

105
33
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: MỞ ĐẦU

1.1. Lý do chọn đề tài

1.2. Đối tượng nghiên cứu

1.3. Mục tiêu nghiên cứu

1.4. Phạm vi nghiên cứu

1.5. Bố cục của nghiên cứu

2. CHƯƠNG 2: TỔNG QUAN

2.1. Giới thiệu về đề tài

3. CHƯƠNG 3: CÁC NGHIÊN CỨU LIÊN QUAN

3.1. Tình hình nghiên cứu trên thế giới

3.1.1. Bài toán phát hiện lừa đảo tuyển dụng

3.1.2. Bài toán phân tích cảm xúc dựa trên danh mục khía cạnh

3.1.3. Bài toán phát hiện với khả năng giải thích

3.2. Tình hình nghiên cứu ở Việt Nam

4. CHƯƠNG 4: BỘ DỮ LIỆU ViReCAX

4.1. Xây dựng hướng dẫn gán nhãn dữ liệu

4.2. Nguồn tham khảo của hướng dẫn gán nhãn

4.3. Tiêu chí đánh giá khía cạnh tiêu đề công việc

4.4. Tiêu chí đánh giá khía cạnh mô tả công việc

4.5. Tiêu chí đánh giá khía cạnh công ty

4.6. Tiêu chí đánh giá khía cạnh các thông tin khác

4.7. Cách thức gán nhãn

4.8. Quy trình gán nhãn bộ dữ liệu

4.9. Đánh giá độ đồng thuận

4.9.1. Đánh giá cho những người gán nhãn chuẩn

4.9.2. Đánh giá cho những người gán nhãn mới

5. CHƯƠNG 5: PHÂN TÍCH DỮ LIỆU

5.1. Phân tích thống kê tổng quan

5.1.1. Tổng quan về bộ dữ liệu

5.1.2. Thống kê về độ dài

5.1.3. Thống kê về khía cạnh khác

6. CHƯƠNG 6: CÁC HƯỚNG TIẾP CẬN CHO BÀI TOÁN

6.1. Mô hình đa ngôn ngữ

6.2. Mô hình ngôn ngữ lớn (LLMs)

6.3. Phương pháp đề xuất

7. CHƯƠNG 7: KẾT QUẢ THỰC NGHIỆM VÀ ĐÁNH GIÁ

7.1. Phương pháp đánh giá

7.1.1. Độ đo đánh giá tác vụ phân lớp

7.1.2. Độ đo đánh giá tác vụ tạo sinh văn bản

7.2. Phương pháp tiền xử lý và cấu hình thực nghiệm

7.3. Phân tích lỗi

8. CHƯƠNG 8: KẾT LUẬN, HẠN CHẾ VÀ HƯỚNG PHÁT TRIỂN

8.1. Kết luận

8.2. Hạn chế

8.3. Hướng phát triển trong tương lai

TÀI LIỆU THAM KHẢO

PHỤ LỤC A: THU THẬP KHẢO SÁT

A.1. Thông tin về người khảo sát

A.2. Kết quả khảo sát

PHỤ LỤC B: CÁC MẪU TIN TUYỂN DỤNG ĐƯỢC GÁN NHÃN KHÁC

PHỤ LỤC C: CÁC MẪU TIN TUYỂN DỤNG ĐƯỢC PHÂN LOẠI SAI KHÁC

Tóm tắt

I. Tổng quan về Khóa Luận Tốt Nghiệp Ngành Khoa Học Dữ Liệu

Khóa luận tốt nghiệp ngành khoa học dữ liệu tại Trường Đại học Công nghệ Thông tin là một bước quan trọng trong hành trình học tập của sinh viên. Đây là cơ hội để sinh viên áp dụng kiến thức đã học vào thực tiễn, đồng thời phát triển kỹ năng nghiên cứu và phân tích dữ liệu. Khóa luận không chỉ giúp sinh viên hiểu rõ hơn về lĩnh vực khoa học dữ liệu mà còn tạo điều kiện cho họ tiếp cận với các công nghệ mới nhất trong ngành.

1.1. Ý nghĩa của Khóa Luận Tốt Nghiệp

Khóa luận tốt nghiệp giúp sinh viên củng cố kiến thức và kỹ năng trong ngành khoa học dữ liệu. Nó cũng là cơ hội để sinh viên thể hiện khả năng nghiên cứu và giải quyết vấn đề thực tiễn.

1.2. Cấu trúc của Khóa Luận Tốt Nghiệp

Khóa luận thường bao gồm các phần như giới thiệu, lý thuyết, phương pháp nghiên cứu, kết quả và thảo luận. Mỗi phần đều có vai trò quan trọng trong việc trình bày và bảo vệ ý tưởng nghiên cứu.

II. Những Thách Thức Trong Nghiên Cứu Khoa Học Dữ Liệu

Nghiên cứu trong lĩnh vực khoa học dữ liệu không thiếu những thách thức. Các vấn đề như chất lượng dữ liệu, tính khả thi của mô hình và khả năng giải thích kết quả là những yếu tố quan trọng cần được xem xét. Sinh viên cần phải đối mặt với những khó khăn này để có thể hoàn thành khóa luận một cách hiệu quả.

2.1. Chất lượng Dữ Liệu

Chất lượng dữ liệu là yếu tố quyết định đến độ chính xác của các mô hình phân tích. Dữ liệu không đầy đủ hoặc sai lệch có thể dẫn đến kết quả không chính xác.

2.2. Khả Năng Giải Thích Kết Quả

Khả năng giải thích kết quả là một thách thức lớn trong khoa học dữ liệu. Sinh viên cần phải tìm cách trình bày và giải thích các kết quả một cách rõ ràng và dễ hiểu.

III. Phương Pháp Nghiên Cứu Trong Khóa Luận Tốt Nghiệp

Để thực hiện khóa luận tốt nghiệp, sinh viên cần lựa chọn phương pháp nghiên cứu phù hợp. Các phương pháp như phân tích thống kê, học máy và học sâu thường được áp dụng để giải quyết các bài toán trong khoa học dữ liệu.

3.1. Phân Tích Thống Kê

Phân tích thống kê giúp sinh viên hiểu rõ hơn về dữ liệu và các mối quan hệ giữa các biến. Đây là bước đầu tiên quan trọng trong quá trình nghiên cứu.

3.2. Học Máy và Học Sâu

Học máy và học sâu là những công nghệ tiên tiến giúp sinh viên xây dựng các mô hình dự đoán và phân loại. Việc áp dụng các kỹ thuật này sẽ nâng cao chất lượng nghiên cứu.

IV. Ứng Dụng Thực Tiễn Của Khóa Luận Tốt Nghiệp

Khóa luận tốt nghiệp không chỉ là một bài tập học thuật mà còn có nhiều ứng dụng thực tiễn. Các kết quả nghiên cứu có thể được áp dụng trong nhiều lĩnh vực như kinh doanh, y tế và giáo dục.

4.1. Ứng Dụng Trong Kinh Doanh

Nghiên cứu khoa học dữ liệu có thể giúp các doanh nghiệp tối ưu hóa quy trình và nâng cao hiệu quả hoạt động. Các mô hình dự đoán có thể hỗ trợ trong việc ra quyết định.

4.2. Ứng Dụng Trong Y Tế

Trong lĩnh vực y tế, khoa học dữ liệu có thể được sử dụng để phân tích dữ liệu bệnh nhân và dự đoán các xu hướng sức khỏe. Điều này giúp cải thiện chất lượng chăm sóc sức khỏe.

V. Kết Luận và Hướng Phát Triển Tương Lai

Khóa luận tốt nghiệp ngành khoa học dữ liệu tại Trường Đại học Công nghệ Thông tin là một bước quan trọng trong sự nghiệp của sinh viên. Kết quả nghiên cứu không chỉ có giá trị học thuật mà còn có thể mở ra nhiều cơ hội nghề nghiệp trong tương lai.

5.1. Tầm Quan Trọng Của Nghiên Cứu

Nghiên cứu khoa học dữ liệu đóng vai trò quan trọng trong việc phát triển công nghệ và cải thiện cuộc sống. Nó giúp giải quyết các vấn đề phức tạp trong xã hội.

5.2. Hướng Phát Triển Trong Tương Lai

Trong tương lai, khoa học dữ liệu sẽ tiếp tục phát triển với sự xuất hiện của các công nghệ mới. Sinh viên cần cập nhật kiến thức và kỹ năng để đáp ứng nhu cầu thị trường.

10/07/2025
Khóa luận tốt nghiệp khoa học dữ liệu phân loại và xác định tự động yếu tố bất thường trong tin tuyển dụng tiếng việt

Trích đoạn nội dung tài liệu

Mở đầu: Chúng tôi sẽ trình bày lý do chọn dé tai và động lực nghiên cứu, mô tả đối tượng nghiên cứu, đặt ra mục tiêu cần đạt được trong nghiên cứu và giới hạn phạm vi của nghiên cứu. Cuối cùng, chúng tôi sẽ tóm tắt bố cục của toàn bộ nghiên cứu. Tổng quan: Chúng tôi cung cấp một cái nhìn tổng quan về dé tài đối với lĩnh vực Natural language processing - Xử lý ngôn ngữ tự nhiên (NLP). Chúng tôi sẽ trình bày đến những tính ứng dụng và những khó khăn, thách thức còn tồn đọng của nghiên cứu.

Các nghiên cứu liên quan: Chúng tôi trình bày về các công trình nghiên cứu liên quan trên thế giới và ở Việt Nam. Đối với tình hình nghiên cứu trên thế giới, chúng tối xem xét đến các bài toán phát hiện lừa đảo tuyển dụng, bài toán phân tích cảm xúc dựa trên khía cạnh và các bài toán phát hiện với khả năng giải thích. Đối với tình hình nghiên cứu ở Việt Nam, chúng tôi xem xét đến miền dữ liệu tuyển dụng và các bộ dữ liệu có liên quan. Xây dựng bộ dữ liệu: Chúng tôi sẽ trình bày chi tiết về bộ dữ liệu ViReCAX bao gồm nguồn và cách thức thu thập dữ liệu, hướng dẫn gán nhãn dữ liệu, quy trình gán nhãn dữ liệu, các kết quả đánh giá độ đồng thuận.

Phân tích dữ liệu: Chúng tôi sẽ trình bày các kết quả phân tích dữ liệu bao gồm phân tích thống kê tổng quan, phân tích thống kê về độ dài của !https://muaban. BO CUC CUA NGHIÊN CỨU tin tuyển dụng va câu giải thích. Đồng thời, chúng tôi cũng phân tích về mat từ ngữ được sử dụng trong tin tuyển dụng. Các hướng tiếp cận cho bài toán: Chúng tôi sẽ trình bay các mô hình tiền huấn luyện và kĩ thuật áp dụng cho các tác vụ mà chúng tôi dé xuất.

Kết quả thực nghiệm và đánh giá: Chúng tôi sẽ trình bày về các độ đo đánh giá, thông số cài đặt mô hình cũng như các kết quả trên từng tác vụ. Ngoài ra, chúng tôi còn tiến hành phân tích lỗi trên các tin tuyển dụng được mô hình dự đoán sai. Kết luận và hướng phát triển: Chúng tôi sẽ trình bày về các kết luận và hạn chế. Từ đó, chúng tôi đề xuất các hướng phát triển trong tương lai.

phát triển dành cho đề tài trong tương lai. TONG QUAN Trong chương 2, chúng tôi cung cấp một cái nhìn tổng quan về đề tài đối với lĩnh vực NLP. Chúng tôi sẽ trình bày đến những tính ứng dụng và những khó khăn, thách thức còn tồn đọng của nghiên cứu.1 Giới thiệu về đề tài Các kỹ thuật học máy (machine learning) và học sâu (deep learning) đã được ứng dụng trong nhiều bài toán phát hiện bắt thường trực tuyến như thư điện tử rác (email spam), ngôn từ thù địch (hate speech), tin giả (fake news), tấn công mạo danh (phish- ing), mang lại nhiều thành tựu đáng kể. Tương tự, việc phát hiện bat thường trong tuyển dụng cũng là một lĩnh vực nghiên cứu rất quan trọng nhằm giảm thiểu các vụ đánh cắp thông tin, lừa đảo và chiếm đoạt tài sản, đặc biệt là trong bối cảnh tuyển dụng trực tuyến ngày nay.

Tại Việt Nam, Thống kê từ Cổng cảnh báo an toàn thông tin!, Bộ Thông tin - Truyền thông cho biết trong năm 2023 đã có gần 16.000 phản ánh từ người dùng Internet về tình trạng lừa đảo trực tuyến, gây thiệt hại ước tính 390 nghìn tỷ đồng, tương đương 3,6% GDP. Điều này cho thấy van dé lừa đảo trực tuyên dưới mác các tin tuyển dụng là một thách thức lớn cần được chú trọng và giải quyết hiệu quả. Ở nghiên cứu này, bài toán phát hiện bat thường trong tin tuyển dung được chúng tôi định nghĩa là một bài toán đa tác vụ. Đầu vào của bài toán là một tin tuyển dụng trực tuyến, bao gồm nhiều trường thông tin khác nhau ở cả định dang văn bản và số.

Bài toán này được chia thành ba tác vụ chính: ¢ Tác vụ 1: Phân lớp. Tác vụ này xác định liệu tin tuyển dụng có bất thường hay không. Đầu ra của tác vụ này sẽ có 3 nhãn bao gồm CLEAN, SEEDING và WARNING. ¢ Tác vụ 2: Phân lớp.

Tác vụ này xác định những nhóm thông tin (khía cạnh) nào trong tin tuyển dụng có yếu tố bất thường. Đầu ra của tác vụ này gồm một danh sách mức độ xác thực tương ứng với từng khía cạnh. Các khía cạnh bao gồm TITLE (tiêu đề), DESC (mô ta), COMPANY (về công ty) và OTHER "https://canhbao. CÁC THÁCH THUC (các thông tin khác).

Mức độ xác thực bao gồm là POSITIVE, NEGATIVE, NEUTRAL và NOT-MENTIONED. * Tác vụ 3: Tạo sinh văn bản. Tác vu này tao ra một van ban giải thích cho kết quả của hai tác vụ trước đó theo mdu có định (pattern), cung cấp lý do tại sao tin tuyển dụng được coi là bất thường va chỉ ra yếu tố bất thường trong từng khía cạnh. Đối với việc định nghĩa chỉ tiết và mô tả cho từng tác vụ, chúng tôi sẽ trình bày ở chương 4.

Trong nghiên cứu này, chúng tôi sẽ tập trung giải quyết cả ba tác vụ nêu trên.2 Tính ứng dụng thực tiễn của đề tài Với thực trạng không gian mạng ngày càng xuất hiện nhiều tin tuyển dụng lừa đảo, việc có một công cụ hỗ trợ là rất cần thiết để giúp các cá nhân người lao động có thể đưa ra các quyết định đúng đắn hơn. Từ mô hình đã được huấn luyện, chúng ta có thể phát triển để tích hợp nó vào các tiện ích mở rộng của trình duyệt nhằm tự động phát hiện và cảnh báo người dùng về những tin tuyển dụng có dấu hiệu bat thường, giúp họ tránh được những rủi ro không đáng có. Ngoài ra, việc giảm thiểu các tin tuyển dụng lừa đảo không chỉ bảo vệ người tìm việc mà còn giúp các nền tảng tuyển dụng trực tuyến duy tri và củng cỗ được sự uy tín, xây dựng niềm tin với người dùng. Khi các tin lừa đảo được loại bỏ, môi trường tuyển dụng trực tuyến sẽ trở nên an toàn hơn, đồng thời giảm thiểu các vụ lừa đảo chiếm đoạt tài sản, từ đó nâng cao tính minh bạch và đáng tin cậy của lĩnh vực tuyển dụng trực tuyến.3 Các thách thức Nhìn chung, bài toán đa tác vụ phát hiện tin tuyển dung bat thường đối mặt với nhiều thử thách và khó khăn.

Đầu tiên, trong quá trình xây dựng hướng dẫn gán nhãn và bộ dữ liệu, việc thiết lập các tiêu chuẩn để xác định một tin tuyển dụng thực sự có các yếu tố bat thường hay không là một điều rất phức tạp. Các nghiên cứu và tài liệu liên quan dén van dé này không nhiều, nêu có, thường là các bài việt chia sẻ chưa 7 2. CÁC THÁCH THỨC được xác minh tính đúng đắng, độ phủ bao quát cũng như độ chỉ tiết. Vì vậy, chúng tôi can phải tham khảo va tổng hợp tài liệu từ nhiều văn bản chính thống cũng như tra cứu pháp luật Việt Nam.

Quá trình này tiêu tốn khá nhiều thời gian và công sức. Trong quá trình gán nhãn dữ liệu, việc huấn luyện người gán nhãn cũng như tốc độ gán nhãn trên từng mẫu dữ liệu cũng là một khó khăn khác. Với tính phức tạp của bài toán, chúng tôi cần phải đảm bảo việc huấn luyện được diễn ra một cách chi tiết và rõ ràng nhất để tránh những sai sót không đáng có. Đồng thời, việc gán nhãn từng mẫu dữ liệu cũng tốn nhiễu thời gian bởi vì đây là một bài toán đa tác vụ.

Người gán nhãn cần phải đọc kỹ từng tin tuyển dụng, sau đó phải đưa ra 1 nhãn chính, 4 nhãn khía cạnh và cung cấp một câu giải thích với lý do phù hợp cho từng khía cạnh. Nhằm đảm bảo chất lượng dữ liệu đầu ra, chúng tôi còn cho các thành viên kiểm tra chéo (cross-checking) ngẫu nhiên các mẫu đã gán nhãn, góp ý và chỉnh sửa. Điều này làm cho tổng thời gian gán nhãn tăng lên. Cuối cùng, một thách thức khác trong quá trình huấn luyện các mô hình tiền huấn luyện sử dụng kiến trúc BERT và RoBERTa là van dé giới han số lượng mã hoá (tokens) có thể xử lý được ở một mức nhất định.

Các tin tuyển dụng thường khá dài dẫn đến việc chúng tôi phải cắt bỏ các phần thông tin phía sau. Từ đó dẫn đến việc mô hình chỉ có thể học được dựa vào một phần thông tin đưa vào. CÁC NGHIÊN CỨU LIEN QUAN Trong chương 3, chúng tôi trình bày về các công trình nghiên cứu liên quan trên thế giới và ở Việt Nam. Đối với tình hình nghiên cứu trên thế giới, chúng tối xem xét đến các bài toán phát hiện lừa đảo tuyển dụng, bài toán phân tích cảm xúc dựa trên khía cạnh và các bài toán phát hiện với khả năng giải thích.

Đối với tình hình nghiên cứu ở Việt Nam, chúng tôi xem xét đến miễn dif liệu tuyển dung và các bộ dữ liệu có liên quan. Nghiên cứu này được xây dựng dựa trên hai trục chính. Thứ nhất, về các phương pháp tự động phát hiện các tin tuyển dụng lừa đảo. Thứ hai, về việc mở rộng các mô hình phát hiện với khả năng tự động đánh giá mức độ xác thực thông tin bên trong các khía cạnh và khả năng giải thích.

Tình hình nghiên cứu trên thé giới 3.1 Bài toán phát hiện lừa đảo tuyển dụng Mức độ nghiêm trọng của việc lừa đảo qua mạng ngày càng tăng, đặc biệt là các tin tuyển dụng bất thường. Điều này đã gây ảnh hưởng xấu đến người tìm việc làm và làm giảm uy tín của các tổ chức bị giả mạo. Mặc dù vậy, hiện nay có rất ít nghiên cứu về van dé này. Bài toán phát hiện ORF lần đầu tiên được đề xuất bởi Vidros [1].

Tác giả đã nêu rõ vai trò và thách thức của hình thức tuyển dụng trực tuyến. Nghiên cứu cũng phân tích về ORF và các biến thé của nó, đồng thời so sánh với các bài toán liên quan như thư rác (email spam), bắt nat trên mang (cyberbullying), tan công gia mao (phishing), trêu chọc qua mang (trolling) và phá hoại Wikipedia (Wikipedia vandalism). Điểm nổi bật nhất được đề xuất của nghiên cứu được là tập hợp các quy tắc thực nghiệm dựa trên phân tích dữ liệu thực tế. Sau đó, vào năm 2017, nhóm tác giả này đã công bố một phương pháp phát hiện tự động lừa đảo tuyển dụng để chứng minh các giả định của mình, cùng với bộ dữ liệu Employment Scam Aegean Dataset (EMSCAD) [2].

Bộ dữ liệu bao gồm 17.880 tin tuyển dụng, trong đó có 17.014 tin không lừa đảo và 866 tin lừa đảo, được thu thập từ cổng thông tin việc làm Workable, và được gán nhãn thủ công.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Khóa luận tốt nghiệp ngành Khoa học Dữ liệu tại Trường Đại học Công nghệ Thông tin mang đến cái nhìn sâu sắc về các ứng dụng và phương pháp trong lĩnh vực khoa học dữ liệu. Tài liệu này không chỉ trình bày các khái niệm cơ bản mà còn đi sâu vào các nghiên cứu thực tiễn, giúp người đọc hiểu rõ hơn về cách thức phân tích và xử lý dữ liệu trong các tình huống cụ thể.

Đặc biệt, tài liệu này mở ra cơ hội cho người đọc khám phá thêm về các mô hình phân tích cảm xúc, như trong Khóa luận tốt nghiệp khoa học dữ liệu nghiên cứu mô hình phân tích cảm xúc dựa trên khía cạnh đa thể thức cho tiếng việt, hay các phương pháp xác thực thông tin dựa trên suy luận số liệu trong Khóa luận tốt nghiệp công nghệ thông tin xác thực thông tin dựa trên suy luận số liệu. Những tài liệu này không chỉ giúp mở rộng kiến thức mà còn cung cấp các ứng dụng thực tiễn trong lĩnh vực khoa học dữ liệu, từ đó nâng cao khả năng phân tích và ra quyết định dựa trên dữ liệu cho người đọc.

Hãy khám phá thêm về Khóa luận tốt nghiệp khoa học dữ liệu nhận dạng chuỗi ý kiến cho phân tích cảm xúc dựa trên khía cạnh bình luận điện thoại thông minh trên tiếng việt để hiểu rõ hơn về cách thức phân tích cảm xúc trong các ý kiến và bình luận, từ đó áp dụng vào thực tiễn một cách hiệu quả.