Bối cảnh và vấn đề nghiên cứu

Trong công tác quản trị nhân lực hiện đại, tỷ lệ nhân viên nghỉ việc (employee turnover/churn) là một trong những thách thức hàng đầu đối với sự phát triển bền vững của doanh nghiệp. Theo số liệu từ khảo sát của SHRM/Globoforce (Using Recognition and Other Workplace Efforts to Engage Employees), có tới 47% chuyên gia nhân sự xếp vấn đề duy trì và tỷ lệ luân chuyển nhân sự vào nhóm thách thức quản lý nguồn nhân lực lớn nhất. Sự biến động nhân sự liên tục gây ra nhiều hệ lụy trực tiếp: gia tăng chi phí đào tạo, gián đoạn quy trình sản xuất, làm suy giảm tinh thần làm việc của tập thể và thu hẹp biên lợi nhuận của tổ chức. Khi một nhân sự rời đi, doanh nghiệp phải đối mặt với các khoản chi phí phát sinh đáng kể:

  • Chi trả mức lương cho nhân sự thay thế cao hơn từ 15% đến 35% so với nhân viên cũ;
  • Phí tuyển dụng cho các công ty săn đầu người chiếm khoảng 20% đến 30% mức lương năm đầu của nhân viên mới;
  • Các chi phí đền bù, thưởng tuyển dụng ban đầu (sign-on bonus) và hoàn trả chi phí đào tạo cho đơn vị cũ.

Mặc dù hoạt động đào tạo và phát triển nghề nghiệp là yếu tố then chốt thu hút lực lượng lao động (với 46% nhân viên tin rằng các khóa đào tạo của công ty giúp họ gắn bó hơn), các doanh nghiệp thường gặp khó khăn trong việc đánh giá liệu ứng viên tham gia khóa học có thực sự muốn làm việc lâu dài hay chỉ tìm kiếm cơ hội chuyển đổi công việc. Hầu hết các nghiên cứu trước đây thường tập trung vào việc dự đoán sự rời bỏ của nhân viên kỳ cựu hoặc nhân sự hiện hữu, bỏ qua nhóm ứng viên mới (fresh candidates) đăng ký tham gia các khóa đào tạo do doanh nghiệp tài trợ.

Đề tài "Employee Churn Prediction" (Dự đoán tỷ lệ nghỉ việc của nhân viên bằng Machine Learning) của tác giả Nguyễn Phương Ly được thực hiện nhằm giải quyết khoảng trống này, hướng đến hai mục tiêu nghiên cứu cụ thể:

  1. Xây dựng mô hình học máy nhằm dự đoán xác suất một ứng viên sau đào tạo sẽ tiếp tục làm việc tại công ty hay tìm kiếm công việc mới (phân loại nhị phân: 0 - ở lại, 1 - rời đi).
  2. Diễn giải mô hình nhằm xác định và định lượng các đặc trưng nhân khẩu học, kinh nghiệm và môi trường ảnh hưởng trực tiếp đến quyết định chuyển dịch việc làm của ứng viên.

Đối tượng nghiên cứu của đồ án là hành vi chuyển việc tự nguyện (voluntary turnover intent) của các ứng viên tham gia khóa đào tạo chuyên ngành Dữ liệu lớn và Khoa học dữ liệu (Big Data & Data Science). Phạm vi nghiên cứu sử dụng tập dữ liệu công khai trên Kaggle được công bố năm 2021 với 19.158 bản ghi, áp dụng các thuật toán phân loại đơn lẻ và học kết hợp (ensemble learning) trên nền tảng điện toán đám mây.

Cơ sở lý thuyết và phương pháp

Khung lý thuyết và mô hình tiếp cận

Nghiên cứu phân loại biến động nhân sự thành hai dạng chính:

  • Nghỉ việc không tự nguyện (Involuntary turnover): Do tổ chức khởi xướng (sa thải do vi phạm, tái cấu trúc tổ chức, nghỉ hưu hoặc mất sức lao động); mang tính chất bất khả kháng đối với dự báo hành vi cá nhân.
  • Nghỉ việc tự nguyện (Voluntary turnover): Do nhân viên chủ động quyết định chuyển sang vị trí hoặc tổ chức khác. Đề tài tập trung khai thác khái niệm ý định nghỉ việc (turnover intent) để xây dựng mô hình dự báo trước rủi ro rời bỏ.

Mô hình bài toán được thiết lập dưới dạng bài toán phân loại nhị phân có giám sát (Supervised Binary Classification), trong đó nhãn mục tiêu $Y \in {0, 1}$ được xác định dựa trên vector $X$ gồm 12 đặc trưng đầu vào.

Nhóm phương pháp Thuật toán sử dụng Nguyên lý và đặc tính chính
Phân loại đơn lẻ (Individual Classifiers) Logistic Regression Ước lượng xác suất bằng hàm Sigmoid/Logit; biến đổi giá trị thực về khoảng $(0, 1)$.
Decision Tree Phân vùng đệ quy dữ liệu dựa trên các thước đo lựa chọn thuộc tính (ASM) như Information Gain, Gain Ratio và Gini Index.
K-Nearest Neighbors (KNN) Thuật toán học lười (lazy learning), phi tham số; phân loại dựa trên khoảng cách (Euclidean, Manhattan, Minkowski) và biểu quyết đa số từ $k$ láng giềng.
Multi-Layer Perceptron (MLP) Mạng nơ-ron truyền thẳng (Feedforward Neural Network) với các tầng ẩn phi tuyến, tối ưu hóa ma trận trọng số (coefs_) và độ lệch (intercepts_).
Support Vector Machine (SVM) Tìm siêu phẳng tối ưu (Hyperplane) trong không gian nhiều chiều để tối đa hóa khoảng cách biên (Margin) giữa các lớp dữ liệu.
Học kết hợp (Ensemble Learning) Random Forest Kỹ thuật chia để trị kết hợp nhiều cây quyết định độc lập trên các mẫu dữ liệu ngẫu nhiên (Bagging/Bootstrap).
Extreme Gradient Boosting (XGBoost) Phương pháp Boosting tuần tự tối ưu hóa hàm mục tiêu $Obj = L + \Omega$ (trong đó $L$ là hàm mất mát và $\Omega$ là thành phần điều chuẩn chống quá khớp).
Voting Classifier Kết hợp đầu ra từ nhiều bộ phân loại theo cơ chế Hard Voting (bầu chọn theo đa số nhãn) hoặc Soft Voting (tính trung bình xác suất dự đoán).

Phương pháp xử lý dữ liệu và môi trường thực nghiệm

  • Nguồn dữ liệu: Tập dữ liệu HR Analytics: Job Change of Data Scientists từ Kaggle (Möbius, 2021) gồm 19.158 dòng và 14 cột thuộc tính.
  • Môi trường thực nghiệm: Google Colaboratory (Google Colab), tận dụng tài nguyên CPU, GPU/TPU và các thư viện mã nguồn mở Python chuyên sâu về xử lý dữ liệu và học máy (Scikit-learn, XGBoost).
  • Kỹ thuật xử lý mất cân bằng: Áp dụng phương pháp SMOTE (Synthetic Minority Over-sampling Technique) để nhân bản mẫu tổng hợp cho lớp thiểu số (Class 1 - chiếm 25%) nhằm tránh hiện tượng mô hình thiên lệch về lớp đa số (Class 0 - chiếm 75%).
  • Tiền xử lý và kỹ thuật đặc trưng:
    • Loại bỏ định danh enrollee_id không mang giá trị dự báo;
    • Điền giá trị khuyết thiếu thông qua phương thức fillna();
    • Mã hóa biến phân loại (Dummy Encoding qua hàm get_dummies()) cho 10 biến định loại;
    • Chuẩn hóa đặc trưng (Standardization) đưa các biến số liên tục (training_hours, city_development_index) về phân phối chuẩn có giá trị trung bình bằng 0 và độ lệch chuẩn bằng 1;
    • Lựa chọn đặc trưng (Feature Selection) nhằm giảm số lượng thuộc tính đầu vào xuống một nửa mà vẫn duy trì hiệu năng mô hình.

Nội dung chính theo từng chương

Chương 1: Giới thiệu về bài toán dự đoán nhân viên nghỉ việc (Introduction of Employee Churn Prediction)

Chương 1 hệ thống hóa các khái niệm nền tảng về tỷ lệ nghỉ việc và nêu bật sự tương đồng giữa bài toán dự đoán khách hàng rời bỏ dịch vụ (customer churn) với bài toán nhân viên nghỉ việc (employee churn). Tác giả trình bày công thức đo lường tỷ lệ luân chuyển lao động hàng tháng truyền thống: $$\text{Monthly Turnover Rate (%)} = \frac{L}{(B + E) / 2} \times 100%$$ (Trong đó: $L$ là số nhân viên nghỉ việc trong tháng, $B$ là số nhân viên đầu kỳ, $E$ là số nhân viên cuối kỳ).

Tác giả chỉ ra rằng chỉ số tổng hợp này chỉ phản ánh quá khứ ở mức vĩ mô mà không thể chỉ ra cá nhân cụ thể nào có nguy cơ nghỉ việc cao. Đồ án định vị giá trị của việc ứng dụng các thuật toán khai phá dữ liệu và học máy để chuyển dịch từ quản trị bị động sang chủ động, đặc biệt nhấn mạnh vào phân khúc ứng viên mới tham gia các khóa đào tạo Data Science.

Chương 2: Các phương pháp học máy trong phân loại (Machine Learning Methods Used in Classification)

Chương 2 trình bày chi tiết cơ sở toán học và cơ chế hoạt động của các thuật toán phân loại nhị phân. Tác giả phân tích cấu trúc của các mô hình hộp trắng (như Decision Tree với khả năng giải thích trực quan cấu trúc rẽ nhánh) đối chiếu với mô hình hộp đen (như MLP với cấu trúc hàm mất mát phi lồi nhiều điểm cực tiểu cục bộ).

Trong phần về học kết hợp, chương làm rõ cơ chế boosting tuần tự của XGBoost: các mô hình phía sau tập trung sửa đổi sai số dư (residuals) của mô hình phía trước thông qua thuật toán hạ gradient (gradient descent). XGBoost được viết bằng C++, hỗ trợ tính toán song song quá trình tạo cây, tích hợp sẵn các tham số điều chuẩn hóa và kiểm định chéo giúp tối ưu hóa thời gian tính toán và giảm thiểu cả độ lệch (bias) lẫn phương sai (variance).

Chương 3: Khám phá dữ liệu (Data Exploration)

Chương 3 tiến hành phân tích khám phá dữ liệu (EDA) thông qua các kỹ thuật trực quan hóa và thống kê nhằm trả lời 8 câu hỏi bản chất về hành vi của ứng viên:

  1. Tỷ lệ ứng viên nghỉ việc: Dữ liệu cho thấy tỷ lệ mất cân bằng rõ rệt với 75% ứng viên chọn ở lại (Class 0) và chỉ có 25% ứng viên tìm kiếm công việc mới (Class 1).
  2. Phân bố theo giới tính: Nam giới chiếm phần lớn trong số ứng viên rời đi, phản ánh cơ cấu mẫu khảo sát có tỷ trọng nam giới áp đảo.
  3. Mối quan hệ giữa kinh nghiệm và tìm việc: Ứng viên có thời gian làm việc trong ngành Khoa học dữ liệu dưới 8 năm có xu hướng tìm việc mới cao nhất; ngược lại, hơn 50% số nhân sự có trên 20 năm kinh nghiệm quyết định gắn bó với tổ chức.
  4. Quy mô công ty: Nhân viên làm việc tại các doanh nghiệp quy mô nhỏ có tỷ lệ tìm kiếm cơ hội mới cao hơn hẳn so với nhân viên tại các công ty quy mô vừa và lớn (nơi có mức lương và độ ổn định công việc cao hơn).
  5. Trình độ học vấn: Ứng viên có trình độ cử nhân/sau đại học (Graduate) chiếm tỷ lệ tìm kiếm công việc mới cao nhất trong số các nhóm học vấn.
  6. Ảnh hưởng của thời lượng đào tạo: Thời lượng đào tạo trung bình dao động từ 46 đến 48 giờ. Phân tích hệ số tương quan cho thấy thời lượng đào tạo hầu như không ảnh hưởng đến quyết định chuyển việc (hệ số tương quan $-0,02$).
  7. Ảnh hưởng của chỉ số phát triển thành phố (City Development Index - CDI): CDI có tương quan nghịch mạnh với quyết định nghỉ việc (hệ số tương quan $-0,34$). Đa số ứng viên ở lại sinh sống tại các thành phố có chỉ số CDI cao ($> 0,8$, tập trung ở mức $0,9$), trong khi ứng viên rời đi tập trung nhiều ở các vùng có CDI thấp.
  8. Mối quan hệ tổng hợp: Tác giả khẳng định CDI là yếu tố định hình mạnh nhất đến quyết định chuyển dịch công việc, trong khi số giờ đào tạo không phải là biến số mang tính quyết định.

Chương 4: Dự đoán nhân viên nghỉ việc bằng các phương pháp học máy (Predicting Employee Churn Using Machine Learning Methods)

Chương 4 thiết lập quy trình giải pháp hoàn chỉnh từ khâu tiền xử lý đến cấu trúc mô hình. Bài toán được mô hình hóa với 12 thuộc tính đầu vào sau khi loại bỏ enrollee_id:

  • Biến định loại (10 biến): city, gender, relevent_experience, enrolled_university, education_level, major_discipline, experience, company_size, company_type, last_new_job.
  • Biến định lượng (2 biến): training_hours (biến thiên từ 1 đến 360 giờ), city_development_index (thang đo từ 0 đến 1).

Tác giả thực hiện mã hóa Dummy (Dummy Encoding) chuyển các thuộc tính định loại thành các cột nhị phân và chuẩn hóa thang đo Z-score cho các biến số liên tục nhằm bảo toàn thông tin về các điểm ngoại lai (outliers).

Chương 5: Kết quả và đánh giá (Result and Evaluation)

Chương 5 trình bày toàn bộ các bảng phân loại thực nghiệm trên tập kiểm thử:

  • Đánh giá chi tiết báo cáo phân loại (Classification Report bao gồm Precision, Recall, F1-score) cho từng thuật toán: Logistic Regression (Bảng 5-1), Decision Tree (Bảng 5-2), KNN (Bảng 5-3), MLP Classifier (Bảng 5-4), SVM (Bảng 5-5).
  • Báo cáo kết quả của các mô hình học kết hợp: Random Forest (Bảng 5-6), XGBoost (Bảng 5-7), Soft Voting Classifier (Bảng 5-8), Hard Voting Classifier (Bảng 5-9).
  • Đối chiếu hiệu năng giữa mô hình đơn lẻ và mô hình ensemble dựa trên chỉ số Weighted F1-score (Hình 5-1).
  • Đánh giá tác động của kỹ thuật SMOTE (Bảng 10 & Hình 5-2) đối với các độ đo của Class 1 và Class 0.
  • Đánh giá thực nghiệm mô hình sau khi chọn lọc đặc trưng (Hình 5-3): việc cắt giảm 50% số lượng biến đầu vào chỉ làm suy giảm một tỷ lệ không đáng kể trên tổng điểm F1-score.

Kết quả và đóng góp

Kết quả thực nghiệm chính

Các phát hiện và kết quả định lượng được trích xuất từ báo cáo thực nghiệm bao gồm:

Nội dung khảo sát / Thực nghiệm Giá trị định lượng ghi nhận trong nghiên cứu
Cơ cấu nhãn mục tiêu (Class Distribution) Lớp không nghỉ việc (Class 0): 75%
Lớp tìm việc mới (Class 1): 25%
Hệ số tương quan với biến mục tiêu Chỉ số phát triển thành phố (city_development_index): $-0,34$ (ảnh hưởng mạnh)
Thời lượng đào tạo (training_hours): $-0,02$ (ảnh hưởng không đáng kể)
Thời lượng đào tạo trung bình $46 - 48$ giờ/khóa học
Tác động của thâm niên công tác Nhóm làm việc $\le 8$ năm có tỷ lệ rời đi cao nhất; nhóm $> 20$ năm có $> 50%$ ở lại
Hiệu năng mô hình (Weighted F1-score) Mô hình XGBoost đạt điểm F1 có trọng số vượt trội hơn hẳn các bộ phân loại đơn lẻ (Decision Tree, Logistic Regression, KNN, SVM).
Tối ưu hóa không gian đặc trưng Giảm 50% số lượng đặc trưng đầu vào mà hiệu năng mô hình chỉ giảm thiểu ở mức rất nhỏ.

Đóng góp của đề tài

  1. Về mặt học thuật: Cung cấp quy trình thực nghiệm toàn diện so sánh giữa 5 bộ phân loại đơn lẻ và 3 kiến trúc học kết hợp trên tập dữ liệu nhân sự mất cân bằng có nhiều biến định loại. Chứng minh hiệu quả vượt trội của thuật toán eXtreme Gradient Boosting (XGBoost) kết hợp kỹ thuật cân bằng dữ liệu SMOTE trong bài toán phân loại nhân sự.
  2. Về mặt thực tiễn: Giúp các bộ phận nhân sự (HR) trong các công ty công nghệ/dữ liệu phân loại chính xác đối tượng ứng viên đăng ký học nghề, từ đó xây dựng lộ trình đào tạo phù hợp, kiểm soát chi phí tuyển dụng và giảm thiểu lãng phí ngân sách đào tạo cho các ứng viên không có nguyện vọng ở lại.

Hạn chế và hướng nghiên cứu tiếp

  • Hạn chế:
    • Tập dữ liệu nghiên cứu có sự mất cân bằng tỷ lệ mẫu cao (tỷ lệ 3:1), đặt ra thách thức lớn cho việc tối ưu đồng thời cả độ chính xác (Precision) và độ bao phủ (Recall) cho lớp thiểu số nếu không dùng các kỹ thuật can thiệp lấy mẫu.
    • Số lượng biến định loại chiếm tỷ trọng lớn (10/12 thuộc tính), một số biến có số lượng giá trị phân loại lớn (high cardinality), làm tăng số chiều dữ liệu sau khi mã hóa dummy.
    • Phân tích khám phá cho thấy dữ liệu có sự thiên lệch lớn về giới tính nam, phản ánh đặc thù cục bộ của tập dữ liệu khảo sát.
  • Hướng nghiên cứu tiếp:
    • Khảo sát sâu hơn các phương pháp điều chỉnh siêu tham số (hyperparameter tuning) nâng cao trên các cấu trúc mạng nơ-ron phức tạp.
    • Mở rộng thử nghiệm mô hình trên các tập dữ liệu nhân sự thực tế từ nhiều ngành nghề khác nhau ngoài lĩnh vực Khoa học dữ liệu để kiểm chứng độ khái quát hóa.

Giá trị tham khảo

Đồ án là tài liệu tham khảo chuyên môn phù hợp cho:

  • Sinh viên và học viên chuyên ngành Hệ thống thông tin quản lý (MIS), Khoa học dữ liệu và Công nghệ thông tin: Tham khảo phương pháp luận chuẩn hóa dữ liệu hỗn hợp (vừa có biến phân loại, vừa có biến liên tục) và cách thức thiết lập quy trình đánh giá mô hình học máy nhị phân.
  • Chuyên viên phân tích dữ liệu nhân sự (HR Analytics Specialist): Ứng dụng khung phân tích nhân tố tác động (như CDI, quy mô công ty, thâm niên) vào việc xây dựng chính sách giữ chân nhân sự và tối ưu hóa ngân sách tuyển dụng - đào tạo.
  • Các nghiên cứu về kỹ thuật xử lý dữ liệu mất cân bằng: Tham khảo phương pháp áp dụng SMOTE kết hợp thuật toán XGBoost và kỹ thuật lựa chọn thuộc tính để tối ưu tài nguyên tính toán.

Câu hỏi thường gặp

1. Tỷ lệ phân bố của lớp mục tiêu trong tập dữ liệu nghiên cứu là bao nhiêu và tác giả xử lý vấn đề này như thế nào?
Trong tập dữ liệu gồm 19.158 bản ghi, nhãn mục tiêu bị mất cân bằng nghiêm trọng với 75% ứng viên thuộc lớp không chuyển việc (Class 0) và 25% ứng viên thuộc lớp tìm kiếm việc làm mới (Class 1). Tác giả đã áp dụng kỹ thuật lấy mẫu tổng hợp cho lớp thiểu số (SMOTE) để cân bằng dữ liệu trước khi huấn luyện mô hình.

2. Đặc trưng nào có mối liên hệ mật thiết nhất đối với quyết định rời đi của ứng viên?
Chỉ số phát triển của thành phố (city_development_index) là đặc trưng có ảnh hưởng mạnh nhất đến quyết định của ứng viên với hệ số tương quan nghịch $-0,34$. Các ứng viên sinh sống tại các thành phố có chỉ số phát triển cao ($> 0,8$) có xu hướng ở lại công ty cao hơn rõ rệt so với ứng viên ở các thành phố có chỉ số thấp.

3. Thời lượng hoàn thành khóa đào tạo (training_hours) có tác động như thế nào đến quyết định nghỉ việc?
Thời lượng đào tạo trung bình của ứng viên là từ 46 đến 48 giờ. Tuy nhiên, biến số này không có tác động đáng kể đến quyết định chuyển việc của ứng viên do hệ số tương quan ghi nhận được ở mức rất thấp ($-0,02$).

4. Đồ án đã áp dụng các phương pháp tiền xử lý nào đối với các biến phân loại và biến số?
Đối với 10 biến phân loại, tác giả sử dụng kỹ thuật mã hóa Dummy (Dummy Encoding) thông qua hàm get_dummies(). Đối với 2 biến số liên tục (training_hours và city_development_index), tác giả sử dụng phương pháp chuẩn hóa thang đo chuẩn tắc (Standardization Z-score) để đưa dữ liệu về giá trị trung bình bằng 0 và độ lệch chuẩn bằng 1.

5. Kết quả thử nghiệm lựa chọn đặc trưng (Feature Selection) mang lại lợi ích gì cho mô hình?
Bằng việc áp dụng kỹ thuật lựa chọn đặc trưng, tác giả đã cắt giảm được 50% số lượng thuộc tính đầu vào của mô hình. Kết quả thực nghiệm cho thấy điểm số F1 có trọng số (Weighted F1-score) chỉ bị suy giảm một mức rất nhỏ so với mô hình sử dụng toàn bộ thuộc tính, giúp tiết kiệm đáng kể tài nguyên và thời gian tính toán.


Kết luận

Khóa luận tốt nghiệp của tác giả Nguyễn Phương Ly đã xây dựng thành công giải pháp ứng dụng học máy để giải quyết bài toán dự đoán ý định nghỉ việc của ứng viên tham gia đào tạo ngành Khoa học dữ liệu. Thông qua việc phân tích khám phá 19.158 bản ghi và thử nghiệm hàng loạt thuật toán từ phân loại đơn lẻ đến học kết hợp, nghiên cứu chứng minh thuật toán XGBoost kết hợp kỹ thuật SMOTE mang lại hiệu năng phân loại tối ưu nhất. Đề tài cung cấp cơ sở thực nghiệm vững chắc giúp các doanh nghiệp nhận diện các yếu tố then chốt chi phối quyết định chuyển việc (đặc biệt là chỉ số phát triển thành phố), từ đó tối ưu hóa chi phí đào tạo và nâng cao hiệu quả quản trị nguồn nhân lực.