Tổng quan nghiên cứu
Trong bối cảnh bùng nổ công nghệ thông tin và chuyển đổi số, các cơ sở giáo dục đại học và giáo dục nghề nghiệp đang đối mặt với khối lượng dữ liệu quản trị nhân sự ngày càng lớn. Tại các trường cao đẳng công lập, quỹ chi trả lương và phụ cấp thường chiếm từ 60% đến 70% tổng kinh phí chi thường xuyên. Đề tài luận văn thạc sĩ chuyên ngành Khoa học máy tính của tác giả Đào Mỹ Hạnh, dưới sự hướng dẫn khoa học của GS.TS Vũ Đức Thi tại Trường Đại học Công nghệ Thông tin và Truyền thông – Đại học Thái Nguyên (năm 2015), đã tập trung giải quyết bài toán tối ưu hóa phân tích thu nhập của cán bộ, viên chức. Vấn đề cốt lõi của nghiên cứu là ứng dụng kỹ thuật khai phá dữ liệu và phân cụm không giám sát để tự động phân loại cấu trúc thu nhập mà không cần định nghĩa nhãn từ trước.
Mục tiêu cụ thể của luận văn là khảo sát các mô hình phân cụm kinh điển, nghiên cứu thuật toán phân cụm gia tăng và ứng dụng trực tiếp vào cơ sở dữ liệu lương của Trường Cao đẳng Nghề Hà Nam. Phạm vi nghiên cứu bao quát toàn bộ dữ liệu nhân sự, ngạch bậc, thâm niên và các khoản thu nhập thực tế của hơn 150 cán bộ, giảng viên trong giai đoạn 2014 – 2015. Về mặt ý nghĩa thực tiễn, việc ứng dụng thuật toán phân cụm giúp ban giám hiệu giảm thiểu 35% sai lệch trong công tác lập dự toán quỹ lương hàng năm, đồng thời tăng 25% hiệu quả phân bổ các nguồn thu nhập tăng thêm. Đây là tiền đề khoa học vững chắc giúp nhà trường xây dựng chính sách đãi ngộ công bằng, tạo động lực làm việc cho người lao động và bảo đảm an toàn tài chính dài hạn.
Cơ sở lý thuyết và phương pháp nghiên cứu
Khung lý thuyết áp dụng
Nghiên cứu được xây dựng trên nền tảng quy trình khám phá tri thức từ cơ sở dữ liệu (KDD) gồm 7 giai đoạn: làm sạch dữ liệu, tích hợp dữ liệu, trích chọn dữ liệu, chuyển đổi dữ liệu, khai phá dữ liệu, đánh giá mẫu và biểu diễn tri thức. Trọng tâm của đề tài là lý thuyết phân cụm dữ liệu (Data Clustering) – một dạng học không giám sát trong học máy nhằm gom nhóm các đối tượng có độ tương đồng cao vào cùng một cụm và tách biệt các đối tượng khác biệt sang các cụm khác nhau.
Khung lý thuyết của luận văn phân loại chi tiết 4 hướng tiếp cận phân cụm chính: phân cụm phân hoạch, phân cụm phân cấp, phân cụm dựa trên mật độ và phân cụm dựa trên lưới. Trong đó, nghiên cứu đi sâu vào các khái niệm toán học nền tảng như: lân cận bán kính Eps của một điểm, ngưỡng số điểm lân cận tối thiểu MinPts, điểm nhân, điểm biên và điểm nhiễu ngoại lai. Các định nghĩa về mật độ đến được trực tiếp, mật độ đến được và mật độ liên thông được chuẩn hóa chặt chẽ. Ngoài ra, nghiên cứu vận dụng linh hoạt các phép đo khoảng cách đa chiều như khoảng cách Minkowski bậc q, khoảng cách Euclid, hệ số ghép đơn giản và hệ số tương đồng Jaccard đối với các thuộc tính định danh, thứ tự và nhị phân.
Phương pháp nghiên cứu
Nghiên cứu sử dụng nguồn dữ liệu thứ cấp được trích xuất trực tiếp từ hệ thống quản lý nhân sự và bảng thanh toán lương của Trường Cao đẳng Nghề Hà Nam. Cỡ mẫu thực nghiệm bao gồm 180 bản ghi thông tin cán bộ, giảng viên và nhân viên hợp đồng. Phương pháp chọn mẫu là chọn mẫu toàn bộ (census sampling) nhằm bảo đảm tính đại diện tuyệt đối 100% cho các phòng ban, khoa chuyên môn trong toàn trường mà không làm mất đi các trường hợp biên đặc thù.
Phương pháp phân tích được thực hiện thông qua việc so sánh đối sánh giữa 3 thuật toán: K-Means truyền thống, Seeded K-Means cải tiến và Incremental DBSCAN (thuật toán phân cụm dựa trên mật độ có khả năng cập nhật gia tăng). Lý do lựa chọn Incremental DBSCAN làm phương pháp phân tích trọng tâm là vì thuật toán này có khả năng tự động tìm ra các cụm có hình dạng bất kỳ, không phụ thuộc vào việc khai báo trước số lượng cụm k, đồng thời có khả năng khử nhiễu triệt để và cập nhật dữ liệu nhân sự phát sinh mà không phải quét lại toàn bộ cơ sở dữ liệu từ đầu. Toàn bộ timeline nghiên cứu và thử nghiệm phần mềm được triển khai liên tục trong 12 tháng, từ tháng 01/2014 đến tháng 01/2015.
Kết quả nghiên cứu và thảo luận
Những phát hiện chính
Quá trình chạy thực nghiệm thuật toán Incremental DBSCAN và Seeded K-Means trên tập dữ liệu 180 cán bộ đã tự động phân tách cấu trúc lương của nhà trường thành 3 phân cụm rõ nét với độ chính xác đạt trên 92%. Phát hiện thứ nhất chỉ ra rằng nhóm cán bộ quản lý và giảng viên thâm niên cao chiếm 18% tổng số nhân sự nhưng chiếm tới 38,5% tổng quỹ lương của đơn vị, với mức lương bình quân trên 12 triệu đồng/tháng. Nhóm này có hệ số lương ngạch bậc từ 4,98 trở lên kết hợp với các khoản phụ cấp chức vụ và phụ cấp thâm niên nghề vượt khung.
Phát hiện thứ hai cho thấy nhóm giảng viên trực tiếp giảng dạy chiếm tỷ trọng lớn nhất với 62% tổng số lao động, có mức thu nhập dao động trong khoảng từ 5,5 đến 8,5 triệu đồng/tháng. Trong nhóm này, thu nhập từ giờ giảng phụ trội và phụ cấp ưu đãi nghề chiếm trung bình 32% tổng thu nhập hàng tháng. Phát hiện thứ ba ghi nhận nhóm nhân viên hành chính, phục vụ và giảng viên trẻ mới tuyển dụng chiếm 20% nhân sự, có mức thu nhập bình quân dưới 4,5 triệu đồng/tháng. Đáng chú ý, thuật toán đã phát hiện chính xác 8% bản ghi dữ liệu ngoại lai thuộc về các giảng viên dạy vượt định mức giờ chuẩn trên 200%, gây mất cân đối cục bộ trong việc phân bổ khối lượng công tác.
Thảo luận kết quả
Kết quả phân cụm phản ánh trung thực thực trạng phân phối thu nhập tại các cơ sở giáo dục nghề nghiệp công lập, nơi mức lương cứng vẫn phụ thuộc chặt chẽ vào thâm niên công tác theo thang bảng lương nhà nước. Trong thực tế, dữ liệu phân tích được mô tả sinh động thông qua biểu đồ phân tán 2 chiều giữa trục hoành là hệ số lương kết hợp thâm niên và trục tung là tổng thu nhập thực lĩnh, kết hợp bảng ma trận phân phối thu nhập theo từng khoa chuyên môn. Biểu đồ chỉ ra sự phân cụm đậm đặc ở dải thu nhập trung bình và sự phân tán rộng ở nhóm có thu nhập cao do yếu tố giờ giảng ngoài giờ.
So với các nghiên cứu trước đây vốn chỉ dừng lại ở các chỉ số thống kê mô tả trung bình cộng đơn thuần, việc ứng dụng thuật toán Incremental DBSCAN giúp nhà trường nhận diện rõ ràng các nhóm nhân sự có tính chất tương đồng mà không bị sai lệch bởi các giá trị dị biệt. Tốc độ xử lý của Incremental DBSCAN khi cập nhật thêm 20 bản ghi mới đã giảm 40% thời gian tính toán so với việc chạy lại thuật toán K-Means từ đầu. Việc làm rõ 3 phân tầng thu nhập giúp ban lãnh đạo có cơ sở khoa học để tái cấu trúc giờ giảng, ngăn chặn tình trạng quá tải cục bộ và phân bổ ngân sách phúc lợi công bằng hơn giữa khối giảng dạy và khối phục vụ.
Đề xuất và khuyến nghị
Tái cơ cấu quy chế chi tiêu nội bộ gắn với hiệu suất lao động: Ban Giám hiệu cần rà soát và điều chỉnh định mức giờ giảng chuẩn, nâng tỷ trọng chi trả theo hiệu suất công việc lên mức tối thiểu 25% trong cơ cấu thu nhập, hoàn thành trong quý 2 năm 2015.
Tích hợp module phân cụm tự động vào phần mềm quản trị nhân sự: Phòng Công nghệ thông tin chủ trì đóng gói thuật toán Incremental DBSCAN thành một chức năng phân tích định kỳ trên hệ thống quản lý nội bộ, bảo đảm xử lý tự động 100% dữ liệu biến động lương hàng tháng trước ngày 25 của chu kỳ thanh toán.
Thiết lập hạn ngạch giờ giảng bổ sung để kiểm soát quỹ lương: Phòng Kế hoạch Tài chính phối hợp với Phòng Đào tạo giới hạn mức giờ dạy vượt định mức không quá 30% so với giờ chuẩn cho mỗi giảng viên, nhằm giảm 15% áp lực chi vượt ngân sách trong năm học tiếp theo.
Xây dựng chính sách hỗ trợ và đào tạo nâng chuẩn cho nhóm thu nhập thấp: Phòng Tổ chức Cán bộ lập kế hoạch chuẩn hóa chức danh nghề nghiệp cho 36 cán bộ, nhân viên thuộc nhóm thu nhập dưới 4,5 triệu đồng/tháng, tạo điều kiện thi thăng hạng viên chức trong lộ trình 18 tháng để nâng cao mức sống cho người lao động.
Đối tượng nên tham khảo luận văn
Ban Giám hiệu và các nhà quản lý giáo dục: Nắm vững phương pháp luận và công cụ phân tích hiện đại để đánh giá cơ cấu chi phí nhân lực, từ đó ban hành các quyết sách quản trị tài chính minh bạch, giúp gia tăng 30% hiệu quả sử dụng ngân sách nhà trường.
Chuyên viên phòng Kế toán và phòng Tổ chức Cán bộ: Ứng dụng quy trình tiền xử lý dữ liệu và thuật toán phân cụm để tự động hóa công tác lập dự toán ngân sách, rà soát bảng lương và phát hiện sai sót dữ liệu chỉ trong vài phút thay vì nhiều ngày xử lý thủ công.
Học viên cao học và nhà nghiên cứu ngành Công nghệ thông tin: Tiếp cận tài liệu tham khảo chi tiết về thuật toán phân cụm dựa trên mật độ DBSCAN, thuật toán Seeded K-Means và kỹ thuật cây hậu tố với hơn 20 sơ đồ thuật toán và bảng dữ liệu minh họa chuẩn mực.
Kỹ sư phát triển phần mềm quản lý trường học: Tận dụng mô hình thiết kế cơ sở dữ liệu quan hệ và kiến trúc giao diện các module quản trị danh mục, khoa viện, giảng viên và tính lương để rút ngắn 50% thời gian xây dựng các hệ thống ERP giáo dục tương tự.
Câu hỏi thường gặp
Mục tiêu chính của việc ứng dụng phân cụm dữ liệu trong phân tích lương là gì? Mục tiêu chính là tự động phát hiện các cấu trúc phân tầng thu nhập tiềm ẩn trong cơ sở dữ liệu nhân sự lớn mà không cần gán nhãn trước. Qua đó, nhà trường nhận diện chính xác các nhóm thu nhập từ thấp đến cao để điều chỉnh chính sách đãi ngộ hợp lý.
Tại sao thuật toán Incremental DBSCAN lại phù hợp với dữ liệu lương trường học? Incremental DBSCAN xử lý xuất sắc dữ liệu có hình dạng cụm phức tạp, tự động loại bỏ các điểm dữ liệu nhiễu và đặc biệt có khả năng cập nhật ngay các bản ghi cán bộ mới tuyển dụng mà không cần quét lại toàn bộ hệ thống từ đầu.
Dữ liệu đầu vào cần trải qua những bước xử lý nào trước khi phân cụm? Dữ liệu phải trải qua 4 bước chuẩn hóa gồm: làm sạch giá trị khuyết thiếu, chuyển đổi các thuộc tính định danh và thứ bậc về khoảng giá trị từ 0 đến 1, loại bỏ đơn vị đo và gán trọng số thích hợp cho từng biến số thu nhập.
Kết quả phân cụm hỗ trợ công tác dự báo tài chính của nhà trường ra sao? Kết quả giúp nhà trường xác định chính xác dung lượng của từng nhóm thu nhập, phân tích tỷ trọng chi trả giờ giảng phụ trội và giảm thiểu 35% sai lệch khi lập kế hoạch dự toán ngân sách chi thường xuyên cho năm tài chính tiếp theo.
Nghiên cứu này có thể áp dụng cho các cơ quan, doanh nghiệp khác không? Mô hình hoàn toàn có thể nhân rộng cho các cơ quan hành chính sự nghiệp, bệnh viện hoặc doanh nghiệp có quy mô từ 100 đến hàng nghìn nhân sự bằng cách điều chỉnh các biến số đầu vào phù hợp với đặc thù kinh doanh.
Kết luận
Luận văn đã hệ thống hóa toàn diện cơ sở lý thuyết về khai phá dữ liệu, tập trung sâu vào các kỹ thuật phân cụm phân hoạch và phân cụm dựa trên mật độ.
Tác giả đã nghiên cứu, cài đặt và thử nghiệm thành công thuật toán Incremental DBSCAN, chứng minh tính ưu việt trong việc khử 85% điểm nhiễu và xử lý gia tăng dữ liệu.
Thực nghiệm trên 180 bản ghi lương tại Trường Cao đẳng Nghề Hà Nam đã chỉ ra 3 phân cụm thu nhập rõ rệt, bộc lộ các bất cập trong việc phân công giảng dạy vượt giờ.
Hệ thống phần mềm ứng dụng được xây dựng hoàn chỉnh với đầy đủ giao diện quản trị người dùng, quản lý danh mục khoa viện và thực thi phân cụm trực quan.
Đề tài mở ra hướng tiếp cận định lượng hiện đại trong quản trị nhân sự giáo dục với lộ trình chuyển giao công nghệ và nâng cấp hệ thống khả thi trong vòng 12 đến 24 tháng tới. Quý bạn đọc và các nhà nghiên cứu quan tâm có thể khai thác tài liệu này để phát triển các giải pháp phân tích dữ liệu nâng cao cho đơn vị mình.