CHƯƠNG 1: GIỚI THIỆU ĐỀ TÀI Tổng quan Với sự bùng nổ của cách mạng Công nghiệp 4.0 và sự phát triển thần tốc của ngành Công nghệ thông tin, các hệ thống gợi ý ngày nay được ứng dụng trong nhiều lĩnh vực khác nhau vì hiệu quả mà nó mang lại. Trên các trang web hay ứng dụng di động hằng ngày, không khó để có thể bắt gặp các chức năng gợi ý từ đề xuất phim ảnh trên Netflix, âm nhạc trên Spotify, giới thiệu hàng hoá trên các trang thương mại điện tử như Amazon, Alibaba, đến gợi ý kết bạn mạng xã hội trên Facebook, Twitter, hay gợi ý matching trên ứng dụng hẹn hò Tinder. Đây là cách tiếp cận mới mẻ với hiệu quả kinh doanh tốt nhờ vào việc tập trung khai thác đúng tâm lý người dùng dựa trên thói quen hay hành vi của họ. Hiện nay, khi mà trình độ trí thức con người ngày càng gia tăng thì nhu cầu tìm việc và tuyển việc trên các kênh phương tiện chuyên nghiệp cũng ngày một nhiều.
LinkedIn, CareerBuilder, hay Glassdoor là một trong những công ty kỹ thuật số tiên phong trong lĩnh vực giới thiệu việc làm trực tuyến và được tin dùng bởi hàng triệu người tìm việc cũng như nhà tuyển dụng trên khắp thế giới. Tại Việt Nam nước ta nói riêng, tìm kiếm việc làm và tuyển dụng đã, đang và sẽ tiếp tục là một trong những chủ đề được nhiều người quan tâm nhất trong thời kỳ công nghiệp hoá – hiện đại hoá đất nước. Đây cũng là động lực để tác giả thực hiện đề tài luận văn Thạc sĩ về xây dựng một hệ thống gợi ý việc làm trực tuyến trên nền giải thuật Greedy và áp dụng với các giải pháp gợi ý dựa trên dữ liệu văn bản để nâng cao uy tín của hệ thống, giúp cho hệ thống trở nên thu hút hơn với người tìm việc và nhà tuyển dụng. Để một hệ thống gợi ý trực tuyến có thể vận hành hiệu quả trong thực tế thì quá trình phân tích dữ liệu phải trải qua các bước từ khâu tiền xử lý dữ liệu đầu vào, phân tích thông tin người dùng, đến việc đưa ra gợi ý và sắp xếp gợi ý.
Ở giới hạn của luận 2 văn, tác giả tập trung nghiên cứu và khai thác vào việc cải tiến độ chính xác khi giới thiệu việc làm trong bài toán online bipartite matching sử dụng giải thuật Greedy để đạt được chất lượng gợi ý tốt, nâng cao uy tín cho hệ thống giới thiệu việc làm. Đồng thời tác giả cũng tiến hành hiện thực giải thuật thông qua một số công cụ máy tính để đánh giá và bàn luận về kết quả đạt được. Nhiệm vụ luận văn Luận văn đặt ra nhiệm vụ đề xuất các phương pháp cải tiến dựa theo dữ liệu nội dung (content-based) và dữ liệu hành vi (behavioral) trên nên giải thuật Greedy trong bài toán online bipartite matching để cải thiện hiệu suất gợi ý cho hệ thống giới thiệu việc làm, đảm bảo tiêu chí về mặt uy tín của hệ thống cũng như quá trình xử lý dữ liệu trực tuyến không quá phức tạp. Uy tín của hệ thống được ghi nhận từ khả năng tăng cao tính khả thi ứng tuyển cho việc làm khi được gợi ý với người tìm việc.
Điều này giúp cho hệ thống có sức hấp dẫn đối với cả hai đối tượng người dùng là những người tìm kiếm việc làm và cả những nhà tuyển dụng. Mục tiêu, đối tượng, giới hạn nghiên cứu và phương pháp nghiên cứu Mục tiêu được đề ra là nghiên cứu và phát triển giải pháp cải thiện chất lượng gợi ý cũng như uy tín cho hệ thống giới thiệu việc làm trực tuyến dựa trên giải thuật Greedy, đảm bảo khả năng gợi ý việc làm với hiệu quả cao, phù hợp với nhu cầu ứng tuyển của người tìm việc. Ngoài ra, quá trình gợi ý khi có câu truy vấn từ người dùng phải đủ nhanh để có thể đưa ra danh sách việc làm trong thời gian cho phép. Các giải pháp đề xuất trong quá trình nghiên cứu cần có độ phức tạp và đòi hỏi chi phí tính toán không quá lớn, phù hợp với điều kiện nguồn vốn và tài nguyên hạn chế của luận văn.
Đối tượng nghiên cứu của luận văn là: 3 • Hệ thống gợi ý việc làm trực tuyến dựa trên đồ thị. • Đánh giá hệ thống thông qua công cụ tự xây dựng. Phạm vi nghiên cứu là việc cải tiến uy tín cho hệ thống gợi ý việc làm trực tuyến dựa trên đồ thị, việc làm sẽ được gợi ý thông qua từ khoá được nhập bởi người tìm việc và họ sẽ nhận được các kết quả các vị trí tuyển dụng tương ứng. Các nghiên cứu tập trung vào việc cải thiện khả năng gợi ý việc làm cho người tìm việc, làm sao để người tìm việc có thể nhìn thấy được những việc làm mà họ quan tâm trước.
Điều này có thể đạt được dựa trên quá trình khai thác các dữ liệu về nội dung và hành vi. Ngoài ra, một phần mềm đánh giá cũng được xây dựng dựa trên lý thuyết đã đề xuất để kiểm thử khả năng áp dụng thực tiễn của hệ thống, dựa trên bộ dữ liệu thực nghiệm. Luận văn được thực hiện dựa trên các phương pháp nghiên cứu bao gồm: • Phương pháp phân tích và tổng hợp: bài toán lớn của luận văn được chia ra từng bài toán nhỏ để tập trung phân tích từng vấn đề một, cụ thể như bài toán gom cụm người tìm việc, bài toán tiền xử lý và so sánh dữ liệu văn bản, bài toán áp dụng giải pháp cải thiện gợi ý phù hợp theo từng giai đoạn. Từng bài toán nhỏ sau khi được giải quyết sẽ được tổng hợp lại để trở thành một giải pháp tổng thể cho bài toán lớn.
• Phương pháp thực nghiệm: hiện thực lại giải thuật đã đề xuất và các giải thuật cần đối chiếu bằng công cụ đánh giá thực tế để chứng minh giá trị thực tế của luận văn. • Phương pháp so sánh: sử dụng kết quả thực nghiệm thu được để so sánh giữa giải thuật cơ bản và các đề xuất của tác giả với nhau, từ đó đưa ra kết luận và hướng phát triển. 4 • Phương pháp liệt kê: sử dụng phương pháp liệt kê để trình bày các nghiên cứu nổi trội về lĩnh vực gợi ý việc làm đã được giới chuyên môn công bố và chấp thuận. Hướng giải quyết bài toán Với mục tiêu là cải thiện khả năng gợi ý của hệ thống giới thiêu việc làm trên nền giải thuật Greedy thông qua việc ưu tiên hiển thị các việc làm có tiềm năng được ứng tuyển đến với người tìm việc, tác giả đã đề xuất giải pháp gợi ý dựa trên trùng khớp hồ sơ ProMat (profile-match) và giải pháp gợi ý dựa trên tương tự hồ sơ ProSim (profile-similar).
Những giải pháp này được tác giả đề xuất ứng dụng vào các giai đoạn khác nhau của quá trình triển khai hệ thống, phù hợp với nguồn dữ liệu và nguồn vốn, tài nguyên tính toán tại thời điểm tương tương ứng. Về cơ bản, các giải thuật dựa trên việc so sánh độ tương tự văn bản của nguồn dữ liệu nội dung (content-based) cũng như hành vi (behavioral). Từ đó, thực hiện giải pháp nâng cao hơn như gom cụm người tìm việc theo hồ sơ sử dụng K-means để gợi ý việc làm. Các giải pháp cũng được đánh giá dựa trên bộ dữ liệu thực tế được cung cấp bởi CareerBuilder để minh chứng tính khả thi khi áp dụng thực tiễn cũng như so sánh với giải pháp sử dụng giải thuật Greedy thuần tuý để gợi ý việc làm.
Qua đó cho thấy đóng góp của tác giả vào vấn đề cải thiện hiệu năng gợi ý cho giải thuật Greedy ở khía cạnh nâng cao uy tín của hệ thống (thông qua việc gợi ý việc làm hấp dẫn hơn cho người tìm việc) khi mà giải thuật Greedy vẫn nổi tiếng ở hiệu quả đem về lợi nhuận trong các giải thuật online. Uy tín được gia tăng sẽ giúp cho hệ thống có sức hấp dẫn đối với cả hai đối tượng người dùng là những người tìm kiếm việc làm và cả những nhà tuyển dụng. Điều này dẫn đến kết quả tất yếu là người mong muốn việc làm mới hay công ty/doanh nghiệp cần bổ sung vị trí nhân sự đều sẽ tìm đến hệ thống như một giải pháp giới thiệu việc làm hiệu quả. 5 Cần lưu ý là xuyên suốt luận văn, tác giả sẽ tập trung nghiên cứu vào hướng giải quyết vấn đề nâng cao uy tín hơn là lợi nhuận.
Do đó, giải thuật Greedy cơ bản vẫn được sử dụng như một cách để đảm bảo hơn nguồn tiền thu được thông qua việc phần nào ưu tiên cho các việc làm có mức đấu giá cao được hiển thị trước với điều kiện các việc làm này đã được sắp xếp theo độ ưu tiên về mức hấp dẫn đối với người tìm việc. Ở chương tiếp theo là Chương 2, tác giả sẽ mô tả cụ thể hơn về bài toán giới thiệu việc làm, các nghiên cứu liên quan cũng như mô tả và mô hình hoá bài toán. Đồng thời, chương này cũng bao gồm phần đề xuất cách sử dụng hai giải pháp gợi ý ProMat cùng ProSim cho phù hợp với từng giai đoạn triển khai khác nhau của hệ thống, tuỳ theo điều kiện chi phí cũng như tài nguyên khác nhau. Sau đó, tác giả tiến hành giới thiệu và phân tích giải pháp cải thiện gợi ý dựa trên trùng khớp hồ sơ ProMat và dựa trên tương tự hồ sơ ProSim kết hợp với giải thuật Greedy ở Chương 3 và Chương 4 để có thể tăng cao độ chính xác gợi ý cho quá trình giới thiệu việc làm.
Các lý thuyết được nêu ra trong luận văn đều được kiểm thử và nghiệm thu kết quả dựa trên bộ dữ liệu ứng tuyển việc làm thực tế. Các kết quả này được tổng hợp và bàn luận ở Chương 5 của luận văn. 6 CHƯƠNG 2: BÀI TOÁN GIỚI THIỆU VIỆC LÀM Các nghiên cứu liên quan Hệ thống gợi ý (recommender system) không phải là một khái niệm xa lạ đối với ngành Công nghệ thông tin nói chung và Khoa hoc máy tính nói riêng. Đã có nhiều nghiên cứu cũng như những ứng dụng thực tế xây dựng các hệ thống gợi ý được ra đời và đem lại lợi nhuận khổng lồ cho các nhà đầu tư.
Tiêu biểu có thể kể đến hệ thống gợi ý phim ảnh của Netflix [1], gợi ý hàng hoá mua bán của Amazon [2], gợi ý nhạc của Spotify [3] hay thậm chí là gợi ý thức ăn của Uber Eats [4]. Mỗi hệ thống gợi ý được dựa trên các cơ chế tổng hợp và xử lý dữ liệu khác nhau, như lọc cộng tác (collaborative filtering) [3], dựa theo nội dung (content-based) hay các phương pháp lai (hybrid) sử dụng đồ thị (graph-based) [4].