Đồ án: Xây dựng hệ thống cảnh báo tin tuyển dụng từ Internet - ĐHBK Hà Nội

Đồ án tốt nghiệp: Xây dựng hệ thống cảnh báo tin tuyển dụng từ internet. Tìm hiểu cách thu thập và phân tích dữ liệu, cảnh báo thông tin việc làm phù hợp.

Trường đại học

Đại học Bách Khoa Hà Nội

Chuyên ngành

Công Nghệ Thông Tin

Người đăng

Ẩn danh

Thể loại

Đồ án tốt nghiệp

2021

66
1
0

Phí lưu trữ

30 Point

Mục lục chi tiết

Lời cam đoan của sinh viên

Lời cảm ơn

Tóm tắt nội dung đồ án

MỤC LỤC

DANH MỤC HÌNH VẼ

DANH MỤC BẢNG

DANH SÁCH THUẬT NGỮ VÀ TỪ VIẾT TẮT

1. CHƯƠNG 1: GIỚI THIỆU ĐỀ TÀI

1.1. Thực trạng thị trường tuyển dụng lao động hiện nay

1.2. Website việc làm yourway và các khó khăn trong việc tìm kiếm dữ liệu

1.3. Mục tiêu và phạm vi đề tài

1.3.1. Mục tiêu của đồ án

1.3.2. Phạm vi đề tài

1.4. Định hướng giải pháp

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT VÀ CÔNG NGHỆ

2.1. Hệ thống phân tán

3. XÂY DỰNG ỨNG DỤNG WEB TƯƠNG TÁC NGƯỜI DÙNG

3.1. Phân tích thiết kế

3.2. Triển khai hệ thống website

3.3. Giao diện ứng dụng

4. THIẾT KẾ VÀ XÂY DỰNG HỆ THỐNG QUẢN LÝ, XỬ LÝ DỮ LIỆU

4.1. Kiến trúc tổng quan hệ thống

4.2. Phát triển hệ thống quản lý và xử lý dữ liệu

4.3. Triển khai hệ thống quản lý, xử lý dữ liệu

4.4. Kết quả và đánh giá

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Giới Thiệu Hệ Thống Cảnh Báo Tin Tuyển Dụng Tự Động

Thị trường việc làm ngày càng năng động và đa dạng, đặc biệt trong kỷ nguyên công nghệ 4.0. Internet đã trở thành công cụ tìm kiếm việc làm phổ biến, tuy nhiên, việc tìm kiếm thủ công vẫn tốn nhiều thời gian và công sức. Theo Tổng cục Thống kê Việt Nam, hàng triệu người lao động mất việc làm hoặc thiếu việc làm do đại dịch COVID-19. Doanh nghiệp cũng gặp khó khăn trong tuyển dụng. Do đó, hệ thống cảnh báo tin tuyển dụng tự động trở nên cần thiết, giúp người tìm việc tiếp cận thông tin nhanh chóng và hiệu quả. Hệ thống này sẽ tự động tìm kiếm việc làm trên Internet, sàng lọc theo yêu cầu của người dùng và gửi thông báo khi có tin phù hợp. Từ đó, người tìm việc có thể tiết kiệm thời gian, công sức và tăng cơ hội tìm được công việc mong muốn. Phần mềm cảnh báo việc làm tự động không chỉ là một công cụ, mà còn là giải pháp giúp thị trường lao động trở nên minh bạch và hiệu quả hơn. Hệ thống cần được xây dựng trên nền tảng công nghệ hiện đại, có khả năng mở rộng và tùy biến cao để đáp ứng nhu cầu đa dạng của người dùng. Nền tảng cần sử dụng các kỹ thuật web scraping việc làm, crawler tin tuyển dụng, và hệ thống tìm việc làm thông minh. Một trong những tài liệu tham khảo quan trọng là đồ án tốt nghiệp của Nguyễn Văn Tiến tại Đại học Bách Khoa Hà Nội, với đề tài "Xây dựng hệ thống cảnh báo trên luồng tin tuyển dụng thu thập từ Internet". Đồ án này đã đề xuất một số giải pháp tiềm năng, sử dụng các công nghệ như Apache SparkApache Kafka, để xây dựng một hệ thống thu thập tin tuyển dụng hiệu quả.

1.1. Tầm Quan Trọng của Cảnh Báo Việc Làm Theo Yêu Cầu

Trong bối cảnh thị trường lao động cạnh tranh, việc nhận được cảnh báo việc làm theo yêu cầu kịp thời là yếu tố then chốt. Hệ thống này giúp người tìm việc không bỏ lỡ cơ hội phù hợp, đặc biệt với những vị trí 'hot' hoặc yêu cầu kỹ năng chuyên biệt. Thay vì phải liên tục tìm kiếm trên nhiều trang web, người dùng chỉ cần thiết lập custom job alerts và chờ thông báo. Tính năng này đặc biệt hữu ích cho những người đang bận rộn hoặc không có nhiều thời gian theo dõi thị trường việc làm. Hệ thống cũng giúp nhà tuyển dụng tiếp cận được ứng viên tiềm năng một cách nhanh chóng và hiệu quả. Thông qua API tuyển dụng và các kênh phân phối thông tin tự động, tin tuyển dụng được lan tỏa đến đúng đối tượng mục tiêu, tăng khả năng tuyển dụng thành công.

1.2. Giới Thiệu Các Thành Phần Chính của Hệ Thống

Một hệ thống cảnh báo tin tuyển dụng tự động hoàn chỉnh thường bao gồm các thành phần sau: Crawler tin tuyển dụng, chịu trách nhiệm thu thập thông tin từ các trang web việc làm; Công cụ sàng lọc tin tuyển dụng, giúp loại bỏ các tin không phù hợp với tiêu chí tìm kiếm; Hệ thống lưu trữ và xử lý dữ liệu, đảm bảo thông tin được lưu trữ an toàn và truy xuất nhanh chóng; Module thông báo, gửi tin tuyển dụng realtime đến người dùng qua email, ứng dụng di động, hoặc các kênh khác. Sự kết hợp hài hòa giữa các thành phần này sẽ tạo ra một hệ thống auto job search hiệu quả, đáp ứng nhu cầu của cả người tìm việc và nhà tuyển dụng.

II. Thách Thức Trong Xây Dựng Hệ Thống Thu Thập Tin Tuyển Dụng

Xây dựng một hệ thống cảnh báo tin tuyển dụng tự động hiệu quả không phải là điều dễ dàng. Có nhiều thách thức cần vượt qua, từ kỹ thuật đến pháp lý và đạo đức. Một trong những thách thức lớn nhất là sự đa dạng của các trang web việc làm. Mỗi trang web có cấu trúc dữ liệu khác nhau, đòi hỏi crawler tin tuyển dụng phải được thiết kế linh hoạt và dễ dàng thích nghi. Ngoài ra, các trang web thường xuyên thay đổi cấu trúc, gây khó khăn cho việc duy trì hoạt động ổn định của crawler. Vấn đề web scraping việc làm cũng đặt ra nhiều câu hỏi về tính hợp pháp và đạo đức. Việc thu thập dữ liệu mà không có sự cho phép của chủ sở hữu trang web có thể vi phạm các điều khoản sử dụng và luật bảo vệ dữ liệu. Cần đảm bảo rằng hệ thống hoạt động tuân thủ pháp luật và tôn trọng quyền riêng tư của người dùng. Thách thức khác là xử lý lượng lớn dữ liệu thu thập được. Các trang web việc làm có hàng triệu tin tuyển dụng, đòi hỏi hệ thống phải có khả năng lưu trữ, xử lý và phân tích dữ liệu một cách hiệu quả. Hệ thống tìm việc làm thông minh phải có khả năng sàng lọc, phân loại và đánh giá độ tin cậy của thông tin, đảm bảo người dùng nhận được những tin tuyển dụng chất lượng và phù hợp.

2.1. Vượt Qua Rào Cản Cấu Trúc Website Tuyển Dụng Phức Tạp

Cấu trúc website tuyển dụng rất đa dạng và phức tạp, gây khó khăn cho việc trích xuất dữ liệu một cách nhất quán. Các yếu tố như định dạng HTML khác nhau, sử dụng JavaScript để tải nội dung, hoặc áp dụng các biện pháp chống bot có thể làm cho phần mềm quét tin tuyển dụng gặp khó khăn. Để giải quyết vấn đề này, cần sử dụng các công nghệ web scraping việc làm tiên tiến, có khả năng phân tích cấu trúc trang web một cách thông minh và tự động điều chỉnh khi có thay đổi. Đồng thời, cần xây dựng một hệ thống quản lý và bảo trì crawler hiệu quả, đảm bảo hoạt động ổn định và liên tục.

2.2. Đảm Bảo Tính Hợp Pháp và Đạo Đức Khi Web Scraping

Việc web scraping việc làm cần tuân thủ các nguyên tắc pháp lý và đạo đức để tránh vi phạm quyền sở hữu trí tuệ và quyền riêng tư. Cần đọc kỹ và tuân thủ các điều khoản sử dụng của trang web, chỉ thu thập dữ liệu công khai và không sử dụng thông tin cá nhân một cách trái phép. Đồng thời, cần tôn trọng robots.txt và giới hạn tần suất truy cập để không gây ảnh hưởng đến hoạt động của trang web. Việc xây dựng một chính sách thu thập tin tuyển dụng minh bạch và tuân thủ pháp luật là rất quan trọng để đảm bảo uy tín và bền vững của hệ thống.

III. Phương Pháp Xây Dựng Crawler Tin Tuyển Dụng Hiệu Quả

Để xây dựng một crawler tin tuyển dụng hiệu quả, cần áp dụng các phương pháp và công nghệ phù hợp. Crawler cần có khả năng thu thập thông tin từ nhiều nguồn khác nhau, xử lý dữ liệu một cách nhanh chóng và chính xác, và thích nghi với sự thay đổi của các trang web. Một trong những phương pháp phổ biến là sử dụng thư viện Beautiful SoupScrapy trong Python. Beautiful Soup giúp phân tích cú pháp HTML và XML, trích xuất dữ liệu một cách dễ dàng. Scrapy là một framework mạnh mẽ để xây dựng crawler, cung cấp các tính năng như quản lý request, xử lý response, và lưu trữ dữ liệu. Crawler cần được thiết kế theo kiến trúc module hóa, dễ dàng mở rộng và bảo trì. Mỗi module chịu trách nhiệm cho một tác vụ cụ thể, như thu thập thông tin từ một trang web, xử lý dữ liệu, hoặc lưu trữ thông tin. Việc sử dụng API tuyển dụng cũng là một lựa chọn tốt, giúp truy cập dữ liệu một cách có cấu trúc và tuân thủ các quy định của nhà cung cấp.

3.1. Lựa Chọn Công Cụ và Thư Viện Web Scraping Phù Hợp

Việc lựa chọn công cụ và thư viện web scraping việc làm phù hợp là yếu tố quan trọng để xây dựng một crawler hiệu quả. Beautiful SoupScrapy là hai lựa chọn phổ biến trong Python, nhưng còn nhiều công cụ khác như Selenium, Puppeteer, hoặc Cheerio (cho Node.js). Mỗi công cụ có ưu điểm và nhược điểm riêng, phù hợp với các yêu cầu khác nhau của dự án. Cần đánh giá kỹ các yếu tố như khả năng xử lý JavaScript, tốc độ thu thập dữ liệu, khả năng chống bot, và chi phí để đưa ra lựa chọn tối ưu.

3.2. Thiết Kế Kiến Trúc Crawler Module Hóa và Linh Hoạt

Kiến trúc module hóa giúp crawler dễ dàng mở rộng, bảo trì và thích nghi với sự thay đổi của các trang web. Mỗi module nên chịu trách nhiệm cho một tác vụ cụ thể, như thu thập thông tin từ một trang web, xử lý dữ liệu, hoặc lưu trữ thông tin. Các module nên được thiết kế độc lập và có giao diện rõ ràng, cho phép dễ dàng thay thế hoặc thêm mới module. Việc sử dụng các pattern thiết kế như Factory, Strategy, hoặc Observer có thể giúp tăng tính linh hoạt và tái sử dụng của crawler.

3.3. Tận Dụng API Tuyển Dụng để Truy Cập Dữ Liệu Có Cấu Trúc

Sử dụng API tuyển dụng là một cách tiếp cận hiệu quả để truy cập dữ liệu có cấu trúc và tuân thủ các quy định của nhà cung cấp. API thường cung cấp dữ liệu dưới định dạng JSON hoặc XML, dễ dàng xử lý và tích hợp vào hệ thống. Tuy nhiên, không phải trang web nào cũng cung cấp API, và API có thể có giới hạn về số lượng request hoặc yêu cầu xác thực. Cần đánh giá kỹ các điều khoản sử dụng và chi phí của API trước khi quyết định sử dụng.

IV. Ứng Dụng Apache Spark Xử Lý Dữ Liệu Tuyển Dụng Lớn

Với lượng dữ liệu lớn thu thập được từ Internet, việc xử lý và phân tích dữ liệu trở nên khó khăn nếu sử dụng các phương pháp truyền thống. Apache Spark là một framework mạnh mẽ để xử lý dữ liệu lớn, cung cấp các tính năng như tính toán song song, lưu trữ trong bộ nhớ, và hỗ trợ nhiều ngôn ngữ lập trình. Spark có thể được sử dụng để lọc, phân loại, và đánh giá độ tin cậy của thông tin tuyển dụng. Spark SQL cho phép truy vấn dữ liệu bằng ngôn ngữ SQL, giúp người dùng dễ dàng tìm kiếm các tin tuyển dụng phù hợp với tiêu chí của mình. Spark Streaming cho phép xử lý dữ liệu theo thời gian thực, giúp người dùng nhận được tin tuyển dụng realtime một cách nhanh chóng. Việc sử dụng Spark giúp tăng tốc độ xử lý dữ liệu, giảm chi phí lưu trữ, và cải thiện độ chính xác của hệ thống cảnh báo tin tuyển dụng tự động.

4.1. Tối Ưu Hóa Hiệu Năng Xử Lý Dữ Liệu Bằng Spark SQL

Sử dụng Spark SQL cho phép truy vấn dữ liệu bằng ngôn ngữ SQL, giúp người dùng dễ dàng tìm kiếm các tin tuyển dụng phù hợp với tiêu chí của mình. Spark SQL cung cấp các tính năng tối ưu hóa hiệu năng như caching, partitioning, và query optimization, giúp tăng tốc độ xử lý dữ liệu và giảm chi phí lưu trữ. Cần thiết kế schema dữ liệu một cách hợp lý và sử dụng các index để tăng tốc độ truy vấn.

4.2. Xây Dựng Ứng Dụng Realtime Với Spark Structured Streaming

Spark Structured Streaming cho phép xử lý dữ liệu theo thời gian thực, giúp người dùng nhận được tin tuyển dụng realtime một cách nhanh chóng. Spark Structured Streaming cung cấp các tính năng như windowing, aggregation, và fault tolerance, giúp xây dựng các ứng dụng real-time mạnh mẽ và tin cậy. Cần cấu hình trigger interval một cách hợp lý để đảm bảo hiệu năng và độ trễ của hệ thống.

4.3. Tích Hợp Spark Với Các Nguồn Dữ Liệu Tuyển Dụng Khác Nhau

Spark có thể được tích hợp với nhiều nguồn dữ liệu tuyển dụng khác nhau, như Kafka, HDFS, Amazon S3, hoặc MySQL. Việc tích hợp với nhiều nguồn dữ liệu giúp tăng tính linh hoạt và khả năng mở rộng của hệ thống. Cần lựa chọn connector phù hợp với từng nguồn dữ liệu và cấu hình authentication một cách an toàn.

V. Triển Khai Hệ Thống Cảnh Báo Tin Tuyển Dụng Tự Động

Sau khi xây dựng xong các thành phần của hệ thống, cần triển khai và kiểm thử để đảm bảo hoạt động ổn định và hiệu quả. Việc triển khai có thể được thực hiện trên môi trường cloud hoặc on-premise, tùy thuộc vào yêu cầu của dự án. Cần cấu hình các thông số của hệ thống một cách hợp lý, như số lượng worker node, memory allocation, và parallelism. Việc kiểm thử cần được thực hiện kỹ lưỡng, bao gồm kiểm thử chức năng, kiểm thử hiệu năng, và kiểm thử bảo mật. Sau khi triển khai, cần theo dõi và bảo trì hệ thống thường xuyên, khắc phục các lỗi và cải thiện hiệu năng. Việc thu thập phản hồi từ người dùng cũng rất quan trọng, giúp cải thiện chất lượng và tính hữu ích của hệ thống cảnh báo tin tuyển dụng tự động.

5.1. Lựa Chọn Môi Trường Triển Khai Cloud Hay On Premise

Việc lựa chọn môi trường triển khai cloud hay on-premise phụ thuộc vào nhiều yếu tố, như chi phí, bảo mật, và khả năng mở rộng. Môi trường cloud cung cấp tính linh hoạt và khả năng mở rộng cao, nhưng có thể đắt hơn và có rủi ro về bảo mật. Môi trường on-premise cung cấp kiểm soát tốt hơn về bảo mật, nhưng có thể tốn kém hơn trong việc bảo trì và nâng cấp. Cần đánh giá kỹ các yếu tố này trước khi đưa ra quyết định.

5.2. Kiểm Thử Kỹ Lưỡng Chức Năng Hiệu Năng và Bảo Mật

Việc kiểm thử kỹ lưỡng là rất quan trọng để đảm bảo hoạt động ổn định và hiệu quả của hệ thống. Kiểm thử chức năng cần đảm bảo rằng tất cả các chức năng của hệ thống hoạt động đúng như mong đợi. Kiểm thử hiệu năng cần đảm bảo rằng hệ thống có thể xử lý lượng lớn dữ liệu một cách nhanh chóng và chính xác. Kiểm thử bảo mật cần đảm bảo rằng hệ thống an toàn trước các tấn công từ bên ngoài.

5.3. Theo Dõi và Bảo Trì Hệ Thống Sau Triển Khai

Sau khi triển khai, cần theo dõi và bảo trì hệ thống thường xuyên để đảm bảo hoạt động ổn định và hiệu quả. Việc theo dõi bao gồm theo dõi các log, metrics, và alerts để phát hiện các lỗi và sự cố. Việc bảo trì bao gồm khắc phục các lỗi, cải thiện hiệu năng, và cập nhật các phiên bản phần mềm. Việc thu thập phản hồi từ người dùng cũng rất quan trọng để cải thiện chất lượng và tính hữu ích của hệ thống.

VI. Kết Luận và Hướng Phát Triển Hệ Thống Trong Tương Lai

Hệ thống cảnh báo tin tuyển dụng tự động là một công cụ hữu ích giúp người tìm việc và nhà tuyển dụng kết nối với nhau một cách hiệu quả. Việc xây dựng một hệ thống như vậy đòi hỏi sự kết hợp giữa nhiều kỹ năng và công nghệ, từ web scraping việc làm đến xử lý dữ liệu lớnmachine learning. Trong tương lai, hệ thống có thể được cải thiện bằng cách sử dụng các thuật toán machine learning để cá nhân hóa kết quả tìm kiếm, dự đoán nhu cầu tuyển dụng, và phát hiện các tin tuyển dụng gian lận. Việc tích hợp với các mạng xã hội và các nền tảng khác cũng giúp tăng tính tiện lợi và phạm vi tiếp cận của hệ thống. Việc xây dựng một cộng đồng người dùng và chia sẻ thông tin cũng giúp cải thiện chất lượng và độ tin cậy của hệ thống tự động tìm kiếm việc làm trên internet.

6.1. Cá Nhân Hóa Kết Quả Tìm Kiếm Bằng Machine Learning

Sử dụng các thuật toán machine learning để cá nhân hóa kết quả tìm kiếm giúp người dùng nhận được những tin tuyển dụng phù hợp nhất với kỹ năng, kinh nghiệm, và sở thích của mình. Các thuật toán có thể học hỏi từ lịch sử tìm kiếm, hồ sơ cá nhân, và phản hồi của người dùng để đưa ra những gợi ý chính xác và hữu ích.

6.2. Dự Đoán Nhu Cầu Tuyển Dụng và Phát Hiện Tin Gian Lận

Các thuật toán machine learning cũng có thể được sử dụng để dự đoán nhu cầu tuyển dụng và phát hiện các tin tuyển dụng gian lận. Việc dự đoán nhu cầu tuyển dụng giúp người tìm việc chuẩn bị kỹ năng và kinh nghiệm phù hợp. Việc phát hiện tin tuyển dụng gian lận giúp bảo vệ người dùng khỏi các hành vi lừa đảo và trục lợi.

6.3. Mở Rộng Tích Hợp Với Mạng Xã Hội và Nền Tảng Khác

Việc tích hợp với các mạng xã hội và các nền tảng khác giúp tăng tính tiện lợi và phạm vi tiếp cận của hệ thống. Người dùng có thể chia sẻ tin tuyển dụng với bạn bè, đồng nghiệp, và kết nối với nhà tuyển dụng. Việc tích hợp với các nền tảng khác như LinkedIn, Facebook, hoặc Twitter cũng giúp thu thập dữ liệu và cải thiện chất lượng của hệ thống.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

22/09/2025
Đồ án tốt nghiệp xây dựng hệ thống cảnh báo trên luồng tin tuyển dụng thu thập từ internet

Trích đoạn nội dung tài liệu

CHƯƠNG 1. GIỚI THIỆU ĐỀ TÀI 1.1 Thực trạng thị trường tuyển dụng lao động hiện nay Hiện nay dịch bệnh COVID-19 đã diễn ra liên tục trong vòng 2 năm qua đã khiến kinh tế Việt Nam nói riêng và thế giới nói chung gặp nhiều khó khăn. Rất nhiều công ty tập đoàn trên thế giới cũng vô cùng khó khăn, rơi vào khủng hoảng vì các đợt giãn cách phong tỏa thời gian dài. Các chuỗi cung ứng vận chuyển giữa các vùng bị đứt gãy cũng như khó khăn trong việc lưu thông khiến cho giá cả leo thang.

Gây nên cơn khủng hoàng việc làm trên toàn cầu nói chung và Việt Nam nói riêng. Đại dịch COVID-19 đã khiến hàng triệu lao động mất việc làm cũng như thiếu việc làm tại Việt Nam. Theo số liệu Tổng cục Thống kê Việt Nam (Tài liệu tham khảo [2]) đưa ra trung bình trong 9 tháng năm 2021, số người thất nghiệp trong độ tuổi lao động lên tới hơn 1,3 triệu người tăng hơn rất nhiều so với cùng kì năm ngoái. Đồng thời tỉ lệ thất nghiệp trong độ tuổi 15-24 tuổi lên tới 7,9% đặc biệt hơn là khu vực thành thị lên tới 10,79%.

Các con số đều tăng hơn so với thời điểm trước khi đại dịch xảy ra cho thấy đại dịch đã ảnh hưởng rất lớn tới người lao động cũng như các đơn vị công ty tuyển dụng việc làm.1: Lực lượng lao động Việt Nam theo quý, năm 2020 và 2021 Hơn nữa khi đại dịch lan rộng đã khiến đất nước phải giãn cách, phong tỏa nhiều khu vực. Vô hình chung cũng gây khó khăn cho các công ty trong việc tuyển dụng tìm nhân sự duy trì hoạt động cho bộ máy công ty. Các công ty cũng như người lao động phải phỏng vấn và duy trì kết nối hoàn toàn trên môi trường Internet. Từ đó chúng ta cũng nhận thấy nhiều bất cập về lượng thông tin tuyển dụng, thông tin ứng tuyển tìm việc chưa được khai thác triệt để, người lao động không thể tìm kiếm chính xác được các thông tin tuyển dụng phù hợp hay nhà tuyển dụng cũng khó có khả năng tìm ra các ứng viên tiềm năng.

Người lao động Sinh viên: Nguyễn Văn Tiến – 20173401 – Khóa 62 1 TIEU LUAN MOI download : skknchat123@gmail.com cũng như công ty tuyển dụng phải liên tục tìm kiếm trên mạng Internet gây lãng phí thời gian và chi phí vận hành.2 Website việc làm yourway và các khó khăn trong việc tìm kiếm dữ liệu Yourway là một website tìm kiếm việc làm đã được xây dựng thành công với các chức năng cho phép người dùng đăng tin tuyển dụng (dành cho các công ty), tìm kiếm và đăng bài tìm việc (dành cho cá nhân có nhu cầu), xem thống kê số liệu việc làm dưới dạng trực quan biểu đồ. Với những gì đã được xây dựng, website phần nào đã thực hiện việc kết nối người cần tìm việc và doanh nghiệp, tổ chức muốn tuyển nhân viên. Tuy nhiên bên cạnh đó, với cách tìm việc truyền thống thì vẫn còn những hạn chế nhất định. • Đầu tiên là việc tìm kiếm thủ công theo phương thức truyền thống (tìm kiếm bằng tên, lọc khoảng lương, khu vực, …) mất tương đối thời gian.

Đồng thời mỗi khi truy cập lại để tìm kiếm, người dùng lại phải thực hiện lại một loạt các thao tác vừa đề cập. Như vậy là rất tốn thời gian và công sức • Bên cạnh đó, việc gửi thông tin tuyển dụng đến người dùng theo lịch đã được một số các trang web việc làm tương tự phục vụ (linkedin.com, …) nhưng lại khá cứng nhắc khi chỉ đưa một vài thông tin cho người dùng chọn. Đây là vấn đề khiến cho đôi khi có những công việc chưa thực sự phù hợp với mong muốn được gửi đến người dùng.2 Mục tiêu và phạm vi đề tài 1.1 Mục tiêu của đồ án Tính năng thông báo dữ liệu đến người dùng đã có ở nhiều hệ thống website. Tuy nhiên lại chưa giải quyết được vấn đề tùy biến cho người dùng.

Trong đồ án này, sinh viên hướng tới giải quyết bài toán truy vấn dữ liệu sử dụng công nghệ dữ liệu lớn. Với mục tiêu khắc phục những hạn chế, khó khăn của các phương pháp truy vấn cũ như giảm bớt thao tác người dùng, tùy biến được truy vấn tốt hơn, lưu trữ hiệu quả. Từ những vấn đề đã nêu ở phần 1.1, mục tiêu được đặt ra cho đồ án này là xây dựng hệ thống cảnh báo dữ liệu một cách liên tục trên luồng dữ liệu tuyển dụng. Hệ thống này sẽ có các khả năng giải quyết các vấn đề như sau: • Khả năng xử lý dữ liệu liên tục, người dùng chỉ cần thực hiện truy vấn một lần và hệ thống lưu lại để xử lý cho các lần sau.

• Tính năng gửi dữ liệu định kì theo mong muốn tuần suất nhận thông báo của người dùng • Khả năng cho phép người dùng tùy chỉnh các điều kiện truy vấn trên luồng dữ liệu • Giao diện website giúp cho người dùng có thể xây dựng câu truy vấn một cách đơn giản, cấu hình và quan sát hệ thống một cách trực quan Sinh viên: Nguyễn Văn Tiến – 20173401 – Khóa 62 2 TIEU LUAN MOI download : skknchat123@gmail.com Mở rộng hơn, với các tính năng bên trên, hệ thống hướng đến theo dạng một dịch vụ có thể tích hợp vào bất kì hệ thống truy vấn nào để xử lý dữ liệu cho người dùng.2 Phạm vi đề tài Mặc dù hướng đến là một hệ thống tích hợp được với nhiều hệ thống xử lý, truy vấn dữ liệu khác, nhưng trong phạm vi đồ án này, hệ thống mới chỉ được tích hợp với dữ liệu của website yourway, bản thử cũng sử dụng dữ liệu thật của website này để thực hiện. Đồ án này được thực hiện bởi nhóm gồm có 2 sinh viên là Nguyễn Văn Tiến và Vũ Minh Hiếu. Phần việc cụ thể phân chia để xây dựng hệ thống được trình bày như bên dưới: Hệ thống Sinh viên Quản lý và xử lý dữ liệu Website tương tác người dùng Kết nối các luồng dữ liệu đầu vào Chức năng kết nối CSDL Tạo lược đồ luồng dữ liệu Chức năng thêm luồng dữ liệu Nguyễn Xử lý truy vấn trên các luồng dữ liệu Chức năng quản lý các luồng dữ Văn Tiến trong công việc Spark liệu 20173401 Chuẩn bị dữ liệu kết quả để gửi đến Chức năng quản lý công việc liên người dùng tục Quản lý các truy vấn Chức năng thêm truy vấn Vũ Minh Cấu hình hệ thống Chức năng quản lý truy vấn Hiếu Cấu trúc dữ liệu đầu vào Chức năng cấu hình hệ thống 20168683 Lập lịch xử lý kết quả truy vấn 1.3 Định hướng giải pháp Từ những vấn đề trong thực tế cuộc sống khi người tìm việc không thể liên tục truy cập các website tuyển dụng để thực hiện liên tục việc tìm kiếm một công việc phù hợp với bản thân nhiều ngày cũng như cập nhật các tin tuyển dụng một cách nhanh nhất. Để tăng tính thực tế và ứng dụng thực tiễn, đồ án tập trung phát triển hệ thống tổng hợp, xử lý và thông báo kết quả xử lý của dòng dữ liệu liên tục về công việc trên nền tảng hệ thống đã có sẵn của yourway.

Vì vậy nhóm em đã phát triển hệ thống giúp đỡ các người dùng có khả năng đưa ra yêu cầu tìm kiếm một lần và nhận lại theo lịch trình được định sẵn danh sách các kết quả theo yêu cầu tìm kiếm đó với các dữ liệu mới nhất. Từ đó giúp tích kiệm thời gian cho người dùng, tự động hóa khả năng nhận kết quả của người dùng theo hướng chủ động gửi kết quả đó tới từng thông tin liên lạc của người dùng. Sinh viên: Nguyễn Văn Tiến – 20173401 – Khóa 62 3 TIEU LUAN MOI download : skknchat123@gmail.com Để giải quyết các vấn đề trên, hệ thống tổng thể được chia thành 2 phần trong đồ án này là: • Hệ thống 1: Hệ thống website tương tác nhằm mục đích giúp người dùng dễ dàng hơn trong việc tương tác hệ thống • Hệ thống 2: Hệ thống quản lý, xử lý dữ liệu thực hiện nhiệm vụ chính liên quan đến dữ liệu và trả kết quả cho người dùng Về phần công nghệ, sinh viên sử dụng công nghệ: • Xử lý dữ liệu lớn: Apache Spark và Apache Kafka. o Apache Spark là một mã nguồn mở xử lý dữ liệu trên quy mô lớn.

Với khả năng tính toán song song, giao diện lập trình dễ dàng và khả năng chịu lỗi tốt, Apache Spark đang đi đầu trong xu hướng xử lý dữ liệu lớn. o Apache Kafka là một nền tảng truyền tải dữ liệu phân tán. Tốc độ và khả năng chịu lỗi của Apache Kafka đang dần thay thế cho hệ thống truyền tin truyền thống. • Hệ thống web: framework FastAPI và Angular o FastAPI là một khung làm việc xây dựng các RESTful API trên ngôn ngữ lập trình Python.

FastAPI là một công nghệ mới với những cải tiến để phát triển nhanh và dễ bảo trì hơn với các công nghệ đời cũ hơn. o Angular là một khung làm việc mạnh mẽ dùng để xây dựng giao diện website được phát triển bởi Google. • Cơ sở dữ liệu: MySQL – một trong những CSDL phổ biến nhất hiện nay. Kết quả thu được sau khi sinh viên thực hiện đồ án này là một hệ thống cảnh báo dữ liệu bằng công nghệ dữ liệu lớn.

Bên cạnh đó là những kiến thức thu được khi giải quyết bài toán.4 Bố cục đồ án Dựa vào các vấn đề tồn tại và hướng tiếp cận được đề xuất để giải quyết bài toán ở phần trước, các phần tiếp theo của đồ án tốt nghiệp này được tổ chức như sau: Chương 2. Cơ sở lý thuyết và công nghệ: đề cập đến các định nghĩa, giải thích lý thuyết các nên tảng phân tán cũng như xử lý dữ liệu lớn đồng thời cũng giới thiệu các công cụ sử dụng trong mã nguồn hệ thống. Chương này sẽ bao gồm 4 phần chính. Phần đầu sẽ trình bày các lý thuyết hệ thống phân tán, phần tiếp theo sẽ trình bày về nền tảng spark, đặc tả các chức năng, và phần cuối cùng sẽ trình bày về các yêu cầu phi chức năng của hệ thống.

Sinh viên: Nguyễn Văn Tiến – 20173401 – Khóa 62 4 TIEU LUAN MOI download : skknchat123@gmail.com Chương 3. Thiết kế và xây dựng hệ thống quản lý, xử lý dữ liệu: trình bày chi tiết về hệ thống ứng dụng, phân tích sâu hơn về từng mô-đun trong hệ thống qua kiến trúc cũng như công nghệ sử dụng. Xây dựng ứng dụng web tương tác người dùng: trình bày về giao diện với người dùng, giúp hệ thống tương tác dễ hơn với người dùng. Ngoài ra, chương này còn đề cập đến kết quả kiểm thử cũng như một vài đánh giá sơ bộ về hệ thống.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ