Tổng quan nghiên cứu

Trong kỷ nguyên số hóa giáo dục đại học, công tác truyền thông và tư vấn tuyển sinh đóng vai trò then chốt quyết định hiệu quả thu hút người học. Thực tế tại các cơ sở giáo dục như Trường Đại học Phan Thiết cho thấy, đội ngũ tư vấn trực tiếp chỉ làm việc 8 giờ mỗi ngày và 6 ngày trong tuần, trong khi nhu cầu tìm kiếm thông tin của học sinh và phụ huynh diễn ra liên tục 24/7. Hơn 70% các câu hỏi gửi về thường có nội dung lặp lại xoay quanh học phí, điều kiện xét tuyển và ngành đào tạo, dẫn đến tình trạng quá tải nguồn nhân lực và chậm trễ phản hồi, khiến khoảng 15% đến 20% thí sinh tiềm năng chuyển hướng sang các trường khác. Luận văn thạc sĩ chuyên ngành Công nghệ thông tin của tác giả Lê Văn Sáng, dưới sự hướng dẫn của Tiến sĩ Bùi Thị Thu Trang tại Trường Đại học Bà Rịa - Vũng Tàu, đã giải quyết triệt để bài toán trên thông qua việc phát triển hệ thống tư vấn tuyển sinh tự động UPT_BOT. Mục tiêu cụ thể của nghiên cứu là xây dựng trợ lý ảo thông minh ứng dụng nền tảng Rasa Framework, có khả năng giải đáp tự động toàn diện thông tin tuyển sinh năm 2022 và năm 2023 cho 16 ngành đào tạo đại học chính quy. Về mặt giá trị thực tiễn, giải pháp giúp tự động hóa 100% các truy vấn cơ bản, giảm trên 50% chi phí vận hành đội ngũ tư vấn ngoài giờ, đồng thời duy trì thời gian phản hồi tức thì dưới 2 giây cho hàng ngàn người dùng cùng lúc.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng trên nền tảng lý thuyết xử lý ngôn ngữ tự nhiên (Natural Language Processing - NLP), kết hợp chặt chẽ giữa hai phân hệ hiểu ngôn ngữ tự nhiên (NLU) và sinh ngôn ngữ tự nhiên (NLG). Về mô hình học sâu, luận văn khai thác cấu trúc mạng nơ-ron hồi quy RNN cùng biến thể tiên tiến mạng bộ nhớ dài-ngắn LSTM (Long Short-Term Memory) với kiến trúc 4 tầng gồm cổng quên (forget gate), cổng vào (input gate), cổng ra (output gate) và cổng trạng thái ô nhớ (cell state), kết hợp mạng đơn vị hồi quy cổng GRU để nắm bắt ngữ cảnh phụ thuộc xa trong câu thoại tiếng Việt. Hệ thống được triển khai trên nền tảng mã nguồn mở Rasa Framework - công nghệ đã đạt hơn 25 triệu lượt tải trên toàn cầu tính đến tháng 2 năm 2023. Kiến trúc Rasa vận hành thông qua sự phối hợp đồng bộ giữa 5 khái niệm cốt lõi: Ý định (Intent) đại diện cho mục đích của thí sinh, Thực thể (Entity) trích xuất dữ liệu cụ thể như tên ngành hay tổ hợp môn, Biến nhớ (Slots) lưu trữ trạng thái người dùng, Kịch bản hội thoại (Stories) dẫn dắt cuộc trò chuyện và Hành động (Actions) thực thi các tác vụ logic nghiệp vụ.

Phương pháp nghiên cứu

Nghiên cứu sử dụng phương pháp thực nghiệm kết hợp định lượng trên tập dữ liệu gồm 1.250 mẫu câu thoại được trích xuất trực tiếp từ Đề án tuyển sinh các năm 2022 và 2023 của Trường Đại học Phan Thiết. Cỡ mẫu này được phân bổ chi tiết thành 10 nhóm Intent chính và 6 lớp Entity trọng tâm bao phủ 16 ngành đào tạo. Phương pháp chọn mẫu có chủ đích (Purposive Sampling) được áp dụng nhằm thu thập toàn bộ các dạng câu hỏi thực tế có tần suất xuất hiện cao nhất từ các kênh tư vấn trực tiếp và mạng xã hội. Luận văn lựa chọn phương pháp phân tích học máy có giám sát (Supervised Learning) với bộ phân loại DIET kết hợp giải thuật học chuỗi, bởi phương pháp này mang lại khả năng phân loại ý định chính xác cao đối với văn bản tiếng Việt phi cấu trúc, đồng thời tối ưu hóa tài nguyên phần cứng và hoàn toàn độc lập với các dịch vụ đám mây trả phí. Toàn bộ quy trình từ thu thập dữ liệu, gắn nhãn, huấn luyện mô hình, kiểm thử và đánh giá được tiến hành chặt chẽ trong khung thời gian nghiên cứu từ năm 2020 đến tháng 9 năm 2023.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thực nghiệm mô hình UPT_BOT trên tập dữ liệu tuyển sinh thực tế đã mang lại nhiều kết quả vượt trội:

  • Mô hình đạt độ chính xác phân loại ý định tổng thể lên tới 92,4% và chỉ số F1-Score trung bình đạt 0,89 trên toàn bộ 10 nhóm Intent tuyển sinh chính.
  • Hệ thống xử lý xuất sắc các ý định phức tạp như tra cứu điều kiện xét tuyển học bạ và tra cứu chính sách học bổng với độ tin cậy dự đoán duy trì ổn định từ 88% đến 96%.
  • Tốc độ phản hồi trung bình của Chatbot đạt xấp xỉ 1,2 giây cho mỗi lượt tương tác, nhanh hơn 95% so với thời gian phản hồi thủ công thông thường của chuyên viên tư vấn (thường dao động từ 3 đến 15 phút).
  • Sau khi được huấn luyện lại bằng cách bổ sung thêm 200 mẫu câu biến thể có chứa thực thể chuyên biệt, tỷ lệ nhầm lẫn giữa ý định hỏi điều kiện xét tuyển chung và điều kiện xét tuyển bằng học bạ đã giảm mạnh từ 18,5% xuống còn dưới 3,2%.

Thảo luận kết quả

Sự thành công vượt bậc của mô hình bắt nguồn từ việc kết hợp hiệu quả giữa cơ chế trích xuất thực thể dựa trên ngữ cảnh và chính sách quản lý hội thoại MemoizationPolicy cùng FallbackPolicy trong Rasa Core. Khi đối mặt với các câu hỏi chưa từng xuất hiện trong tập huấn luyện, hệ thống vẫn duy trì khả năng nhận diện chính xác nhờ tầng biểu diễn từ vựng sâu. Dữ liệu thực nghiệm được trực quan hóa rõ nét thông qua Ma trận nhầm lẫn ý định (Intent Confusion Matrix - ICM), thể hiện cụ thể các giá trị True Positive (TP), False Positive (FP), True Negative (TN) và False Negative (FN), cho thấy sự phân tách ranh giới rõ ràng giữa các lớp ý định. Bên cạnh đó, biểu đồ cột đo lường độ tin cậy dự đoán và bảng tổng hợp hiệu năng đa lớp giúp chỉ ra chính xác những trường hợp người dùng nhập văn bản thiếu thông tin, từ đó kích hoạt cơ chế hỏi bổ sung thông qua Slot Filling. So với các hệ thống chatbot dựa trên quy tắc tĩnh truyền thống vốn chỉ đạt độ chính xác khoảng 68% đến 72%, UPT_BOT cho thấy sự vượt trội toàn diện về tính linh hoạt, khả năng hiểu ngôn ngữ tự nhiên và tính cá nhân hóa trong giao tiếp.

Đề xuất và khuyến nghị

Nhằm nâng cao hiệu quả vận hành và mở rộng khả năng ứng dụng của hệ thống trợ lý ảo tuyển sinh trong thực tế, các giải pháp và khuyến nghị chiến lược được đề xuất như sau:

  • Mở rộng tập ngữ liệu huấn luyện: Bổ sung từ 2.000 đến 3.000 mẫu câu thoại mới, bao gồm các chủ đề mở rộng như đời sống ký túc xá, hoạt động câu lạc bộ và học phí chi tiết từng học kỳ; mục tiêu nâng độ chính xác toàn diện lên mức 97% trong vòng 6 tháng tới do Trung tâm Công nghệ Thông tin phối hợp Ban Tuyển sinh triển khai.
  • Triển khai tích hợp đa kênh: Thiết lập cổng kết nối API đồng bộ Chatbot lên 3 nền tảng giao tiếp phổ biến nhất hiện nay gồm Cổng thông tin điện tử Nhà trường, Fanpage Facebook Messenger và Zalo Official Account; hướng tới phục vụ hơn 60.000 lượt thí sinh mỗi đợt tuyển sinh, hoàn thành trong quý 1 năm 2024 do Đội ngũ kỹ thuật phần mềm đảm nhiệm.
  • Thiết lập cơ chế chuyển giao chuyên viên: Tích hợp module chuyển tiếp hội thoại tự động (Human-handoff) cho đội ngũ tư vấn viên trực tiếp khi độ tin cậy của câu trả lời dưới ngưỡng 65%, bảo đảm thời gian tiếp quản cuộc gọi không quá 60 giây do Phòng Công tác Sinh viên phụ trách.
  • Kết nối cơ sở dữ liệu thời gian thực: Liên kết hệ thống Chatbot với Cơ sở dữ liệu tuyển sinh trực tuyến của Nhà trường để cho phép thí sinh tra cứu kết quả xét tuyển và tình trạng hồ sơ trực tiếp trong thời gian phản hồi dưới 1,5 giây, dự kiến hoàn thiện trong lộ trình 9 tháng.

Đối tượng nên tham khảo luận văn

Luận văn là tài liệu tham khảo giá trị cao, phục vụ thiết thực cho 4 nhóm đối tượng trọng tâm sau:

  • Cán bộ quản lý và chuyên viên tuyển sinh tại các cơ sở giáo dục đại học: Áp dụng quy trình xây dựng kịch bản tư vấn tự động để tối ưu hóa quy trình chăm sóc người học, giảm 40% chi phí truyền thông và tăng tỷ lệ chuyển đổi hồ sơ nhập học.
  • Giảng viên, nghiên cứu sinh và học viên cao học ngành Công nghệ thông tin: Khảo cứu mô hình kiến trúc mạng LSTM, GRU và cơ chế phân lớp ngôn ngữ tự nhiên trong tiếng Việt để phát triển các đề tài nghiên cứu chuyên sâu về Trí tuệ nhân tạo.
  • Kỹ sư phát triển phần mềm và AI Engineer: Khai thác chi tiết mã nguồn, phương pháp cấu hình pipeline Rasa NLU, Rasa Core và kỹ thuật tùy biến Action Server để ứng dụng phát triển chatbot doanh nghiệp đa lĩnh vực.
  • Ban giám hiệu và nhà hoạch định chiến lược giáo dục: Sử dụng nghiên cứu như một khung tham chiếu công nghệ đáng tin cậy để xây dựng lộ trình chuyển đổi số toàn diện cho đơn vị trong giai đoạn 2023 - 2030.

Câu hỏi thường gặp

1. Tại sao nghiên cứu lại ưu tiên lựa chọn Rasa Framework thay vì các nền tảng đám mây thương mại?

Rasa Framework là nền tảng mã nguồn mở hoàn toàn miễn phí, cho phép tùy biến sâu các tầng mạng nơ-ron và quản lý toàn bộ dữ liệu nội bộ mà không lo rò rỉ thông tin. Hơn nữa, Rasa không phát sinh chi phí duy trì hàng tháng theo số lượng tin nhắn như các dịch vụ trả phí của Google hay Amazon, giúp nhà trường tiết kiệm hàng trăm triệu đồng mỗi năm.

2. Hệ thống UPT_BOT xử lý hiện tượng trùng lặp hoặc nhập nhằng ý định câu hỏi bằng cách nào?

Chatbot giải quyết nhập nhằng thông qua việc kết hợp phân loại ý định với trích xuất thực thể và lưu trữ biến nhớ (Slots). Ví dụ, khi người dùng chỉ hỏi về điều kiện xét tuyển, bot sẽ kích hoạt hành động phản hồi điều kiện chung; nhưng khi phát hiện thực thể học bạ đi kèm, hệ thống lập tức chuyển hướng kịch bản sang nhánh xét tuyển học bạ chuyên biệt với độ chính xác đạt trên 94%.

3. Mạng bộ nhớ dài-ngắn LSTM đóng góp vai trò gì trong kiến trúc của Chatbot?

LSTM với cấu trúc 4 tầng gồm các cổng quên, cổng vào, cổng ra và ô nhớ trạng thái giúp mô hình ghi nhớ các từ khóa quan trọng xuất hiện ở đầu câu và liên kết ngữ cảnh qua nhiều lượt trao đổi. Điều này khắc phục triệt để nhược điểm triệt tiêu đạo hàm của mạng RNN truyền thống khi xử lý những câu hỏi tuyển sinh dài từ 20 đến 35 từ.

4. Hệ thống Chatbot có khả năng giải đáp thông tin cho bao nhiêu ngành học tại UPT?

UPT_BOT được trang bị cơ sở dữ liệu chi tiết cho toàn bộ 16 ngành đào tạo đại học chính quy của Trường Đại học Phan Thiết, tiêu biểu như Công nghệ thông tin, Quản trị kinh doanh, Luật kinh tế và Kỹ thuật ô tô. Hệ thống cung cấp đầy đủ thông tin về mã ngành, 4 tổ hợp môn xét tuyển, chỉ tiêu, mức học phí tín chỉ và chính sách học bổng.

5. Nhà trường cần chuẩn bị hạ tầng phần cứng như thế nào để triển khai hệ thống tương tự?

Hệ thống có thể vận hành mượt mà trên một máy chủ tiêu chuẩn trang bị chip xử lý 4 nhân, 8GB đến 16GB RAM và không bắt buộc phải có card đồ họa GPU rời trong giai đoạn phục vụ dưới 10.000 truy vấn mỗi ngày. Thời gian triển khai cài đặt môi trường và huấn luyện mô hình ban đầu chỉ mất khoảng 2 đến 4 giờ làm việc.

Kết luận

  • Luận văn đã nghiên cứu toàn diện và làm chủ công nghệ xử lý ngôn ngữ tự nhiên hiện đại với nền tảng Rasa Framework, mạng nơ-ron hồi quy RNN và LSTM.
  • Xây dựng thành công hệ thống Chatbot UPT_BOT phục vụ tư vấn tuyển sinh tự động 24/7 cho 16 ngành đào tạo tại Trường Đại học Phan Thiết với độ chính xác vượt 92%.
  • Chuẩn hóa bộ dữ liệu thực nghiệm gồm hơn 1.200 mẫu câu thoại tiếng Việt chuyên ngành tuyển sinh, tạo tiền đề vững chắc cho việc mở rộng tri thức số.
  • Cung cấp giải pháp công nghệ giúp tiết kiệm hơn 50% chi phí nhân sự tư vấn và nâng cao trải nghiệm tiếp cận thông tin tức thì cho hàng vạn thí sinh.
  • Đề xuất lộ trình nâng cấp 12 tháng hướng tới tích hợp mô hình ngôn ngữ lớn (LLM) và kết nối dữ liệu tuyển sinh trực tuyến thời gian thực.

Các cơ sở giáo dục đại học và viện nghiên cứu quan tâm có thể ứng dụng ngay mô hình này để nâng tầm chất lượng tuyển sinh trong kỷ nguyên số.