Giới thiệu dự án
Trong kỷ nguyên số hóa giáo dục đại học, công tác tuyển sinh đối mặt với áp lực tiếp nhận và xử lý hàng chục nghìn lượt truy vấn từ thí sinh và phụ huynh mỗi mùa tuyển sinh. Theo thống kê từ các trường đại học khối công nghệ, hơn 70% các thắc mắc tập trung vào các chủ đề lặp lại như phương thức xét tuyển, điểm sàn, học phí, học bổng và cơ hội việc làm. Tuy nhiên, đội ngũ tư vấn viên truyền thống bị giới hạn về thời gian làm việc (khung giờ hành chính) và năng lực xử lý đồng thời, dẫn đến tình trạng quá tải kênh liên lạc, phản hồi chậm trễ và giảm trải nghiệm tiếp cận thông tin của thí sinh.
Hệ thống chatbot tư vấn tuyển sinh đại học ứng dụng trí tuệ nhân tạo (AI) và xử lý ngôn ngữ tự nhiên (NLP) được nghiên cứu và phát triển bởi sinh viên Hoàng Xuân Vũ và Nguyễn Văn Tài thuộc Khoa Khoa học Máy tính, Trường Đại học Công nghệ Thông tin (UIT) - ĐHQG-HCM, dưới sự hướng dẫn của TS. Nguyễn Lưu Thùy Ngân và ThS. Đặng Văn Thìn. Dự án giải quyết trực tiếp bài toán tự động hóa phản hồi thông tin tuyển sinh 24/7 với độ chính xác cao, hỗ trợ xử lý linh hoạt tiếng Việt không dấu và duy trì ngữ cảnh hội thoại đa tầng.
+-----------------------------------+
| Thí sinh / Phụ huynh (User) |
+-----------------+-----------------+
| (Câu hỏi có/không dấu)
v
+-------------------------------------------------------------------+
| HỆ THỐNG CHATBOT TƯ VẤN TUYỂN SINH |
| |
| +--------------------+ +-------------------------------+ |
| | Module Tiền xử lý | -----> | Module Phục hồi dấu tiếng Việt| |
| | (Pyvi, Regex, Norm)| | (BiLSTM-4-grams, CER: 0.93%) | |
| +--------------------+ +---------------+---------------+ |
| | |
| +--------------------+ +---------------v---------------+ |
| | Bộ phân loại miền | <------+ Phân loại ý định chuyên sâu | |
| | (In/Out of Domain) | | (PhoBERT-base, F1: 97.68%) | |
| +---------+----------+ +---------------+---------------+ |
| | | |
| v v |
| +--------------------+ +-------------------------------+ |
| | Xử lý ngoài phạm vi| | Slot Filling & Quản lý hội thoại| |
| | (Fallback/Gợi ý) | | (Cấu trúc cây tri thức 10 nhóm)| |
| +--------------------+ +---------------+---------------+ |
+------------------------------------------------|------------------+
|
v
+------------------------------+
| Phản hồi chính xác 24/7 (API)|
+------------------------------+
Mục tiêu của dự án:
- Xây dựng bộ ngữ liệu chuẩn hóa phục vụ tư vấn tuyển sinh đại học với 4.511 mẫu câu hỏi, bao phủ 10 nhóm ý định chính dựa trên đề án tuyển sinh thực tế.
- Nghiên cứu, tối ưu hóa các mô hình học máy (Machine Learning) và học chuyển tiếp (Transfer Learning) cho bài toán Phân loại ý định (Intent Classification).
- Thiết kế và huấn luyện mô hình khôi phục dấu tiếng Việt (Diacritic Restoration) nhằm giải quyết thách thức người dùng nhập liệu không dấu trên môi trường chat.
- Xây dựng cơ chế quản lý hội thoại nâng cao: theo dõi ngữ cảnh (Conversation Tracking), đề xuất câu hỏi (Recommendation), hỏi lại để làm rõ (Asking Again) và chuyển tiếp tư vấn viên (Human Handover).
- Đóng gói giải pháp dưới dạng API dịch vụ và xây dựng ứng dụng web demo hoàn chỉnh có khả năng tích hợp đa nền tảng.
Phạm vi và giới hạn:
- Phạm vi dữ liệu: Toàn bộ thông tin tuyển sinh, chương trình đào tạo, chính sách ký túc xá, học phí và học bổng năm 2021-2022 của Trường Đại học Công nghệ Thông tin - ĐHQG-HCM.
- Giới hạn kỹ thuật: Hệ thống tập trung vào xử lý hội thoại dạng văn bản (text-based); các trường hợp truy vấn đa phương tiện (hình ảnh bảng điểm, giọng nói) hoặc các câu hỏi nằm ngoài cơ sở tri thức sẽ kích hoạt luồng xử lý ngoại lệ fallback hoặc chuyển tiếp chuyên viên.
Phân tích và thiết kế giải pháp
Phân tích hiện trạng
| Tiêu chí so sánh |
Chatbot dựa trên luật (Rule-based / Pattern Matching) |
Chatbot dựa trên nền tảng thương mại (Rasa / Dialogflow) |
Hệ thống đề xuất (Nghiên cứu UIT) |
| Cơ chế nhận diện |
So khớp chuỗi mẫu (Levenshtein, Regex, AIML) |
Học sâu tích hợp sẵn, DIET Classifier |
Tinh chỉnh mô hình ngôn ngữ tiếng Việt chuyên sâu (PhoBERT) |
| Xử lý tiếng Việt không dấu |
Kém, dựa hoàn toàn vào từ điển cứng (Vietpad, VietEditor) |
Hạn chế, cần dữ liệu tăng cường thủ công |
Mô hình chuyên biệt BiLSTM-4-grams (WER 3.95%, CER 0.93%) |
| Độ chính xác ý định |
60.0% - 85.0% (phụ thuộc độ khớp từ khóa) |
92.0% - 95.0% |
97.69% Accuracy / 97.68% F1-score |
| Khả năng duy trì ngữ cảnh |
Rất thấp, xử lý đơn lượt (Single-turn) |
Tốt, qua cấu hình Story/Rules phức tạp |
Cấu trúc cây phân cấp kết hợp Slot Filling & Tracking |
| Chi phí & Triển khai |
Thấp nhưng khó bảo trì quy tắc |
Chi phí bản quyền/hạ tầng cao |
Mã nguồn mở, đóng gói RESTful API linh hoạt |
Phân tích yêu cầu người dùng theo mô hình MoSCoW:
- Must have (Bắt buộc): Nhận diện chính xác 10 nhóm ý định tuyển sinh; tự động khôi phục dấu tiếng Việt; trích xuất thực thể theo dạng cây; phản hồi thông tin điểm sàn, ngành học, học phí.
- Should have (Nên có): Cơ chế hội thoại đa lượt (Multi-turn conversation); gợi ý câu hỏi liên quan; phân loại câu hỏi trong/ngoài miền tuyển sinh (In/Out-of-Domain).
- Could have (Có thể có): Giao diện web chat tương tác trực quan; tính năng tự động chuyển tiếp đoạn chat cho tư vấn viên khi độ tin cậy thấp.
- Won't have (Chưa thực hiện): Nhận diện giọng nói (Speech-to-Text); tự động cập nhật tri thức động qua cơ chế Unsupervised Learning trực tiếp trong phiên chạy.
Thiết kế hệ thống
Kiến trúc hệ thống được thiết kế theo mô hình dịch vụ module hóa (Modular Service-Oriented Architecture), bao gồm 4 tầng chức năng chính:
[Client Web Interface (HTML5/CSS3/JavaScript/REST Client)]
Ngăn xếp công nghệ (Technology Stack):
- Ngôn ngữ lập trình: Python 3.8+
- Framework học sâu: PyTorch 1.10+, HuggingFace Transformers 4.15+
- Thư viện NLP tiếng Việt:
pyvi v0.1.1, VnCoreNLP (RDRSegmenter)
- Mô hình cốt lõi:
vinai/phobert-base, xlm-roberta-base, Word2Vec (PhoW2V 20GB), BiLSTM
- Hệ cơ sở dữ liệu: SQLite / PostgreSQL 14
- Backend API & Web UI: Flask 2.0+ / FastAPI, HTML5, CSS3, JavaScript (Fetch API)
Thiết kế cơ sở dữ liệu và Cấu trúc tri thức:
Dữ liệu câu trả lời được mô hình hóa theo dạng cấu trúc cây phân cấp (Hierarchical Tree Structure). Nút gốc là Ý định (Intent), các nhánh trung gian là các Thực thể (Entities/Slots), và nút lá là Nội dung phản hồi (Answer).
- Ví dụ:
[Ý định: Hỏi đáp KTX] $\rightarrow$ [Thực thể: Giá phòng] $\rightarrow$ [Thực thể: Phòng 4 sinh viên] $\rightarrow$ [Thực thể: Máy lạnh] $\rightarrow$ Mẫu câu phản hồi chi tiết.
Phương pháp nghiên cứu (Methodology)
Dự án áp dụng quy trình phát triển lặp kết hợp khung phương pháp nghiên cứu thực nghiệm khoa học:
- Khảo sát & Thu thập ngữ liệu: Trích xuất thông tin từ đề án tuyển sinh chính thức của UIT, phân rã thành 229 câu hỏi/trả lời gốc; tăng cường dữ liệu chéo (Cross-annotation) lên 4.511 mẫu.
- Tiền xử lý & Trích xuất đặc trưng: Thử nghiệm TF-IDF, BoW, N-grams kết hợp nhãn từ loại (POS tagging) cho mô hình truyền thống; nhúng từ (Word Embeddings) với PhoW2V cho Deep Learning; Byte-Pair Encoding (BPE) cho Transformer.
- Thực nghiệm & Đánh giá mô hình: Áp dụng kỹ thuật kiểm định chéo $K\text{-fold}$ ($k=5$) để đánh giá độ hội tụ và tránh overfitting trên các tập dữ liệu Train/Validation/Test.
- Đóng gói & Tích hợp: Xây dựng luồng kết nối API và kiểm thử tích hợp toàn diện trên môi trường web.
Implementation và kết quả
Quy trình phát triển và Thuật toán cốt lõi
1. Tiền xử lý dữ liệu (Data Preprocessing Pipeline):
Dữ liệu đầu vào từ người dùng được xử lý qua 6 bước nghiêm ngặt:
- Chuẩn hóa khoảng trắng và ánh xạ từ viết tắt/từ đồng nghĩa (ví dụ: "khmt", "khoa học mt" $\rightarrow$ "khoa học máy tính").
- Khử nhiễu, loại bỏ ký tự đặc biệt, biểu tượng cảm xúc (emojis).
- Chuẩn hóa quy tắc chính tả tiếng Việt (ví dụ: "xoá" $\rightarrow$ "xóa", "huỹ" $\rightarrow$ "hủy").
- Loại bỏ từ lặp liên tiếp.
- Tách từ tiếng Việt bằng công cụ
Pyvi Vietnamese Toolkit:
import re
from pyvi import ViTokenizer, ViPosTagger
class TextPreprocessor:
def __init__(self):
self.abbreviations = {
r"\bkhmt\b": "khoa học máy tính",
r"\bktmt\b": "kỹ thuật máy tính",
r"\buit\b": "đại học công nghệ thông tin",
r"\bktx\b": "ký túc xá"
}
self.spelling_corrections = {
"xoá": "xóa",
"huỹ": "hủy",
"hoả": "hỏa"
}
def normalize(self, text: str) -> str:
text = text.lower().strip()
text = re.sub(r"[^\w\s\d]", " ", text)
for pattern, replacement in self.abbreviations.items():
text = re.sub(pattern, replacement, text)
for wrong, right in self.spelling_corrections.items():
text = text.replace(wrong, right)
text = re.sub(r"\s+", " ", text)
# Word Segmentation
segmented_text = ViTokenizer.tokenize(text)
return segmented_text
2. Mô hình phân loại ý định dựa trên PhoBERT:
PhoBERT áp dụng kiến trúc RoBERTa được huấn luyện trước trên 20GB văn bản tiếng Việt. Cơ chế Self-Attention tính toán ma trận trọng số ngữ cảnh hai chiều:
$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V$$
Mã nguồn triển khai tinh chỉnh (Fine-tuning) lớp phân loại ý định:
import torch
import torch.nn as nn
from transformers import AutoModel, AutoTokenizer
class PhoBERTIntentClassifier(nn.Module):
def __init__(self, num_classes: int = 10, dropout_rate: float = 0.2):
super(PhoBERTIntentClassifier, self).__init__()
self.phobert = AutoModel.from_pretrained("vinai/phobert-base")
self.dropout = nn.Dropout(dropout_rate)
self.classifier = nn.Linear(self.phobert.config.hidden_size, num_classes)
def forward(self, input_ids, attention_mask):
outputs = self.phobert(input_ids=input_ids, attention_mask=attention_mask)
# Sử dụng output của token [CLS] đại diện cho câu
cls_output = outputs[1]
pooled_output = self.dropout(cls_output)
logits = self.classifier(pooled_output)
return logits
3. Mô hình phục hồi dấu tiếng Việt BiLSTM-4-grams:
Mô hình hai chiều (Bidirectional LSTM) trích xuất ngữ cảnh quá khứ ($h_t^f$) và tương lai ($h_t^b$) của chuỗi ký tự/từ không dấu để dự đoán phân phối nhãn có dấu tương ứng:
$$h_t^f = \text{LSTM}(x_t, h_{t-1}^f), \quad h_t^b = \text{LSTM}(x_t, h_{t+1}^b), \quad y_t = \sigma(W_y \cdot [h_t^f \oplus h_t^b] + b_y)$$
Kiểm thử và Đánh giá thực nghiệm
Thực nghiệm được thiết lập trên tập dữ liệu tuyển sinh 4.511 câu hỏi cho 10 ý định: Hỏi đáp xét tuyển, Hỏi đáp điểm chuẩn, Hỏi đáp KTX, Hỏi đáp ngành, Hỏi đáp nghề nghiệp, Hỏi đáp tổ hợp, Hỏi đáp UIT, Thông tin chỉ tiêu, Hỏi đáp xe bus, Thông tin học bổng.
Phân bố F1-Score giữa các mô hình phân loại ý định (%)
Naive SVM CNN XLM-R PhoBERT
Bayes (TF-IDF) (PhoW2V)
1. Kết quả thực nghiệm bài toán Phân loại ý định:
| Nhóm mô hình |
Kiến trúc chi tiết |
Độ chính xác (Accuracy) |
F1-Score (Macro) |
| Machine Learning |
Naive Bayes (BoW + N-grams) |
81.50% |
81.35% |
|
SVM (TF-IDF + POS Tagging) |
84.25% |
84.12% |
|
Feedforward Neural Network (FNN) |
85.10% |
84.95% |
| Deep Learning |
CNN (Filter: 64, Kernels: 2,3 + PhoW2V) |
89.80% |
89.65% |
|
LSTM (256 units, Dropout: 0.2) |
88.40% |
88.15% |
| Transfer Learning |
XLM-RoBERTa (xlm-roberta-base) |
93.60% |
93.42% |
|
PhoBERT (phobert-base) |
97.69% |
97.68% |
2. Kết quả thực nghiệm bài toán Khôi phục dấu tiếng Việt:
| Mô hình |
Tỉ lệ lỗi từ (WER) |
Tỉ lệ lỗi ký tự (CER) |
Thời gian xử lý / câu (Latency) |
Đánh giá khả năng áp dụng |
| LSTM cơ bản |
6.82% |
1.85% |
0.52 giây |
Tốc độ nhanh, độ chính xác trung bình |
| BiLSTM-4-grams |
3.95% |
0.93% |
0.58 giây |
Tối ưu toàn diện (Chọn triển khai) |
| Transformer Base |
4.10% |
1.05% |
7.24 giây |
Độ chính xác tốt nhưng độ trễ quá cao |
Đổi mới và đóng góp
- Giải quyết triệt để rào cản gõ tiếng Việt không dấu: Tích hợp mô hình
BiLSTM-4-grams chuyên biệt cho dữ liệu tuyển sinh, giảm thiểu tỉ lệ lỗi ký tự xuống 0.93% với thời gian xử lý chỉ 0.58s, tối ưu hóa trải nghiệm người dùng trên thiết bị di động mà không làm nghẽn luồng xử lý.
- Ứng dụng hiệu quả mô hình ngôn ngữ đơn ngữ chuyên sâu: Khẳng định sự vượt trội của PhoBERT so với mô hình đa ngôn ngữ XLM-R (vượt trội +4.26% F1-score) và các mô hình học sâu truyền thống (+8.03% F1-score so với CNN).
- Cơ chế quản lý ngữ cảnh thông minh (Smart Dialogue Management): Không chỉ phân loại ý định độc lập, hệ thống kết hợp cơ chế Slot Filling dạng cây, hỗ trợ đắc lực các tình huống giao tiếp thực tế:
- Hỏi lại (Asking Again): Tự động yêu cầu bổ sung thông tin khi thiếu thực thể.
- Theo dõi ngữ cảnh (Conversation Tracking): Kế thừa thực thể từ các lượt chat trước.
- Phân loại miền kép (Domain Filtering): Nhận diện và xử lý an toàn các câu hỏi ngoài phạm vi.
- Công bố khoa học uy tín: Công trình được bình duyệt và báo cáo tại Hội nghị Khoa học Trẻ và Nghiên cứu sinh năm 2022 do Trường Đại học Công nghệ Thông tin tổ chức với bài báo khoa học mang tên: "Nghiên cứu các phương pháp tiếp cận cho bài toán phân lớp ý định trong hệ thống Chatbot".
Ứng dụng thực tế và triển khai
+-------------------------------------------------------------------------+
| KIẾN TRÚC TRIỂN KHAI PRODUCTION |
| |
| [Thí sinh truy cập Web/App] |
| [Nginx Reverse Proxy & SSL Termination] |
| [Gunicorn WSGI / Uvicorn ASGI Server] (4 Workers) |
| [FastAPI / Flask Microservice] |
+-------------------------------------------------------------------------+
Kịch bản ứng dụng thực tế:
- Tư vấn trực tuyến tự động: Nhúng trực tiếp vào Cổng thông tin tuyển sinh của UIT và Fanpage chính thức, tiếp nhận và phản hồi ngay lập tức hàng nghìn yêu cầu cùng lúc.
- Khai phá dữ liệu tuyển sinh (Admissions Data Analytics): Cơ sở dữ liệu ghi vết lịch sử chat cung cấp thông tin thống kê về các ngành học được quan tâm nhất, các thắc mắc phổ biến về học phí, giúp Ban Giám hiệu và Phòng Tuyển sinh điều chỉnh chiến lược truyền thông kịp thời.
Kế hoạch và Lộ trình triển khai:
- Giai đoạn 1 (Tháng 1 - 2): Chuẩn hóa và làm sạch bộ dữ liệu tuyển sinh hàng năm.
- Giai đoạn 2 (Tháng 3 - 4): Đào tạo mô hình PhoBERT và BiLSTM trên máy chủ GPU; xây dựng API Core.
- Giai đoạn 3 (Tháng 5): Thử nghiệm nội bộ (Alpha Testing) với ban tư vấn tuyển sinh và 500 sinh viên.
- Giai đoạn 4 (Tháng 6 - 8): Triển khai chính thức phục vụ mùa tuyển sinh đại học quốc gia.
Hạn chế và hướng phát triển
Hạn chế kỹ thuật:
- Thời gian suy diễn của mô hình Transformer phức tạp: Mô hình Transformer chuẩn cho bài toán thêm dấu đạt độ chính xác câu 77.24% nhưng độ trễ 7.24s/câu là rào cản lớn khi lượng truy cập đồng thời tăng cao.
- Tính tĩnh của cơ sở tri thức: Khi đề án tuyển sinh cập nhật chỉ tiêu hoặc ngành mới, hệ thống cần gán nhãn bổ sung và tái huấn luyện (Retrain) lớp phân loại.
- Ngữ cảnh dài hạn: Hệ thống xử lý xuất sắc hội thoại 2-4 lượt nhưng độ chính xác giảm dần đối với các phiên hội thoại phức tạp trên 8 lượt chuyển đổi chủ đề liên tục.
Hướng phát triển trong tương lai:
- Nghiên cứu áp dụng kỹ thuật Nén mô hình (Knowledge Distillation) hoặc Lượng tử hóa (Quantization) để đưa PhoBERT về dạng tối ưu (Distil-PhoBERT), giảm dung lượng và tăng tốc độ suy luận.
- Tích hợp công nghệ Tạo sinh tăng cường truy xuất (Retrieval-Augmented Generation - RAG) kết hợp Large Language Models (LLM) tiếng Việt để tự động trích xuất câu trả lời trực tiếp từ tài liệu PDF tuyển sinh mà không cần thiết kế cây tri thức thủ công.
- Mở rộng khả năng nhận dạng thực thể tên riêng (Named Entity Recognition - NER) kết hợp nhận diện giọng nói (Voicebot) để triển khai trên các kiosk tư vấn trực tiếp tại trường.
Đối tượng hưởng lợi
- Thí sinh và Phụ huynh: Nhận phản hồi chính xác, tức thì 24/7; dễ dàng tra cứu mọi thông tin dù gõ tiếng Việt có dấu hay không dấu; loại bỏ hoàn toàn thời gian chờ đợi.
- Nhà trường & Ban Tuyển sinh: Tiết kiệm hơn 70% chi phí nhân sự trực tổng đài; tự động hóa việc lọc và phân loại nhu cầu; nắm bắt xu hướng quan tâm của thí sinh qua hệ thống Dashboard báo cáo.
- Lập trình viên & Kỹ sư AI: Tiếp cận kiến trúc chuẩn kết hợp giữa mô hình Transformer hiện đại (PhoBERT) và mô hình hồi quy (BiLSTM); tham khảo mã nguồn tiền xử lý tiếng Việt và kỹ thuật quản lý hội thoại theo cây.
- Cộng đồng Nghiên cứu NLP tiếng Việt: Cung cấp tài liệu tham khảo thực nghiệm giá trị về các bài toán Intent Classification và Diacritic Restoration trên tập dữ liệu chuyên ngành đặc thù.
Câu hỏi thường gặp
1. Hệ thống cần cấu hình phần cứng tối thiểu nào để triển khai?
Để phục vụ môi trường Production xử lý 50-100 requests/giây:
- CPU: Tối thiểu 4 Cores (Intel Xeon hoặc AMD EPYC).
- RAM: Tối thiểu 8 GB (khuyến nghị 16 GB để nạp mô hình PhoBERT và BiLSTM vào bộ nhớ).
- GPU: Khuyến nghị NVIDIA T4 hoặc RTX 3060 (nếu chạy suy luận thuần CPU, độ trễ sẽ dao động trong khoảng 150ms - 300ms/yêu cầu).
- Lưu trữ: 20 GB SSD khả dụng.
2. Mô hình xử lý như thế nào khi người dùng nhập câu hỏi sai chính tả hoặc tiếng lóng (Teencode)?
Hệ thống tích hợp module tiền xử lý mạnh mẽ với từ điển ánh xạ viết tắt tiếng Việt chuyên sâu, bộ chuẩn hóa chính tả và công cụ phân đoạn từ Pyvi. Những lỗi sai chính tả phổ biến (huỹ $\rightarrow$ hủy, khoa hoc mt $\rightarrow$ khoa học máy tính) đều được tự động chuẩn hóa về dạng chuẩn trước khi đưa vào mô hình phân loại.
3. Làm thế nào để tích hợp Chatbot vào website hoặc Fanpage của trường?
Hệ thống cung cấp sẵn chuẩn giao tiếp RESTful API:
- Endpoint tiếp nhận:
POST /api/v1/chat với định dạng JSON: {"session_id": "string", "message": "string"}.
- Dữ liệu trả về:
{"response": "string", "intent": "string", "confidence": float, "suggestions": list}.
Nhờ đó, lập trình viên có thể dễ dàng nhúng vào giao diện Web qua thẻ iframe/Widget JavaScript, hoặc liên kết với Webhook của Facebook Messenger Platform, Zalo Official Account.
4. Chi phí vận hành hệ thống và thời gian hoàn vốn (ROI) ước tính ra sao?
- Chi phí hạ tầng: Thuê Cloud VPS (4 vCPU, 8GB RAM) dao động từ 500.000 - 1.000.000 VNĐ/tháng.
- Hiệu quả kinh tế: Thay thế trung bình 3-5 nhân sự trực ca đêm và cuối tuần trong giai đoạn cao điểm 3 tháng tuyển sinh (tiết kiệm khoảng 40.000.000 - 60.000.000 VNĐ/mùa tuyển sinh). Thời gian hoàn vốn đầu tư công nghệ ước tính dưới 6 tháng.
5. Dữ liệu tuyển sinh thay đổi theo từng năm thì việc cập nhật có phức tạp không?
Hệ thống được thiết kế tách biệt hoàn toàn giữa Tầng Mô hình Phân loại (Model Engine) và Tầng Cơ sở Tri thức (Knowledge Base):
- Đối với việc thay đổi thông tin chi tiết (điểm chuẩn, học phí, chỉ tiêu): Chỉ cần cập nhật trực tiếp trong bảng dữ liệu hoặc cây tri thức mà không cần huấn luyện lại mô hình PhoBERT.
- Đối với việc thêm các nhóm ngành mới: Tiến hành gán nhãn bổ sung khoảng 50-100 mẫu câu cho ý định mới và thực hiện fine-tune lại lớp phân loại trong khoảng 1-2 giờ trên GPU.
Kết luận
Đồ án tốt nghiệp "Xây dựng hệ thống chatbot hỗ trợ tư vấn tuyển sinh đại học" của sinh viên Hoàng Xuân Vũ và Nguyễn Văn Tài đã giải quyết trọn vẹn và chuyên sâu bài toán tự động hóa giao tiếp trong lĩnh vực giáo dục đại học. Bằng việc kết hợp sáng tạo giữa mô hình ngôn ngữ tiên tiến PhoBERT (đạt độ chính xác ấn tượng 97.69%) và mạng BiLSTM-4-grams khôi phục dấu tiếng Việt (tỉ lệ lỗi ký tự chỉ 0.93%), hệ thống đã chứng minh tính khả thi, độ tin cậy và giá trị ứng dụng thực tiễn vượt trội. Công trình không chỉ đóng góp một bài báo khoa học chất lượng tại Hội nghị Khoa học Trẻ UIT 2022 mà còn mang lại giải pháp công nghệ sẵn sàng triển khai, góp phần thúc đẩy chuyển đổi số toàn diện trong công tác tuyển sinh đại học hiện đại.