Tổng quan nghiên cứu

Trong kỷ nguyên chuyển đổi số chuỗi cung ứng, hệ thống Quản lý Kho mở rộng (SAP Extended Warehouse Management - SAP EWM) đóng vai trò then chốt tại các tập đoàn đa quốc gia nhờ khả năng điều phối đồng thời hàng trăm kho hàng và hàng nghìn vị trí lưu trữ phức tạp. Tuy nhiên, theo khảo sát thực tế tại các trung tâm phân phối, thời gian đào tạo một nhân viên kho đạt năng suất tiêu chuẩn kéo dài từ 2 đến 4 tuần, trong khi chuyên viên tư vấn cấu hình cần từ 6 đến 12 tháng để làm chủ toàn bộ quy trình. Rào cản lớn nhất nằm ở khối lượng tài liệu kỹ thuật khổng lồ, phân mảnh trên nhiều cổng thông tin và chủ yếu được biên soạn bằng tiếng Anh chuyên ngành, dẫn đến thời gian xử lý sự cố hỗ trợ cấp độ 1 thường bị kéo dài từ nhiều giờ đến nhiều ngày.

Nghiên cứu tập trung giải quyết bài toán tối ưu hóa quy trình tra cứu tri thức và hỗ trợ vận hành SAP EWM bằng cách xây dựng một Tác nhân Trí tuệ Nhân tạo (AI Agent) tích hợp kỹ thuật Tạo sinh tăng cường truy xuất (Retrieval-Augmented Generation - RAG). Mục tiêu cụ thể của đề tài là xây dựng thành công bản mẫu trợ lý ảo có khả năng tự động phản hồi các truy vấn nghiệp vụ bằng tiếng Việt với thời gian phản hồi trung bình dưới 10 giây và đạt độ chính xác trên 85%.

Phạm vi nghiên cứu được thực hiện trong khuôn khổ chương trình đào tạo Thạc sĩ Hệ thống Thông tin Quản lý tại Trường Đại học Ngân hàng TP. Hồ Chí Minh giai đoạn 2024–2026, kết hợp dữ liệu thực nghiệm và khảo sát nghiệp vụ tại Công ty Zuellig Pharma Việt Nam. Đề tài mang ý nghĩa thực tiễn sâu sắc khi giúp doanh nghiệp cắt giảm hơn 60% thời gian chờ đợi hỗ trợ kỹ thuật, tối ưu hóa chi phí vận hành hạ tầng chỉ còn khoảng 30 đến 50 USD mỗi tháng và tạo tiền đề vững chắc cho việc tự động hóa hỗ trợ người dùng ERP.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu xây dựng trên nền tảng phương pháp luận Vòng đời Phát triển Hệ thống (Systems Development Life Cycle - SDLC) gồm 7 giai đoạn kinh điển được đúc kết bởi Kenneth E. Kendall và Julie E. Kendall, giúp kiểm soát chặt chẽ từ khâu xác định nhu cầu, phân tích nghiệp vụ, thiết kế kiến trúc cho đến triển khai và kiểm thử.

Về mặt công nghệ AI, đề tài ứng dụng kiến trúc RAG theo đề xuất của Lewis và cộng sự nhằm khắc phục triệt để ba giới hạn cố hữu của Mô hình Ngôn ngữ Lớn (LLM) thuần túy: hiện tượng ảo giác thông tin, giới hạn tri thức đóng băng theo thời gian và sự thiếu hụt dữ liệu chuyên ngành đặc thù. Cơ chế điều phối tác nhân dựa trên khung ReAct (Reasoning and Acting) của Yao và cộng sự, kết hợp công cụ LangGraph để quản lý luồng trạng thái có cấu trúc (StateGraph).

Các khái niệm nền tảng bao gồm: không gian vector nhúng ngữ nghĩa đa ngôn ngữ 384 chiều, khoảng cách Euclid (L2) trong cơ sở dữ liệu vector FAISS, cơ chế viết lại truy vấn (Query Rewriting) và giao thức suy luận đa lớp ULTRATHINK giúp định hình tư duy mô hình GPT-4o-mini trước khi sinh văn bản phản hồi.

Phương pháp nghiên cứu

Nguồn dữ liệu của đề án được hợp nhất từ 3 phân tầng tri thức: tài liệu tiêu chuẩn chính thức của SAP (SAP Help Portal, Knowledge Base Articles - KBA), tài liệu kinh nghiệm thực hành tốt nhất từ chuyên gia tư vấn (Consultant Best Practices), và các quy trình vận hành chuẩn (SOP) đặc thù của doanh nghiệp. Dữ liệu văn bản thô được xử lý qua pipeline phân đoạn với kích thước 500 ký tự và độ chồng lấp 50 ký tự nhằm bảo toàn ngữ cảnh liền mạch.

Về phương pháp phân tích và đánh giá, nghiên cứu thiết lập bộ kiểm thử chuẩn gồm 36 câu hỏi nghiệp vụ phân bổ đều qua 7 nhóm tiêu chí chuyên sâu (từ cấu hình nhập/xuất kho POSC đến xử lý mã lỗi giao dịch). Cỡ mẫu 36 câu hỏi được chọn theo phương pháp chọn mẫu phân tầng có chủ đích (Purposive Stratified Sampling), bao phủ đầy đủ các tác vụ của 3 nhóm người dùng: nhân viên kho, chuyên viên IT Helpdesk và chuyên gia tư vấn triển khai.

Lý do lựa chọn phương pháp đánh giá lai (Hybrid Evaluation) là nhằm đảm bảo tính khách quan tuyệt đối: kết hợp đo lường định lượng tự động bằng khung RAGAS (LLM-as-a-judge) với đánh giá định tính qua thẩm định mù (Blind Review) trên thang đo Likert bởi đội ngũ chuyên gia SAP EWM có trên 5 năm kinh nghiệm. Tiến độ nghiên cứu được hoàn thành nghiêm ngặt trong 14 tuần, bao gồm 3 tuần thu thập dữ liệu, 3 tuần xây dựng cơ sở dữ liệu vector, 3 tuần phát triển RAG, 3 tuần hoàn thiện luồng tác nhân LangGraph và 2 tuần tích hợp giao diện Telegram Bot cùng triển khai thực nghiệm.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình kiểm thử thực nghiệm trên hệ thống Tác nhân AI hỗ trợ SAP EWM đã ghi nhận những kết quả định lượng và định tính vượt trội so với các chỉ tiêu ban đầu:

Thứ nhất, theo khung đánh giá tự động RAGAS với mô hình giám sát độc lập, hệ thống đạt chỉ số Tính trung thực (Faithfulness) là 0,814 (tương đương 81,4%) và Độ liên quan của câu trả lời (Answer Relevance) đạt 0,908 (tương đương 90,8%). Điều này chứng minh tác nhân AI đã neo chặt câu trả lời vào dữ liệu ngữ cảnh được truy xuất, giảm thiểu tối đa hiện tượng bịa đặt thông tin kỹ thuật.

Thứ hai, thời gian phản hồi trung bình của hệ thống đạt 5,5 giây cho mỗi truy vấn phức tạp, nhanh hơn 45% so với ngưỡng yêu cầu tối đa 10 giây đặt ra ban đầu. Khi so sánh với mô hình Zero-shot LLM thông thường, tốc độ xử lý của pipeline LangGraph kết hợp FAISS vẫn duy trì độ ổn định cao ngay cả với các câu hỏi đa tầng ngữ cảnh.

Thứ ba, kết quả thẩm định mù định tính từ các chuyên gia SAP EWM ghi nhận điểm số hài lòng trung bình đạt mức 3,8 trên thang điểm 5,0. Đặc biệt, tiêu chí trích dẫn nguồn minh bạch (đính kèm chính xác tên tài liệu và số trang tham chiếu) đạt tỷ lệ hài lòng trên 92%, giúp người dùng kiểm chứng ngay lập tức trên hệ thống SAP thực tế.

Thứ tư, hệ thống thể hiện khả năng lọc nhiễu xuất sắc khi thiết lập ngưỡng tương đồng ngữ nghĩa 0,7, từ chối chính xác 100% các câu hỏi nằm ngoài phạm vi tri thức SAP EWM một cách lịch sự, không gây hiểu nhầm cho người vận hành.

Thảo luận kết quả

Khi biểu diễn dữ liệu thời gian phản hồi qua biểu đồ phân phối độ trễ, luồng xử lý tuần tự (Rewrite -> Retrieve -> Generate) thể hiện tính ổn định vượt trội so với các kiến trúc thử nghiệm có chứa vòng lặp phản hồi phức tạp. Bảng tổng hợp đối sánh giữa các giải pháp công nghệ cho thấy việc sử dụng mô hình nhúng cục bộ paraphrase-multilingual-MiniLM-L12-v2 giúp triệt tiêu chi phí gọi API nhúng ngoài, đồng thời giữ mức tiêu thụ bộ nhớ RAM của FAISS dưới 512 MB trên máy chủ ảo VPS tiêu chuẩn.

Nguyên nhân chính giúp hệ thống đạt độ chính xác cao là nhờ sự kết hợp giữa bước viết lại truy vấn (Query Rewriting) và giao thức tư duy ULTRATHINK. Kỹ thuật viết lại câu hỏi đã bổ sung các từ viết tắt chuyên ngành (như POSC, WOCR, T-code /SCWM/MON) trước khi truy xuất, giúp nâng cao độ phủ ngữ cảnh (Context Recall) lên hơn 25% so với phương pháp tìm kiếm từ khóa BM25 truyền thống.

So với các nghiên cứu RAG doanh nghiệp trước đây vốn phụ thuộc vào mô hình nhúng thương mại đắt đỏ, đề án đã chứng minh rằng một cấu hình mã nguồn mở tối ưu hoàn toàn có thể đạt hiệu năng tương đương, giúp doanh nghiệp tiết kiệm hàng nghìn USD chi phí bản quyền hàng năm mà vẫn bảo mật tuyệt đối dữ liệu nội bộ.

Đề xuất và khuyến nghị

Dựa trên kết quả thực nghiệm của đề án, 4 nhóm giải pháp chiến lược được đề xuất nhằm tối ưu hóa và ứng dụng rộng rãi công nghệ AI Agent trong doanh nghiệp:

Thứ nhất, nâng cấp tầng truy xuất thông tin bằng cách tích hợp mô hình xếp hạng lại (Cross-Encoder Reranker) như BAAI/bge-reranker-v2 trong vòng 6 tháng tới. Mục tiêu của giải pháp này là lọc từ 20 đoạn văn bản trích xuất ban đầu xuống còn 5 đoạn tối ưu nhất, giúp tăng chỉ số Context Precision lên mức trên 90% và giảm thiểu độ dài ngữ cảnh gửi đến mô hình ngôn ngữ lớn. Chủ thể thực hiện là đội ngũ kỹ sư AI phối hợp cùng chuyên viên giải pháp dữ liệu.

Thứ hai, tự động hóa quy trình làm giàu cơ sở tri thức (Automated Ingestion Pipeline) định kỳ hàng tuần. Doanh nghiệp cần xây dựng công cụ quét tự động các tài liệu SAP Notes, KBA mới và quy trình SOP sửa đổi từ cổng SharePoint nội bộ, thực hiện phân đoạn và cập nhật chỉ mục vector FAISS mà không làm gián đoạn hệ thống đang vận hành. Thời gian triển khai dự kiến trong 3 tháng, do phòng IT và Quản trị hệ thống ERP chủ trì.

Thứ ba, chuyển đổi kiến trúc luồng xử lý từ tuần tự sang RAG hiệu chỉnh (Corrective RAG - CRAG) trước quý 4/2026. Giải pháp này bổ sung nút đánh giá chất lượng tài liệu trích xuất theo thời gian thực; nếu độ tin cậy dưới ngưỡng 0,7, hệ thống sẽ tự động kích hoạt truy vấn bổ sung hoặc chuyển hướng cuộc gọi hỗ trợ sang chuyên viên trực ca.

Thứ tư, mở rộng phạm vi áp dụng bản mẫu Proof of Concept (PoC) sang các phân hệ ERP cốt lõi khác như Quản lý Vật tư (SAP MM), Bán hàng & Phân phối (SAP SD) và Tài chính Kế toán (SAP FICO) trong giai đoạn 2026–2027. Ban Lãnh đạo Chuyển đổi số doanh nghiệp cần đóng vai trò điều phối chính để chuẩn hóa kho dữ liệu liên phòng ban.

Đối tượng nên tham khảo luận văn

Công trình nghiên cứu mang giá trị học thuật và ứng dụng thực tiễn cao, là tài liệu tham khảo đắc lực cho 4 nhóm đối tượng:

  1. Học viên cao học và Nhà nghiên cứu chuyên ngành Hệ thống Thông tin Quản lý (MIS), Khoa học Dữ liệu: Tài liệu cung cấp bức tranh toàn diện về phương pháp luận SDLC kết hợp công nghệ AI Agent hiện đại, đi kèm khung đánh giá RAGAS chi tiết làm cơ sở phát triển các đề tài nghiên cứu liên quan đến AI ứng dụng trong doanh nghiệp.
  2. Chuyên viên tư vấn và Kỹ sư giải pháp SAP ERP: Luận văn đóng vai trò như một cẩm nang kỹ thuật chuyên sâu về cấu trúc quy trình, tài liệu cấu hình IMG và mã lỗi vận hành thực tế trong phân hệ SAP EWM, giúp rút ngắn thời gian tra cứu và xử lý sự cố tại các dự án triển khai.
  3. Đội ngũ Kỹ sư Trí tuệ Nhân tạo (AI Engineers) và Phát triển Phần mềm: Cung cấp chi tiết thiết kế kiến trúc phân tầng, mã nguồn mẫu về StateGraph với LangGraph, kỹ thuật quản lý bộ nhớ vector bằng FAISS và kinh nghiệm tối ưu hóa System Prompt đa lớp cho giao diện Telegram Bot.
  4. Giám đốc Công nghệ (CTO), Trưởng phòng Chuyển đổi số và Quản lý Kho vận (Supply Chain Managers): Nghiên cứu cung cấp bài toán kinh tế - kỹ thuật rõ ràng, chứng minh tính khả thi khi triển khai giải pháp trợ lý ảo AI nội bộ với chi phí vận hành thấp, bảo mật cao và hiệu quả hoàn vốn nhanh chóng.

Câu hỏi thường gặp

1. Hệ thống AI Agent xử lý rào cản ngôn ngữ giữa tài liệu tiếng Anh và truy vấn tiếng Việt như thế nào?
Hệ thống sử dụng mô hình nhúng đa ngôn ngữ paraphrase-multilingual-MiniLM-L12-v2 ánh xạ câu hỏi tiếng Việt và tài liệu tiếng Anh vào cùng không gian vector 384 chiều. Sau đó, GPT-4o-mini thực hiện tổng hợp ngữ cảnh và phản hồi bằng tiếng Việt tự nhiên, nhưng vẫn giữ nguyên vẹn các thuật ngữ kỹ thuật chuẩn mực của SAP.

2. Kỹ thuật RAG vượt trội hơn phương pháp Fine-tuning (tinh chỉnh mô hình) trong bài toán này ở điểm nào?
RAG vượt trội hoàn toàn ở ba khía cạnh: chi phí vận hành cực thấp (khoảng 30–50 USD/tháng so với hàng nghìn USD duy trì máy chủ GPU huấn luyện), khả năng cập nhật tài liệu tức thì chỉ bằng cách nạp file vào kho vector, và khả năng trích dẫn chính xác số trang tài liệu để người dùng kiểm chứng.

3. Thời gian phản hồi 5,5 giây có đáp ứng tốt yêu cầu hỗ trợ vận hành kho theo thời gian thực không?
Có. Trong môi trường trung tâm phân phối, thời gian 5,5 giây là mức lý tưởng cho các câu hỏi tra cứu cấu hình và giải thích mã lỗi phức tạp. Hệ thống còn tích hợp chỉ báo trạng thái đang xử lý (typing indicator) trên Telegram Bot, giúp người dùng duy trì trải nghiệm tương tác liên tục và mượt mà.

4. Làm thế nào hệ thống kiểm soát và triệt tiêu hiện tượng ảo giác (hallucination) của mô hình AI?
Hệ thống kiểm soát ảo giác qua 3 lớp phòng vệ: thiết lập ngưỡng tương đồng vector 0,7 để loại bỏ dữ liệu rác, áp dụng giao thức tư duy ULTRATHINK buộc mô hình chỉ suy luận dựa trên bằng chứng trích xuất, và cài đặt luật phủ định từ chối trả lời nếu ngữ cảnh không chứa thông tin cần thiết.

5. Kiến trúc của đề án có thể mở rộng tích hợp trực tiếp vào hệ thống SAP đang chạy thực tế không?
Hoàn toàn khả thi. Mặc dù đề tài giới hạn ở bản mẫu ngoại tuyến để đảm bảo an toàn dữ liệu, kiến trúc phân tầng qua FastAPI cho phép dễ dàng tích hợp thêm các cổng kết nối SAP RFC hoặc OData Services trong tương lai nhằm tra cứu trực tiếp trạng thái đơn hàng và tồn kho thời gian thực.

Kết luận

  • Đề án đã giải quyết thành công điểm nghẽn trong vận hành SAP EWM bằng cách xây dựng hoàn chỉnh Tác nhân AI tích hợp kỹ thuật RAG trên nền tảng LangGraph và cơ sở dữ liệu vector FAISS.
  • Hệ thống đạt hiệu năng thực nghiệm ấn tượng với chỉ số Tính trung thực 0,814, Độ liên quan câu trả lời 0,908, thời gian phản hồi trung bình chỉ 5,5 giây và điểm đánh giá chuyên gia đạt 3,8/5,0.
  • Nghiên cứu đóng góp một phương pháp luận đánh giá lai (Hybrid Evaluation) chuẩn mực, kết hợp giữa đo lường tự động RAGAS và thẩm định mù từ chuyên gia nghiệp vụ ERP.
  • Lộ trình phát triển tiếp theo bao gồm tích hợp tầng Cross-Encoder Reranker, hoàn thiện quy trình nạp dữ liệu tự động và mở rộng sang các phân hệ SAP S/4HANA cốt lõi trong giai đoạn 2026–2027.
  • Khám phá toàn bộ kiến trúc giải pháp, quy trình thiết kế prompt và bộ dữ liệu kiểm thử 36 kịch bản chuyên sâu để ứng dụng ngay mô hình Tác nhân AI vào tối ưu hóa vận hành doanh nghiệp của bạn!