Giới thiệu dự án

Trong môi trường doanh nghiệp và các tổ chức hiện đại, hoạt động hội họp chiếm từ 35% đến 50% tổng thời gian làm việc của nhân sự quản lý và kỹ thuật. Việc ghi chép biên bản cuộc họp (meeting minutes) theo phương pháp thủ công truyền thống bộc lộ nhiều điểm nghẽn nghiêm trọng: tiêu tốn từ 45 - 60 phút sau mỗi buổi họp để tổng hợp, dễ bỏ sót 20 - 30% các đầu việc then chốt (action items), và phản ánh thông tin mang tính chủ quan của người ghi chép.

Khóa luận tốt nghiệp ngành Hệ thống Nhúng và IoT tại Trường Đại học Sư phạm Kỹ thuật TP.HCM mang tên "Hệ thống tạo biên bản cuộc họp sử dụng mô hình ngôn ngữ lớn và kỹ thuật tái lập lời hướng dẫn" do sinh viên Võ Văn Linh thực hiện dưới sự hướng dẫn của TS. Nguyễn Mạnh Hùng đã nghiên cứu và phát triển giải pháp tự động hóa toàn diện quy trình này. Đề tài kết hợp công nghệ nhận dạng giọng nói tự động (ASR), mô hình ngôn ngữ lớn (LLM) và kỹ thuật tái lập lời nhắc (Rephrase and Respond - RaR) nhằm xóa bỏ khoảng cách giao tiếp giữa người dùng và trí tuệ nhân tạo.

+-------------------------------------------------------------------------------+
|                             PROBLEM STATEMENT                                 |
|                                                                               |
|  [Vague User Prompt]              [Naive LLM Processing]      [Output Issues] |
|  "Help me generate minutes" ----> - Thiếu ngữ cảnh nghiệp vụ -> - Sơ sài      |
|  "I need more detail"             - Không phân vai người nói    - Lệch trọng  |
|                                   - Tự suy diễn xác suất         tâm          |
+-------------------------------------------------------------------------------+

Mục tiêu dự án

  1. Xây dựng đường ống (pipeline) chuyển đổi âm thanh hội thoại sang văn bản đa người nói với độ chính xác cao bằng mô hình nhận dạng tiếng nói tự động OpenAI Whisper.
  2. Thiết kế và tích hợp kiến trúc xử lý ngôn ngữ ba tầng: Bộ nhớ ngữ cảnh (Memory), Tái lập lời hướng dẫn (Self-Rephrase), và Phản hồi thông minh (Response).
  3. Ứng dụng mô hình ngôn ngữ lớn tiên tiến Microsoft Phi-3-mini-128k-instruct để tóm tắt, trích xuất thực thể và cấu trúc hóa biên bản cuộc họp theo định dạng chuẩn doanh nghiệp.
  4. Xây dựng giao diện tương tác web thời gian thực dựa trên thư viện Streamlit và khung kết nối LangChain, cho phép người dùng tinh chỉnh tài liệu động thông qua hội thoại tương tác.

Phạm vi và giới hạn đề tài

  • Phạm vi ứng dụng: Tập trung vào các cuộc họp doanh nghiệp sử dụng ngôn ngữ tiếng Anh, hỗ trợ nhận diện và phân loại nội dung nhiều người tham gia.
  • Giới hạn kỹ thuật: Dữ liệu âm thanh đầu vào được xử lý theo dạng tệp (batch audio processing); khả năng tương tác tập trung vào trích xuất và điều chỉnh chi tiết nội dung mà không làm biến dạng cấu trúc biên bản chuẩn.

Phân tích và thiết kế giải pháp

Phân tích hiện trạng

Các giải pháp biên bản cuộc họp tự động hiện tại trên thị trường chủ yếu hoạt động theo cơ chế một chiều (one-shot processing), khiến người dùng gặp khó khăn khi muốn hiệu chỉnh tài liệu.

Giải pháp Ưu điểm Nhược điểm Chi phí & Triển khai
Ghi chép thủ công Linh hoạt theo ý người ghi, hiểu sâu ngữ cảnh nội bộ. Tốn nhân lực, tốc độ chậm, dễ sai lệch thông tin và bỏ sót quyết định. Chi phí nhân sự cao theo thời gian.
Otter.ai / Zoom AI Chuyển đổi giọng nói nhanh, tích hợp họp trực tuyến sẵn có. Tóm tắt tĩnh, không tùy biến sâu được theo prompt phức tạp, chi phí định kỳ cao. Thu phí SaaS hàng tháng/người dùng.
Mô hình LLM truyền thống Khả năng tóm tắt mạnh, tổng hợp nhanh từ văn bản thô. Phụ thuộc nặng vào kỹ năng viết prompt; câu lệnh ngắn dẫn đến kết quả sơ sài. API pay-as-you-go hoặc tự host tốn GPU.
Hệ thống đề xuất (Whisper + RaR + Phi-3) Tự động tối ưu hóa prompt qua RaR, cho phép hỏi đáp điều chỉnh biên bản đa tầng. Yêu cầu tài nguyên xử lý mô hình cục bộ hoặc gọi API suy luận. Mã nguồn mở, kiểm soát hoàn toàn dữ liệu.

Yêu cầu hệ thống theo mô hình MoSCoW

  • Must have (Bắt buộc): Pipeline Audio-to-Text chuẩn xác qua Whisper ASR; Module Rephrase-and-Respond tái cấu trúc prompt thô; Module Response sinh biên bản chuẩn; Giao diện Streamlit.
  • Should have (Nên có): Bộ nhớ hội thoại (Conversation Memory) lưu trữ lịch sử tương tác; Tùy chọn chuyển đổi phong cách văn bản (Active/Passive voice); Bộ lọc mức độ chi tiết (Summary/Detailed).
  • Could have (Có thể có): Khả năng xuất định dạng PDF/DOCX; Tự động tách tag Action Items và Next Meeting Schedule.
  • Won't have (Chưa hỗ trợ): Phiên dịch thời gian thực đa ngôn ngữ tức thì trong luồng audio stream.

Thiết kế kiến trúc hệ thống

Hệ thống được tổ chức thành hai phân hệ độc lập nhưng liên kết chặt chẽ qua luồng dữ liệu: Phân hệ chuyển đổi âm thanh (Audio2Dialogue) và Phân hệ xử lý văn bản tri thức (Render Engine).

Công nghệ sử dụng và phiên bản

  • OpenAI Whisper ASR: Công nghệ nhận dạng giọng nói tự động dựa trên mạng nơ-ron tích chập (CNN) và khối giải mã Transformer, tiền xử lý và chuyển đổi âm thanh trực tiếp sang văn bản mà không qua tầng trung gian (End-to-End).
  • Microsoft Phi-3-mini-128k-instruct: Mô hình ngôn ngữ kích thước 3.8 tỷ tham số (3.8B), hỗ trợ cửa sổ ngữ cảnh lên tới 128,000 tokens, tối ưu hóa cho tác vụ suy luận logic cao và đọc hiểu tài liệu dài.
  • LangChain Framework (v0.2.x): Khung điều phối kết nối luồng dữ liệu giữa Prompt Templates, Memory Chains và LLM Engine.
  • Streamlit (v1.35.x): Framework phát triển giao diện web tương tác bằng Python.
  • Hạ tầng thực thi: Python 3.10+, PyTorch 2.3.0, CUDA 12.1.

Kế hoạch và tiến độ triển khai

Dự án được thực hiện trong thời gian từ ngày 25/02/2024 đến ngày 02/06/2024 theo mô hình Agile/Scrum qua 4 giai đoạn:

[Sprint 1: 25/02 - 20/03] Nghiên cứu cơ sở lý thuyết, kiến trúc Transformer, đánh giá tập dữ liệu BIG-bench.
[Sprint 2: 21/03 - 15/04] Triển khai pipeline Whisper ASR & Xây dựng module Self-Rephrase bằng LangChain.
[Sprint 3: 16/04 - 10/05] Tích hợp mô hình Phi-3-mini-128k-instruct, ghép nối bộ nhớ Memory và Response Engine.
[Sprint 4: 11/05 - 02/06] Thử nghiệm 50 kịch bản benchmark, đánh giá LLM vs Human, hoàn thiện Streamlit UI.

Triển khai thực nghiệm và Kết quả

Chi tiết thuật toán Rephrase-and-Respond (RaR)

Cốt lõi của hệ thống nằm ở cơ chế chuyển tiếp hai bước: Khi người dùng đưa vào một câu lệnh mơ hồ, module Self-Rephrase sẽ kết hợp dữ liệu hội thoại từ Memory để tự động viết lại câu hỏi rõ ràng trước khi đưa vào mô hình sinh nội dung Response.

from langchain.prompts import PromptTemplate
from langchain.chains import LLMChain
from langchain_community.llms import HuggingFacePipeline

# 1. Định nghĩa khuôn mẫu Tái lập lời hướng dẫn (Self-Rephrase)
rephrase_template = """
You are an expert executive assistant. Given the meeting transcript context and 
a user request, rephrase the request into a comprehensive, unambiguous, and 
actionable instruction that specifies all required details.

Context: {context}
User Query: {user_query}

Rephrased Instruction:
"""

rephrase_prompt = PromptTemplate(
    input_variables=["context", "user_query"],
    template=rephrase_template
)

# 2. Định nghĩa khuôn mẫu Sinh biên bản cuộc họp (Response Generation)
response_template = """
You are an AI meeting minute generator. Generate formal meeting minutes based on 
the verified transcript and the optimized instruction below.

Context: {context}
Optimized Instruction: {rephrased_query}

Formal Meeting Minutes:
- Subject / Agenda:
- Attendees & Speaker Assignments:
- Key Discussion Points:
- Concrete Action Items & Deadlines:
- Next Steps:
"""

response_prompt = PromptTemplate(
    input_variables=["context", "rephrased_query"],
    template=response_template
)

Kịch bản thử nghiệm so sánh Prompt thực tế

Khi người dùng nhập câu lệnh tối giản: "Help me generate meeting minutes", sự khác biệt giữa hai phương pháp thể hiện rõ rệt:

  • Phương pháp truyền thống (Không có RaR): Hệ thống chỉ xuất các gạch đầu dòng liệt kê người nói chung chung, không nắm bắt được phân vai cụ thể và không cấu trúc được hành động tiếp theo.
  • Phương pháp đề xuất (Có RaR): Hệ thống tự động phân giải prompt thành: "Can you summarize the specific experiences shared by Speaker 01 (Kristen Dodds) and Speaker 00 (Joe Weiss), including specific details such as dates, locations, descriptions of seismic events, and notable observations?". Kết quả tạo ra biên bản chuẩn hóa với đầy đủ các mục: Attendees, Key Points Discussed, Action Items, Next Meeting Schedule, và Minutes Prepared By.

Kết quả đánh giá định lượng (Benchmarks)

Hệ thống được kiểm thử thông qua 50 câu hỏi trích xuất thông tin chuyên sâu từ các đoạn hội thoại mẫu. Mỗi câu trả lời được chấm điểm theo thang đo 5 mức: 1 (Hoàn toàn không liên quan), 3 (Liên quan ít, sai lệch), 5 (Liên quan vừa phải, chứa lỗi nhỏ), 7 (Phù hợp, thiếu sót nhỏ), và 10 (Hoàn toàn chính xác, đầy đủ).

Quá trình chấm điểm độc lập được thực hiện bởi cả mô hình ngôn ngữ lớn (LLM-as-a-Judge) và Chuyên gia con người (Human Evaluation).

Bảng kết quả đánh giá bởi mô hình ngôn ngữ lớn (LLM Evaluation)

Mức điểm tiêu chuẩn 1 điểm (Rất tệ) 3 điểm (Kém) 5 điểm (Trung bình) 7 điểm (Khá) 10 điểm (Xuất sắc)
Phương pháp truyền thống 11 0 9 5 24
Phương pháp đề xuất (RaR) 6 1 3 5 34
Tỷ lệ thay đổi -45.45% +100% -66.67% 0.0% +41.67%

Bảng kết quả đánh giá bởi chuyên gia con người (Human Evaluation)

Mức điểm tiêu chuẩn 1 điểm (Rất tệ) 3 điểm (Kém) 5 điểm (Trung bình) 7 điểm (Khá) 10 điểm (Xuất sắc)
Phương pháp truyền thống 11 3 8 7 20
Phương pháp đề xuất (RaR) 6 1 5 6 31
Tỷ lệ thay đổi -45.45% -66.67% -37.50% -14.29% +55.00%
TỶ LỆ CÂU TRẢ LỜI ĐẠT ĐIỂM TUYỆT ĐỐI (10/10) TRÊN 50 TEST CASES:
LLM Evaluation:   [Truyền thống: 48%] ======> [Đề xuất: 68%]  (+20.0% Raw, +41.7% Tăng trưởng)
Human Evaluation: [Truyền thống: 40%] ======> [Đề xuất: 62%]  (+22.0% Raw, +55.0% Tăng trưởng)

Đổi mới và Đóng góp kỹ thuật

  1. Cơ chế Tái lập Lời nhắc Động (Dynamic Prompt Rephrasing Layer): Thay vì áp đặt một prompt mẫu cố định (hard-coded template), hệ thống đưa ra cơ chế suy luận trung gian giúp biến đổi các câu lệnh ngắn, thiếu dữ kiện của người dùng thành các yêu cầu tối ưu hóa cấu trúc cho LLM.
  2. Loại bỏ hiện tượng ảo giác và lệch mục tiêu: Tỷ lệ câu trả lời hoàn toàn không liên quan (điểm 1) giảm mạnh 45.45% (từ 11 trường hợp xuống còn 6 trường hợp ở cả hai phương thức đánh giá).
  3. Cải thiện độ chính xác đầu ra vượt trội: Số lượng câu trả lời đạt điểm tối đa (điểm 10) tăng 41.67% dưới góc nhìn của LLM và tăng 55.00% dưới sự thẩm định của con người.
  4. Kiến trúc mô-đun hóa dễ mở rộng: Tách biệt rõ ràng giữa tầng thu nhận tín hiệu âm thanh, tầng xử lý ngữ nghĩa và tầng giao diện, cho phép dễ dàng hoán đổi mô hình nền tảng (ví dụ nâng cấp lên Llama-3 hoặc Mistral mà không cần viết lại toàn bộ pipeline).

Ứng dụng thực tế và Triển khai

+-------------------------------------------------------------------------------+
|                        KIẾN TRÚC TRIỂN KHAI DOANH NGHIỆP                      |
|                                                                               |
|  [Audio Sources]       [Processing Pipeline]             [Business Apps]      |
|  - Zoom / Teams  --->  - Whisper ASR (CUDA)       --->   - Notion / Jira Sync |
|  - Offline Mics        - Phi-3 Mini + RaR Engine         - Export PDF/DOCX    |
|  - Web Portal          - LangChain Memory Store          - Email Dispatch     |
+-------------------------------------------------------------------------------+

Các kịch bản ứng dụng (Use Cases)

  • Cuộc họp điều hành doanh nghiệp (Board Meetings): Tự động ghi nhận các nghị quyết, danh sách biểu quyết và phân công công việc chi tiết theo từng giám đốc phụ trách.
  • Buổi họp kỹ thuật Agile/Scrum: Trích xuất nhanh các trở ngại (blockers), tiến độ cam kết trong ngày và các hạng mục cần hỗ trợ kỹ thuật liên bộ phận.
  • Phỏng vấn tuyển dụng & Đánh giá nhân sự: Chuyển đổi toàn bộ nội dung phỏng vấn thành hồ sơ tổng kết năng lực ứng viên một cách khách quan.

Yêu cầu phần cứng và Triển khai hệ thống

# 1. Khởi tạo môi trường ảo Python
python -m venv venv && source venv/bin/activate

# 2. Cài đặt các thư viện lõi
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
pip install openai-whisper langchain langchain-community streamlit transformers accelerate

# 3. Khởi chạy ứng dụng web
streamlit run app.py --server.port 8501 --server.enableCORS false
  • Yêu cầu phần cứng tối thiểu: CPU 8 Cores, 16GB RAM, GPU NVIDIA RTX 3060 (12GB VRAM) hoặc tương đương để chạy mô hình suy luận cục bộ (Local Inference).
  • Hiệu quả kinh tế (ROI): Một doanh nghiệp tổ chức trung bình 20 cuộc họp/tuần có thể tiết kiệm xấp xỉ 80 giờ làm việc/tháng, tương đương giảm thiểu hơn 70% chi phí thời gian hành chính cho đội ngũ thư ký và quản lý dự án.

Hạn chế và Hướng phát triển

Hạn chế kỹ thuật

  • Rào cản ngôn ngữ: Hiện tại pipeline kiểm thử tập trung chính vào dữ liệu đàm thoại tiếng Anh; các cuộc họp tiếng Việt đa phương ngữ cần bổ sung mô hình nhận diện giọng nói chuyên biệt (như PhoWhisper).
  • Độ trễ xử lý âm thanh: Tệp âm thanh lớn (>100MB) đòi hỏi thời gian tiền xử lý và tách kênh âm thanh đáng kể nếu chạy trên hạ tầng phần cứng không có bộ tăng tốc GPU chuyên dụng.
  • Nhận diện chồng âm (Overlapping Speech): Khi nhiều người nói cùng lúc, Whisper có thể gặp hiện tượng trộn lẫn từ ngữ giữa các diễn giả.

Hướng phát triển trong tương lai

  • Tích hợp thuật toán phân tách giọng người nói nâng cao (Speaker Diarization qua PyAnnote.audio).
  • Hỗ trợ tinh chỉnh (Fine-tuning) mô hình LLM với dữ liệu thuật ngữ chuyên ngành tài chính, y tế và luật pháp.
  • Phát triển cơ chế streaming trực tiếp: Vừa ghi âm cuộc họp vừa hiển thị biên bản cập nhật theo thời gian thực (Real-time Live Meeting Summarization).

Đối tượng hưởng lợi

+-----------------------------------------------------------------------------+
|                          GIÁ TRỊ MANG LẠI CHO CÁC BÊN                        |
+----------------------+------------------------------------------------------+
| Sinh viên & Học viên | Tài liệu tham khảo chuẩn mực về kết hợp Whisper,     |
|                      | LangChain và kỹ thuật Prompt Engineering tiên tiến.  |
+----------------------+------------------------------------------------------+
| Kỹ sư phần mềm       | Mã nguồn mẫu và kiến trúc phân tầng (Memory - RaR -  |
|                      | Response) dễ tích hợp vào các hệ sinh thái AI.       |
+----------------------+------------------------------------------------------+
| Doanh nghiệp         | Giải pháp tự động hóa ghi chép giúp tiết kiệm 90%    |
|                      | thời gian hành chính và chuẩn hóa dữ liệu quản trị.  |
+----------------------+------------------------------------------------------+
| Nhà nghiên cứu NLP   | Bộ dữ liệu đối sánh định lượng về độ hiệu quả của    |
|                      | kỹ thuật Rephrase-and-Respond trên mô hình cỡ nhỏ.   |
+----------------------+------------------------------------------------------+

Câu hỏi thường gặp

1. Hệ thống cần cấu hình phần cứng như thế nào để vận hành mượt mà?

Để chạy toàn bộ hệ thống cục bộ (on-premise) bao gồm cả Whisper ASR và mô hình Phi-3-mini-128k-instruct, máy chủ cần tối thiểu 1 GPU NVIDIA với dung lượng VRAM từ 12GB trở lên (ví dụ: RTX 3060/4060 hoặc RTX 3090). Nếu sử dụng qua API cloud của OpenAI và Azure, hệ thống chỉ cần máy chủ web tiêu chuẩn 2 CPU Cores và 4GB RAM.

2. Kỹ thuật Rephrase and Respond (RaR) giải quyết vấn đề gì so với Chain-of-Thought (CoT)?

Chain-of-Thought (CoT) hướng dẫn mô hình suy nghĩ từng bước dựa trên câu hỏi hiện tại của người dùng. Tuy nhiên, nếu câu hỏi ban đầu mơ hồ hoặc thiếu dữ kiện, CoT vẫn suy luận trên nền tảng sai sót đó. RaR giải quyết tận gốc vấn đề này bằng cách bổ sung một bước làm rõ và chuẩn hóa câu hỏi trước khi bắt đầu quy trình suy luận và sinh văn bản.

3. Dữ liệu cuộc họp nội bộ có được đảm bảo an toàn bảo mật không?

Hệ thống hoàn toàn có thể đóng gói và triển khai khép kín (self-hosted) trong mạng nội bộ của doanh nghiệp bằng cách sử dụng các mô hình mã nguồn mở (Whisper offline và Phi-3 local weights). Toàn bộ dữ liệu âm thanh và văn bản biên bản không cần truyền ra ngoài Internet, đảm bảo tuân thủ nghiêm ngặt các tiêu chuẩn bảo mật doanh nghiệp.

4. Hệ thống xử lý thế nào khi người dùng yêu cầu chỉnh sửa một phần nội dung biên bản?

Nhờ Module Memory quản lý trạng thái hội thoại kết hợp cùng Self-Rephrase, khi người dùng nhập các yêu cầu như "Hãy tóm tắt chi tiết hơn phần thảo luận của Speaker 01", hệ thống sẽ tự động đối chiếu ngữ cảnh lịch sử, trích xuất chính xác đoạn phát biểu của Speaker 01 và tạo bản tóm tắt chuyên sâu mà không làm ảnh hưởng đến các phần khác của biên bản.

5. Chi phí vận hành giải pháp này so với việc thuê dịch vụ SaaS thương mại?

Tự triển khai hệ thống giúp doanh nghiệp tiết kiệm 60 - 80% chi phí so với việc đăng ký tài khoản SaaS định kỳ cho hàng trăm nhân viên. Chi phí chỉ phát sinh một lần cho hạ tầng phần cứng hoặc chi phí điện toán đám mây theo mức sử dụng thực tế.


Kết luận

Đồ án tốt nghiệp "Hệ thống tạo biên bản cuộc họp sử dụng mô hình ngôn ngữ lớn và kỹ thuật tái lập lời hướng dẫn" đã giải quyết thành công bài toán tự động hóa quy trình ghi chép và cấu trúc hóa biên bản cuộc họp. Bằng việc tích hợp kỹ thuật Rephrase and Respond (RaR) vào đường ống xử lý của mô hình Microsoft Phi-3-mini-128k-instruct và OpenAI Whisper, hệ thống đã chứng minh tính ưu việt với tỷ lệ phản hồi xuất sắc tăng 41.67% - 55.00%tỷ lệ lỗi nghiêm trọng giảm 45.45%.

Công trình nghiên cứu không chỉ mang lại giá trị học thuật trong việc chứng minh hiệu quả của các mô hình ngôn ngữ nhỏ kết hợp kỹ thuật prompt nâng cao, mà còn cung cấp một giải pháp phần mềm hoàn chỉnh, sẵn sàng chuyển giao và ứng dụng thực tế vào môi trường vận hành của các doanh nghiệp và tổ chức thời đại số.