CHƯƠNG 1: HỆ THỐNG TÌM KIẾM TỪ NỘI DUNG VÀ HÌNH ẢNH TRONG GIÁO DỤC 1. Trích xuất văn bản từ hình ảnh sử dụng công nghệ OCR 1. Công nghệ OCR Công nghệ OCR (Optical Character Recognition - Nhận dạng ký tự quang học) là một công nghệ cho phép chuyển đổi hình ảnh của văn bản viết tay hoặc in ấn thành dữ liệu số hóa. Điều này có nghĩa là OCR có thể "đọc" và chuyển đổi chữ trong hình ảnh thành văn bản mà bạn có thể sao chép, tìm kiếm hoặc chỉnh sửa như một tài liệu thông thường.
Công nghệ OCR hoạt động theo các bước chính sau Đầu tiên, thu nhận hình ảnh: tài liệu được quét và chuyển đổi thành dữ liệu nhị phân. Phần mềm OCR phân tích hình ảnh đã quét và phân loại vùng sáng làm nền và vùng tối làm văn bản. Thứ hai, tiền xử lý: hình ảnh được chỉnh sửa, làm sạch, loại bỏ các lỗi để chuẩn bị cho bước đọc. Một số kỹ thuật làm sạch của công nghệ OCR là khử nhiễu, làm mịn viền ký tự, xóa bỏ đường viền không cần thiết và nhận dạng chữ viết.
Thứ ba, nhận dạng văn bản: phần mềm OCR phân tích và nhận dạng các ký tự trong hình ảnh, sử dụng các phương pháp như so khớp mẫu và trích xuất đặc điểm. Thứ tư, so khớp mẫu: phương pháp này hoạt động bằng cách tách một hình dạng ký tự (hay gọi là hình dạng chữ) và so sánh nó với các hình dạng chữ tương tự đã được lưu trữ trong hệ thống. Phương pháp này chỉ hiệu quả khi hình dạng chữ đầu vào có phông chữ và tỷ lệ tương đồng với dữ liệu đã lưu trữ. So khớp mẫu hoạt động tốt khi xử lý các tài liệu được đánh máy bằng những phông chữ đã biết.
Thứ năm, trích xuất đặc điểm: phương pháp này phân tích hình dạng chữ bằng cách tách chúng thành các đặc điểm như đường nét thẳng, nét vòng khép kín, hướng nét và giao điểm nét. Dựa trên những đặc điểm này, hệ thống sẽ tìm ra kết quả phù hợp nhất hoặc gần đúng nhất với các hình dạng chữ có trong cơ sở dữ liệu. Cuối cùng, hậu xử lý: Sau khi phân tích, hệ thống sẽ chuyển đổi dữ liệu văn bản được trích xuất thành tệp trên máy tính. Một số hệ thống OCR có thể tạo các tệp PDF có chú thích bao gồm cả phiên bản trước và sau của tài liệu được quét (Amazon Web Services, n.
Sau khi đã có khái niệm về công nghệ OCR, bây giờ ta sẽ đi vào sử dụng một số ứng dụng OCR thực tế. Nhóm nghiên cứu sẽ sử dụng hai công cụ sau: VietOCR và Google Tài liệu. Sau đây là một vài điểm chính về các công cụ được sử dụng VietOCR: Đây là một phần mềm mã nguồn mở hỗ trợ nhận dạng ký tự quang học (OCR) cho văn bản tiếng Việt từ hình ảnh hoặc tài liệu được quét. Phần mềm này giúp trích xuất văn bản từ các định dạng hình ảnh như JPG, PNG, TIFF và PDF.
VietOCR sử dụng công cụ Tesseract OCR làm nền tảng nhận dạng ký tự và được bổ sung thêm khả năng xử lý tốt tiếng Việt. Trên giao diện chính của phần mềm, ta có thể thấy hai khu vực: bên trái chứa nội dung của file tài liệu vừa mới thêm vào, khung bên phải sẽ là tài liệu sau khi trích xuất từ file ảnh. Bạn nhấn đề mục OCR Language (góc trên bên phải màn hình) và chọn Vietnamese. Sau đó, nhấn nút để bắt đầu quá trình biên dịch nội dung.1: Giao diện chính của VietOCR Google Tài liệu: Đây là một công cụ xử lý văn bản trực tuyến được tích hợp trong bộ ứng dụng Google Workspace.
Một trong những tính năng nổi bật của Google Tài liệu là khả năng nhận dạng ký tự quang học (OCR), cho phép người dùng chuyển đổi hình ảnh hoặc tệp chứa văn bản thành văn bản có thể chỉnh sửa. Google Tài liệu có chương trình OCR tích hợp có thể nhận dạng văn bản từ các file JPEG, PNG, GIF và PDF. Nhưng tất cả các file phải từ 2MB trở xuống và văn bản phải từ 10 pixel trở lên. Chức năng OCR của Google hỗ trợ nhận dạng văn bản ở nhiều ngôn ngữ khác nhau, bao gồm cả tiếng Việt.
Người dùng chỉ cần có tài khoản Google để sử dụng chức năng này mà không cần cài đặt phần mềm bổ sung. Về mặt trình bày, nhóm nghiên cứu sẽ phân tích cụ thể quá trình trích xuất nội dung văn bản thành hai phần: nhận dạng chữ đánh máy và nhận dạng chữ viết tay.2 Nhận dạng chữ đánh máy Dưới đây là kết quả sau khi chạy Hình 1.1 qua các công cụ nhận dạng hình ảnh cùng nhận xét: Hình 1.1- Ảnh OCR1: chữ đánh máy được scan Đầu tiên là ứng dụng VietOCR. Mở ứng dụng VietOCR, nhấn file chọn Open, lựa chọn hình ảnh hoặc file bạn muốn xuất nội dung.2: Cách chọn hình ảnh hoặc file để xuất nội dung Nội dung văn bản do VietOCR xuất ra có độ chính xác rất cao. Tuy nhiên vẫn còn hạn chế như một số chữ bị sai chính tả “dạng-đạng”, “thể-thẻ”…, đầu ra hậu xử lý vẫn còn gặp phải những vấn đề về định dạng như chưa xuống hàng đúng dòng.3: VietOCR khi xử lý ảnh OCR1 Cách trích xuất văn bản từ hình ảnh sử dụng Google Tài liệu.
Bước 1: Đăng nhập tài khoản Google Drive của bạn. Bước 2: Nhấp vào Mới>tải Tệp. Ngoài ra bạn, bạn cũng có thể nhấp vào Drive của tôi>tải Tệp. Bước 3: Đi đến vị trí của tệp mà bạn muốn chuyển đổi sang văn bản.
Nhấp vào nút Mở (Open) để tải tệp lên. Bước 4: Tài liệu hiện đã có trong Google Drive. Nhấp chuột phải vào tài liệu và nhấp vào Mở bằng>Google Tài liệu. Trích xuất văn bản từ hình ảnh bằng Google Tài liệu Bước 5: Google sẽ chuyển đổi tệp PDF/ảnh của bạn thành văn bản và mở tệp đó trong một tài liệu Google mới có thể chỉnh sửa được.
Google Tài liệu khi xử lý ảnh OCR 1 Nội dung văn bản được trích xuất đúng chính tả lên tới 100%, tuy nhiên vẫn còn hạn chế về định dạng như xuống hàng không đúng, màu chữ bị thay đổi. Hình ảnh được sử dụng ở trên là trong trường hợp lý tưởng. Vậy khi có những biến số ảnh hướng đến hình chụp văn bản in như độ sáng, độ phân giải… thì liệu các công cụ sẽ cho ra kết quả như thế nào? Phần sau đây sẽ được dùng để thử nghiệm điều này bằng hình ảnh sau đây: Hình 1.6-Ảnh OCR 2: Chữ đánh máy được chụp trong điều kiện không tốt VietOCR: Ứng dụng không thể nhận dạng được những từ ngữ trong hình ảnh, qua đó ta thấy hạn chế lớn nhất của ứng dụng này chính là không thể nhận dạng chữ đánh máy khi văn bản không thẳng hàng. VietOCR sẽ xuất ra các ký tự Unicode lỗi như sau: Hình 1.7: VietOCR khi xử lý Ảnh OCR 2 Google Tài liệu: Vẫn nhận dạng được văn bản với độ chính xác cao.
Tuy nhiên vẫn còn mắc một số lỗi như sai chính tả, sai định dạng.8: Google Tài liệu xử lý Ảnh OCR 2 1.3 Nhận dạng chữ viết tay Sau phần nhận dạng chữ viết máy, các công cụ OCR sẽ tiếp tục được thử nghiệm để nhận dạng chữ viết tay.1- Ảnh OCR 2: Chữ viết tay VietOCR: Hoàn toàn không nhận dạng được chữ viết tay Hình 1.2- VietOCR xử lý Ảnh OCR 2 Google Tài liệu: Nội dung văn bản được trích xuất có độ chính xác cao tuy vẫn mắc một số lỗi chính tả.3- Google Tài liệu xử lý Ảnh OCR 2 Nhận xét: so sánh giữa hai công cụ thì Google Tài liệu có ưu thế hơn VietOCR trong cả nhận dạng chữ đánh máy và chữ viết tay vì độ chính xác cao hơn, ít mắc lỗi hơn. Nội dung có thể chỉnh sửa sẵn bằng các công cụ có sẵn trong Google Tài liệu và tải xuống, chia sẻ. Rút trích từ khóa (Keyword Extraction). Khái niệm về trích xuất từ khóa Trích xuất từ khóa (Keyword Extraction – KE) là quá trình tự động xác định các thuật ngữ quan trọng nhất để mô tả nội dung của một tài liệu.
Đây là nhiệm vụ thiết yếu trong các lĩnh vực như khai thác văn bản (Text Mining), xử lý ngôn ngữ tự nhiên (Natural Language Processing – NLP) và truy xuất thông tin (Information Retrieval). Trong bối cảnh số lượng tài liệu kỹ thuật số tăng trưởng theo cấp số nhân, trích xuất từ khóa tự động trở thành giải pháp cần thiết nhằm thay thế phương pháp thủ công vốn tiêu tốn nhiều thời gian, công sức và chi phí. Các từ khóa, bao gồm một hoặc nhiều cụm từ, không chỉ giúp tóm lược nội dung mà còn đóng vai trò quan trọng trong việc truy vấn thông tin. Chúng dễ dàng nhận diện, chỉnh sửa, ghi nhớ và chia sẻ, đồng thời không bị ràng buộc bởi bất kỳ cơ sở dữ liệu cụ thể nào.
Nhờ đó, từ khóa có thể được áp dụng trên nhiều kho dữ liệu và hệ thống khác nhau, mang lại sự linh hoạt vượt trội so với các phương pháp như chữ ký toán học – một dãy số thường gắn liền với tài liệu trong các kho dữ liệu nhất định. Sự phát triển của các cơ sở dữ liệu khổng lồ như Google hay Amazon Web Services đã thúc đẩy nhu cầu xây dựng các mô hình trích xuất từ khóa hiệu quả, phục vụ cho việc tìm kiếm và khai thác thông tin từ văn bản. Việc tối ưu hóa phương pháp này không chỉ giải quyết thách thức trong quản lý dữ liệu mà còn mở ra cơ hội nâng cao hiệu quả xử lý thông tin trong thời đại số. Trong lịch sử đã có nhiều phương pháp trích xuất từ khóa khác nhau được đề xướng.
Có thể kể đến như: Tiếp cận bằng thống kê: Ưu điểm của phương pháp này là nó không cần huấn luyện dữ liệu, đồng thời cũng không phụ thuộc vào loại ngôn ngữ được sử dụng. Dữ liệu thống kê của từ ngữ được sử dụng trong tài liệu bao gồm tần xuất dùng từ, mục lục, tiêu đề, n-gram trong ngôn ngữ học tính toán… Tuy vậy, phương pháp này có một hạn chế là trong một số tài liệu khoa học, đặc biệt trong lĩnh vực y học và sức khỏe, từ khóa quan trọng nhất có thể chỉ xuất hiện chỉ 1 lần trong bài viết. Khi đó từ ngữ thật sự quan trọng sẽ bị loại bỏ bởi phương pháp thống kê. S, 2010, tr 1928 – 1938) Tiếp cận theo hướng ngôn ngữ học: Bằng cách sử dụng những đặc trưng ngôn ngữ của từ, câu và đoạn văn bản, các hệ thống trích xuất từ khóa có thể phân tích ngữ nghĩa thông qua phân tích từ vựng, ngữ nghĩa học và phân tích diễn ngôn.