Luận văn thạc sĩ: Xây dựng hệ thống nhận dạng và dịch trên thiết bị di động

Luận văn thạc sĩ nghiên cứu vnu uet xây dựng hệ thống nhận dạng và dịch trên thiết bị di động, đánh giá hiện trạng, phân tích vấn đề, đề xuất biện pháp hoàn thiện trong lĩnh vực

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

Luận Văn Thạc Sỹ

2011

65
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

MỞ ĐẦU

1. CHƯƠNG 1: TỔNG QUAN VỀ OCR

1.1. Giới thiệu về OCR

1.2. Một số công nghệ, phần mềm OCR tiêu biểu

1.3. Một số khái niệm cơ bản

1.4. Các bước cơ bản trong một hệ thống OCR

2. CHƯƠNG 2: CÁC CÔNG NGHỆ SỬ DỤNG TRONG HỆ THỐNG

2.1. Công nghệ Tesseract OCR

2.1.1. Giới thiệu về Tesseract OCR

2.1.2. Tesseract làm việc như thế nào?

2.1.3. Vấn đề tập huấn ngôn ngữ

2.2. Công nghệ Android

2.2.1. Giới thiệu về hệ điều hành android

2.2.2. Kiến trúc hệ thống. Mô hình client/server

2.2.2.1. Giới thiệu về mô hình client/server
2.2.2.2. Các kiến trúc client/server
2.2.2.2.1. Client/Server hai tầng
2.2.2.2.2. Client/server ba tầng
2.2.2.2.3. Client/server n-tầng

2.3. Công nghệ dịch thuật Google Translate

2.3.1. Xử lý ngôn ngữ tự nhiên

2.3.2. Dịch tự động

2.3.3. Dịch vụ dịch thuật trực tuyến Google Translate

3. CHƯƠNG 3: HỆ THỐNG NHẬN DẠNG VÀ DỊCH TRÊN THIẾT BỊ DI ĐỘNG

3.1. Sơ đồ tổng quát của hệ thống

3.2. Ứng dụng trên client

3.3. Ứng dụng trên server

3.4. Chức năng tiền xử lý ảnh

3.5. Chức năng OCR

3.6. Chức năng hậu xử lý kết quả OCR

3.7. Chức năng sửa lỗi chính tả tự động

3.7.1. Hàm đánh giá minimum edit distance (MED)

3.7.2. Hàm đánh giá maximum số cặp ký tự giống nhau

3.8. Chức năng dịch sang ngôn ngữ khác

4. CHƯƠNG 4: THỰC NGHIỆM VÀ ĐÁNH GIÁ

4.1. Thực nghiệm trên Tesseract engine

4.2. Tập mẫu thực nghiệm

4.3. Kết quả OCR

4.4. Thực nghiệm trên một số hệ thống OCR khác nhau

4.5. Tập mẫu thực nghiệm

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về hệ thống nhận dạng và dịch tài liệu trên thiết bị di động

Hệ thống nhận dạng và dịch tài liệu trên thiết bị di động đang trở thành một công nghệ quan trọng trong việc chuyển đổi thông tin từ tài liệu giấy sang định dạng số. Công nghệ này không chỉ giúp tiết kiệm thời gian mà còn nâng cao độ chính xác trong việc xử lý thông tin. Hệ thống này thường bao gồm các thành phần như nhận dạng ký tự quang học (OCR), dịch thuật tự động và quản lý dữ liệu. Việc phát triển các ứng dụng trên thiết bị di động giúp người dùng dễ dàng tiếp cận và sử dụng công nghệ này mọi lúc mọi nơi.

1.1. Khái niệm về nhận dạng văn bản và dịch tài liệu

Nhận dạng văn bản (OCR) là quá trình chuyển đổi hình ảnh văn bản thành dữ liệu số có thể chỉnh sửa. Công nghệ này cho phép người dùng quét tài liệu giấy và chuyển đổi chúng thành định dạng điện tử. Dịch tài liệu tự động là quá trình sử dụng các thuật toán để dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác mà không cần sự can thiệp của con người.

1.2. Lợi ích của hệ thống nhận dạng và dịch tài liệu

Hệ thống này mang lại nhiều lợi ích như tiết kiệm thời gian, giảm thiểu sai sót trong quá trình nhập liệu và nâng cao khả năng truy cập thông tin. Người dùng có thể dễ dàng lưu trữ, tìm kiếm và chia sẻ tài liệu mà không cần phải nhập liệu thủ công.

II. Thách thức trong việc phát triển hệ thống nhận dạng và dịch tài liệu

Mặc dù công nghệ nhận dạng và dịch tài liệu đã phát triển mạnh mẽ, nhưng vẫn còn nhiều thách thức cần phải vượt qua. Chất lượng hình ảnh đầu vào, độ phức tạp của ngôn ngữ và các ký tự đặc biệt là những yếu tố ảnh hưởng lớn đến độ chính xác của hệ thống. Ngoài ra, việc phát triển các ứng dụng di động với khả năng xử lý nhanh và hiệu quả cũng là một thách thức lớn.

2.1. Chất lượng hình ảnh và ảnh hưởng đến kết quả OCR

Chất lượng hình ảnh đầu vào là yếu tố quyết định đến độ chính xác của quá trình nhận dạng. Hình ảnh mờ, không đủ ánh sáng hoặc có nhiều nhiễu sẽ dẫn đến kết quả không chính xác. Việc cải thiện chất lượng hình ảnh trước khi xử lý là rất quan trọng.

2.2. Độ phức tạp của ngôn ngữ và ký tự đặc biệt

Các ngôn ngữ có cấu trúc phức tạp hoặc chứa nhiều ký tự đặc biệt sẽ gây khó khăn cho hệ thống nhận dạng. Việc phát triển các mô hình học máy phù hợp để xử lý các ngôn ngữ này là một thách thức lớn trong nghiên cứu và phát triển.

III. Phương pháp xây dựng hệ thống nhận dạng và dịch tài liệu

Để xây dựng một hệ thống nhận dạng và dịch tài liệu hiệu quả, cần áp dụng các phương pháp hiện đại như học máy, xử lý ngôn ngữ tự nhiên và các thuật toán tối ưu hóa. Việc kết hợp các công nghệ này sẽ giúp cải thiện độ chính xác và tốc độ xử lý của hệ thống.

3.1. Sử dụng công nghệ OCR Tesseract

Tesseract là một trong những công nghệ OCR mã nguồn mở phổ biến nhất hiện nay. Nó hỗ trợ nhiều ngôn ngữ và có khả năng nhận dạng ký tự với độ chính xác cao. Việc tích hợp Tesseract vào hệ thống sẽ giúp nâng cao hiệu quả nhận dạng văn bản.

3.2. Ứng dụng công nghệ dịch thuật tự động

Công nghệ dịch thuật tự động như Google Translate có thể được tích hợp vào hệ thống để cung cấp khả năng dịch nhanh chóng và chính xác. Việc sử dụng API của Google sẽ giúp tiết kiệm thời gian và công sức trong việc phát triển chức năng dịch thuật.

IV. Ứng dụng thực tiễn của hệ thống nhận dạng và dịch tài liệu

Hệ thống nhận dạng và dịch tài liệu trên thiết bị di động đã được ứng dụng rộng rãi trong nhiều lĩnh vực như giáo dục, y tế, và kinh doanh. Các ứng dụng này không chỉ giúp người dùng tiết kiệm thời gian mà còn nâng cao hiệu quả công việc.

4.1. Ứng dụng trong giáo dục

Trong giáo dục, hệ thống này giúp sinh viên và giảng viên dễ dàng chuyển đổi tài liệu học tập từ giấy sang định dạng số, từ đó nâng cao khả năng tiếp cận thông tin và tài liệu học tập.

4.2. Ứng dụng trong kinh doanh

Trong lĩnh vực kinh doanh, hệ thống nhận dạng và dịch tài liệu giúp các doanh nghiệp tiết kiệm chi phí và thời gian trong việc quản lý tài liệu. Việc số hóa tài liệu giúp dễ dàng tìm kiếm và chia sẻ thông tin giữa các bộ phận.

V. Kết luận và tương lai của hệ thống nhận dạng và dịch tài liệu

Hệ thống nhận dạng và dịch tài liệu trên thiết bị di động đang có tiềm năng phát triển mạnh mẽ trong tương lai. Với sự tiến bộ của công nghệ, độ chính xác và khả năng xử lý của hệ thống sẽ ngày càng được cải thiện. Điều này sẽ mở ra nhiều cơ hội mới cho người dùng trong việc tiếp cận và sử dụng thông tin.

5.1. Xu hướng phát triển công nghệ OCR

Công nghệ OCR sẽ tiếp tục phát triển với sự hỗ trợ của các thuật toán học máy và trí tuệ nhân tạo. Điều này sẽ giúp cải thiện độ chính xác và khả năng nhận dạng của hệ thống.

5.2. Tương lai của dịch thuật tự động

Dịch thuật tự động sẽ ngày càng trở nên chính xác hơn nhờ vào sự phát triển của các mô hình ngôn ngữ và công nghệ học sâu. Điều này sẽ giúp người dùng dễ dàng tiếp cận thông tin từ nhiều ngôn ngữ khác nhau.

22/07/2025
Luận văn thạc sĩ vnu uet xây dựng hệ thống nhận dạng và dịch trên thiết bị di động

Trích đoạn nội dung tài liệu

Chương 1: Trình bày kiến thức tổng quan về lĩnh vực OCR làm nền tảng cho các nghiên cứu về sau. Chương 2: Trình bày nội dung tìm hiểu về công nghệ mã nguồn mở Tesseract OCR, công nghệ Android, mô hình client/server, công nghệ dịch Google Translate. Các công nghệ, mô hình này được sử dụng để xây dựng hệ thống. Chương 3: Giới thiệu kiến trúc và các thành phần cơ bản của hệ thống nhận dạng và dịch trên thiết bị di động đã xây dựng.

Chương 4: Trình bày kết quả thực nghiệm chức năng rút trích thông tin từ ảnh của hệ thống cũng như so sánh một sách tương đối kết quả OCR với một số hệ thống khác. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 8 CHƢƠNG 1 – TỔNG QUAN VỀ OCR 1. Giới thiệu về OCR Hình 1. Ứng dụng OCR[21] 1.

OCR là gì OCR (optical character recognition)[7] là lĩnh vực nhận dạng ký tự quang học. Kỹ thuật này cho phép máy tính tự động nhận dạng ký tự thông qua cơ chế quang học. Đối tượng của OCR là ảnh scan các tài liệu, sách, hoặc các video liên quan. Mục tiêu của OCR là chuyển các nguồn tài liệu này sang các định dạng có thể chỉnh sửa và tìm kiếm được.

Vào những những năm đầu của thế kỷ 20, các nhà khoa học đã quan tâm nghiên cứu trong lĩnh vực OCR. Tuy nhiên kết quả lúc bấy giờ vẫn còn rất hạn chế. Từ những năm 90 đến nay, OCR có những nghiên cứu mang tính đột phá, kết hợp với những công nghệ tiến tiến của thời đại đã cho ra đời những hệ thống OCR mạnh mẽ và hiệu suất cao. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 9 Năm 1929, đã xuất hiện chiếc máy nhận dạng chữ số.

Đến những năm đầu của thập niên 1950, chiếc máy đầu tiên có khả năng chuyển tài liệu bản in thành ngôn ngữ trên máy tính được phát minh bởi David Shepard, một chuyên gia về giải mã làm việc cho cơ quan An Ninh quốc gia Hoa Kỳ. Năm 1955 khi Reader‟s Digest mua lại công nghệ này, sản phẩm từ công nghệ OCR được đưa ra thương mại hóa lần đầu tiên. Tuy nhiên mãi đến năm 1978, phiên bản OCR cho máy tính mới được ra đời; ứng dụng đầu tiên của nó là dùng để tải những văn bản luật và tin tức lên cơ sở dữ liệu trực tuyến. Ngày nay, công nghệ OCR được kết hợp với máy scan tốc độ cao và những thuật toán máy tính phức hợp đã làm gia tăng tốc độ xử lý cũng như sự chính xác của dữ liệu.

Những công nghệ OCR hiện tại đều có thể nhận dạng hầu hết các font chữ với độ chính xác cao, một số còn hỗ trợ khả năng kết xuất ra những đoạn văn bản có định dạng gần giống hoàn toàn với bản gốc[21]. Ngoài công nghệ nhận dạng ký tự quang học OCR thì hiện nay còn có thêm nhiều cơ chế nhận dạng tiêu biểu khác[9] được ứng dụng vào thực tế như: nhận dạng ký tự thông minh ICR (Intelligent Character Recognition), nhận dạng vùng đánh dấu OMR (Optical Mark Recognition), nhận dạng chữ mực từ MICR (Magnetic Ink Character Recognition) và cơ chế nhận dạng mã vạch (barcode). Các công nghệ tiên tiến này đã hỗ trợ rất nhiều cho các tổ chức và doanh nghiệp trong việc xử lý thông tin phát sinh xuyên suốt quá trình hoạt động. Những lĩnh vực thường được ứng dụng các công nghệ nhận dạng trên là giáo dục, tài chính, y tế, bảo hiểm, giao vận và ngay cả trong các tổ chức của chính phủ như thuế, hải quan[21].

Công nghệ nhận dạng OCR đã tạo ra sự ảnh hưởng to lớn trong việc lưu trữ, chia sẻ và chỉnh sửa thông tin. Trước đây, nếu chúng ta muốn chuyển một quyển sách từ bản in sang bản điện tử thì cách duy nhất là ngồi nhập thủ công toàn bộ quyển sách vào máy tính thông qua chương trình soạn thảo văn bản, và điều này buộc chúng ta phải trả giá với một khoảng thời không nhỏ. Tuy nhiên, ngày nay với sự phát triển vượt bậc của công nghệ thông tin, chỉ cần một máy scan kết nối với một máy tính tích hợp sẵn phần mềm nhận dạng OCR, bằng một vài thao tác đơn giản, toàn bộ quyển sách sẽ được chuyển thành tập tin đúng như mong muốn của người sử dụng. Do đó có thể nói, công nghệ OCR đã giúp người ta đến gần với nhiều dạng thông tin hơn, xóa bỏ nhiều rào cản về việc chia sẻ nguồn tri thức của nhân loại.

Mặc dù không được sử dụng phổ biến và nhắc đến nhiều như các ngành công nghiệp viễn thông, phần cứng hay phần mềm nhưng ngành công nghiệp LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 10 nhận dạng lại mang đến hiệu quả rõ ràng nhất khi được đưa vào ứng dụng trong thực tế. Việc chuyển đổi thông tin từ tài liệu giấy sang tài liệu điện tử giúp nhiều người dùng có thể truy cập thông tin một cách dễ dàng, cùng một lúc dù ở bất cứ đâu mà không phải chờ đợi hoặc mất quá nhiều thời gian cho việc tìm kiếm. Điều này cũng tạo cho công tác quản lý và bảo mật thông tin trở nên đơn giản hơn khi tất cả những thay đổi hoặc ngày giờ truy cập thông tin đều được kiểm soát chặt chẽ. Đối với các doanh nghiệp, các tổ chức, các cơ quan hành chính, công nghệ OCR mang lại nhiều lợi ích kinh tế, tiết kiệm được những khoảng chi phí không nhỏ như giảm thiểu không gian lưu trữ, giảm tối đa nguồn nhân lực trong công tác quản lý thông tin.

Hiện nay nhiều ứng dụng OCR được đưa ra sử dụng dưới dạng offline trên máy tính hoặc tích hợp và chạy online trên các thiết bị OCR chuyên dụng. Đặc biệt các hệ thống OCR thời gian thực được chú trọng phát triển. Các kỹ thuật nhận dạng hiện nay kết hợp rất hiệu quả với một số phương pháp luận trong lĩnh vực học máy (machine learning) như mạng nơ ron, mô hình Markov ẩn, SVM (supper vector machines), xử lý ngôn ngữ tự nhiên. Mặc dù được phát triển mạnh mẽ, nhưng kết quả nghiên cứu trong lĩnh vực OCR cũng gặp phải những trở ngại nhất định.

OCR không bao giờ đạt tới tỷ lệ chính xác 100% trong nhiều trường hợp. Các yếu tố ảnh hưởng nhiều đến kết quả OCR như chất lượng ảnh đầu vào, bố cục ảnh, loại font chữ, các ký tự đặc biệt (ví dụ công thức toán học), các dạng chữ viết phức tạp (như chữ Trung Quốc) và một số yếu tố khác. Một số công nghệ, phần mềm OCR tiêu biểu Lĩnh vực OCR hiện nay được rất nhiều cá nhân, tổ chức quan tâm nghiên cứu, nhiều công nghệ OCR ra đời và được ứng dụng rộng rãi trong nhiều lĩnh vực liên quan đến nhận dạng. Dưới đây liệt kê danh sách một số phần mềm OCR tiêu biểu[17]: Tên Giấy phép ABBYY FineReader Proprietary AnyDoc Software Proprietary Brainware Proprietary CuneiForm/OpenOCR BSD variant ExperVision TypeReader & RTK Proprietary GOCR GPL Image to OCR Converter Proprietary LEADTOOLS Proprietary Microsoft Office Document Imaging Proprietary LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 11 Microsoft Office OneNote 2007 Proprietary Nicomsoft CrystalOCR Proprietary Ocrad GPL OCRopus GPL OCRopus Apache OmniPage Proprietary Puma.NET BSD Readiris Proprietary ReadSoft Proprietary RelayFax Proprietary Scan2CAD Proprietary Scantron Proprietary SimpleOCR Freeware and Commercial SmartScore Proprietary Tesseract Apache Transym OCR Proprietary 1.

Một số khái niệm cơ bản Pixel (Picture element)[2] : Ảnh trong thực tế là một ảnh liên tục về không gian và giá trị về độ sáng. Ảnh cần phải số hóa để có thể xử lý ảnh bằng máy tính. Trong quá trình số hóa ảnh người ta biến đổi tín hiệu liên tục thành tín hiệu rời rạc thông qua quá trình lấy mẫu (rời rạc hóa về không gian) và lượng hóa thành phần giá trị mà nguyên tắc mắt thường không phân biệt được hai điểm kề nhau. Khái niệm Picture Element (ta quen gọi hay viết là pixel - phần tử ảnh, điểm ảnh) được sử dụng trong quá trình này.

Do vậy một ảnh có thể coi là một tập các pixel. Ở đây cũng cần phân biệt khái niệm pixel hay đề cập đến trong các hệ thống đồ họa máy tính. Để tránh nhầm lẫn ta tạm gọi khái niệm pixel này là pixel thiết bị. Khái niệm pixel thiết bị có thể xem xét như sau: khi ta quan sát màn hình (chế độ đồ họa), màn hình không liên tục mà gồm nhiều điểm nhỏ, gọi là pixel.

Trong ảnh 2 chiều, mỗi pixel gồm một cặp tọa độ x, y và màu. Độ phân giải của ảnh(Resolution)[2]: chính là mật độ điểm ảnh được ấn định trên một ảnh số được hiển thị. Theo định nghĩa, khoảng cách giữa các điểm ảnh phải được chọn sao cho mắt người vẫn thấy được sự liên tục của ảnh. Việc lựa chọn khoảng cách thích hợp tạo nên một mật độ phân bổ, đó chính là độ phân giải và được bố trí theo hai trục x, y trong không gian hai chiều.

Đơn vị cho độ phân giải là dpi (dots per inch). LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 12 Mức xám của ảnh: Mỗi điểm ảnh đều có một cường độ sáng. Mỗi mức xám là kết quả của sự mã hóa tương ứng một cường độ sáng của mỗi điểm ảnh với một giá trị số - kết quả của quá trình lượng hóa. Các thang giá trị mức xám thông thường là 16, 32, 64, 128, 256, trong đó mức thông dụng nhất là 256, mỗi pixel được mã hóa bởi 8 bit.

Ảnh nhị phân: Tùy theo giá trị mức xám của điểm ảnh mà các ảnh được phân chia ra thành ảnh màu, ảnh xám hay ảnh nhị phân. Khi trên một ảnh chỉ có giá trị 0 hoặc 1 thì ta nói đó là một ảnh nhị phân hay một ảnh đen trắng và các điểm ảnh của nó gọi là điểm ảnh nhị phân. Ảnh màu: hay còn gọi là ảnh RGB. Cách biểu diễn cũng tương tự như ảnh đen trắng, chỉ khác là các số tại mỗi phần tử của ma trận biểu diễn cho ba màu riêng lẻ gồm: đỏ (Red), lục (Green), lam (Blue).

Để biểu diễn cho một điểm ảnh màu cần 24 bit, 24 bit này chia thành 3 khoảng 8 bit. Mỗi khoảng này biểu diễn cho cường độ sáng của một trong các màu chính tổ hợp của các màu ta được nhiều mức biểu diễn, như vậy mỗi điểm ảnh có thể được mô tả rõ giá trị màu tự nhiên của nó (true color). Ảnh đa cấp xám: là ảnh có nhiều mức xám khác nhau. Thực tế chỉ ra rằng bất cứ ứng dụng nào trên ảnh mức xám cũng được ứng dụng trên ảnh màu.

Ta có thể biến đổi ảnh màu về ảnh xám. Mỗi điểm ảnh màu gồm 3 giá trị (Red, Green, Blue), nếu 3 giá trị này bằng nhau thì ta có ảnh xám (grey). Khi đó mỗi điểm ảnh ta chỉ cần lưu 1 giá trị. Các đường cơ bản trong dòng text Hình 1.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ