Trích Xuất Thông Tin Từ Ảnh Bìa Sách Tiếng Việt

Khóa luận tốt nghiệp nghiên cứu tốt nghiệp khoa học dữ liệu trích xuất các đặc trưng sử dụng mô hình học sâu ứng dụng trong hệ, vận dụng lý thuyết vào thực tế, đề xuất giải pháp

Chuyên ngành

Khoa học dữ liệu

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2022

82
3
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. MỞ ĐẦU

2. CHƯƠNG 1: GIỚI THIỆU ĐỀ TÀI

1.1. Tính ứng dụng của đề tài

3. CHƯƠNG 2: BÀI TOÁN TRÍCH XUẤT THÔNG TIN TRÊN BÌA SÁCH TIẾNG VIỆT

2.1. Bài toán trích xuất thông tin trên bìa sách tiếng Việt

2.2. Chước SO

2.3. Phương pháp đề xuất giải quyết bài toán

4. CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN

4.1. Các công trình nghiên cứu trên ngôn ngữ nước ngoài

4.2. Các công trình nghiên cứu trên ngôn ngữ tiếng Việt

5. CHƯƠNG 4: XÂY DỰNG BỘ DỮ LIỆU CHO BÀI TOÁN TRÍCH XUẤT THÔNG TIN TRÊN BÌA SÁCH TIẾNG VIỆT

5.1. Hướng dẫn gán nhãn dữ liệu

5.2. Quá trình gán nhãn dữ liệu

5.3. Phân tích bộ dữ liệu

6. CÁC PHƯƠNG PHÁP TIẾP CẬN

6.1. Tiền xử lý chia dữ liệu tập huấn luyện, tập kiểm thử và tập đánh giá

6.2. Tiền xử lý dữ liệu cho mô hình phát hiện văn bản (Text Detection)

6.3. Tiền xử lý dữ liệu cho mô hình Text Recognition

6.4. Tiền xử lý dữ liệu cho mô hình Object detection

6.5. Bài toán phát hiện chữ trên ảnh (Text Detection)

6.5.1. Hệ thống nhận dạng chữ viết PaddleOCR

6.5.2. Mô hình SAST

6.5.3. Mô hình CRAFT

6.6. Bài toán nhận diện chữ trên ảnh (Text Recognition)

6.6.1. Mô hình CRNN trong hệ thống PP-OCR

6.6.2. Mô hình SVTR-LCNet trong hệ thống PP-OCR

6.6.3. Thư viện VietOCR

6.7. Bài toán xử lý tổng hợp thông tin

6.7.1. Mô hình Yolov4

7. CÀI ĐẶT, THỰC NGHIỆM VÀ ĐÁNH GIÁ

7.1. Cài đặt, thực nghiệm

7.1.1. Bài toán phát hiện văn bản (Text Detection)

7.1.2. Bài toán nhận diện văn bản

7.1.3. Phân loại và tổng hợp thông tin

7.2. Kết quả thực nghiệm và đánh giá

7.2.1. Độ đo đánh giá

7.2.2. Kết quả thực nghiệm, phân tích và đánh giá

8. KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Giới thiệu về Trích Xuất Thông Tin Từ Ảnh Bìa Sách Tiếng Việt

Trích xuất thông tin từ ảnh bìa sách tiếng Việt là một lĩnh vực nghiên cứu quan trọng trong công nghệ nhận diện văn bản. Với sự phát triển của công nghệ OCR, việc nhận diện và trích xuất thông tin từ bìa sách trở nên khả thi hơn bao giờ hết. Mục tiêu chính của nghiên cứu này là xây dựng một hệ thống có khả năng tự động hóa quá trình trích xuất thông tin như tên sách, tên tác giả và nhà xuất bản từ ảnh bìa sách tiếng Việt.

1.1. Tầm quan trọng của việc trích xuất thông tin

Việc trích xuất thông tin từ bìa sách không chỉ giúp quản lý sách hiệu quả mà còn hỗ trợ trong việc số hóa tài liệu. Điều này đặc biệt quan trọng trong bối cảnh số hóa ngày càng phát triển.

1.2. Các ứng dụng của công nghệ OCR trong trích xuất thông tin

Công nghệ OCR được ứng dụng rộng rãi trong nhiều lĩnh vực, từ quản lý thư viện đến phát triển ứng dụng di động. Việc áp dụng OCR vào trích xuất thông tin từ bìa sách giúp tiết kiệm thời gian và công sức.

II. Thách thức trong Trích Xuất Thông Tin Từ Ảnh Bìa Sách

Mặc dù công nghệ OCR đã phát triển, nhưng vẫn còn nhiều thách thức trong việc trích xuất thông tin từ ảnh bìa sách tiếng Việt. Các vấn đề như chất lượng ảnh, độ phức tạp của văn bản và sự đa dạng trong thiết kế bìa sách gây khó khăn cho quá trình nhận diện.

2.1. Chất lượng ảnh và ảnh hưởng đến độ chính xác

Chất lượng ảnh bìa sách ảnh hưởng trực tiếp đến khả năng nhận diện văn bản. Ảnh mờ, thiếu sáng hoặc bị biến dạng có thể dẫn đến sai sót trong quá trình trích xuất thông tin.

2.2. Độ phức tạp của văn bản trên bìa sách

Văn bản trên bìa sách thường có nhiều kiểu chữ khác nhau, màu sắc và kích thước khác nhau, điều này làm cho việc nhận diện trở nên khó khăn hơn.

III. Phương Pháp Trích Xuất Thông Tin Từ Ảnh Bìa Sách

Để giải quyết các thách thức trong việc trích xuất thông tin, nhiều phương pháp đã được nghiên cứu và áp dụng. Các mô hình học máy và công nghệ OCR hiện đại đã được sử dụng để cải thiện độ chính xác và hiệu suất của hệ thống.

3.1. Sử dụng mô hình OCR hiện đại

Mô hình OCR như Tesseract và EasyOCR đã được áp dụng để nhận diện văn bản trên bìa sách. Những mô hình này hỗ trợ nhiều ngôn ngữ, bao gồm cả tiếng Việt.

3.2. Tiền xử lý ảnh trước khi nhận diện

Tiền xử lý ảnh là bước quan trọng giúp cải thiện chất lượng ảnh đầu vào. Các kỹ thuật như làm sạch, điều chỉnh độ sáng và độ tương phản được áp dụng để tối ưu hóa ảnh trước khi đưa vào mô hình.

IV. Kết Quả Nghiên Cứu và Ứng Dụng Thực Tiễn

Nghiên cứu đã đạt được những kết quả khả quan trong việc trích xuất thông tin từ bìa sách tiếng Việt. Hệ thống đã được thử nghiệm với nhiều mẫu bìa sách và cho thấy độ chính xác cao trong việc nhận diện thông tin.

4.1. Đánh giá hiệu suất của mô hình

Các mô hình được thử nghiệm cho thấy độ chính xác đạt trên 75%, với các chỉ số như Precision và Recall được cải thiện đáng kể.

4.2. Ứng dụng trong quản lý sách

Hệ thống trích xuất thông tin từ bìa sách có thể được ứng dụng trong quản lý thư viện, giúp người dùng dễ dàng tìm kiếm và quản lý thông tin sách.

V. Kết Luận và Hướng Phát Triển Tương Lai

Trích xuất thông tin từ ảnh bìa sách tiếng Việt là một lĩnh vực đầy tiềm năng. Nghiên cứu này không chỉ mở ra hướng đi mới cho việc số hóa tài liệu mà còn góp phần vào việc phát triển công nghệ OCR tại Việt Nam.

5.1. Tương lai của công nghệ OCR tại Việt Nam

Với sự phát triển không ngừng của công nghệ, OCR sẽ ngày càng trở nên phổ biến và được ứng dụng rộng rãi trong nhiều lĩnh vực khác nhau.

5.2. Đề xuất nghiên cứu tiếp theo

Cần tiếp tục nghiên cứu và phát triển các mô hình mới, cải thiện độ chính xác và khả năng nhận diện văn bản trong các điều kiện khác nhau.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI. Nếu bạn thấy nội dung không chính xác hoặc có vấn đề, vui lòng Báo lỗi nội dung.

10/07/2025
Khóa luận tốt nghiệp khoa học dữ liệu trích xuất các đặc trưng sử dụng mô hình học sâu ứng dụng trong hệ thống phát hiện xâm nhập

Trích đoạn nội dung tài liệu

Chương 1: Tổng quan Giới thiệu về lĩnh vực nghiên cứu về OCR hiện nay và tinh ứng dung của nó trong cuộc sông hiện tại. Đồng thời, trình bày thực trạng quản lý sách hiện nay tại Việt Nam. * Chương 2: Bài toán trích xuất trên bìa sách tiếng Việt Trình bày đầu vào và đầu ra của bài toán trích xuất thông tin trên bìa sách tiếng Việt. Nêu các thách thức đặt ra của bài toán và hướng giải quyết.

¢ Chương 3: Các công trình nghiên cứu liên quan Chúng tôi trình bày một số công trình nghiên cứu chúng tôi tham khảo có cả ngôn ngữ nước ngoài và ngôn ngữ tiếng Việt. * Chương 4: Xây dựng bộ dữ liệu cho bài toán trích xuất thông tin trên bìa sách tiếng Việt Trình bày chi tiết hình thức bộ dữ liệu xây dựng, cách thu thập va gán nhãn cho bộ dữ liệu ảnh bìa sách. Quy trình gán nhãn dữ liệu và đưa ra một số phân tích về bộ dữ liệu xây dựng. « Chương 5: Các phương pháp tiếp cận Trình bày các phương pháp và mô hình dùng huấn luyện cho phát hiện văn bản trên bìa sách, nhận diện văn bản trên bìa sách, tổng hợp thông tin bìa sách.

s Chương 6: Cai đặt, thực nghiệm và đánh giá Trình bày các thức cài đặt các mô hình thực nghiệm và đánh giá kết quả thực nghiệm. * Chương 7: Kết luận và hướng phát triển 1 Chương 1.1 Giới thiệu đề tài Ở nước ta trong mấy chục năm qua, văn hoá đọc đã có những bước phát triển vượt bậc. Điều đó thể hiện ở những con số sau đây: trước năm 1975, cả hai miền Bắc và Nam xuất bản hàng năm được khoảng chưa đầy 4.000 tên sách, ngày nay hàng năm xuất bản khoảng xấp xỉ 25.000 tên sách, tăng gấp 6 lần, gần đây tốc độ gia tăng hàng năm khoảng 10%. Cả nước hiện nay đang xuất bản khoảng gần 400 tên báo, tạp chí, nhiều báo có số lượng xuất bản mỗi số lên tới 500.

Chính vì thế cần giải pháp để hỗ trợ việc quản lý sách cho những cửa hàng, thư viện và cá nhân là cần thiết, cũng từ đó hướng đến tự động hoá, chuyển đổi từ thư viện truyền thống sang thư viện điện tử/thư viện sé. Hiện nay khi thời đại khoa học công nghệ đang ngày càng phát triển, có thể dễ dàng nhận thấy công nghệ OCR hiện đã được ứng dụng rộng rãi trong đời sống, trong nhiều lĩnh vực khác nhau. Công nghệ OCR thường được dùng phổ biến nhất đó là trong các máy scanner tại các văn phòng. Hiện nay, các máy scan cơ bản chỉ có thể quét được các hình ảnh và trả chúng về những hình ảnh dạng số hoá.

Chính những lý do thực tế này, chúng tôi thực hiện đề tài này để đóng góp một phần công sức cho cộng đồng nghiên cứu về xử lý ảnh cũng như cộng đồng yêu sách ở Việt Nam. Đề tài trích xuất thông tin trên ảnh chụp bìa sách tiếng Việt với đầu vào là hình ảnh bìa sách và dau ra là thông tin tên tác giả, tên sách và tên nhà xuất bản. Trong dé tài này chúng tôi giới thiệu bộ dữ liệu ảnh gồm 7.875 ảnh chụp bìa sách đã gán nhãn. Chúng tôi xây dựng hệ thống trích xuất thông tin trên bìa gồm tên tác giả, tên sách, tên nhà xuất bản bằng cách giải quyết 3 bài toán sau: (1) phát hiện văn bản trên ảnh bìa sách, (2) nhận dạng văn bản trên ảnh bìa sách, (3) tổng hợp, phân loại nội dung văn bản.2 Tinh ứng dụng của đề tài Nghiên cứu của chúng tôi mang đến một số đóng góp cho cộng đồng xử lý ảnh va tính ứng dụng trong việc quản lý thư viện, cửa hàng bán sách, tủ sách cá nhân.

Trong lĩnh vực xử lý ảnh nói chung và mảng OCR nói riêng, bộ dữ liệu chúng tôi xây dựng gồm 7,875 ảnh chụp các bìa sách tiếng Việt phục vụ nghiên cứu và huấn luyện được mô hình phát hiện chữ tiếng Việt trên ảnh và nhận dạng chữ tiếng Việt trên ảnh. Ứng dụng cho những hệ thống có thực hiện nhiệm vụ nhận dạng chữ tiếng Việt thông qua hình ảnh. Ứng dụng chính mà chúng tôi hướng đến khi thực hiện đề tài này là xây dựng một hệ thống số hóa tủ sách hay ứng dụng hỗ trợ trích xuất các thông tin của sách trên bìa sách. Trên bìa sách có những thông tin chính bao gồm tác giả, tên sách, nhà xuất bản, những thông tin này giống như địa chỉ để người đọc tìm kiếm đến một cuốn sách.

Trong các thư viện, nhà sách hay tủ sách cá nhân khi muốn sao lưu và thống kê quản lý số lượng sách trong kho, điều tất nhiên phải ghi lại các thông tin trên bìa sách về tên sách, tên tác giả, nhà xuất bản. Tuy nhiên với số lượng sách khổng lồ trong thư viện hay các nhà sách cần ứng dụng hỗ trợ thực hiện công việc sao lưu này một cách nhanh chóng.Ngoài tiết kiệm được thời gian, các tài liệu, văn bản được số hóa sẽ giúp tiết kiệm không gian lưu trữ và dé dang quản lý. 143 Kếtluận Nhìn chung, bài toán OCR đã và đang được đẩy mạnh nghiên cứu và ứng dụng nhiều trong cuộc sống. Đặc biệt, OCR trong việc giải quyết các bài toán về nhận diện chữ viết trong hình ảnh tao ra nhiều giá trị cho cuộc sống con người trong xu thé số hóa hiện nay.

Áp dụng OCR xây dựng một hệ thống trích xuất thông tin từ sách hỗ trợ cho việc quản lý sách trong thư viện, nhà sách hay tủ sách cá nhân giúp tiết kiệm được thời gian cũng như không gian lưu trữ, giúp người dùng sắp xếp quản lý sách một cách chuyên nghiệp và thuận hơn. Đồng thời, qua quá trình xây dựng nghiên cứu về dé tài đóng góp phần nhỏ vào công cuộc nghiên cứu chuyển đổi công nghệ số, đặc biệt là trong nhận dạng chữ cho thế giới nói chung và Việt Nam nói riêng. BÀI TOÁN TRÍCH XUẤT THONG TIN TRÊN BÌA SÁCH TIÊNG VIỆT Trên bìa sách có những thông tin chính bao gồm tác giả, tên sách, nhà xuất bản được trích xuất ra các trường thông tin qua các bước (1) tìm vị trí các văn bản có trên ảnh bìa sách (text detection), (2) nhận dạng các văn bản dưới dạng ảnh thành nội dung dưới dạng chuỗi (text recognition), (3) phân loại các chuỗi thông tin về đúng các trường tác giả, tên sách, nhà xuất bản.1 Bài toán trích xuât thông tin trên bìa sách tiêng Việt Bài toán trích xuất thông tin trên bìa sách tiếng Việt có đầu vào với đầu ra như sau: * Đầu vào: Ảnh chụp bìa sách tiếng Việt « Đầu ra: Thông tin các trường tác giả, tên sách, nhà xuất bản. Đâu ra - _ Tên sách: Tựa vào long me - Tác giả: ĐẶNG THIÊN SƠN „ - Nhà Xuât bản: NHÀ XUẤT BẢN DÂN TRÍ Hình 2: Ví dụ mô tả đầu vào và đầu ra của bài toán trích xuất thông tin từ bìa sách tiếng Việt.

10 Nhìn vào hình 2, hình bên trái là đầu vào của hệ thống hình ảnh bìa sách tiếng Việt được chụp bằng điện thoại. Bên trái là kết quả của hệ thống gồm chi tiết các thông tin tên sách, tên tác giả, tên nhà xuat ban.2 Thách thức OCR là một bài toán được nghiên cứu và ứng dụng trong thực tế tuy nhiên bài toán chúng tôi đặt ra có một số thách thức. Dữ liệu là điều kiện cần để thực hiện bất kỳ một mô hình học máy, tuy nhiên dữ liệu để giải quyết các bài toán OCR trong tiếng Việt rất ít, đặc biệt qua khảo sát thấy được, bài toán của chúng tôi thực hiện chưa có công bé dữ liệu nào. Từ đó đặt ra thách thức cho chúng tôi, cần xây dựng một bộ dữ liệu ảnh chụp bìa sách tiếng Việt và gán nhãn đề làm đầu vào cho các mô hình máy học.

Trong bài toán phát hiện và nhận dạng chữ viết phổ biến những dạng văn bản có phông chữ cố định và dạng phông chữ phổ biến cụ thể như bài toán trích xuất thông tin trên hóa đơn, tuy nhiên các văn bản xuất hiện trên bìa sách là văn bản phi cấu trúc. Văn bản đa dạng về bố cục, phông chữ và background phức tạp. Thêm vào đó, các công trình nghiên cứu về bài toán nhận dạng văn bản trên hình ảnh có cấu trúc phức tạp rất ít, đặc biệt cho tiếng Việt. Từ những thách thức đặt ra, chúng tôi quyết định thực hiện đề tài này biến những thách thức thành cơ hội được nghiên cứu và thực nghiệm tạo ra bộ dữ liệu, các mô hình có thể một phần đóng góp vào những ứng dụng phục vụ trong cuộc sống, cũng như một phan thúc day quá trình cuộc cách mạng công nghệ của Việt Nam và thé giới.3 Phương pháp đề xuât giải quyét bài toán Dựa vào phân tích, đánh giá các điều kiện cần và đủ để giải quyết bài toán trích xuất thông trên bìa sách mà chúng tôi đặt ra, chúng tôi đề xuất các phương pháp đề từng bước giải quyết các van dé như sau: s Xây dựng bộ dữ liệu anh bìa sách, bộ dữ liệu đủ lớn đạt 7.000 ảnh và gan nhãn.

11 Nhãn dữ liệu là tọa độ bounding box văn bản có trên bìa sách và nội dung văn bản có trong bounding box. ¢ Huấn luyện mô hình cho nhiệm vụ phát hiện văn bản trên ảnh bìa sách (text detection) các mô hình chúng tôi đề xuất sử dung CRAFT , mô hình SAST, EAST của Paddle. ¢ Huấn luyện mô hình cho nhiệm vụ nhận dạng văn bản trên ảnh bìa sách (text recognition) các mô hình chúng tôi dé xuất sử dụng mô hình nhận dạng văn ban SVTR, CRNN của Paddle, mô hình transformerOCR của VietOCR. ¢ Huấn luyện mô hình YOLOv4 phát hiện vùng đối tượng văn bản thuộc nhóm thông tin tên sách(Title), tên tác giả(Author), tên nhà xuất ban(Publisher).

Xử lý tong hợp thông tin. Phát hiện văn bản Thực hiện xử lý tổng hợp mảnh thông tin tên sách, tên tác giả, tên Huấn luyện mô hình CRAFT, SAST, nhà xuất bản. EAST cho nhiệm vụ phát hiện văn bản trên bìa sách. @ ® @ © Xây dựng dữ liệu C Quản Nhận dạng văn Po Guốn: Xây dựng bộ dữ liệu bìa sách bản khoảng 7.

Huấn luyện mô hình SVTR, CRNN, TransformerOCR cho nhiệm vụ nhận diện văn bản trên bìa sách. Hình 3: Sơ đồ chuỗi các phương pháp dé xuất giải quyết bài toán trích xuất thông tin từ bìa sách tiếng Việt. CÁC CÔNG TRÌNH NGHIÊN CỨU LIEN QUAN Dạng ảnh chứa văn bản xử lý trong bài toán OCR được chia 2 dạng: ảnh văn bản có cau trúc và văn bản phi cấu trúc.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề Trích Xuất Thông Tin Từ Ảnh Bìa Sách Tiếng Việt cung cấp cái nhìn sâu sắc về quy trình và kỹ thuật trích xuất thông tin từ ảnh bìa sách, một lĩnh vực đang ngày càng trở nên quan trọng trong việc số hóa và quản lý thông tin văn hóa. Tài liệu này không chỉ giúp người đọc hiểu rõ hơn về các phương pháp hiện có mà còn chỉ ra những lợi ích thiết thực như cải thiện khả năng tìm kiếm và phân loại sách, từ đó nâng cao trải nghiệm người dùng trong việc tiếp cận thông tin.

Để mở rộng kiến thức của bạn về chủ đề này, bạn có thể tham khảo thêm tài liệu Khóa luận tốt nghiệp khoa học dữ liệu trích xuất thông tin trên bìa sách tiếng việt, nơi cung cấp cái nhìn chi tiết hơn về các kỹ thuật và ứng dụng trong lĩnh vực này. Ngoài ra, tài liệu Luận văn thạc sĩ khoa học máy tính nghiên cứu và triển khai ứng dụng trích xuất thông tin từ hóa đơn thanh toán cũng sẽ giúp bạn hiểu rõ hơn về việc áp dụng công nghệ trích xuất thông tin trong các lĩnh vực khác nhau. Cuối cùng, tài liệu Luận văn thạc sĩ khoa học máy tính applying machine learning techniques in extracting information from the log file sẽ mang đến cho bạn cái nhìn về việc ứng dụng học máy trong việc trích xuất thông tin từ các nguồn dữ liệu khác nhau. Những tài liệu này sẽ giúp bạn mở rộng hiểu biết và khám phá sâu hơn về các khía cạnh khác nhau của trích xuất thông tin.