Mở đầu Ở chương này nhóm sẽ làm rõ các khái niệm và thách thức liên quan đến bài toán trích xuất thông tin thẻ danh thiếp, đồng thời tìm hiểu một số phương pháp và hướng tiếp cận hiện nay. Nhóm đã khảo sát một số phương pháp nghiên cứu đã từng được áp dụng từ trước đến nay, từ đó có thể đưa ra nhận xét ưu và nhược điểm của từng phương pháp.2 Bài toán rút trích thông tin thẻ danh thiếp Nhiều tổ chức và doanh nghiệp hiện nay cần có đầy đủ thông tin khách hàng để phục vụ việc liên lạc, chạy tiếp thị - quảng cáo, hay làm thủ tục giấy tờ. Điều này đòi hỏi khách hàng phải cung cấp một số tài liệu mà doanh nghiệp yêu cầu để họ có thể xác nhận danh tính cũng như thu thập được các thông tin có liên quan. Điển hình có thể thấy như việc trao đổi danh thiếp ở các ngân hàng, khu du lịch, khách sạn,.
là tương đối nhiều. Thông thường các thông tin từ khách hàng dưới dạng thẻ danh thiếp trực tiếp hay ảnh chụp đòi hỏi các doanh nghiệp cần có bước kiểm tra, phân loại thông tin, bước trích xuất các thông tin quan 2. Các nghiên cứu liên quan. trọng như "họ và tên", "địa chỉ", 1 "nghề nghiệp",.
và sau cùng bước nhập liệu 7T vào các phần mềm quản lý. Trước sự phát triển của các phương pháp học sâu cùng với sự cải thiện của công nghệ OCR, các giải pháp tự động hay bán tự động liên quan đến việc trích xuất thông tin từ tài liệu đang được áp dụng rộng rãi và dần được ứng dụng vào việc rút trích thông thông tin từ danh thiếp. Xu hướng này cho thấy các ưu điểm vượt trội so với các thao tác thủ công truyền thống như: ‹ Trich xuất thông tin: Thông tin có thé dễ dàng thu được từ ảnh chụp thẻ danh thiếp và lưu trữ vào một nguồn có thể sử dụng lâu dài. Các thông tin thu được chủ yếu ở dạng văn bản hoặc số.
Điều này giúp các các doanh nghiệp tổ chức dữ liệu theo các cách khác nhau, tạo điều kiện cho việc sắp xếp hay chọn lọc thông tin. * Tốc độ nhanh và hiệu quả: Việc số hoá thông tin diễn ra khá nhanh giúp các doanh nghiệp, tổ chức tiết kiệm được thời gian và nguồn nhân lực. Hiện nay chỉ mat khoảng vài giây để chup/quét thẻ danh thiếp và truy xuất các thông tin liên quan. Sự chuyển dịch dần qua số hoá thông tin thay vì nhập liệu và xác minh thông tin một cách thủ công là nhờ các hướng tiếp cận dựa trên học sâu đang phát triển gần đây.
* Hạn chế phat sinh dữ liệu lỗi: Với sự tiến bộ trong công nghệ và sức mạnh tính toán của máy tính ngày nay cho phép thu thập dữ liệu, xử lý dữ liệu mà ít phát sinh lỗi. Khả năng xảy ra lỗi có thể được giảm thiểu bằng cách áp dụng các hệ thống tự động hoá này kết hợp với việc kiểm tra của con người ở bước cuối cùng trên quy trình trích xuất thông tin. + Dễ dàng tích hợp vào các hệ thong khác nhau: Các giải pháp số hoá có thể dễ dàng tích hợp vào bất cứ hệ thống nào. Ví dụ một mô hình được huấn luyện cho việc nhận diện thông tin có thể triển khai lên một trang 2.
Các nghiên cứu liên quan. Web nơi mà người dùng sẽ tải lên được rất nhiều ảnh cùng một lúc. Hay triển khai trên một thiết bị di động, ở đây người dùng có thể chụp và lựa chọn ảnh phù hợp. Kết quả có thể trả về theo định dạng phù hợp và một số tính năng riêng đi kèm.
Ngày nay, các phương pháp học sâu được ứng dụng để giải quyết rất nhiều bài toán ở các lĩnh vực khác nhau. Nhưng vẫn tổn tại một số thách thức mà các nhà nguyên cứu, các nhà phát triển phần mềm cần phải giải quyết như xây dựng các mô hình phải có chất lượng tốt, kết quả từ các mô hình phải có độ chính xác cao. Dé đạt được điều đó, phải tiến hành giảm thiểu độ lỗi phát sinh từ mô hình học sâu hay về mặt công nghệ, kỹ thuật. Đối với bài toán "Rút trích thông tin từ danh thiếp" có thể kể đến các vấn đề như: * Da dạng về mẫu, kiểu dáng và đa ngôn ngữ: Thông thường, các thẻ danh thiếp sẽ khác nhau cả về font chữ và bố cục thiết kế (Hình 2.
Các ký tự từ các font chữ khác khau sẽ có những đặc trưng riêng về cấu tạo và cách thức thể hiện, có thể kể đến như chữ có chân, chữ không chân, chữ nghệ thuật, chữ thư pháp,. Điều này gây khó khăn trong việc nhận diện các ký tự, các từ một cách chính xác. Thẻ danh thiếp sẽ mang đặc trưng của chủ sở hữu, với mục đích truyền đạt được lĩnh vực, nghề nghiệp của cá nhân hay tổ chức đó. Vì vậy không thể nhận diện thẻ danh thiếp từ một bố cục quy định sẵn.
Thi thoảng một số thẻ danh thiếp được trình bày dưới nhiều ngôn ngữ khác nhau cùng một lúc. Hay nói cách khác, việc sử dụng bộ dữ liệu có phạm vi rộng, có sự đa dạng lớn để huấn luyện mô hình thì khả năng cao mô hình thu được sẽ kém hiệu quả. * Hướng va độ nghiêng của chữ: Dé có thể số hoá được tài liệu hay thẻ danh thiếp thì chúng cần được quét hay chụp ảnh bằng các thiết bị như máy quét và camera sao cho tài liệu song song với mặt phẳng của cảm 2. Các nghiên cứu liên quan.
NGUY€N HUU THONG DH of Corporate Customer Department Corporate Customer Department (84) 931168168 § thong.vn 2 MobiFone Corporation MOBIFONE SERVICE COMPANY BRANCH NO.vn MMIB Truong Son St, Ward I4, District IO Ho Chi Minh City NI GSA REN ala Aan | ==— 11 Hình 2.1: Sự đa dạng của các thẻ danh thiếp về mẫu, kiểu dáng và ngôn ngữ biến (sensor). Nhưng việc chụp ảnh thủ công với camera hay một số thiết bị khác có thể gây ra sự sai lệch về hướng hay bị xoay một góc không mong muốn (Hình 2. Các thiết bị di động hiện nay có các cảm biến hướng giúp người dùng nhận biết và điều chỉnh để cho kết quả phù hợp. Đối với trường hợp tài liệu hay thé danh thiếp bị xoay một góc lớn có thể làm giảm độ chính xác của mô hình phát hiện và nhận diện chữ.
Tuy nhiên có một số phương pháp có thể khắc phụ được vấn đề này như RAST algorithm [4], Hough transform [5]. ag Gena ty Cô phân Viên thông yễ Hoang Trọn "Ngu n. g Nhân “Nhân viên kinh doanh. (a) Ảnh danh thiếp chụp sai hướng (b) Ảnh danh thiếp với thẻ bị xoay Hình 2.2: Lỗi phát sinh trong quá trình số hoá thẻ danh thiếp 2.
Các nghiên cứu liên quan. ‹ Bo cục phức tạp: bố cục hình ảnh có thể được xác định bởi môi trường xung quanh nơi mà thẻ danh thiếp được được chụp. Bao gồm một số yếu tố mà gây khó khăn cho hệ thống nhận diện như ánh sáng (không đồng đều hay trên và dưới mức quy định), độ tương phản, góc chụp hình, bố cục nền xung quanh, các vật thể che khuất thẻ danh thiếp,.3) Thông tin được trích xuất từ thẻ danh thiếp có bố cục phức tạp khiến cho việc xử lý gặp khó khăn. Cách khắc phục tạm thời có thể kể đến như phải đảm bảo hình ảnh được tiền xử lý trước khi huấn luyện hay thực hiện gán nhãn một cách chính xác.
Về điều kiện ánh sáng có thể áp dụng một số filter (bộ lọc) mà giúp làm nổi bật được chữ trên ảnh, hay thực hiện phân ngưỡng trắng đen giữa chữ và nền ảnh bằng phương pháp Otsu [6].3 Một số hướng tiếp cận phổ biến 2.1 Xác định thẻ danh thiếp Xác định vị trí thẻ danh thiếp từ ảnh đầu vào là bước xử lý tách thẻ danh thiếp khỏi hình nền nhiễu thông tin, giúp tăng hiệu quả quá trình nhận diện văn bản sau đó và tăng tốc độ xử lý. Phương pháp phát hiện cạnh Canny [7, 8, 3] là phương pháp xử lý ảnh phổ biến được áp dụng cho bài toán phát hiện cạnh của thẻ danh thiếp. Dựa vào thông tin cạnh phát hiện được có thể dùng để tách thẻ danh thiếp ra khỏi hình nền từ ảnh đầu vào giúp tăng hiệu quả cho giai đoạn phát hiện và nhận diện chữ. Với hình ảnh đầu vào, phương pháp phát hiện cạnh Canny sẽ trích xuất đường viền lớn nhất [9, 10, 11] để thu về được một hình tứ giác tương ứng với thẻ danh thiếp (Hình 2.
Sau khi xác định được vị trí thẻ danh thiếp, vùng nền sẽ được loại bỏ bằng phương pháp Projective Transform [12, 13] và đầu ra cuối cùng quá trình xử lý sé là ảnh chỉ chứa thẻ danh thiếp, hình ảnh này được sử dụng làm đầu vào cho bước tiếp theo. Các nghiên cứu liên quan.3: Bố cục phức tạp gây khó khăn cho hệ thống nhận diện và rút trích thông tin Tuy nhiên, đối với những ảnh đầu vào có thẻ danh thiếp màu tương tự với phông nền thì phương pháp Canny sẽ gặp khó khăn trong việc xác định đường viền của thẻ. Một trường hợp khác thẻ danh thiếp có khung hình chữ nhật nhỏ trong thẻ danh thiếp sẽ hoặc những đường viễn trong thiết kế gây nhầm lẫn đó là đường viền của danh thiếp (Hình 2. Nhận diện van bản Bài toán nhận diện văn bản hay còn được gọi là nhận diện ký tự quang học (OCR - Optical Character Recognition).
Với đầu vào của bài toán là hình ảnh 10 2. Các nghiên cứu liên quan. Toshi ati Isai Poster tienen Te: eee ee ae nh = etd 09606 088.4: Kết quả sau khi sử dụng phương pháp phát hiện cạnh Canny z + |lvCaFÂeuH & yae 3 8 b % » « FS (a) Màu thẻ trùng với phông nên € (b) Cạnh trong thẻ gây nhiễu thông tin Hình 2.5: Trường hợp phương pháp Canny không giải quyết được chứa nội dung văn bản và đầu ra là đoạn văn bản được trích xuất từ hình ảnh trên. Bài toán này có hai hướng tiếp cận chính (Hình 2.6) là: » Step-wise [14] (Tach biệt): Quá trình phát hiện và nhận diện văn ban được chia thành từng bài toán con nhỏ gối nhau, đầu ra của mô-đun này sẽ là đầu vào của mô-đun ngay sau đó.
Các bài toán con bao gồm: localization, ver- ification, segmentation va recognition. Mô-đun localization sé tim những vùng có xác suất chứa văn bản trong ảnh, sau đó mô-đun verification sé phân loại liệu rằng có phải là văn bản hay không từ đó xác định được các vùng chứa văn bản.