mở đầu một chiều hướng mới trong việc quản lý các thư viện được tin học hoá, bởi vì cũng cần đảm bảo việc quản lý bản thân các nguồn số hoá gắn liền với sự thông báo trong mục lục truyền thống. Như vậy các thư viện số đã bổ sung vào hệ thống quản lý thư viện tích hợp một hệ thống quản lý các nguồn số hoá trong quá trình xây dựng các sưu tập thông tin. Sự hiện diện đồng thời dưới dạng số của một nguồn lực và hình thức mô tả nguồn đó tác động đến sự tiến triển của các khổ mẫu dữ liệu. Nguyễn Thị Thủy – K53TTTV Page 11 Ứng dụng phân hệ Sưu tập số của phần mềm Libol 6.0 tại Thư viện Học viện Kỹ thuật Quân sự Số hóa tài liệu Số hóa tài liệu của vai trò quan trọng bậc nhất trong quá trình hình thành các bộ sưu tập số.
Thông thường, các dữ liệu dạng chữ, hình ảnh, âm thanh… sử dụng trên máy tính và được máy tính nhận biết đúng định dạng, được gọi chung là dữ liệu số. Quá trình chuyển các dạng dữ liệu truyền thống như các bản viết tay, bản in trên giấy, hình ảnh… sang chuẩn dữ liệu trên máy tính và được máy tính nhận biết được gọi là số hoá dữ liệu. Như vậy, số hoá dữ liệu là hình thức chuyển đổi các dữ liệu truyền thống bên ngoài thành dạng dữ liệu số mà máy tính có thể hiểu được. Nội dung (công đoạn) số hóa tài liệu Số hóa tài liệu cũng giống như bất kì hoạt động nào khác của thư viện đều phải tuân theo một trình tự nhất định.
Sản phẩm của số hóa tài liệu là các dữ liệu số ở dạng văn bản, âm thanh, hình ảnh…, được lưu trữ dưới dạng file trong bộ nhớ của máy tính và máy tính có thể đọc được. Các bước tiến hành trong số hóa tài liệu bao gồm có 2 bước: Quét hình – Scanning Nhận dạng ký tự quang học - OCR (Optical Character Recognition). Quét hình - Scanning Giai đoạn này cho ra sản phẩm số hóa dạng hình gọi là quét hình – scanning. Nếu như trước đây, khi ta muốn số hóa một cuốn sách khoảng 2000 trang thì phải mất hàng mấy ngày để quét từng trang sách.
Nhưng hiện nay cũng với cuốn sách đó chỉ mất vài giờ đồng hồ là cho ra một sản phẩm tài liệu số đảm bảo chất lượng tốt, sắc nét, hình ảnh đẹp, giống 100% bản gốc và đặc biệt còn cho phép tự động tạo các siêu dữ liệu mô tả và siêu dữ liệu cấu trúc của tài liệu ở định dạng XML. Hiện nay ở Việt nam đã có các thiết bị số hóa tài liệu của công nghệ KIRTAS APT 1200, công nghệ này cùng với thiết bị BookScan APT 1200 có thể giúp các thư viện có thể số hóa nguồn tài liệu với Nguyễn Thị Thủy – K53TTTV Page 12 Ứng dụng phân hệ Sưu tập số của phần mềm Libol 6.0 tại Thư viện Học viện Kỹ thuật Quân sự số lượng lớn, giá cả hợp lý và đảm bảo chất lượng, thiết bị nhận dạng quang học OCR. Đặc biệt là công nghệ KIRTAS APT 1200 có một phần mềm biên tập BookScan Editor cho phép tự động biên tập, tạo siêu dữ liệu theo yêu cầu; BookScan APT 1200 không làm hư hỏng tài liệu gốc do không phải tháo gáy tài liệu đối với tài liệu có độ dày trang khi thực hiện Scan. Nhận dạng ký tự quang học Giai đoạn này cho ra sản phẩm dạng số hóa văn bản gọi là nhận dạng ký tự quang học – OCR (Optical Character Recognition).
Nhận dạng ký tự quang học (tiếng Anh: Optical Character Recognition, viết tắt là OCR), là loại phần mềm máy tính được tạo ra để chuyển các hình ảnh của chữ viết tay hoặc chữ đánh máy (thường được quét bằng máy scanner) thành các văn bản tài liệu. OCR được hình thành từ một lĩnh vực nghiên cứu về nhận dạng mẫu, trí tuệ nhận tạo và machine vision. Mặc dù công việc nghiên cứu học thuật vẫn tiếp tục, một phần công việc của OCR đã chuyển sang ứng dụng trong thực tế với các kỹ thuật đã được chứng minh. Nhận dạng ký tự quang học (dùng các kỹ thuật quang học chẳng hạn như gương và ống kính) và nhận dạng ký tự số (sử dụng máy quét và các thuật toán máy tính) lúc đầu được xem xét như hai lĩnh vực khác nhau.
Bởi vì chỉ có rất ít các ứng dụng tồn tại với các kỹ thuật quang học thực sự, bởi vậy thuật ngữ Nhận dạng ký tự quang học được mở rộng và bao gồm luôn ý nghĩa nhận dạng ký tự số. Đầu tiên hệ thống nhận dạng yêu cầu phải được huấn luyện với các mẫu của các ký tự cụ thể. Các hệ thống "thông minh" với độ chính xác nhận dạng cao đối với hầu hết các phông chữ hiện nay đã trở nên phổ biến. Một số hệ thống còn có khả năng tái tạo lại các định dạng của tài liệu gần giống với bản gốc bao gồm: hình ảnh, các cột, bảng biểu, các thành phần không phải là văn bản.
Nguyễn Thị Thủy – K53TTTV Page 13 Ứng dụng phân hệ Sưu tập số của phần mềm Libol 6.0 tại Thư viện Học viện Kỹ thuật Quân sự Hiện nay, với chữ Việt, phần mềm nhận dạng chữ Việt in VnDOCR 4.0 có khả năng nhận dạng trực tiếp các loại tài liệu được quét qua máy quét, không cần lưu trữ dưới dạng tệp ảnh trung gian. Các trang tài liệu có thể được quét và lưu trữ dưới dạng tệp tin nhiều trang. Kết quả nhận dạng được lưu trữ sang định dạng của Microsoft Word, Excel. phục vụ rất tốt nhu cầu số hóa dữ liệu.
Ngoài ra, còn có một dự án OCR Tiếng Việt có tên VietOCR, được phát triển dựa trên nền tảng mã nguồn mở tesseract-ocr do Google tài trợ. VietOCR có khả năng nhận dạng chữ Việt rất tốt. Đây là một chương trình nguồn mở Java/.NET, hỗ trợ nhận dạng cho các dạng ảnh PDF, TIFF, JPEG, GIF, PNG, và BMP. ABBYY - một hãng công nghệ hàng đầu trên thế giới về lĩnh vực Nhận dạng ký tự quang học đã tiến hành nghiên cứu và triển khai công nghệ nhận dạng Tiếng Việt vào tháng 4 năm 2009.
Với công nghệ này độ chính xác trong việc nhận dạng tài liệu chữ in Tiếng Việt lên tới hơn 99% (cứ nhận dạng 100 ký tự thì có chưa đến 1 ký tự sai). Công nghệ của ABBYY chấp nhận hầu hết các định dạng ảnh đầu vào như: PDF, TIFF, JPEG, GIF, PNG, BMP, PCX, DCX, DjVu. Kết quả nhận dạng được lưu trữ dưới các định dạng MS Word, MS Excel, HTML, TXT, XML, PDF, PDF 2 lớp, trong đó định dạng PDF 2 lớp là một định dạng hoàn hảo cho việc lưu trữ và khai thác tài liệu. Với định dạng này, người đọc có thể đọc trung thực ảnh gốc nhờ lớp ảnh bên trên, các công cụ tìm kiếm có thể tìm kiểm toàn văn trên văn bản nhờ lớp text nhận dạng được bên dưới.
Yêu cầu Tài liệu số hóa là một dạng tài liệu hiện đại. Tuy nhiên, yêu cầu đặt ra đối với một sản phẩm số hóa về cơ bản sẽ mang một số nét đặc trưng giống với tài liệu nói chung và một số yêu cầu riêng của mình. Yêu cầu đối với một tài liệu số hóa bao gồm: Nguyễn Thị Thủy – K53TTTV Page 14 Ứng dụng phân hệ Sưu tập số của phần mềm Libol 6.0 tại Thư viện Học viện Kỹ thuật Quân sự - Nội dung; - Hình thức; - Sản phẩm số hóa phải phù hợp với phần mềm. Nội dung Nội dung chứa trong tài liệu là một yêu cầu không thể thiếu trong mỗi cuốn sách.
Nội dung bao gồm toàn bộ tri thức mà cuốn sách muốn truyền đạt đến bạn đọc. Một cuốn sách hay khi nội dung của nó được đáp ứng đúng yêu cầu của người đọc, không vi phạm đến những điều luật pháp quy định. Những yêu cầu về nội dung đối với một sản phẩm số hóa bao gồm: - Nội dung tài liệu số hóa phải phù hợp với nhu cầu tin chiếm đại đa số mà người dùng tin tại Thư viện. - Nội dung trong các tài liệu không vi phạm luật pháp quốc gia và quốc tế như về bản quyền tác giả, có nội dung tốt,….
- Có nguồn gốc xuất xứ rõ ràng như nhà xuất bản, tác giả, …. Tất cả các yêu cầu về nội dung đòi hỏi thư viện phải tiến hành chặt chẽ để đảm bảo chất lượng cho sản phẩm số hóa. Hình thức Sản phẩm tài liệu số hóa cũng giống như các tài liệu ở dạng truyền thống thì ngoài yêu cầu về nội dung thì cần phải đảm bảo yêu cầu về hình thức. Nếu yêu cầu về hình thức đối với tài liệu truyền thống là tài liệu phải được trình bày đẹp, dễ nhìn, trang trí thu hút trí tò mò của bạn đọc…thì tài liệu số hóa cũng tương tự như vậy.
Tuy nhiên do tài liệu số hóa và tài liệu truyền thống khác nhau ở phương thức lưu trữ là ở trên bộ nhớ của máy tính, được thể hiện dưới dạng file, cần phải có phương tiện hỗ trợ là máy tính thì mới có thể sử dụng được. Yêu cầu về mặt hình thức đối với tài liệu số hóa chính là tài liệu số hóa phải được ở một định dạng phổ biến để mọi người có thể dễ dàng truy cập, dễ dàng khai thác. Một số định dạng phổ biến của tài liệu điện tử: Nguyễn Thị Thủy – K53TTTV Page 15 Ứng dụng phân hệ Sưu tập số của phần mềm Libol 6.0 tại Thư viện Học viện Kỹ thuật Quân sự Định dạng văn bản - Những định dạng văn bản phổ biến nhất của tài liệu điện tử như: Các định dạng đơn phần mềm Microsoft Word và Word Perfect; - Định dạng RTF (Rich Text Format) được bảo đảm bởi nhiều phụ lục phần mềm trong khi đó vẫn giữ định dạng văn bản đã đặt; - Định dạng PDF (Portable Ducument Format) gồm có hình ảnh trang với cả văn bản và biểu đồ. Có thể đọc những file theo định dạng PDF bằng nhiều phần mềm để đọc files khác nhau, nhưng chúng được xây dựng chỉ nhờ phần mềm Adobe Acrobat.
Các định dạng đồ họa lưu giữ hình ảnh (ví dụ, ảnh chụp, hình vẽ) và được chia ra thành hai kiểu chính: Các định dạng vector - lưu giữ hình ảnh như là tập hợp các hình dạng hình học. Phổ biến hơn cả là: - Định dạng DXF (Drawing Interchange Format) được sử dụng rộng rãi trong các chương trình thiết kế bằng máy tính cho các kỹ sư và kiến trúc sư; - Định dạng EPS (Encapsulated PortScript) được sử dụng rộng rãi trong các hệ thống biểu quyết/bầu cử tại bàn; - Định dạng CGM (Computer Graphics Metafile) được sử dụng rộng rãi trong nhiều phần mềm đồ họa (ví dụ trong phần mềm Photoshop).