CHƯƠNG 1 TỔNG QUAN ĐỀ TÀI NGHIÊN CỨU 1. Tình hình ứng dụng máy tìm kiếm trên Thế Giới 1. Google Không cần phải giới thiệu gì thêm. Google chính là một trong những công cụ tìm kiếm dẫn đầu hiện nay.
Theo báo cáo mới nhất của netmarketshare vào tháng 01 năm 2018 thì có đến 74,52% tỉ lệ tìm kiếm trên máy tính được cung cấp bởi Google. Trong bảng xếp hạng công cụ tìm kiếm trên thiết bị di động thì Google cũng đang chiếm ưu thế cao với khoảng 93%. GoogleScholar GoogleScholar là một “nhánh” của các tìm kiếm thường xuyên được thực hiện trên Google. Thay vì tìm kiếm theo kiểu chung chung, có thể sử dụng Google Scholar để tìm kiếm các đầu sách, các bài nghiên cứu và thậm chí là cả Hình 1.1 Công cụ tìm kiếm Google Scholar thông tin về những vụ kiện ở tòa án.
Trên trang chính, chỉ cần nhập cụm từ muốn tra cứu như bình thường. Google Scholar sau đó sẽ tiến hành lọc cơ sở dữ liệu của nó và chọn ra các ví dụ có liên quan. Nếu nghiên cứu nhạy cảm với thời gian (chẳng hạn như công nghệ), có thể chọn các tùy chọn ở bên trái để thay đổi độ “mới” của thông tin muốn tìm kiếm. Nếu bạn đang phải hoàn thành một sản phẩm có yêu cầu nghiêm ngặt về nguồn, Google Scholar sẽ cung cấp trích dẫn mẫu từ các nguồn của nó.
Hãy tìm mẫu phù hợp với tiêu chuẩn trong công trình cá nhân, sau đó chỉ cần sao chép trực tiếp vào trích dẫn để tiết kiệm thời gian. RefSeek Tuy mới được ra mắt không lâu nhưng RefSeek là một lựa chọn đáng tin cậy trong việc tìm kiếm thông tin cho các nghiên cứu nói chung. Nó có một cách 1 tiếp cận dựa trên trang web nhiều hơn, đưa ra các trang web có liên quan nhưng rất đáng tin cậy cho bất kỳ lĩnh vực nào người dùng đang nghiên cứu. Nhìn chung, RefSeek là một công cụ tuyệt vời để tổng hợp nhiều bài viết và thông tin liên quan đến một đối tượng cụ thể nào đó.
Ví dụ: nếu muốn tìm hiểu về bộ xử vi lý của máy tính, trình tìm kiếm này sẽ đưa ra cùng lúc rất nhiều bài viết hay. Citeulike Citeulike là một trong những công cụ tìm kiếm giáo dục “mạnh mẽ” trong việc tìm kiếm các bài báo và nghiên cứu cụ thể. Sau khi nhập cụm từ tìm kiếm, Citeulike sẽ đưa ra tất cả các nghiên cứu về chủ đề này. Nếu một bài viết được Citeulike tin tưởng là có độ xác thực cao, sẽ có dấu tích bên cạnh bài viết đó.
Có thể thấy các nhóm thông tin liên quan đến cụm từ tìm kiếm của Hình 1.2 Công cụ tìm kiếm Citeulike mình, hãy xem tóm tắt nhanh cho mỗi bài viết trước khi kiểm tra phiên bản đầy đủ và ẩn tất cả các chi tiết không cần thiết để có thể duyệt nhanh hơn. iSeek iSeek cũng là một công cụ tìm kiếm học thuật rất đáng để bạn sử dụng. Đừng để bị đánh lừa bởi danh sách kết quả có vẻ khá khiêm tốn - iSeek sẽ chỉ hiển thị 10 kết quả tìm kiếm ở mỗi trang và nếu bạn tìm kiếm một thông tin nào đó khá phổ biến về mặt khoa học thì sẽ có rất nhiều trang về chủ đề này. Nếu số lượng kết quả tìm kiếm trả về quá nhiều và trông có vẻ hơi rối mắt, bạn có thể sử dụng bộ lọc kết quả tìm kiếm.3 Công cụ tìm kiếm iSeek 2 1.
Tình hình ứng dụng máy tìm kiếm tại Việt Nam Ở Việt Nam nổi bật với các công cụ tìm kiếm Cốc cốc, tuy nhiên chưa có nhiều công cụ tìm kiếm riêng cho các ngành đặc thù như: Tìm kiếm bài viết nghiên cứu liên quan đến các ngành (rừng, toán học, sinh học, …). Cốc cốc Cốc Cốc là công cụ tìm kiếm mặc định trên trình duyệt Cốc Cốc và được phát triển bởi Công ty TNHH Công nghệ Cốc Cốc. Ra mắt vào năm 2013, công cụ tìm kiếm Cốc Cốc tập trung tối ưu khả năng xử lý ngôn ngữ tiếng Việt nhằm đưa ra các kết quả phù hợp với nhu cầu tìm kiếm của người Việt.4 Công cụ tìm kiếm Cốc cốc 1. Mục tiêu nghiên cứu 1.
Mục tiêu chung Nghiên cứu máy tìm kiếm nhằm ứng dụng thử nghiệm giải pháp tìm kiếm thông tin bài báo khoa học trên Tạp chí Khoa học và Công nghệ Trường Đại học Lâm nghiệp hiệu quả hơn theo từ khóa, tự động gợi ý và hoàn thành. Mục tiêu cụ thể Nắm bắt hiện trạng dữ liệu bài báo khoa học trên Tạp chí Khoa học và Công nghệ Trường Đại học Lâm nghiệp. Nghiên cứu khả năng ứng dụng máy tìm kiếm, kỹ thuật và cơ chế hoạt động của máy tìm kiếm. Nghiên cứu công nghệ và kỹ thuật lập trình: RESTful API, Xử lý đa luồng (Multi-threaded), … Xây dựng thử nghiệm công cụ tìm kiếm toàn văn bản thông tin bài báo trên Tạp chí Khoa học và Công nghệ Trường Đại học Lâm nghiệp.
Đánh giá so sánh hiệu quả công cụ 1. Nội dung nghiên cứu Để hoàn thành mục tiêu của khóa luận đã đưa ra, cần tiến hành nghiên cứu và thực hiện các công việc sau đây: Nội dung 1: Khảo sát thực trạng dữ liệu bài báo khoa học trên Tạp chí Khoa học và Công nghệ Trường Đại học Lâm nghiệp. 3 Nội dung 2: Nghiên cứu về máy tìm kiếm. Nội dung 3: Nghiên cứu về các công nghệ phát triển web như: Python, Django Framework, RESTful API, … Nội dung 4: Phân tích thiết kế hệ thống và xây dựng công cụ tìm kiếm toàn văn bản thông tin bài báo trên Tạp chí Khoa học và Công nghệ Trường Đại học Lâm nghiệp.
Đối tượng và phạm vi nghiên cứu 1. Đối tương nghiên cứu Đề tài hướng nghiên cứu 2 đối tượng chính, gồm: - Nghiên cứu về máy tìm kiếm. - Nghiên cứu về dữ liệu trên Tạp chí Khoa học và Công nghệ Trường Đại học Lâm nghiệp. Phạm vi nghiên cứu - Không gian: nghiên cứu trong phạm vi dữ liệu bài báo khoa học trên Tạp chí Khoa học và Công nghệ Trường Đại học Lâm nghiệp.
- Thời gian: Dữ liệu bài báo công bố từ năm 2019 – 2021. - Nguồn dữ liệu sử dụng: Sử dụng dữ liệu bài báo khoa học được công bố trên Tạp chí Khoa học và Công nghệ Trường Đại học Lâm nghiệp. Phương pháp nghiên cứu Kết hợp nghiên cứu lý thuyết và thực hành: Lý thuyết: Đọc và tìm hiểu các tài liệu, kiến thức liên quan đến - Máy tìm kiếm. - Các chuẩn cấu trúc dữ liệu (SQL, NoSQL).
- Các mô hình hệ thống, kiến trúc hệ thống. Thực nghiệm: Cài đặt và đánh giá kết quả thực nghiệm - Phân tích thiết kế. - Lập trình phát triển. - Kiểm thử đánh giá.
Phương pháp kế thừa - Kế thừa các tài liệu nghiên cứu đã công bố liên quan đến máy tìm kiếm. 4 CHƯƠNG 2 NGHIÊN CỨU CƠ SỞ LÝ THUYẾT 2. Máy tìm kiếm có tên tiếng anh là Search Engine hay còn gọi là SE, máy tìm kiếm là một bộ máy hoạt động nhằm dò quét và lập chỉ mục thông tin của các website trên môi trường internet để giúp con người dễ dàng tìm kiếm thông tin mỗi khi chúng ta gửi truy vấn đề hệ thống máy chủ của bộ máy tìm kiếm 2. Hoạt động của Máy tìm kiếm Máy tìm kiếm có nhiệm vụ đi theo những liên kết từ website đến website khác và lập chỉ mục, khi chúng ta dùng từ khóa (Keyword) để truy vấn đến kết quả tìm kiếm thì máy tìm kiếm sẽ trích lọc dữ liệu từ máy chủ nơi chứa dữ liệu, sau đó cho hiển thị theo các thứ hạng từ những tiêu chí đánh giá khác nhau để có thể lọc được kết quả gần với ý muốn của người dùng nhất.
Càng về sau thì máy tìm kiếm lại càng thay đỗi thuật toán liên tục và hiện đại hơn, giúp con người nhiều việc hơn. Hệ thống máy tìm kiếm Search Engine Bộ thu thập thông tin – Robot Robot là một chương trình tự động duyệt qua các cấu trúc siêu liên kết để thu thập tài liệu & một cách đệ quy nó nhận về tất cả tài liệu có liên kết với tài liệu này. Robot được biết đến dưới nhiều tên gọi khác nhau: spider, web wanderer hoặc web worm,… Những tên gọi này đôi khi gây nhầm lẫn, như từ ‘spider’, ‘wanderer’ làm người ta nghĩ rằng robot tự nó di chuyển và từ ‘worm’ làm người ta liên tưởng đến virus. Về bản chất robot chỉ là một chương trình duyệt và thu thập thông tin từ các site theo đúng giao thức web.
Những trình duyệt thông thường không được xem là robot do thiếu tính chủ động, chúng chỉ duyệt web khi có sự tác động của con người. Bộ lập chỉ mục – Index Hệ thống lập chỉ mục hay còn gọi là hệ thống phân tích và xử lý dữ liệu, thực hiện việc phân tích, trích chọn những thông tin cần thiết (thường là các từ đơn, từ ghép, cụm từ quan trọng) từ những dữ liệu mà robots thu thập được và tổ chức thành cơ sở dữ liệu riêng để có thể tìm kiếm trên đó một cách nhanh chóng, hiệu quả. Hệ thống chỉ mục là danh sách các từ khoá, chỉ rõ các từ khoá nào xuất hiện ở trang nào, địa chỉ nào. Bộ tìm kiếm thông tin – Search Engine 5 Search engine là cụm từ dùng chỉ toàn bộ hệ thống bao gồm bộ thu thập thông tin, bộ lập chỉ mục & bộ tìm kiếm thông tin.
Các bộ này hoạt động liên tục từ lúc khởi động hệ thống, chúng phụ thuộc lẫn nhau về mặt dữ liệu nhưng độc lập với nhau về mặt hoạt động. Search engine tương tác với user thông qua giao diện web, có nhiệm vụ tiếp nhận & trả về những tài liệu thoả yêu cầu của user. Nguyên lý hoạt động của Search Engine Search engine điều khiển robots đi thu thập thông tin trên mạng thông qua các siêu liên kết (hyperlink). Khi robots phát hiện ra một site mới, nó gửi tài liệu (web page) về cho server chính để tạo cơ sở dữ liệu chỉ mục phục vụ cho nhu cầu tìm kiếm thông tin.
Bởi vì thông tin trên mạng luôn thay đổi nên robots phải liên tục cập nhật các site cũ. Mật độ cập nhật phụ thuộc vào từng hệ thống search engine. Khi search engine nhận câu truy vấn từ user, nó sẽ tiến hành phân tích, tìm trong cơ sở dữ liệu chỉ mục và trả về những tài liệu thoả yêu cầu.