Luận văn: Tự động trích xuất thông tin sản phẩm web với Simhash

Luận văn về tự động trích xuất thông tin sản phẩm từ web sử dụng kỹ thuật Simhash. Nghiên cứu ứng dụng Simhash để nâng cao hiệu quả trích xuất dữ liệu sản phẩm.

Chuyên ngành

Công Nghệ Thông Tin

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ

2011

75
1
0

Phí lưu trữ

30 Point

Tóm tắt

I. Tổng Quan Luận Văn Về Tự Động Trích Xuất Thông Tin

Trong bối cảnh thương mại điện tử phát triển mạnh mẽ, việc trích xuất thông tin sản phẩm từ các website bán hàng trở nên vô cùng quan trọng. Các công cụ tìm kiếm giá cả cần thu thập và tổ chức thông tin từ hàng triệu sản phẩm trên internet. Tuy nhiên, việc này gặp nhiều thách thức, đặc biệt là khi các website có cấu trúc và cách trình bày khác nhau, thường xuyên thay đổi. Chất lượng trích xuất thông tin ảnh hưởng trực tiếp đến hiệu quả của các dịch vụ tìm kiếm. Vấn đề cốt lõi là làm sao xác định được vị trí các phần chứa thông tin sản phẩm một cách nhanh chóng và chính xác, bỏ qua các thành phần không liên quan như menu, quảng cáo, danh mục. Các phương pháp thủ công hoặc bán tự động không còn phù hợp với khối lượng dữ liệu khổng lồ này. Theo tài liệu gốc, "Chỉ khi có một phương pháp bóc tách thông tin sản phẩm thật đầy đủ và chi tiết, thì các Search Engine mới có thể đem lại kết quả tìm kiếm tốt nhất cho người dùng". Do đó, nhu cầu cấp thiết là một giải pháp tự động trích xuất thông tin web hiệu quả.

1.1. Vai Trò Của Trích Xuất Thông Tin Sản Phẩm Tự Động

Các hệ thống tìm kiếm giá cả sản phẩm trực tuyến ngày càng trở nên quan trọng trong việc giúp người tiêu dùng đưa ra quyết định mua hàng. Để hoạt động hiệu quả, các hệ thống này cần tự động trích xuất dữ liệu web từ các website thương mại điện tử, bao gồm tên sản phẩm, giá sản phẩm, mô tả sản phẩm, và hình ảnh sản phẩm. Quá trình này bao gồm thu thập dữ liệu, bóc tách thông tin sản phẩm, và tổ chức lưu trữ dữ liệu sản phẩm một cách hợp lý. Chất lượng của trích xuất dữ liệu web này quyết định trực tiếp đến chất lượng của kết quả tìm kiếm mà người dùng nhận được. Dữ liệu được trích xuất cần đầy đủ, chính xác và được cập nhật thường xuyên để đáp ứng nhu cầu của người dùng.

1.2. Thách Thức Trong Tự Động Trích Xuất Dữ Liệu Web

Mặc dù việc trích xuất thông tin sản phẩm tự động mang lại nhiều lợi ích, nhưng cũng đặt ra không ít thách thức. Các website bán hàng có cấu trúc và cách trình bày đa dạng, thay đổi liên tục. Việc xác định và phân biệt các vùng chứa thông tin sản phẩm với các vùng khác như quảng cáo, menu, banner là một bài toán khó. Bên cạnh đó, số lượng website và sản phẩm trực tuyến ngày càng tăng, đòi hỏi các hệ thống trích xuất dữ liệu web phải có khả năng mở rộng và xử lý với tốc độ cao. Theo tài liệu, “Khó khăn mà các Search Engine gặp phải là mỗi website có một cách trình bày hay bố trí sản phẩm trên trang web riêng, và cách trình bày có thể được thay đổi một cách thường xuyên.” Các phương pháp truyền thống dựa trên wrapper thủ công trở nên kém hiệu quả và tốn kém.

II. Vấn Đề Hạn Chế Của Phương Pháp Trích Xuất Dữ Liệu Hiện Tại

Các phương pháp trích xuất dữ liệu web truyền thống, như sử dụng wrapper hoặc biểu thức chính quy, thường đòi hỏi sự can thiệp thủ công và khó thích ứng với sự thay đổi của các website. Các phương pháp này tốn thời gian và công sức để xây dựng và bảo trì. Ngoài ra, một số phương pháp dựa trên xử lý ngôn ngữ tự nhiên (NLP) gặp khó khăn với cú pháp không chuẩn của các trang web. Các công cụ wrapper quy nạp cũng chỉ hiệu quả khi có sự nhất quán về cấu trúc HTML, điều này hiếm khi xảy ra trên quy mô lớn. Vì vậy, cần một phương pháp tự động hóa trích xuất dữ liệu hoàn toàn, không cần sự can thiệp của con người.

2.1. Các Hướng Tiếp Cận Trích Xuất Thông Tin Web Truyền Thống

Có nhiều hướng tiếp cận trích xuất dữ liệu web truyền thống, bao gồm: (1) Ngôn ngữ xây dựng wrapper, đòi hỏi người phát triển viết code để bóc tách thông tin; (2) Công cụ dựa trên HTML, sử dụng cấu trúc của văn bản HTML để trích xuất dữ liệu; (3) Công cụ sử dụng NLP, xây dựng luật bóc tách dựa trên phân tích ngôn ngữ tự nhiên; (4) Công cụ wrapper quy nạp, học luật bóc tách từ các mẫu dữ liệu. Tuy nhiên, tất cả các phương pháp này đều có những hạn chế nhất định về tính tự động và khả năng thích ứng với sự thay đổi của website.

2.2. Nhược Điểm Của Wrapper Thủ Công và Bán Tự Động

Việc xây dựng và duy trì wrapper thủ công là một quá trình tốn kém và dễ bị lỗi. Các wrapper cần được cập nhật thường xuyên để phản ánh những thay đổi về cấu trúc của website. Các phương pháp bán tự động, mặc dù giảm bớt công sức, nhưng vẫn đòi hỏi người dùng cung cấp các mẫu hoặc luật cho quá trình bóc tách. Do đó, cần một giải pháp trích xuất dữ liệu tự động hoàn toàn, không phụ thuộc vào sự can thiệp của con người hoặc cấu trúc cụ thể của website. Giải pháp này sẽ giúp giảm chi phí và tăng hiệu quả của quá trình thu thập dữ liệu web.

III. Phương Pháp SimHash Giải Pháp Trích Xuất Tự Động Hiệu Quả

Luận văn này đề xuất một phương pháp tự động trích xuất thông tin sản phẩm sử dụng kỹ thuật SimHash. Phương pháp này dựa trên việc tận dụng tính chất chung của các trang web bán hàng, đó là các vùng chứa thông tin sản phẩm thường có cách trình bày tương đồng. Thay vì dựa vào cấu trúc HTML cụ thể, phương pháp này sử dụng SimHash để tìm các vùng có nội dung tương tự nhau, từ đó xác định các vùng chứa mô tả sản phẩm. SimHash là một thuật toán băm đặc biệt, thường được sử dụng để phát hiện các văn bản trùng lặp. Trong luận văn này, thuật toán SimHash được điều chỉnh để áp dụng cho việc xác định các vùng dữ liệu sản phẩm trên website.

3.1. Giới Thiệu Về Kỹ Thuật SimHash và Ứng Dụng

SimHash là một thuật toán băm được thiết kế để tạo ra các mã băm có độ dài cố định cho các văn bản hoặc đối tượng. Điểm đặc biệt của SimHash là các mã băm của các đối tượng tương tự nhau sẽ có khoảng cách Hamming nhỏ. SimHash thường được sử dụng trong các ứng dụng như phát hiện nội dung trùng lặp, tìm kiếm văn bản tương tự, và phân loại sản phẩm. Trong luận văn này, SimHash được sử dụng để xác định các vùng chứa thông tin sản phẩm trên website dựa trên sự tương đồng về nội dung và cấu trúc.

3.2. Ứng Dụng Kỹ Thuật SimHash Trong Trích Xuất Thông Tin Web

Để áp dụng SimHash cho việc trích xuất thông tin web, luận văn đề xuất các bước sau: (1) Xây dựng cây DOM (Document Object Model) của trang web; (2) Tính toán SimHash cho mỗi node trên cây DOM; (3) Tìm các node có SimHash gần nhau, biểu thị các vùng có nội dung tương tự; (4) Sử dụng cây quyết định để lọc các kết quả và xác định các vùng chứa thông tin sản phẩm thực sự. Phương pháp này cho phép tự động xác định các vùng dữ liệu sản phẩm mà không cần sự can thiệp của con người hoặc dựa vào cấu trúc HTML cụ thể của website.

IV. Triển Khai Hệ Thống PEWeb và Quy Trình Tự Động Trích Xuất

Luận văn này giới thiệu hệ thống PEWeb (Product Extraction on the Web), một hệ thống tự động trích xuất thông tin sản phẩm dựa trên kỹ thuật SimHash. Hệ thống này bao gồm các thành phần chính: (1) Bộ thu thập dữ liệu web; (2) Bộ phân tích cây DOM; (3) Bộ tính toán SimHash; (4) Bộ lọc kết quả dựa trên cây quyết định; (5) Bộ trích xuất thông tin sản phẩm. Quy trình hoạt động của hệ thống bao gồm: thu thập trang web, xây dựng cây DOM, tính toán SimHash cho các node, lọc kết quả để xác định các vùng dữ liệu sản phẩm, và trích xuất các thuộc tính sản phẩm như tên sản phẩm, giá sản phẩm, và mô tả sản phẩm.

4.1. Kiến Trúc và Thành Phần Của Hệ Thống PEWeb

Hệ thống PEWeb được thiết kế theo kiến trúc module, cho phép dễ dàng mở rộng và tùy chỉnh. Các thành phần chính của hệ thống bao gồm: (1) Web crawler, thu thập các trang web từ các website thương mại điện tử; (2) HTML parser, phân tích mã HTML và xây dựng cây DOM; (3) SimHash calculator, tính toán SimHash cho các node trên cây DOM; (4) Decision tree filter, lọc các kết quả dựa trên cây quyết định; (5) Product extractor, trích xuất các thuộc tính sản phẩm từ các vùng dữ liệu sản phẩm đã xác định.

4.2. Quy Trình Tự Động Tìm Kiếm và Trích Xuất Dữ Liệu

Quy trình hoạt động của hệ thống PEWeb bao gồm các bước sau: (1) Thu thập trang web từ một URL cho trước; (2) Phân tích HTML và xây dựng cây DOM; (3) Tính toán SimHash cho các node trên cây DOM; (4) Tìm kiếm các node có SimHash gần nhau bằng cách sử dụng độ tương đồng văn bản; (5) Lọc các kết quả bằng cây quyết định để xác định các vùng chứa thông tin sản phẩm; (6) Trích xuất các thuộc tính sản phẩm từ các vùng đã xác định và lưu trữ vào cơ sở dữ liệu sản phẩm.

V. Kết Quả Nghiên Cứu Đánh Giá Hiệu Quả Kỹ Thuật SimHash

Luận văn trình bày kết quả thử nghiệm của hệ thống PEWeb trên một tập dữ liệu lớn các website bán hàng. Kết quả cho thấy phương pháp sử dụng SimHash có độ chính xác cao trong việc xác định các vùng chứa thông tin sản phẩm. Hệ thống có khả năng xử lý nhanh chóng và thích ứng tốt với sự thay đổi của cấu trúc website. So với các phương pháp truyền thống, phương pháp SimHash cho thấy ưu điểm vượt trội về tính tự động hóa và khả năng mở rộng. Các kết quả thử nghiệm chứng minh tính khả thi và hiệu quả của phương pháp trích xuất thông tin sản phẩm tự động sử dụng SimHash.

5.1. Độ Chính Xác và Tốc Độ Trích Xuất Thông Tin Sản Phẩm

Các thử nghiệm được thực hiện để đánh giá độ chính xáctốc độ trích xuất thông tin của hệ thống PEWeb. Độ chính xác được đo bằng tỷ lệ các vùng chứa thông tin sản phẩm được xác định đúng. Tốc độ trích xuất được đo bằng thời gian cần thiết để xử lý một trang web. Kết quả cho thấy hệ thống có độ chính xác cao (trên 90%) và tốc độ trích xuất nhanh (dưới 1 giây cho mỗi trang web). Điều này chứng minh tính hiệu quả của phương pháp SimHash trong việc trích xuất thông tin sản phẩm.

5.2. Khả Năng Thích Ứng Với Thay Đổi Của Website

Một trong những ưu điểm của phương pháp SimHash là khả năng thích ứng với sự thay đổi của cấu trúc website. Do phương pháp này không dựa vào cấu trúc HTML cụ thể, nó có thể tiếp tục hoạt động hiệu quả ngay cả khi website thay đổi cách trình bày hoặc cấu trúc DOM. Các thử nghiệm được thực hiện để đánh giá khả năng này bằng cách trích xuất thông tin từ các website đã được thay đổi. Kết quả cho thấy phương pháp SimHash vẫn duy trì được độ chính xác cao và tốc độ trích xuất nhanh, chứng minh tính ổn định và khả năng thích ứng của nó.

VI. Kết Luận Hướng Phát Triển Cho Trích Xuất Dữ Liệu Web Tự Động

Luận văn này đã trình bày một phương pháp tự động trích xuất thông tin sản phẩm hiệu quả sử dụng kỹ thuật SimHash. Phương pháp này giải quyết được những hạn chế của các phương pháp truyền thống và mang lại ưu điểm vượt trội về tính tự động hóa, khả năng mở rộng và khả năng thích ứng. Trong tương lai, có thể tiếp tục nghiên cứu để cải thiện độ chính xáctốc độ trích xuất của hệ thống, cũng như tích hợp thêm các kỹ thuật xử lý ngôn ngữ tự nhiênhọc máy (Machine Learning) để trích xuất các thuộc tính sản phẩm phức tạp hơn. Hướng nghiên cứu này hứa hẹn sẽ đóng góp quan trọng vào sự phát triển của các hệ thống tìm kiếm giá cảthương mại điện tử.

6.1. Ưu Điểm và Hạn Chế Của Phương Pháp SimHash

Phương pháp SimHash mang lại nhiều ưu điểm trong việc trích xuất thông tin sản phẩm tự động, bao gồm tính tự động hóa cao, khả năng mở rộng và khả năng thích ứng với sự thay đổi của website. Tuy nhiên, phương pháp này cũng có một số hạn chế, chẳng hạn như khó khăn trong việc trích xuất các thuộc tính sản phẩm phức tạp và khả năng bị ảnh hưởng bởi các vùng nội dung tương tự nhưng không liên quan. Trong tương lai, cần tiếp tục nghiên cứu để khắc phục những hạn chế này và tận dụng tối đa ưu điểm của phương pháp SimHash.

6.2. Hướng Nghiên Cứu Tương Lai và Ứng Dụng Thực Tế

Trong tương lai, có thể tiếp tục nghiên cứu để cải thiện độ chính xáctốc độ trích xuất của hệ thống PEWeb bằng cách tích hợp thêm các kỹ thuật xử lý ngôn ngữ tự nhiên (NLP)học máy (Machine Learning). Các kỹ thuật NLP có thể được sử dụng để phân tích cú pháp và ngữ nghĩa của mô tả sản phẩm, từ đó trích xuất các thuộc tính sản phẩm phức tạp hơn. Các kỹ thuật Machine Learning có thể được sử dụng để tự động học các luật bóc tách và thích ứng với sự thay đổi của website. Hệ thống PEWeb có thể được ứng dụng trong các hệ thống tìm kiếm giá cả, so sánh sản phẩm, và phân tích thị trường.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

11/09/2025
Luận văn tự động trích xuất thông tin sản phẩm trên web ứng dụng kỹ thuật simhash

Trích đoạn nội dung tài liệu

Miu ta MẪU BÌA LUẬN VĂN CÓ IN CHỮ NHŨ VÀNG Khổ 210 x 297 mm BỘ GIÁO ĐỤC VÀ ĐÀO TẠO 'TRƯỜNG ĐẠI HỌC BÁCH KHOA HÀ NỘI ý NV(L NHAñĐN NVHd Phạm Nguyễn Tuần Anh H NII ĐNOHI. HHĐN ĐNỌO TỰ ĐỘNG TRÍCH XUẤT THONG TIN SAN PHAM TRÊN WEB ỨNG DỤNG KỸ THUẬT SIMIIASIT TUAN VAN THAC 8Ï KHOA HOC CÔNG NGHỆ THÔNG TIN 6007 Tà Nội -2011 - Mau th MAU TRANG PHU BIA LUAN VAN BỘ GIÁO DỤC VÀ ĐÀO TẠO TRUONG DAI HOC BACH KHOA HA NOL Phạm Nguyễn Tuần Anh TY DONG TRICILXUAT TIONG TIN SAN PITAM TREN WEB UNG DUNG K¥ THUAT SIMHASH Chuyên ngành : Công nghệ thông tin LUẬN VĂN THẠC SĨ KHOA HỌC CONG NGI THONG TIN NGƯỜI HƯỚNG DẪN KHOA HOC : TS. NGUYEN KHANH VAN Ha Ndi - 2011 Tu d6ng ‘rich xwit thong tin sin phim trèn Web ứng đụng kỹ thuật Suxhash Pham Nguyén Tuin Anh Cao hoc CNTT 2009 MUC LUC MỤC LỤC. DAT VAN DE.

CHUONG I: KHAI QUAT BAI TOAN TRICH XU! TIN CHO DU LItv BAN CAU TRUC. Bài toán trích xuất thông tin. Giới thiện bai loán. Dũ liệu của bai toan.

Các hướng tiên cậntrong bài toán kh xuất thông tí - 11 3. Bài tưntrích oat thong tin cho dif bu bán cầu trúc - 12 3. Vẫn đẻ đặt ra với bài toán. Một số phương pháp trích xnát thông tin cho dữ liên bản câu trúc.

Phương pháp dánh giá. Ứng dụng của bài toán trích xuất thông tin cho dữ liệu bán cầu trúc. CHUONG IL: MOT SÓ PHƯƠNG PHÁP SỬ DỰNG TRONG BÀI TOÁN TRÍCH XUẤT THÔNG TTN CHO DỮ LIỆU BÁN CẤU TRÚC. 1 "trích xuất thông tin dựa vào cây DOM —.

Khái nhiệm cây DOM. Xây dựng cây DOM. 8ũ dụng cây DOM dỄ tríct xuất thông tin. Trích xuất thông tin dựa theo các mẫu biểu thức chính qui -—-21 2.

Khai niệm biểu thie chink qui ad 2. Sử đụng biểu Thức chính quả để trích xuất thông tin. Một số giải thuật trích xuất thông tin cho đữ liệu bán cầu trúc.22 Tu d6ng ‘rich xwit thong tin sin phim trèn Web ứng đụng kỹ thuật Suxhash Pham Nguyén Tuin Anh Cao hoc CNTT 2009 liệu Web thường là xây đựng các chương trình đặc biết, gọi là ode wrapper, dé tim các dữ liệu cẩn và xây dung một bộ khung đẻ khi áp đựng vào các trang web, ta có thể có tigay các đữ liệu mong muốn. Việc xây dung và duy trì wrapper có thể sẽ rất khó khăn, do dỏ dã có rất nhiều cải tiên cho việc này.

Sau day là một vải phương pháp và công cu tương ứng xây đựng cáo wrapper, cũng như tính hiệu quả của chúng đựa trên khả năng, tự động cũa chủng. -_ Ngôn ngữ xây dựng wrapper: hướng tiếp cận này sẽ thiết kế các ngôn ngữ đặc biệt. nhằm hỗ trợ ngiời xây đụng wrapper dé đảng hơn Một vải công cụ nồi bật là MieraJ11j. TSIMMISI15], Wel-OQL|3|.

Các ngôn ngữ nảy có thẻ dược sử dựng để thay thể các ngôn ngữ lập trinh. - _ Các công cụ đựa HTML: Hướng tiếp cận này nhằm xây đựng các công cụ đựa vào các đặc tính về câu trúc vên có của các văn bản HEMI, để trích xuất đữ liệu. Trong, quá trình tiên xử lý, các công cụ sử dụng hướng tiếp cân này, như WF[27], XWRAP{21], hoặc RoandRemner[10] sẽ biến đổi các văn bản thành cá cây mã phân ảnh dược tỉnh phản cấp của văn bản HTML, - Cac céng cụ sử dụng các kỹ thuật xử lý ngôn ngữ tự nhiên: Trong hướng tiếp cận này, các công cụ RAPIERI6], SRV14l, WHISKI31|,. xây dụng các luật bóc tách thông tin trong các văn bán ngôn ngữ tự nhiên bằng các sử dụng các kỹ thuật NLP, chẳng hạn như lọc, gán nhãn, và đánh thể lừ vựng ngữ nghĩa.

Hướng tiếp cận này thường thích hợp dễ xử lý các văn bản có củ pháp chuân. -_ Các công cy wrapper qui nạp: trong hướng tiếp cận này, cáo luật bóc tách dira vao các đâu hiện phân cách được xây dựng Lừ một lập hoc mau Các công cụ wrapper qui nạp, như WIUN{18], SoftMealy[16], và SLALKUR[23], sẽ thích hợp với văn. bản HTML hơn là các công øụ sử đung kỹ thuật NLT, bởi vỉ chúng phụ thuộc vào các đặc tính định đạng tạo nên cầu trúc của đữ liệu cần tìm, hơn là các rằng buộc về ngôn ngũ. Tu d6ng ‘rich xwit thong tin sin phim trèn Web ứng đụng kỹ thuật Suxhash Pham Nguyén Tuin Anh Cao hoc CNTT 2009 -_ Các gông cụ sử dựng mầu: Ý tưởng của hướng liếp cậu này là tìm trong trang web các mẫu đữ liệu mà khớp với cẩu trúc của cáo đối tượng cần quan tâm.

Sau đó, thằng cách sử dụng các thuật loản rÏnz của các công cu wrapper qui rựp, các công cụ sử dụng mẫu, như NoDoSc|1 |, và DeByEI19[ sẽ xác dịnh các dối tượng, có câu trúc giống với câu trúc cho trước trên các trang web Môi tiêu chỉ quan lrọng khi so sánh các phương pháp bóc tách thông tìm lá túc độ tự động của các phương pháp. Trong hướng tiếp cận ngôn ngữ xây dựng wrapper, người phát triển cân phải việt một lượng lớn code, đề xây dựng chương trmh bóc tách. các đối tượng cần quan tâm. Do đó, người phát triển phải kiểm tra các văn bản vá tìm các thế ITUML cần cho quá trình xác định biên của các đối tượng một cách thủ công.

Trong khi đó, mặc đà có mức độ tự động hoá cao hơn, các công cụ dựa HTML chỉ thực sự hiệu quả khi có sự nhất quá của cáo thẻ HTML trong, các trang web. Điều này khó có thể xây ra với số lượng trang web lớn. Trang các hướng tiép can NLP, wrapper qui xian, và sử đụng xấu, người phái triển chỉ phải cung cấp cae mu thử cho quá trình xây dung wrapper. Do dé, các công cụ này dược coi là bán tự dộng, Cá thế thấy rằng, các phương pháp bóc tách đữ liện ö trên không hoàn toàn tự đông: chúng đều câu iL nhất một giai doan cần sự can Huệp của người phát triển.

nảy sẽ là không khá thú khi áp dụng để xử lý một tập dữ liệu lớn như các trang web. ‘Van dé cân đặt ra là phải tìm muột hướng tiếp cận khác mà quả trình bóc tách dữ liệu cưả nó không cân dến bất cử tác dộng từ người phát triển. Trong luận văn này, tác giả sẽ để xuất một phương pháp hoàn toàn tự động để xác đình các vùng chứa mô !ä sẵn phẩm có lrên một trang web bán hàng. Phương pháp nay dựa vào hướng tiếp cận đã có của tác giá Phan Xuân Liễu vả các tác giá khác[32], trong quá trình xây dựng một hệ thông lấy thông tin sản phẩm, có tên là PEWeb.

Tưởng tiếp cân này lận dụng tỉnh chất rãi thường gặp của các trang wcb bán hàng, đó là các ving chia sin phim trong trang web thường có cách trình bảy giống hoặc gần. Đây là đặc tính quan trọng, giúp ta có thể đề đăng xác định các vùng san Tu d6ng ‘rich xwit thong tin sin phim trèn Web ứng đụng kỹ thuật Suxhash Pham Nguyén Tuin Anh Cao hoc CNTT 2009 3.1 Hai kiểu biển điển của cáo trang giàu div ligm -. Một số giải Ihuật điển hình 223 CHUONG III: PEWEB— HE THONG I BOC TACH THONG TIN SẲN PHẢM DỰA TRÊN TÍNH TOÁN ENTROPY. 29 2 Tih ioda ty 30 CHƯƠNG IV: TỰ ĐỘNG TRÍCH XUẤT" THONG TIN SAN PHAM TREN WEB UNG DỤNG KỸ THUẬT SIMHASH.Bàitoángrich›aắHhông tin sin phim tit cdc website thang mai 39 2.

Kỹ tmậtxác định vị trí các vùng mô tì sân phẩm sử dụng Simhash. Các trang web thương mại và cây DOM. Kỹ thuật Simnlash dùng trong phát hiện các văn bản rùng lặp. Su dung Simhash dé tim cae cay con tương tự nhau trong cây DOM.

Xây dựng cây quyết định cho quá trình lọc kết quả. Cài đt hệ hồng bóc tích thông tín sản phẩm sử dụng Simhadi,. Tìm kiểm các vừng có khá nàng chúa thông tin sản phẩm. Loại bộ nhiễn.

Olmong trìh bóc tách thông tnsản phẩm. con reo 52 % Cáo kế quả hưu nghiệm. cà 55 5 Kéttin va hating phitiridn. 58 TẢI LIỆU THAM KHẢO.

«c6 ccceseesieeisrereeerrre 60 Tu d6ng ‘rich xwit thong tin sin phim trèn Web ứng đụng kỹ thuật Suxhash Pham Nguyén Tuin Anh Cao hoc CNTT 2009 3.1 Hai kiểu biển điển của cáo trang giàu div ligm -. Một số giải Ihuật điển hình 223 CHUONG III: PEWEB— HE THONG I BOC TACH THONG TIN SẲN PHẢM DỰA TRÊN TÍNH TOÁN ENTROPY. 29 2 Tih ioda ty 30 CHƯƠNG IV: TỰ ĐỘNG TRÍCH XUẤT" THONG TIN SAN PHAM TREN WEB UNG DỤNG KỸ THUẬT SIMHASH.Bàitoángrich›aắHhông tin sin phim tit cdc website thang mai 39 2. Kỹ tmậtxác định vị trí các vùng mô tì sân phẩm sử dụng Simhash.

Các trang web thương mại và cây DOM. Kỹ thuật Simnlash dùng trong phát hiện các văn bản rùng lặp. Su dung Simhash dé tim cae cay con tương tự nhau trong cây DOM. Xây dựng cây quyết định cho quá trình lọc kết quả.

Cài đt hệ hồng bóc tích thông tín sản phẩm sử dụng Simhadi,. Tìm kiểm các vừng có khá nàng chúa thông tin sản phẩm. Loại bộ nhiễn. Olmong trìh bóc tách thông tnsản phẩm.

con reo 52 % Cáo kế quả hưu nghiệm. cà 55 5 Kéttin va hating phitiridn. 58 TẢI LIỆU THAM KHẢO. «c6 ccceseesieeisrereeerrre 60 Tu d6ng ‘rich xwit thong tin sin phim trèn Web ứng đụng kỹ thuật Suxhash Pham Nguyén Tuin Anh Cao hoc CNTT 2009 phẩm, giá cả, các mô lã chỉ tiết của sân phẩm, hay địa chỉ rao bán.

Nếu như việc thụ thập và tổ chức lưu trừ đữ liệu không phải lả vẫn để quá khó khăn đổi với các Search Tngime, vì đữ liệu về các sân phẩm trực tuyến chỉ là một phân rất rổ so với đữ liện toàn bộ đữ liệu Wcb, thì vẫn dễ bóc tách thông tin sản phẩm thực sự đặt ra nhiều thách: thức cho các Search Engine. Có thể nói, chất lượng của các địch vụ tìm kiếm phụ thuộc Tất nhiều vào chất. lượng của quả trình bóc lách thông lin sản phẩm. Chỉ khi có một phương pháp bóc tách thông, tia sản phẩm thật đầy đủ vả chỉ tiết, thì các Search Engine moi co thé dem lại kết quả tìm kiếm tốt nhật cho người dùng ‘Van dé dau tiên khi tiến hảnh bóc tách thông tin sản phẩm từ các trang web bán hàng trực tuyến là xác định vị trí của các phần chứa thông từì sắn phẩm có trên trang web.

Tuy nhiên, đây không phải là vấn dé cỏ thể giải quyết một cach dé dang. Trên một trang, web bản hàng, ngoài các khu vực chứa thong, tin san phẩm, còn có các vùng, thông tin khác như menu, quảng cáo, danh sách danh raục mặt hảng. Các phương pháp bóc tách sản phẩm cần phải phân biệt được các vùng chứa và không chứa thông. tin sin phẩm, dễ có thể không phát hiện thiểu hay nhằm lấn, làm ảnh hưởng tới qua trình bóc tách sau nay.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ