Chương 1: Tổng quan về khai phá mẫu phổ biến, luật kết hợp và các thước đo tương quan. Chương 2: Một số phương pháp cơ bản và mở rộng trong khai phá luật kết hợp. Chương 3: Giới thiệu công cụ khai phá dữ liệu Weka và mô phỏng. Hà Nội, ngày 10 tháng 10 năm 2011 Học viên Vũ Mỹ Hạnh LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 9 CHƢƠNG 1: TỔNG QUAN VỀ KHAI PHÁ MẪU PHỔ BIẾN, LUẬT KẾT HỢP VÀ CÁC THƢỚC ĐO TƢƠNG QUAN 1.
Tổng quan về khai phá dữ liệu 1. Khai phá dữ liệu Phát hiện tri thức trong cơ sở dữ liệu (còn được gọi là khai phá dữ liệu) là một quá trình không tầm thường, nhận ra những mẫu có giá trị, mới, hữu ích, tiềm năng và hiểu được trong dữ liệu.Tiến trình khai phá tri thức Nhiều người cho rằng khai phá dữ liệu (data mining) đồng nghĩa với khám phá tri thức từ dữ liệu – Knowledge Discovery form Data hoặc KDD. Một cách nhìn khác cho rằng khai phá dữ liệu đơn giản chỉ là một bước cốt yếu trong tiến trình khám phá tri thức[2]. Khai phá tri thức là một tiến trình bao gồm một dãy các bước: Hình 1.1: Khai phá dữ liệu là một bƣớc trong tiến trình khai phá tri thức 1.Chọn lựa dữ liệu (Trích chọn dữ liệu) – Data selection: trích chọn những tập dữ liệu cần được khai phá từ các tập dữ liệu lớn như CSDL - databases, kho dữ liệu - data warehouses, theo một số tiêu chí nhất định.
LUAN VAN CHAT LUONG download : add luanvanchat@agmail.Tiền xử lý dữ liệu – Data preprocessing: là bước làm sạch dữ liệu (xử lý với dữ liệu không đầy đủ, dữ liệu nhiễu, dữ liệu không đồng nhất, v.), rút gọn dữ liệu (sử dụng hàm nhóm và tính tổng, các phương pháp nén dữ liệu, sử dụng histograms, lấy mẫu,v.), rời rạc hóa dữ liệu (rời rạc hóa dựa vào histograms, dựa vào entropy, dựa vào phân khoảng,v. Kết thúc bước này, dữ liệu sẽ nhất quán, đầy đủ, được rút gọn và được rời rạc hóa.Đổi dạng dữ liệu – data transformation: là bước chuẩn hóa và làm mịn dữ liệu để đưa dữ liệu về dạng thuận lợi nhất nhằm phục vụ cho các kỹ thuật khai phá ở bước sau.Khai phá dữ liệu – data mining: là bước áp dụng những kỹ thuật khai phá ( phần nhiều là các kỹ thuật của học máy – machine learning) để khai phá, trích chọn được những mẫu – patterns thông tin, những mối liên hệ - relationships đặc biệt trong dữ liệu. Đây được xem là bước quan trọng và tốn nhiều thời gian nhất của toàn quá trình khai phá tri thức – KDD.Trình diễn (Biểu diễn và đánh giá tri thức) – knowledge representation & evaluation: những mẫu thông tin và mối quan hệ trong dữ liệu đã được khai phá ở bước trên được chuyển dạng và biểu diễn ở một dạng gần gũi với người sử dụng, như đồ thị, cây, bảng biểu, luật,v. Đồng thời bước này cũng đánh giá những tri thức khám phá được theo những tiêu chí nhất định.
Các hướng tiếp cận trong khai phá dữ liệu Các hướng tiếp cận của KPDL có thể được phân chia theo chức năng hay lớp các bài toán khác nhau. Sau đây là một số hướng tiếp cận khá phổ biến: Phân lớp và dự đoán (classification and prediction): là phương pháp xếp một đối tượng vào một trong những lớp đã biết trước. Hướng tiếp cận này thường sử dụng một số kỹ thuật học máy như: cây quyết định – decision, mạng nơ-ron – neural network,. Phân lớp còn được gọi là học có giám sát – supervised learning.
Phân cụm (clustering/segmentation): Xếp các đối tượng theo từng cụm, số lượng cũng như tên các cụm chưa được biết trước. Phân cụm còn được gọi là học không giám sát – unsupervised learning. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 11 Khai phá luật kết hợp (association rules): là cách biểu diễn tri thức dưới dạng các luật khá đơn giản nhưng mang rất nhiều ý nghĩa. Thông tin luật đem lại là rất đáng kể và hỗ trợ không nhỏ trong quá trình ra quyết định.
Tìm kiếm được những luật thực sự “mạnh” chứa đựng nhiều thông tin từ CSDL tác nghiệp là một trong những hướng tiếp cận chính của lĩnh vực KPDL, là một động lực không nhỏ thúc đẩy việc tập trung nghiên cứu của nhiều nhà khoa học. Khai phá chuỗi theo thời gian (sequential/temporal patterns): giống như khai phá luật kết hợp, nhưng có thêm tính thứ tự và tính thời gian. Hướng tiếp cận này được ứng dụng nhiều trong lĩnh vực tài chính và thị trường chứng khoán vì nó có tính dự báo cao. Mô tả khái niệm (concept description & summarization): thiên về mô tả, tổng hợp và tóm tắt khái niệm.
Ví dụ như: tóm tắt văn bản,. Một số ứng dụng trong khai phá dữ liệu Khai phá dữ liệu là một lĩnh vực mới nhưng thu hút được rất nhiều sự quan tâm của các nhà nghiên cứu nhờ vào tính ứng dụng thực tiễn của nó. Một số ứng dụng điển hình được kể đến bao gồm: Phân tích dữ liệu và hỗ trợ quyết định (data analysis and dicision support): oPhân tích và quản lý thị trường: Tiếp thị định hướng, quản lý quan hệ khách hàng, phân tích thói quen mua sắm, tiếp thị chéo, phân đoạn thị trường. oPhân tích và quản lý rủi ro: dự báo, duy trì khách hàng, cải thiện bảo lãnh, kiểm soát chất lượng, phân tích cạnh tranh.
oPhát hiện gian lận, phát hiện mẫu bất thường (ngoại lai). Ứng dụng khác: oKhai phá văn bản (text mining), khai phá web (web mining). oKhai phá dữ liệu dòng. oTin sinh (bio-informatics): tìm kiếm, đối sánh giữa các hệ gen và thông tin di truyền, mối liên hệ giữa một số hệ gen và bệnh di truyền, phân tích AND và dữ liệu sinh học.
LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 12 oĐiều trị y học ( medical treament), như tìm hiểu mối quan hệ giữa triệu chứng, chuẩn đoán và phương pháp điều trị, giữa chế độ dinh dưỡng với bệnh lý và thuốc,. oTài chính và thị trường chứng khoán ( finance and stock market): phân tích và dự báo tình tình tài chính cũng như quy luật hoạt động của cổ phiếu trên trị thường chứng khoán,. Một số thách thức trong khai phá dữ liệu Hiện nay, khai phá dữ liệu được ứng dụng trong nhiều lĩnh vực khá điển hình như: trong Phân tích dữ liệu hỗ trợ ra quyết đinh, trong y học, bảo hiểm, giáo dục, trong lĩnh vực tài chính và phân tích thị trường, và một số lính vực khác như Tin sinh học, và khai phá dữ liệu web,. Có khá nhiều những giải pháp cũng như các phương pháp được sử dụng trong khai phá dữ liệu, tuy nhiên vẫn tồn tại không ít khó khăn và thách thức: Cơ sở dữ liệu lớn (về số lượng các bản ghi cũng như về số chiều thuộc tính) trong cơ sở dữ liệu ( CSDL).
Dung lượng của các bản ghi trong CSDL đôi khi lên tới hàng GigaByte(GB), TeraByte(TB). Số chiều thuộc tính trong CSDL có thể rất lớn và đa dạng. Để giải quyết vấn đề này, người ta đưa ra một ngưỡng nào đó cho CSDL bằng các cách như: chiết xuất mẫu, xấp xỉ hoặc xử lý song song. Trong CSDL khi số chiều thuộc tính là rất lớn, cùng với số lượng lớn các bản ghi sẽ dẫn đến kích thước và độ phức tạp của bài toán tăng lên.Vì vậy, không gian tìm kiếm và không gian trạng thái gia tăng, nhiều mẫu dư thừa và trùng lặp, phát sinh nhiều luật thừa.
Đây được coi là vấn đề nan giải trong quá trình khai phá dữ liệu. Nhằm giải quyết những vấn đề trên, phải sử dụng một số tri thức đã biết để loại bỏ và trích lọc ra những dữ liệu thích hợp với yêu cầu bài toán. Dữ liệu bị thay đổi phụ thuộc theo thời gian: có nghĩa là dữ liệu bị ảnh hưởng và phụ thuộc vào thời điểm quan sát, thời điểm lấy mẫu, thời điểm khai phá. Kết quả đạt được sau khai phá cũng gây không ít khó khăn cho khai phá dữ liệu, ví dụ như các mẫu khai phá ở giai đoạn trước có thẻ không còn giá trị hay vô nghĩa tại thời điểm sử dụng, hoặc có thể bị làm nhiễu hay phát sinh LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 13 hiệu ứng phụ làm sai lệch kết quả.
Để khắc phục được vấn đề này cần thiết phải chuẩn hóa, cải tiến và nâng cấp mẫu, nâng cấp các mô hình và có thể xem các thay đổi này là mục đích của khai phá và tìm kiếm mẫu bị thay đổi. Thuộc tính không phù hợp, các bộ giá trị không đầy đủ, bị thiếu các giá trị trong các miền thuộc tính đã làm ảnh hưởng không nhỏ đến quá trình khai phá dữ liệu. Trong khai phá dữ liệu, khi các hệ thống tương tác với nhau phụ thuộc nhau mà thiếu vắng mội vài giá trị nào đó, sẽ dẫn đến các mẫu không còn chính xác, bị thiếu và không đầy đủ. Để giải quyết vấn đề này, người ta coi sự thiếu vắng của các dữ liệu này như là các giá trị ẩn, chưa biết và có thể được tiên đoán bằng một số phương pháp nào đó.
Quan hệ phức tạp giữa các thuộc tính trong CSDL cũng là vấn đề cần được quan tâm. Những bộ thuộc tính có cấu trúc, phân lớp phức tạp, có mối liên hệ phức tạp với nhau trong CSDL đòi hỏi tiến trình khai phá dữ liệu phải có các giải pháp, các kỹ thuật để có thể áp dụng được, nhận ra được các mối quan hệ này. Lựa chọn giải pháp khai phá dữ liệu tự động: Hiện này người ta chưa đưa ra được một tiêu chuẩn để đánh giá cho việc lựa chọn phương pháp nào là phù hợp và hiệu quả cho từng trường hợp cụ thể. Các kỹ thuật đều khá mới mẻ trong các lĩnh vực ứng dụng, hơn nữa lại có rất nhiều kỹ thuật được sử dụng cho nhiều bài toán khác nhau.
Vì vậy, ngay sau câu hỏi khai phá dữ liệu là gì? Câu hỏi kế tiếp ngay sau đó sẽ là: Nên sử dụng kỹ thuật nào là phù hợp và hiệu quả? Câu trả lời thật sự không đơn giản! 1. Các khái niệm cơ bản về khai phá mẫu phổ biến tìm luật kết hợp và phân tích mối tương quan 1. Khái niệm về khai phá mẫu phổ biến 1. Mẫu phổ biến Frequent patterns – mẫu phổ biến được biết đến như: các tập mục – itemsets, dãy con – subsequence, hoặc cấu trúc con – substructures, là những mẫu xuất hiện phổ biến trong một tập dữ liệu.
LUAN VAN CHAT LUONG download : add luanvanchat@agmail. Ý nghĩa của khai phá mẫu phổ biến Tìm kiếm các mẫu phổ biến đóng vai trò thiết yếu trong khai phá luật kết hợp, tìm kiếm mối tương quan, và các mối quan hệ thú vị trong dữ liệu.