CHƯƠNG 1. TỔNG QUAN VỀ PHÁT HIỆN TRI THỨC VÀ KHAI PHÁ DỮ LIỆU Những năm 60 của thế kỷ trước, người ta đã sử dụng các công cụ tin học để tổ chức và khai thác CSDL. Cùng với sự phát triển vượt bậc của các công nghệ điện tử và truyền thông, khả năng thu nhập lưu trữ và xử lý dữ liệu cho các hệ thống tin học không ngừng được nâng cao, theo đó lượng thông tin được lưu trữ trong các bộ nhớ không ngừng được tăng lên. Theo thống kê cho thấy lượng thông tin trong các hệ thống tin học cứ sau 20 tháng lại tăng lên gấp đôi.
Cuối những năm 80 của thế kỳ 20, sự phát triển rộng khắp của các CSDL ở mọi quy mô đã tạo ra sự bùng nổ thông tin trong toàn cầu. Vào thời gian này, người ta bắt đầu đề cập đến khái niệm khủng hoảng phân tích dữ liệu tác nghiệp để cung cấp thông tin với yêu cầu chất lượng ngày càng cao cho người làm quyết định trong các tổ chức thương mại, tài chính, khoa học, giáo dục… Hiện nay lượng dữ liệu khổng lồ này thực sự là một nguồn tài nguyên có nhiều giá trị bởi thông tin là yếu tố then chốt trong mọi hoạt động quản lý kinh doanh, phát triển sản xuất và dịch vụ… Nó giúp những người điều hành và người quản lý có hiểu biết về môi trường và tiến trình hoạt động của tổ chức mình trước khi ra quyết định để tác động đến quá trình hoạt động nhằm đạt đến mục tiêu hiệu quả và bền vững. Khai phá dữ liệu là một lĩnh vực mới xuất hiện, nhằm tự động khai thác những thông tin, những trí thức có tính tiềm ẩn hữu ích từ các CSDL cho các đơn vị tổ chức doanh nghiệp…Từ đó làm thúc đẩy khả năng sản xuất, kinh doanh, cạnh tranh cho các đơn vị, tổ chức này. Các kết quả của khoa học cùng những ứng dụng thành công trong khai phá tri thức cho thấy khai phá dữ liệu là một lĩnh vực phát triển bền vững mang lại lợi ích và có nhiều triển vọng, đồng thời có ưu thế hơn hẳn so với các công cụ phân tích dữ liệu truyền thống.
Hiện nay khai phá dữ liệu đã ứng dụng ngày càng rộng rãi trong các lĩnh vực như: Thương mại, tài chính, điều trị y học, viễn thông, tin-sinh học, giáo dục… 1. Về khai phá dữ liệu Khai phá dữ liệu là một hướng nghiên cứu mới ra đời hơn một thập niên trở lại đây, các kỹ thuật chính được áp dụng trong kỹ thuật này phần lớn được thừa kế từ CSDL, học máy, trí tuệ nhân tạo, lý thuyết thông tin, lý thuyết thống kê và LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com -14- tính toán hiệu năng cao. Do sự phát triển nhanh của khai phá dữ liệu về phạm vi ứng dụng và phương pháp tìm kiếm tri thức đã có nhiều quan điểm khác nhau về khai phá dữ liệu. Ông Tom Mitchell [18] đã đưa ra định nghĩa khai phá dữ liệu như sau: "Khai phá dữ liệu là việc sử dụng dữ liệu lịch sử để khám phá những quy tắc và cải thiện những quyết định trong tương lai".
Với một cách tiếp cận ứng dụng hơn, ông Fayyad [15] đã phát biểu: "Khai phá dữ liệu, thường được xem là việc khám phá tri thức trong các cơ sở dữ liệu, là một quá trình trích xuất những thông tin ẩn, trước đây chưa biết và có khả năng hữu ích, dưới dạng các quy luật, ràng buộc, quy tắc trong cơ sở dữ liệu". Tuy nhiên ở mức độ trừu tượng nhất định, chúng ta định nghĩa khai phá dữ liệu : Khai phá dữ liệu là một quá trình tìm kiếm, phát hiện những tri thức mới, tiềm ẩn hữu dụng từ những dữ liệu đã thu thập được. Khai phá tri thức trong CSDL là mục tiêu chính của khai phá dữ liệu, do vậy hai khái niệm khai phá dữ liệu và phát hiện tri thức được các nhà khoa học trên hai lĩnh vực xem là tương đương nhau. Thế nhưng nếu phân chia một cách chi tiết thì khai phá dữ liệu là một bước chính trong quá trình phát hiện tri thức trong dữ liệu.
Quá trình khai phá tri thức trong cơ sở dữ liệu Quá trình khai phá tri thức được tiến hành theo các bước. Bắt đầu của quá trình là kho dữ liệu thô và kết thúc với tri thức được chiết xuất ra [2]. Về lý thuyết thì có vẻ rất đơn giản nhưng thực sự đây là một quá trình rất khó khăn gặp phải rất nhiều vướng mắc như: quản lý các tập dữ liệu, phải lặp đi lặp lại toàn bộ quá trình. Gom dữ liệu: Tập hợp dữ liệu là bước đầu tiên trong quá trình khai phá dữ liệu.
Đây là bước được khai thác trong một cơ sở dữ liệu, một kho dữ liệu và thậm chí các dữ liệu từ các nguồn ứng dụng Web. Trích lọc dữ liệu: Ở giai đoạn này dữ liệu được lựa chọn hoặc phân chia theo một số tiêu chuẩn nào đó phục vụ mục đích khai thác, ví dụ chọn tất cả những người có tuổi đời từ 25-35 và có trình độ đại học. Làm sạch, tiền xử lý và chuẩn bị trước dữ liệu: Giai đoạn thứ ba này là giai đoạn hay bị sao lãng, nhưng thực tế nó là một bước rất quan trọng trong quá trình khai phá dữ liệu. Một số lỗi thường mắc phải trong khi gom dữ liệu là tính không đủ chặt chẽ, logic.
Vì vậy, dữ liệu thường chứa các giá trị vô LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com -15- nghĩa và không có khả năng kết nối dữ liệu. Giai đoạn này sẽ tiến hành xử lý những dạng dữ liệu không chặt chẽ nói trên. Những dữ liệu dạng này được xem như thông tin dư thừa, không có giá trị. Bởi vậy, đây là một quá trình rất quan trọng vì dữ liệu này nếu không được “làm sạch-tiền xử lý-chuẩn bị trước” thì sẽ gây nên những kết quả sai lệch nghiêm trọng.
Chuyển đổi dữ liệu: Tiếp theo là giai đoạn chuyển đổi dữ liệu, dữ liệu đưa ra có thể sử dụng và điều khiển được bởi việc tổ chức lại nó, tức là dữ liệu sẽ được chuyển đổi về dạng phù hợp cho việc khai phá bằng cách thực hiện các thao tác nhóm hoặc tập hợp… Hình 1. Quá trình phát hiện tri thức 5. Khai phá dữ liệu: Đây là bước mang tính tư duy trong khai phá dữ liệu. Ở giai đoạn này nhiều thuật toán khác nhau đã được sử dụng để trích ra các mẫu từ dữ liệu.
Thuật toán thường dùng là nguyên tắc phân loại, nguyên tắc kết hợp. Đánh giá các luật và biểu diễn tri thức: Ở giai đoạn này, các mẫu dữ liệu được chiết xuất ra bởi phần mềm khai phá dữ liệu. Không phải bất cứ mẫu dữ liệu nào cũng đều hữu ích, đôi khi nó còn bị sai lệch. Vì vậy, cần phải ưu tiên những tiêu chuẩn đánh giá để chiết xuất ra các tri thức cần chiết xuất ra.
Đánh giá sự hữu ích của các mẫu biểu diễn tri thức dựa trên một số phép đo. Sau đó sử dụng các kỹ thuật trình diễn và trực quan hoá dữ liệu để biểu diễn tri thức khai phá được cho người sử dụng. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com -16- Trên đây là 6 giai đoạn của quá trình phát hiện tri thức, trong đó giai đoạn " khai phá dữ liệu" là giai đoạn được quan tâm nhiều nhất. Các kỹ thuật khai phá dữ liệu Hình 1.
2 biểu diễn một tập dữ liệu giả hai chiều bao gồm 23 trường hợp. Mỗi một điểm trên hình đại diện cho một người vay tiền ngân hàng tại một số thời điểm trong quá khứ. Dữ liệu được phân loại vào hai lớp: những người không có khả năng trả nợ và những người tình trạng vay nợ đang ở trạng thái tốt (tức là tại thời điểm đó có khả năng trả nợ ngân hàng). Hai mục đích chính của khai phá dữ liệu trong thực tế là dự đoán và mô tả.
Tập dữ liệu với 2 lớp : có và không có khả năng trả nợ 1. Khai phá dữ liệu dự đoán Nhiệm vụ của khai phá dữ liệu dự đoán là đưa ra các dự đoán dựa vào các suy diễn trên dữ liệu hiện thời. Nó sử dụng các biến hay các trường trong cơ sở dữ liệu để dự đoán các giá trị không biết hay các giá trị tương lai. Bao gồm các kĩ thuật: phân loại, hồi quy.
Phân loại Mục tiêu của phương pháp phân loại dữ liệu là dự đoán nhãn lớp cho các mẫu dữ liệu. Quá trình phân loại dữ liệu thường gồm 2 bước: Xây dựng mô hình và sử dụng mô hình để phân loại dữ liệu. Xây dựng mô hình dựa trên việc phân tích các mẫu dữ liệu cho trước. Mỗi mẫu thuộc về một lớp, được xác định bởi một thuộc tính gọi là thuộc tính lớp.
Các mẫu dữ liệu này còn được gọi là tập dữ liệu huấn luyện. Các nhãn lớp LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com -17- của tập dữ liệu huấn luyện đều phải được xác định trước khi xây dựng mô hình, vì vậy phương pháp này còn được gọi là học có giám sát. Sử dụng mô hình để phân loại dữ liệu. Trước hết chúng ta phải tính độ chính xác của mô hình.
Nếu độ chính xác là chấp nhận được, mô hình sẽ được sử dụng để dự đoán nhãn lớp cho các mẫu dữ liệu khác trong tương lai. Nói cách khác, phân loại là học một hàm ánh xạ một mục dữ liệu vào một trong số các lớp cho trước. 3 cho thấy sự phân loại của các dữ liệu vay nợ vào trong hai miền lớp. Ngân hàng có thể sử dụng các miền phân loại để tự động quyết định liệu những người vay nợ trong tương lai có nên cho vay hay không.
Nợ Thu nhập Hình 1. Phân loại được học bằng mạng nơron cho tập dữ liệu cho vay 1. Hồi quy Phương pháp hồi quy khác với phân loại dữ liệu ở chỗ, hồi quy dùng để dự đoán về các giá trị liên tục còn phân loại dữ liệu thì chỉ dùng để dự đoán về các giá trị rời rạc. Hồi quy là học một hàm ánh xạ một mục dữ liệu vào một biến dự báo giá trị thực.
Các ứng dụng hồi quy có nhiều, ví dụ như đánh giá xác suất một bệnh nhân sẽ chết dựa trên tập kết quả xét nghiệm chẩn đoán, dự báo nhu cầu của người tiêu dùng đối với một sản phẩm mới dựa trên hoạt động quảng cáo tiêu dùng. Khai phá dữ liệu mô tả Kỹ thuật này có nhiệm vụ mô tả về các tính chất hoặc các đặc tính chung của dữ liệu trong CSDL hiện có. Bao gồm các kỹ thuật: phân cụm, phân tích luật kết hợp. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.