CHƯƠNG 1: CƠ SỞ LÝ LUẬN VỀ KHAI PHÁ TRI THỨC 1. Khám phá tri thức và khai phá dữ liệu “Khám phá tri thức là quá trình tìm ra những tri thức, đó là những mẫu tìm ẩm, trước đó chưa biết và là thông tin hữu ích đáng tin cậy”. Còn khai phá dữ liệu là một bước quan trọng trong quá trình khám phá tri thức, sử dụng các thuật toán KPDL chuyên dùng để tìm ra được các mẫu hoặc các mô hình có ích trong dữ liệu. Nói một cách khách, mục đích của khám phá tri thức và KPDL chính là việc tìm ra các mẫu hoặc mô hình đang tồn tại trong các cơ sở dữ liệu.
Khám phá tri thức và khai phá dữ liệu là một lĩnh vực phát triển rất nhanh chóng, là lĩnh vực giao thoa giữa nhiều lĩnh vực liên quan như: Công nghệ, cơ sở dữ liệu, thống kê, học máy, … Người ta cũng có thể sử dụng những tên khác cho khai phá dữ liệu và khám phá tri thức như: Khám phá tri thức trong cơ sở dữ liệu (Knowledge discovery in database – KDD), trích chọn tri thức (Knowledge extration – KE),… Hình 1: Mối quan hệ giữa KDD và tri thức Khám phá tri thức từ CSDL là quá trình sử dụng các phương pháp và công cụ tin học, trong đó con người là trung tâm của quá trình. Do đó con người cần phải cps kiến thức cơ bản về lĩnh vực cần khám phá để có thể chọn được tập con dữ liệu tốt, 1 từ đó phát hiện các mẫu phù hợp cới mục tiêu đề ra. Đó chính là tri thức, được rút ra từ CSDL thường để phục vụ cho việc giải quyết một loạt nhiệm vụ nhất định trong một lĩnh vực nhất định. Tuy vậy, quá trình khám phá tri thức mang tính chất hướng nhiệm vụ vì không phải là mọi tri thức tìm được thì đều được áp dụng vào thực tế Nếu khám phá tri thức là toàn bộ quá trình chiết xuất tri thức từ các CSDL thì KPDL là giai đoạn chủ yếu của quá trình đó.
KPDL là một quá trình phát hiện các mẫu mới, thường bao gồm việc thử tìm mô hình phù hợp với tập dữ liệu và tìm mẫu từ tập dữ liệu đó. Sử dụng các kỹ thuật và các khai niệm của các lĩnh vực đã được nhiên cứu từ trước như: học máy, thống kê, hồi quy, … Hầu hết các CSDL đều chứa rất nhiều các mẫu mới và có ích tuy nhiên mẫu có giá trị với mục tiêu đặt ra phải là những mẫu không tầm thường. Vậy nên hệ thống phải làm nhiều hơn là chỉ mò mẫm thống kê vì kết quả của việc tính toán trực tiếp thông qua công tác thống kê là đã có đối với người dùng. Qúa trình hình thành khám phá tri thức và khai phá dữ liệu Qúa trình phát hiện tri thức và khai phá dữ liệu được thực hiện thông qua nhiều bước và được lặp đi lặp lại.
Các bước trong quá trình này bao gồm: 1. Tìm hiểu lĩnh vực áp dụng và xác định bài toán 2. Thu thập và tiền xử lý dữ liệu 3. Khai phá dữ liệu 4.
Thể hiện tri thức đã phát hiện 5. Sử dụng tri thức phát hiện được Hình 2: Quy trình 5 bước khai phá dữ liệu • Bước 1: Tìm hiểu lĩnh vực áp dụng và xác định bài toán: Bước nào còn được gọi là tìm hiểu tri thức lĩnh vực. Đây là bước tiên quyết để có thể trích rút ra đươc những tri thức hữu dụng và lựa chịn được các phương pháp khai phá dữ liệu tích hợp cho các bước sau, tùy thuộc vào mục đích sử dụng và bản chất của dữ liệu 2 • Bước 2: Thu thập và tiền xử lý dữ liệu: Lựa chọn các nguông dữ liệu, xử lý nhiễu hoặc loại dữ liệu dư thừa, xử lý dữ liệu khiếm khuyết, chuyển đổi dữ liệu và rút gọn dữ liệu, … Bước này thường chiếm phần lớn thời gian trong cả tiến trình KDD • Bước 3: Khai phá dữ liệu: Nước này sẽ tìm kiếm các mẫu/mô hình ẩn chứa trong dữ liệu bằng các thuật toán khai phá dữ liệu nào đó phù hợp với từng laoij dữ liệu đầu vào. Các lớp bài toán quan trọng của khai phá dữ liệu là: mô hình hóa dữ báo phân lớp và hồi quy; phân đoạn và phân cụm; mô hình hóa sự phụ thuộc như các mô hình đồ thị hoặc dự tính mật độ; tổng quát hóa như tìm mối quan hệ giữa các trường, sự liên kết, biểu diễn trực quan; mô hình hóa hoặc phát hiện sự thay đổi, sự chênh lệch trong dữ liệu và tri thức • Bước 4: Thể hiện tri thức đã được phát hiện: Thể hiện các tri thức đã được phát hiện theo các phương pháp mô tả và dự báo.
Đây là 2 đích cơ bản nhất của các hệ thống phát hiện tri thức. Các thí nghiệm chỉ ra rằng các mẫu hoặc mô hình phát hiện được từ dữ liệu thường không được quan tâm hoặc trực tiếp sử dụng ngay và tiến trình KDD cần thiết phải lặp lại với sự đánh giá tri thức được phát hiện. Để đánh giá các luật thu được, người ta thường chia dữ liệu ra thành 2 tập: Huấn luyện trên một tập và kiểm tra trên tập kia. Qúa trình này có thể lặp đi lặp lại nhiều lần với những cách chia khác nhau, kết quả trung bình có thể dự tính được độ mạnh của các luật.
• Bước 5: Sử dụng tri thức phát hiện được: Đây là bước cuối cùng trong quá trình KDD. Trong một số trường hợp, các tri thức có thể được sử dụng mà không cần dưa vào trong hệ thống máy tính. Trong một số trường hợp khác, người sử dụng mong muốn các tri thức đã phát hiện có thể đưa vào máy tính để một số chương trình khai thác được ngay. Việc đưa các kết quả của KDD vào sử dụng trong thực tế là đích cao nhất của khám phá tri thức Vì không gian mẫu thường rất lớn nên các ràng buộc về khả năng tính toán sẽ xác định những giới hạn trong không gian con mà các thuật toán có thể thực hiện được.
Công việc của khai phá dữ liệu trong tiến trình KDD tập trung chủ yếu vào các công cụ được sử dụng để trích dẫn và liệt kê các mẫu từ dữ liệu. Các ứng dụng của khai phá dữ liệu Phát hiện tri thức và khai phá dữ liệu liên quan đến nhiều ngành, nhiều lĩnh vực: thống kê, trí tuệ nhân tạo, cơ sở dữ liệu, thuật toán, … Đặc biệt phát hiện tri thức và khai phá dữ liệu rất gần gũi với lĩnh vực thống kê, sử dụng các phương pháp thống kê để mô hình dữ liệu và phát hiện các mẫu, luật … Ngân hàng dữ liệu (Data Warehousing) và các công cụ phân tích trực tuyến (OLAP- On Line Analytical Processing) cũng liên quan rất chặt chẽ với phát hiện tri thức và khai phá dữ liệu Data Mining (Khai phá dữ liệu) là một lĩnh vực trong khoa học máy tính có mục tiêu là xây dựng các thuật toán mới hoặc tận dụng các thuật toán hiện có để học hỏi từ dữ liệu, nhằm xây dựng các mô hình có thể tổng quát hóa trong việc đưa ra các dự đoán chính xác hoặc để tìm ra các mẫu, đặc biệt là với dữ liệu tương tự mới và chưa thấy trong bộ dữ liệu huấn luyện. Khai phá dữ liệu kết hợp dữ liệu với các công cụ thống kê để dự đoán kết quả đầu ra. Kết quả này sau đó được sử dụng để đưa ra những thông tin chi tiết hữu ích cho một tác vụ nào đó.
Sau khi được huấn luyện, máy có khả năng nhận dữ liệu làm đầu vào, sử dụng một thuật toán và đưa ra câu trả lời tương ứng cho dữ liệu đó. Khai phá dữ liệu có rất nhiều ứng dụng trong thực tế, có thể kể đến như: - Hỗ trợ các nhiệm vụ thường ngày của con người: Máy học, hỗ trợ con người thực hiện các công việc hàng ngày mà không cần kiểm soát hoàn toàn đầu ra, chẳng hạn như Trợ lý ảo, Phân tích dữ liệu,… Mục tiêu sử dụng chính của khai phá dữ liệu trong trường hợp này là là để giảm lỗi do thành kiến của con người. Nó có thể hỗ trợ con người đưa ra quyết định làm giảm công sức và sai sót do con người. - Tự động hóa: Máy học, trong nhiều trường hợp có thể hoạt động hoàn toàn tự chủ mà không cần bất kỳ sự can thiệp nào của con người.
Ví dụ, robot thực hiện các bước thiết yếu trong các quy trình sản xuất tại nhà máy. - Ngành tài chính, ngân hàng: 4 Học máy đang ngày càng phổ biến trong ngành tài chính, ngân hàng. Các ngân hàng chủ yếu sử dụng khai phá dữ liệu để tìm ra các mẫu bên trong dữ liệu để tăng hiệu quả của hoạt động kinh doanh, marketing hoặc ngăn chặn các giao dịch gian lận. - Tổ chức chính phủ: Chính phủ sử dụng khai phá dữ liệu để quản lý các tiện ích và an toàn công cộng.
Chẳng hạn, Trung Quốc sử dụng một hệ thống nhận dạng khuôn mặt khổng lồ cho các hoạt động thanh toán phi tiền mặt và chấm điểm công dân, ngăn chặn các hoạt động phạm tội. - Y tế: Y tế là một trong những lĩnh vực đầu tiên sử dụng khai phá dữ liệu và có nhiều ứng dụng trong thực tế, chẳng hạn như các mô hình nhận diện hình ảnh, phân loại, dự đoán bệnh, đưa ra các phác đồ điều trị, thậm chí nghiên cứu mức độ tương hợp thuốc với từng người sử dụng dựa trên dữ liệu gene và tiền xử bệnh lý. Sự ra đời của các thiết bị đeo và cảm biến có thể sử dụng dữ liệu để đánh giá sức khỏe của bệnh nhân trong thời gian thực. Công nghệ này cũng có thể giúp các chuyên gia y tế phân tích dữ liệu để xác định các xu hướng hoặc dấu hiệu đỏ có thể dẫn đến việc chẩn đoán và điều trị được cải thiện.
- Bán lẻ Các trang web đề xuất các mặt hàng bạn có thể thích nhờ ứng dụng công nghệ máy học để phân tích lịch sử mua hàng của người dùng. Những dữ liệu mà học máy thu thập dược có thể được sử dụng để cá nhân hóa trải nghiệm mua sắm, thực hiện chiến dịch tiếp thị, tối ưu hóa giá, lập kế hoạch bán hàng. - Vận tải Khai phá dữ liệu có thể phân tích dữ liệu để xác định các tuyến đường hiệu quả hơn cũng như dự đoán các vấn đề tiềm ẩn trên hành trình của tài xế, đây chính là cách thức quan trọng giúp các công ty chuyển phát, vận tải công cộng và các tổ chức vận tải khác gia tăng lợi nhuận.