Luận án tiến sĩ về khai phá tập mục phổ biến mờ sử dụng cấu trúc cây và kỹ thuật xử lý song song

Luận án tiến sĩ nghiên cứu khai phá tập mục phổ biến mờ dựa trên cấu trúc cây và kỹ thuật xử lý song song, ứng dụng hiệu quả trong phân tích dữ liệu lớn.

Chuyên ngành

Máy tính

Người đăng

Ẩn danh

Thể loại

luận án tiến sĩ

2023

115
1
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

1. CHƯƠNG 1: CƠ SỞ LÝ THUYẾT

1.1. Các khái niệm cơ bản về luật kết hợp

1.2. Luật kết hợp trong cơ sở dữ liệu nhị phân

1.3. Luật kết hợp trong cơ sở dữ liệu định lượng

1.4. Tổng quan về Logic mờ

1.5. Hàm thành viên

1.6. Biến ngôn ngữ

1.7. Các phép toán logic mờ

1.8. Cơ sở dữ liệu giao dịch mờ

1.9. Độ hỗ trợ của tập mục mờ

1.10. Tập mục phổ biến mờ

1.11. Các nghiên cứu liên quan

1.11.1. Các nghiên cứu tiếp cận dựa trên Apriori

1.11.2. Các nghiên cứu mở rộng tử Apriori

1.11.3. Các phương pháp nghiên cứu dựa trên cây

1.11.3.1. Thuật toán FP-Tree mờ
1.11.3.2. Thuật toán CFFP-tree và UBFFP-tree
1.11.3.3. Thuật toán MFFP (Multiple Fuzzy Frequent Pattern)

1.12. Xác định vấn đề nghiên cứu

1.13. Kết luận chương 1

2. CHƯƠNG 2: KHAI PHÁ TẬP MỤC PHỔ BIẾN MỜ DỰA TRÊN CẤU TRÚC CÂY

2.1. Phát biểu bài toán khai phá luật kết hợp mờ

2.2. Thuật toán phân cụm dữ liệu và xác định các khoảng mờ

2.2.1. Các khái niệm cơ bản

2.2.1.1. Phân cụm dữ liệu
2.2.1.2. Xác định các khoảng mờ

2.2.2. Bài toán đặt ra

2.2.3. Thuật toán phân cụm dữ liệu EMC

2.2.3.1. Ý tưởng thuật toán
2.2.3.2. Thuật toán EMC
2.2.3.3. Đánh giá thuật toán EMC dựa trên Log Likehood

2.2.4. Thuật toán xác định các khoảng mờ

2.2.4.1. Xác định tâm
2.2.4.2. Xác định các khoảng mờ
2.2.4.3. Chuyển đổi CSDL định lượng sang CSDL mờ

2.3. Khai phá tập mục phổ biến mờ

2.3.1. Bài toán đặt ra

2.3.2. Khai phá tập mục phổ biến mờ sử dụng cấu trúc cây FPPC-tree

2.3.2.1. Ý tưởng thuật toán
2.3.2.2. Thuật toán xây dựng cây FPPC
2.3.2.3. Thuật toán xây dựng Nodelist của các mục phổ biến mờ dựa trên cây FFPC

2.3.3. Thuật toán NFFP

2.3.4. Khai phá tập mục phổ biến sử dụng cấu trúc cây FPOSC-tree

2.3.4.1. Ý tưởng thuật toán
2.3.4.2. Thuật toán xây dựng cây FPOSC (Fuzzy Pre-order Size Coding)
2.3.4.3. Thuật toán xây dựng Nodelist của các mục phổ biến mờ dựa trên cây FPOSC

2.3.5. Thuật toán NPSFF

2.3.6. Thuật toán khai phá luật kết hợp mờ

2.4. Kết luận chương 2

3. CHƯƠNG 3: KHAI PHÁ TẬP MỤC PHỔ BIẾN MỜ SỬ DỤNG KỸ THUẬT XỬ LÝ SONG SONG

3.1. Một số khái niệm liên quan về automata di động học (Cellular learning automata)

3.1.1. Automata học LA (Learning Automata)

3.1.1.1. Môi trường
3.1.1.2. Automata học ngẫu nhiên
3.1.1.3. Automata học ngẫu nhiên có cấu trúc thay đổi
3.1.1.4. Mô hình học P-model

3.1.2. Automata di động (CA – Cellular Automata)

3.1.3. Automata di động học – Cellular learning automata

3.1.3.1. Automata di động học có quy tắc
3.1.3.2. Automata di động học bất quy tắc

3.2. Thuật toán khai phá tập mục phổ biến mờ sử dụng CLA

3.2.1. Ý tưởng thuật toán

3.2.2. Tiền xử lý dữ liệu

3.2.3. Khai phá tập mục phổ biến mờ 1-item

3.2.4. Khai phá tập mục phổ biến n-itemset

3.2.5. Thuật toán CLA-FuzzyMining

3.3. Kết luận chương 3

KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

DANH MỤC CÁC CÔNG TRÌNH CỦA TÁC GIẢ

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Giới thiệu và cơ sở lý thuyết

Luận án tiến sĩ này tập trung vào việc khai phá tập mục phổ biến mờ dựa trên cấu trúc câyxử lý song song. Nghiên cứu này nhằm giải quyết các vấn đề liên quan đến việc xử lý dữ liệu định lượng trong các cơ sở dữ liệu lớn, nơi các phương pháp truyền thống không hiệu quả. Lý thuyết tập mờ được áp dụng để chuyển đổi dữ liệu định lượng thành các biến ngôn ngữ, giúp giảm thiểu tính toán và tăng cường khả năng phân tích. Các thuật toán như FP-Tree mờCFFP-tree đã được nghiên cứu để cải thiện hiệu suất khai phá dữ liệu.

1.1. Khái niệm cơ bản về luật kết hợp

Luật kết hợp là một phương pháp quan trọng trong khai thác dữ liệu, giúp tìm ra mối quan hệ giữa các mục trong cơ sở dữ liệu. Trong luận án tiến sĩ, các luật kết hợp được áp dụng để khai phá các tập mục phổ biến mờ, đặc biệt là trong các cơ sở dữ liệu định lượng. Các khái niệm như hàm thành viên, biến ngôn ngữ, và phép toán logic mờ được sử dụng để chuyển đổi dữ liệu định lượng thành dữ liệu mờ, giúp tăng cường khả năng phân tích và dự đoán.

1.2. Tổng quan về Logic mờ

Logic mờ là một công cụ mạnh mẽ trong việc xử lý dữ liệu không chắc chắn. Trong luận án tiến sĩ, logic mờ được sử dụng để chuyển đổi các giá trị định lượng thành các biến ngôn ngữ, giúp giảm thiểu tính toán và tăng cường khả năng phân tích. Các hàm thành viên như tam giác, hình thang, và Gauss được sử dụng để biểu diễn các biến ngôn ngữ, giúp tăng cường khả năng phân tích và dự đoán.

II. Khai phá tập mục phổ biến mờ dựa trên cấu trúc cây

Phần này tập trung vào việc khai phá tập mục phổ biến mờ sử dụng cấu trúc cây. Các thuật toán như FP-Tree mờCFFP-tree được nghiên cứu để cải thiện hiệu suất khai phá dữ liệu. Cấu trúc cây giúp giảm thiểu thời gian tính toán và tăng cường khả năng phân tích dữ liệu. Các thuật toán này được áp dụng để khai phá các tập mục phổ biến mờ trong các cơ sở dữ liệu định lượng, giúp tăng cường khả năng dự đoán và phân tích.

2.1. Thuật toán FP Tree mờ

Thuật toán FP-Tree mờ là một phương pháp hiệu quả để khai phá các tập mục phổ biến mờ. Thuật toán này sử dụng cấu trúc cây để giảm thiểu thời gian tính toán và tăng cường khả năng phân tích dữ liệu. Các biến ngôn ngữ được sắp xếp theo thứ tự tăng dần trong mỗi giao dịch, giúp duy trì tính chất đóng của cây và tăng cường khả năng khai phá dữ liệu.

2.2. Thuật toán CFFP tree

Thuật toán CFFP-tree được thiết kế để giảm kích thước của cây FP-Tree mờ, giúp tăng cường hiệu suất khai phá dữ liệu. Thuật toán này sử dụng một mảng để lưu trữ các giá trị mờ của các biến ngôn ngữ, giúp giảm thiểu dung lượng bộ nhớ và tăng cường khả năng phân tích dữ liệu.

III. Khai phá tập mục phổ biến mờ sử dụng kỹ thuật xử lý song song

Phần này tập trung vào việc khai phá tập mục phổ biến mờ sử dụng kỹ thuật xử lý song song. Các thuật toán như CLA-FuzzyMining được nghiên cứu để cải thiện hiệu suất khai phá dữ liệu. Kỹ thuật xử lý song song giúp tăng cường khả năng xử lý dữ liệu lớn và giảm thiểu thời gian tính toán. Các thuật toán này được áp dụng để khai phá các tập mục phổ biến mờ trong các cơ sở dữ liệu định lượng, giúp tăng cường khả năng dự đoán và phân tích.

3.1. Thuật toán CLA FuzzyMining

Thuật toán CLA-FuzzyMining là một phương pháp hiệu quả để khai phá các tập mục phổ biến mờ sử dụng kỹ thuật xử lý song song. Thuật toán này sử dụng automata di động học để tăng cường khả năng xử lý dữ liệu lớn và giảm thiểu thời gian tính toán. Các biến ngôn ngữ được sử dụng để chuyển đổi dữ liệu định lượng thành dữ liệu mờ, giúp tăng cường khả năng phân tích và dự đoán.

3.2. Ứng dụng thực tế

Kỹ thuật xử lý song song được áp dụng trong các hệ thống phân tán để tăng cường khả năng xử lý dữ liệu lớn. Các thuật toán như CLA-FuzzyMining được sử dụng để khai phá các tập mục phổ biến mờ trong các cơ sở dữ liệu định lượng, giúp tăng cường khả năng dự đoán và phân tích trong các ứng dụng thực tế.

01/03/2025
Luận án tiến sĩ khai phá tập mục phổ biến mờ dựa trên cấu trúc cây và kỹ thuật xử lý song song

Trích đoạn nội dung tài liệu

Chương 1 CƠ SỞ LÝ THUYẾT Trong chương này, NCS trình bày các khái niệm cơ bản về luật kết hợp, luật kết hợp định lượng, logic mờ, luật kết hợp mờ và các nghiên cứu liên quan đến luật kết hợp mờ. Từ đó, xác định các vấn đề còn tồn tại cần giải quyết trong chương 2.1 Luật kết hợp 1.1 Các khái niệm cơ bản về luật kết hợp [56] Định nghĩa 1.1 Cơ sở dữ liệu giao tác: Giả sử 𝐼 = {𝑖1 , 𝑖2 , … , 𝑖𝑚 } là tập các mục. 𝐷 = {𝑇1 , 𝑇2 , … , 𝑇𝑛 } là một tập các giao tác, được gọi là cơ sở dữ liệu giao tác, trong đó mỗi giao tác t trong D có dạng (tid, X) trong đó, mỗi giao tác t có định danh tid và tập mục t-itemset, 𝑡 = (𝑡𝑖𝑑, 𝑡 − 𝑖𝑡𝑒𝑚𝑠𝑒𝑡 ); X được gọi là tập mục itemset nếu 𝑋 ⊆ 𝐼. Ví dụ: CSDL giao tác D được mô tả như bảng sau Bảng 1.1: Cơ sở dữ liệu giao tác Tid Items T1 Bánh mì, Sữa T2 Bánh mì, Tã, Bia, Trứng T3 Sữa, Tã, Bia, Nước ngọt T4 Bánh mì, Sữa, Tã, Bia T5 Bánh mì, Sữa, Tã, Nước ngọt Bảng 1.1 biểu diễn cơ sở dữ liệu giao tác, trong đó tập 𝐼 = {𝐵𝑎́ 𝑛ℎ 𝑚𝑖̀, 𝑆ư ̃ 𝑎, 𝑇𝑎̃, 𝐵𝑖𝑎, 𝑇𝑟ứ 𝑛𝑔, 𝑁ướ 𝑐 𝑛𝑔𝑜̣𝑡 } là tập mục tên các mặt hàng (hay gọi là mục) và 5 giao tác.

Mỗi giao tác biểu diễn danh sách các mặt hàng đã mua. Ví dụ, giao tác T1 có chứa các mục {𝐵𝑎́ 𝑛ℎ 𝑚𝑖̀, 𝑆ữ𝑎}.2: Độ hỗ trợ của tập mục Độ hỗ trợ của một tập mục X trong cơ sở dữ liệu giao tác D ký hiệu là sup (X) là số giao dịch chứa tập mục X, được tính bởi công thức sau: 𝑠𝑢𝑝(𝑋 ) = |𝑡| 𝑋 ⊆ 𝑡, 𝑡 ∈ 𝐷 | (1.| là số giao tác. Ví dụ: trong CSDL ở bảng 1.1, độ hỗ trợ của tập mục {𝐵𝑖𝑎, 𝑇𝑎̃, 𝑆ữ𝑎} là 2 vì có hai giao tác chứa 3 mục trên.3: Tập mục phổ biến Một tập mục X có trong cơ sở dữ liệu giao tác D được gọi là phổ biến nếu độ hỗ trợ của nó (𝑠𝑢𝑝(𝑋 )) lớn hơn hoặc bằng ngưỡng độ hỗ trợ tối thiểu (minsup) cho trước do người dùng định nghĩa. Vì vậy, độ hỗ trợ được xem là tần suất xuất hiện đồng thời của các mục.4: Luật kết hợp Một luật kết hợp là một mệnh đề kéo theo có dạng X →Y, trong đó X và Y là các tập mục thoả mãn điều kiện: 𝑋 ⊆ 𝐼, 𝑌 ⊆ 𝐼 và 𝑋⋂ 𝑌 = ∅.

Đối với luật kết hợp X → Y, X được gọi là tiền đề, Y được gọi là kết quả của luật.5 : Độ hỗ trợ của một luật Cho luật kết hợp 𝑟 = 𝑋 → 𝑌, độ hỗ trợ của luật r ký hiệu là sup(r) là tỉ số giữa số lượng các giao tác T ⊆ D có chứa cả tập mục X và tập mục Y với tổng số giao tác trong D được xác định như sau: |{𝑇 ∈ 𝐷 |𝑇 ⊃ 𝑋 ∪ 𝑌}| 𝑠𝑢𝑝(𝑟) = (1.6 Độ tin cậy của một luật Cho luật kết hợp 𝑟 = 𝑋 → 𝑌, độ tin cậy của luật r ký hiệu là conf(r) là tỉ số giữa số lượng các giao tác T ⊆ D có chứa cả tập mục X và tập mục Y với tổng số giao tác trong D chứa tập mục X, được xác định như sau: |{𝑇 ∈ 𝐷 |𝑇 ⊃ 𝑋 ∪ 𝑌}| 𝑠𝑢𝑝(𝑋 ∪ 𝑌) 𝑐𝑜̣𝑛𝑓(𝑟) = = (1.3) |{𝑇 ∈ 𝐷 |𝑇 ⊃ 𝑋 }| 𝑠𝑢𝑝(𝑋 ) Ví dụ: Xem xét một luật {𝐷𝑖𝑎𝑝𝑒𝑟𝑠, 𝑀𝑖𝑙𝑘} → {𝐵𝑒𝑒𝑟}. Vì độ hỗ trợ của tập mục 2 {𝐵𝑒𝑒𝑟, 𝐷𝑖𝑎𝑝𝑒𝑟𝑠, 𝑀𝑖𝑙𝑘} là 2 và tổng số giao tác là 5, do đó độ hỗ trợ của luật là = 5 0. Độ tin cậy của luật thu được bởi tỉ số giữa độ hỗ trợ của {𝐵𝑒𝑒𝑟, 𝐷𝑖𝑎𝑝𝑒𝑟𝑠, 𝑀𝑖𝑙𝑘} n 22 và độ hỗ trợ của {𝐷𝑖𝑎𝑝𝑒𝑟𝑠, 𝑀𝑖𝑙𝑘}. Vì có 3 giao tác chứa {𝐷𝑖𝑎𝑝𝑒𝑟𝑠, 𝑀𝑖𝑙𝑘} nên độ hỗ 2 trợ của luật sẽ là = 0.7: Luật kết hợp mạnh Cho luật kết hợp 𝑟 = 𝑋 → 𝑌, nếu luật r thỏa mãn cả hai ngưỡng là độ hỗ trợ tối thiểu (minsup) và độ tin cậy tối thiểu (minconf) được gọi là luật kết hợp mạnh, tức là: 𝑠𝑢𝑝(𝑟 = 𝑋 → 𝑌) = 𝑃(𝑋 ∪ 𝑌) ≥ 𝑚𝑖𝑛𝑠𝑢𝑝 𝑠𝑢𝑝(𝑋 ∪ 𝑌) 𝑐𝑜̣𝑛𝑓(𝑟 = 𝑋 → 𝑌) = 𝑃(𝑋 ∪ 𝑌) = ≥ 𝑚𝑖𝑛𝑐𝑜̣𝑛𝑓 𝑠𝑢𝑝(𝑋 ) Ví dụ: Xem xét CSDL trong bảng 1.1, luật kết hợp {𝐷𝑖𝑎𝑝𝑒𝑟𝑠, 𝑀𝑖𝑙𝑘} → {𝐵𝑒𝑒𝑟} có nghĩa là trong cùng một giao dịch, nếu mặt hàng Diapers và Milk được mua thì mặt hàng Beer cũng được mua.

Phát biểu bài toán: Bài toán luật kết hợp được phát biểu như sau [49]: Cho một cơ sở dữ liệu giao tác D, độ hỗ trợ tối thiểu minsup, độ tin cậy tối thiểu minconf. Hãy tìm tất cả các luật kết hợp có dạng 𝑋 → 𝑌 thỏa mãn độ hỗ trợ 𝑠𝑢𝑝(𝑋∪𝑌) 𝑠𝑢𝑝(𝑋 ∪ 𝑌) ≥ 𝑚𝑖𝑛𝑠𝑢𝑝 và độ tin cậy 𝑐𝑜̣𝑛𝑓 (𝑋 → 𝑌) = ≥ 𝑚𝑖𝑛𝑐𝑜̣𝑛𝑓 𝑠𝑢𝑝(𝑋) Hầu hết các thuật toán khai phá luật kết hợp đều theo hướng chia bài toán thành hai pha cụ thể: − Pha 1: Tìm tất cả các tập mục phổ biến từ cơ sở dữ liệu, tức là tìm tất cả tập mục có độ hỗ trợ lớn hơn hoặc bằng độ hỗ trợ tối thiểu (𝑠𝑢𝑝(𝑋 ) ≥ 𝑚𝑖𝑛𝑠𝑢𝑝). − Pha 2: Sinh tất cả các luật có độ tin cậy từ tập mục phổ biến đã tìm thấy ở pha thứ 1. Nếu X là tập mục phổ biến, thì luật sinh ra từ X có dạng 𝐴 → 𝐵 trong đó 𝐵 ⊂ 𝑋, và 𝐴 = 𝑋 − 𝐵 nếu độ tin cậy của luật 𝐴 → 𝐵 có độ tin cậy lớn hơn độ tin cậy tối thiểu cho trước minconf.2 Luật kết hợp trong cơ sở dữ liệu nhị phân Luật kết hợp nhị phân đề cập đến các luật cổ điển trong bài toán phân tích giỏ hàng.

Ở đây các sản phẩm có thể có trong giao dịch hoặc không, chỉ tạo ra các giá trị kiểu boolean (được biểu diễn bằng 1 và 0). Do đó, mọi mục trong giao dịch có thể n 23 được xác định là một thuộc tính nhị phân với miền [0,1]. Mô hình được định nghĩa trong [56] như sau: Cho 𝐼 = {𝑖1 , 𝑖2 , … , 𝑖𝑚 } là một tập các thuộc tính nhị phân, gọi là các mục. Cho T là cơ sở dữ liệu giao dịch.

Mỗi giao dịch t được biểu diễn như là vecto nhị phân với 𝑡[𝑘 ] = 1 nếu giao dịch t có chứa mục 𝑖𝑘 và 𝑡 [𝑘 ] = 0 nếu ngược lại. Cho X là một tập mục chứa trong I, ta nói một giao dịch t thỏa mãn X nếu mọi mục trong X, 𝑖𝑘 ∈ 𝑋, 𝑡[𝑘 ] = 1.2: Ví dụ về cơ sở dữ liệu nhị phân Tid A B C D E 1 1 0 1 1 1 2 1 1 1 0 0 3 0 1 1 0 0 4 1 1 1 0 1 5 1 0 1 1 0 6 0 1 1 1 0 Bảng 1.2 mô tả cơ sở dữ liệu nhị phân, CSDL bao gồm sáu giao tác và năm mục được ký hiệu là A - E. Trong ví dụ này, giao dịch TID =1 có các mục A, C, D, E nên các mục này nhận giá trị 1, còn các mục B không có trong CSDL nên B nhận giá trị 0. Bài toán khai phá luật kết hợp nhị phân tập trung chủ yếu ở giai đoạn khai phá tập mục phổ biến, vì đây là giai đoạn phức tạp, đòi hỏi nhiều chi phí về thời gian và tính toán.

Hai thuật toán điển hình trong khai phá tập mục phổ biến là thuật toán Apriori [5] và FP-growth [57]. Thuật toán Apriori tiêu biểu cho phương pháp sinh ra các tập mục ứng viên rồi duyệt cơ sở dữ liệu kiểm tra độ hỗ trợ của chúng, thuật toán FP-Growth đại diện cho phương pháp không sinh ra các tập mục ứng viên mà nén cơ sở dữ liệu theo cấu trúc cây.3 Luật kết hợp trong cơ sở dữ liệu định lượng Theo dạng luật kết hợp nhị phân này thì các mục chỉ được quan tâm là có hay không xuất hiện trong cơ sở dữ liệu giao tác chứ không quan tâm về mức độ hay tần xuất xuất hiện. Trong thực tế, cơ sở dữ liệu không chỉ chứa các thuộc tính nhị phân n 24 mà còn chứa các thuộc tính định lượng và phân loại mà không thể khai phá bằng kỹ thuật cổ điển. Việc khai phá các luật trong loại dữ liệu như vậy có thể được gọi là bài toán luật kết hợp định lượng [29].

Chiến lược khai phá luật kết hợp định lượng được thực hiện bằng cách chuyển đổi các thuộc tính có giá trị định lượng sang giá trị nhị phân. Trong phương pháp này, mỗi giá trị định lượng/phân loại có dạng 〈𝑎𝑡𝑡𝑟𝑖𝑏𝑢𝑡𝑒, 𝑣𝑎𝑙𝑢𝑒〉 được ánh xạ sang giá trị nhị phân. Sau đó, các kỹ thuật khai phá luật kết hợp nhị phân được thực hiện để tìm luật. Tuy nhiên, khi miền giá trị của thuộc tính là quá lớn hoặc liên tục thì phương pháp này không hiệu quả [58].

Rời rạc hóa các thuộc tính liên tục thành các khoảng thời gian khác nhau là một cách phổ biến để giải quyết vấn đề này. Sau khi rời rạc hóa, các thuộc tính được coi là thuộc tính phân loại [59]. Chẳng hạn, một thuộc tính x có giá trị từ 20 đến 100 có thể được chia thành các khoảng (20–30, 30–40,…, 90–100). Nếu một giá trị là 62, thì khoảng (60–70) trở thành 1 và khoảng còn lại các khoảng vẫn là 0.

Vấn đề chính của sự rời rạc hóa các giá trị là mất thông tin và kết quả kém [61]. Ngoài ra, hiệu quả phụ thuộc vào các khoảng xác định, trong khi việc xác định các khoảng thích hợp là khó [62]. Trong khai phá luật kết hợp định lượng, các thuộc tính có thể là định lượng và phân loại.2 Tổng quan về Logic mờ 1.1 Tập mờ Lý thuyết tập mờ được Zadeh đưa ra vào năm 1965 [22] và rất phù hợp để xử lý các giá trị định lượng và biểu diễn ý nghĩa ngôn ngữ. Biểu diễn ngôn ngữ là phổ biến và dễ hiểu hơn đối với con người.

Một biến ngôn ngữ là một biến có giá trị của nó là tập các thuật ngữ mờ được biểu diễn bằng ngôn ngữ tự nhiên và được xác định bởi các hàm thành viên [63]. Cho một tập vũ trụ U với các phần tử ký hiệu bởi 𝑢 , 𝑈 = {𝑥}. Một tập mờ 𝐴̃ trên U là tập được đặc trưng bởi một hàm 𝜇𝐴 (𝑢) mà nó liên kết mỗi phần tử 𝑢 ∈ 𝑈 với một số thực trong đoạn [0,1].4) n 25 Trong đó 𝜇𝐴 (𝑢) là một ánh xạ từ U vào [0,1] và được gọi là hàm thành viên của tập mờ 𝐴̃.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Luận án tiến sĩ: Khai phá tập mục phổ biến mờ với cấu trúc cây và xử lý song song là một nghiên cứu chuyên sâu về việc áp dụng cấu trúc cây và xử lý song song để khai phá các tập mục phổ biến trong dữ liệu mờ. Luận án này không chỉ giới thiệu các phương pháp tiên tiến mà còn đề xuất giải pháp tối ưu hóa hiệu suất xử lý dữ liệu lớn, mang lại giá trị thực tiễn cao trong lĩnh vực khai phá dữ liệu. Đây là tài liệu hữu ích cho các nhà nghiên cứu và chuyên gia muốn nâng cao hiểu biết về các kỹ thuật khai phá dữ liệu hiện đại.

Để mở rộng kiến thức về chủ đề này, bạn có thể tham khảo thêm Luận án khai phá luật quyết định trên mô hình dữ liệu dạng khối, nghiên cứu về các phương pháp khai phá luật quyết định trong dữ liệu phức tạp. Ngoài ra, Luận văn thạc sĩ khai phá dữ liệu với cây quyết định cung cấp cái nhìn chi tiết về ứng dụng cây quyết định trong khai phá dữ liệu. Cuối cùng, Luận án tiến sĩ khai phá dữ liệu tuần tự để dự đoán hành vi truy cập web là một tài liệu tham khảo tuyệt vời để hiểu sâu hơn về khai phá dữ liệu tuần tự và ứng dụng thực tế của nó.