Luận văn thạc sĩ: Tăng hiệu quả phân lớp với phương pháp trích chọn thuộc tính

Luận văn thạc sĩ nghiên cứu vnu uet nghiên cứu xây dựng phương pháp trích chọn thuộc tính nhằm làm tăng hiệu quả phân lớp đối, đánh giá hiện trạng, phân tích vấn đề, đề xuất biện

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ

2012

74
1
0

Phí lưu trữ

30 Point

Mục lục chi tiết

MỞ ĐẦU

1. CHƯƠNG 1: TỔNG QUAN VỀ KHAI PHÁ DỮ LIỆU VÀ TRÍCH CHỌN THUỘC TÍNH

1.1. Giới thiệu khai phá dữ liệu và trích chọn thuộc tính

1.2. Lựa chọn thuộc tính và bài toán phân lớp

1.3. Phương pháp lựa chọn thuộc tính

1.4. Các mô hình lựa chọn thuộc tính

1.4.1. Một số thuật toán lựa chọn thuộc tính

1.4.1.1. Tìm kiếm toàn bộ
1.4.1.2. Tìm kiếm theo kinh nghiệm

1.4.2. Phương pháp trọng số thuộc tính

1.4.3. Phương pháp lai

1.4.4. Phương pháp lớn dần

2. CHƯƠNG 2: THUẬT TOÁN RANDOM FOREST VÀ GIẢI THUẬT DI TRUYỀN

2.1. Giới thiệu thuật toán Random Forest

2.1.1. Phương pháp Bootstrap và Bagging

2.1.1.1. Phương pháp Bootstrap
2.1.1.2. Phương pháp Bagging

2.1.2. Thuật toán Random Forest

2.1.3. Một số đặc điểm của RF

2.1.4. Thuộc tính quan trọng

2.2. Giải thuật di truyền

2.2.1. Nội dung giải thuật di truyền

3. CHƯƠNG 3: PHƯƠNG PHÁP ĐỀ XUẤT

3.1. Cơ sở lí luận của phương pháp đề xuất

3.2. Kiến trúc hệ thống đề xuất

3.3. Nội dung phương pháp đề xuất

3.4. Hoạt động của hệ thống đề xuất

3.5. Sơ đồ khối phương pháp đề xuất

4. CHƯƠNG 4: THỰC NGHIỆM VÀ ĐÁNH GIÁ

4.1. Môi trường thực nghiệm

4.2. Mô tả chương trình

4.3. Kết quả thực nghiệm

4.3.1. Bộ dữ liệu ung thư dạ dày (Stomach)

4.3.1.1. Mô tả bộ dữ liệu Stomach
4.3.1.2. Kết quả và phân tích thực nghiệm trên bộ dữ liệu Stomach

4.3.2. Bộ dữ liệu ung thư ruột kết Colon Tumor

4.3.2.1. Mô tả dữ liệu
4.3.2.2. Kết quả thực nghiệm với bộ dữ liệu Colon Tumor

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về luận văn thạc sĩ VNU UET nghiên cứu trích chọn thuộc tính

Luận văn thạc sĩ tại Đại học Quốc gia Hà Nội, Trường Đại học Công nghệ, nghiên cứu về phương pháp trích chọn thuộc tính nhằm nâng cao hiệu quả phân lớp đối với dữ liệu đa chiều. Nghiên cứu này không chỉ mang tính lý thuyết mà còn có ứng dụng thực tiễn trong nhiều lĩnh vực như y tế, tài chính và công nghệ thông tin. Việc trích chọn thuộc tính giúp giảm thiểu độ phức tạp của dữ liệu, từ đó cải thiện hiệu suất của các thuật toán phân lớp.

1.1. Giới thiệu về phương pháp trích chọn thuộc tính trong học máy

Phương pháp trích chọn thuộc tính là một bước quan trọng trong quá trình khai phá dữ liệu. Nó giúp loại bỏ các thuộc tính không cần thiết, từ đó tăng cường hiệu quả của các thuật toán phân lớp. Các kỹ thuật như LDA và PCA thường được sử dụng để thực hiện việc này.

1.2. Tầm quan trọng của việc nâng cao hiệu quả phân lớp

Nâng cao hiệu quả phân lớp không chỉ giúp cải thiện độ chính xác của mô hình mà còn giảm thiểu thời gian tính toán. Điều này đặc biệt quan trọng trong bối cảnh dữ liệu ngày càng lớn và phức tạp.

II. Vấn đề và thách thức trong nghiên cứu trích chọn thuộc tính

Mặc dù có nhiều phương pháp trích chọn thuộc tính, nhưng vẫn tồn tại nhiều thách thức trong việc áp dụng chúng vào dữ liệu thực tế. Một trong những vấn đề lớn nhất là sự đa dạng và phức tạp của dữ liệu, đặc biệt là trong các lĩnh vực như y tế và tài chính.

2.1. Các vấn đề thường gặp trong dữ liệu đa chiều

Dữ liệu đa chiều thường chứa nhiều thuộc tính không liên quan hoặc thừa thãi, gây khó khăn trong việc phân tích và xử lý. Việc xác định thuộc tính nào là quan trọng nhất là một thách thức lớn.

2.2. Thách thức trong việc lựa chọn thuật toán phù hợp

Không phải tất cả các thuật toán đều phù hợp với mọi loại dữ liệu. Việc lựa chọn thuật toán phù hợp để trích chọn thuộc tính là rất quan trọng và cần được xem xét kỹ lưỡng.

III. Phương pháp trích chọn thuộc tính hiệu quả trong nghiên cứu

Luận văn đề xuất một phương pháp trích chọn thuộc tính mới, kết hợp giữa các thuật toán di truyền và Random Forest. Phương pháp này không chỉ giúp cải thiện độ chính xác mà còn giảm thiểu thời gian tính toán.

3.1. Giới thiệu về thuật toán di truyền trong trích chọn thuộc tính

Thuật toán di truyền là một phương pháp tối ưu hóa dựa trên nguyên lý chọn lọc tự nhiên. Nó có thể được áp dụng để tìm ra các thuộc tính quan trọng nhất trong tập dữ liệu lớn.

3.2. Ứng dụng thuật toán Random Forest trong phân lớp

Random Forest là một trong những thuật toán phân lớp mạnh mẽ nhất hiện nay. Việc kết hợp nó với phương pháp trích chọn thuộc tính giúp nâng cao hiệu quả phân lớp đáng kể.

IV. Kết quả thực nghiệm và ứng dụng thực tiễn

Kết quả thực nghiệm cho thấy phương pháp đề xuất đã cải thiện đáng kể hiệu quả phân lớp trên các bộ dữ liệu thực tế. Các ứng dụng của phương pháp này có thể được mở rộng sang nhiều lĩnh vực khác nhau.

4.1. Kết quả thực nghiệm trên bộ dữ liệu ung thư

Thực nghiệm trên bộ dữ liệu ung thư cho thấy phương pháp trích chọn thuộc tính đã giúp tăng độ chính xác phân lớp lên đến 95%, một con số ấn tượng trong lĩnh vực y tế.

4.2. Ứng dụng trong lĩnh vực tài chính

Phương pháp này cũng có thể được áp dụng trong lĩnh vực tài chính để phân tích rủi ro và dự đoán xu hướng thị trường, từ đó giúp các nhà đầu tư đưa ra quyết định chính xác hơn.

V. Kết luận và hướng phát triển tương lai

Luận văn đã chỉ ra tầm quan trọng của việc trích chọn thuộc tính trong việc nâng cao hiệu quả phân lớp. Hướng phát triển tương lai có thể bao gồm việc áp dụng các công nghệ mới như học sâu để cải thiện hơn nữa kết quả.

5.1. Tóm tắt những đóng góp của nghiên cứu

Nghiên cứu đã đóng góp vào việc phát triển các phương pháp trích chọn thuộc tính hiệu quả, mở ra hướng đi mới cho các nghiên cứu tiếp theo trong lĩnh vực này.

5.2. Hướng nghiên cứu trong tương lai

Các nghiên cứu trong tương lai có thể tập trung vào việc kết hợp nhiều phương pháp khác nhau để tối ưu hóa hơn nữa quá trình trích chọn thuộc tính và phân lớp.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

22/07/2025
Luận văn thạc sĩ vnu uet nghiên cứu xây dựng phương pháp trích chọn thuộc tính nhằm làm tăng hiệu quả phân lớp đối với dữ liệu đa chiều

Trích đoạn nội dung tài liệu

Phần mở đầu giới thiệu tên luận văn và trình bày lí do chọn đề tài của luận văn cũng nhƣ xác định mục tiêu, đối tƣợng, phạm vi và phƣơng pháp nghiên cứu của luận văn. o Chƣơng 1: Trình bày các vấn đề cơ sở lý thuyết của luận văn, tổng quan về khai phá dữ liệu và trích chọn thuộc tính. o Chƣơng 2: Trình bày nội dung chính của thuật toán phân lớp sử dụng trong luận văn là thuật toán Random Forest. o Chƣơng 3: Trình bày phƣơng pháp đề xuất và hƣớng giải quyết của luận văn.

o Chƣơng 4: Trình bày quá trình thực nghiệm và đánh giá kết quả thực nghiệm. o Kết luận: Phần này trình bày những vấn đề đã đƣợc giải quyết trong luận văn, những vấn đề còn tồn tại và hƣớng giải quyết trong thời gian tới. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 8 CHƢƠNG 1: TỔNG QUAN VỀ KHAI PHÁ DỮ LIỆU VÀ TRÍCH CHỌN THUỘC TÍNH 1.1 Giới thiệu khai phá dữ liệu và trích chọn thuộc tính Khai phá dữ liệu là một khái niệm ra đời từ những cuối những năm 80 của thế kỷ trƣớc. Nó bao hàm một loạt các kỹ thuật nhằm phát hiện các thông tin có giá trị tiềm ẩn trong tập các dữ liệu lớn.

Về bản chất, khai phá dữ liệu liên quan đến việc phân tích các dữ liệu và sử dụng các kỹ thuật để tìm ra các quy luật trong tập dữ liệu. Năm 1989, Fayyad, Piatestsky-Shapiro và Smyth đã dùng khái niệm Phát hiện tri thức trong cơ sở dữ liệu (Knowledge Discovery in Database – KDD) [14] để chỉ toàn bộ quá trình phát hiện các tri thức có ích từ các tập dữ liệu lớn. Trong đó, khai phá dữ liệu là một bƣớc đặc biệt quan trọng trong toàn bộ quá trình, sử dụng các giải thuật đặc biệt để chiết xuất ra các đặc trƣng từ dữ liệu [14]. Trong khai phá dữ liệu thì phƣơng pháp trích chọn thuộc tính đóng một vai trò quan trọng trong tiền xử lý số liệu.

Phƣơng pháp trích chọn sẽ giúp giảm kích cỡ của không gian dữ liệu đặc trƣng, loại bỏ những thuộc tính không liên quan và những thuộc tính nhiễu. Phƣơng pháp này có ảnh hƣởng ngay lập tức đến các ứng dụng nhƣ thuật toán tăng tốc độ khai phá dữ liệu, cải thiện chất lƣợng dữ liệu và vì vậy tăng hiệu xuất khai phá dữ liệu, kiểm soát đƣợc kết quả của thuật toán. Các kĩ thuật khai phá dữ liệu thƣờng đƣợc chia thành 2 nhóm chính: - Kĩ thuật khai phá dữ liệu mô tả: có nhiệm vụ mô tả về các tính chất hoặc các đặc tính chung của dữ liệu trong CSDL hiện có. Các kĩ thuật này gồm có: phân cụm (clustering), tóm tắt (summerization), trực quan hóa (visualiztion), phân tích sự phát triển và độ lệch (Evolution and deviation analyst), phân tích luật kết hợp (association rules).

- Kĩ thuật khai phá dữ liệu dự đoán: có nhiệm vụ đƣa ra các dự đoán dựa vào các suy diễn trên dữ liệu hiện thời. Các kĩ thuật này gồm có: phân lớp (classification), hồi quy (regression). Tuy nhiên, luận văn tập trung tìm hiểu 3 nhiệm vụ chính sau [12]: Giảm chiều dữ liệu: Giảm chiều dữ liệu là việc làm giảm chiều của không gian tìm kiếm dữ liệu, giảm chi phí thu thập và lƣu trữ dữ liệu, nâng cao hiệu quả của việc khai phá dữ liệu và làm đơn giản hóa các kết quả khai phá dữ liệu. Trong nhiệm vụ làm giảm chiều dữ liệu chúng ta cần phân biệt hai khái nhiệm sau:  Trích chọn thuộc tính (Feature Extraction): Trích chọn thuộc tính là việc tìm ra một tập thuộc tính mới từ tập thuộc tính ban đầu nhằm nâng cao hiệu suất tính toán và độ chính xác phân lớp.

Các kỹ thuật trích chọn thuộc tính thƣờng liên quan đến các phép biến đổi phi tuyến (non-linear). Linear discriminant analysis LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 9 (LDA) và principal components analysis (PCA) là hai kỹ thuật phổ biến dùng trong trích chọn thuộc tính.  Chọn lựa thuộc tính (Feature Selection): Chọn lựa thuộc tính là việc chọn ra một tập thuộc tính con từ tập thuộc tính ban đầu sao cho các tập thuộc tính con này thể thể hiện tốt nhất chức năng của một hệ thống quy nạp, chẳng hạn nhƣ một hệ thống phân lớp. Việc tìm kiếm một tập con thuộc tính tối ƣu thƣờng là rất khó và rất nhiều các vấn đề của chọn lựa thuộc tính là thuộc về lớp các bài toán NP-hard.

Tuy nhiên, chọn lựa thuộc tính lại đƣợc sử dụng rộng rãi trong giảm chiều dữ liệu vì các kết quả dựa trên các thuộc tính đƣợc chọn lựa từ tập thuộc tính ban đầu thƣờng dễ dàng lý giải hơn so với một tập các thuộc tính đƣợc biến đổi từ tập thuộc tính ban đầu. Phân cụm và phân lớp: Phân lớp và phân cụm là hai nhiệm vụ có mối quan hệ tƣơng đối gần nhau trong khai phá dữ liệu. Một lớp là một tập các đối tƣợng có cùng một số đặc điểm hoặc mối quan hệ nào đó, tất cả các đối tƣợng trong lớp này đƣợc phân vào trong cùng một tên lớp nhằm mục đích là để phân biệt với các lớp khác. Một cụm là một tập các đối tƣợng tƣơng tự nhau về mặt vị trí.

Các cụm thƣờng đƣợc tạo ra nhằm mục đích để sau đó tiến hành phân lớp các đối tƣợng. Trích chọn luật: Trích chọn luật tìm kiếm và đƣa ra dữ liệu bằng cách tất cả các dữ liệu đƣợc đƣa ra dựa trên các suy diễn/các quyết định mà các suy diễn/quyết định này đƣợc xây dựng từ các tri thức thu thập đƣợc từ dữ liệu đó. Đối với ngƣời sử dụng các kết quả của khai phá dữ liệu họ chỉ mong muốn có một cách giải thích đơn giản là tại sao có các kết quả phân lớp đó, thuộc tính nào ảnh hƣởng đến kết quả khai phá dữ liệu…Tuy nhiên, bằng các tham số phân lớp rất khó để có thể diễn giải các tri thức đó theo cách mà ngƣời sử dụng có thể dễ dàng hiểu đƣợc. Do đó, việc tìm ra các luật IF-THEN nhằm đƣa ra các thông tin có giá trị là một cách diễn giải đơn giản và dễ hiểu nhất đối với ngƣời sử dụng.

Có thể phân loại chọn luật thành hai kiểu chính. Một kiểu liên quan đến việc tìm ra mối quan hệ giữa các thuộc tính đầu vào và các lớp nhãn ở đầu ra trong tập dữ liệu đã đƣợc gán nhãn. Kiểu chọn luật còn lại là việc khai phá các luật quan hệ (association rule), đây là việc tìm ra các mối quan hệ giữa các thuộc tính trong tập dữ liệu và điều này hoàn toàn không phụ thuộc vào lớp nhãn ở đầu ra [27]. Các kỹ thuật trích chọn ra luật quan hệ thƣờng đƣợc ứng dụng nhằm tìm kiếm các mối liên hệ giữa các đối tƣợng trong dữ liệu phiên.

Khai phá các luật quan hệ có thể đƣợc áp dụng để phân tích hành vi khách hàng trong siêu thị. Ví dụ một khách hàng mua bơ cũng sẽ mua bánh mì với một xác suất nhất định nào đó. Khai phá dữ liệu thƣờng đƣợc xem nhƣ là một giai đoạn trong chu trình phát hiện tri thức và khai phá dữ liệu. Các giai đoạn khác trong chu trình này bao gồm: a) LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 10 Kho dữ liệu, b) chọn lựa các dữ liệu đích, c) làm sạch dữ liệu, d) giảm chiều dữ liệu, e) chọn lựa mô hình phù hợp, f) khai phá dữ liệu, g) nhận xét và trình bày kết quả, h) kiểm tra các kết quả có đƣợc.

Một cách đơn giản có thể hiểu nhƣ sau: kho dữ liệu cho phép dữ liệu đƣợc thu thập từ nhiều nguồn dữ liệu khác nhau và ở nhiều định dạng khác nhau và nguồn dữ liệu này đƣợc sử dụng trong một ứng dụng cụ thể; chọn lựa các dữ liệu đích nhằm tạo ra một dữ liệu cụ thể dùng cho ứng dụng; làm sạch số liệu nhằm loại bỏ nhiễu và các giá trị bất thƣờng; giảm chiều dữ liệu nhằm chuyển dữ liệu thành một dạng dữ liệu phù hợp với ứng dụng; chọn lựa mô hình là chọn một giải thuật phù hợp; khai phá dữ liệu nhằm tìm ra các thông tin cần quan tâm; nhận xét và trình bày kết quả là việc giải thích các kết quả có đƣợc; kiểm tra các kết quả có đƣợc là việc chuyển các kết quả thành một dạng có thể kiểm tra lại và sử dụng lại [27]. Nếu xem xét các quá trình của chu trình khai phá dữ liệu trong ngữ cảnh của chọn lựa thuộc tính, chúng có thể đƣợc tổng hợp thành 4 bƣớc cơ bản sau [12, 10, 28, 23]: 1) Kho dữ liệu (Data warehousing) - dữ liệu từ các nguồn khác nhau đƣợc tổng hợp, lƣu trữ lại, 2)Tiền xử lý (Pre-processing) (các bƣớc b, c, và d) – chọn lựa các dữ liệu phù hợp cho một ứng dụng cụ thể, 3) Khai phá dữ liệu (Data ming) (các bƣớc e và f) – một giải thuật phai phá dữ liệu đƣợc chọn lựa và áp dụng trên bộ số liệu thu đƣợc ở bƣớc 2, 4) Hậu xử lý (Post-processing) (các bƣớc g và h) – Các tri thức thu đƣợc từ bƣớc 3 đƣợc chọn lựa, nhóm… sao cho chúng có thể dễ dàng hiểu và sử dụng.2 Lựa chọn thuộc tính và bài toán phân lớp Nhiệm vụ cơ bản của việc phân lớp là phân chia một tập các đối tƣợng thành n-hữu hạn lớp đã biết trƣớc. Tập đối tƣợng cần phân lớp đƣợc đặc trƣng bởi một tập các thuộc tính chứa các thông tin cần thiết liên quan đến các lớp, trong đó mỗi tập các thuộc tính đƣợc đại diện bởi một tập các thuộc tính – giá trị. Với một tập dữ liệu bao gồm một tập các đối tƣợng đã đƣợc phân lớp (thƣờng gọi là tập tập huấn), nhiệm vụ đặt ra là từ tập huấn luyện cho trƣớc xây dựng một bộ phân lớp cho các dữ liệu tƣơng tự.

Vấn đề đặt ra đối với bài toán phân lớp là số lƣợng các thuộc tính có thể rất lớn do những lý do sau:  Dữ liệu đƣợc thu thập không đơn giản chỉ phục vụ cho một tác nghiệp cụ thể chẳng hạn nhƣ khai phá dữ liệu. Do đó, đối với một ứng dụng cụ thể bộ dữ liệu có thể có rất nhiều các thuộc tính thừa hoặc không phù hợp.  Đôi khi thậm chí nếu chúng ta biết các thuộc tính đƣợc thiết kế cho một tác nghiệp cụ thể thì thuộc tính nào là thuộc tính có liên quan thƣờng không đƣợc biết. Điều này là do bản chất của nghiên cứu.

Chúng ta tiến hành thực nghiệm và LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 11 thu thập số liệu vì chúng ta muốn biết nhiều hơn lĩnh vực mà chúng ta muốn tìm hiểu và chúng ta thông thƣờng không có một ý niệm chính xác về các thuộc tính cần thiết.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ