Luận án tiến sĩ: Giải pháp khai phá dữ liệu phân tán đảm bảo tính riêng tư

Luận án tiến sĩ đề xuất giải pháp khai phá dữ liệu phân tán, đảm bảo tính riêng tư, ứng dụng hiệu quả trong xử lý thông tin hiện đại.

Trường đại học

Đại học Thái Nguyên

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

luận án tiến sĩ

2023

117
1
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

MỤC LỤC

DANH MỤC CÁC TỪ VIẾT TẮT

DANH MỤC BẢNG

DANH MỤC HÌNH VẼ

MỞ ĐẦU

1. CHƯƠNG 1: TỔNG QUAN VỀ KHAI PHÁ DỮ LIỆU TỪ NHIỀU NGUỒN CÓ ĐẢM BẢO TÍNH RIÊNG TƯ

1.1. Giới thiệu chương

1.2. Giới thiệu về khai phá dữ liệu có đảm bảo tính riêng tư

1.3. Khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư dựa trên phương pháp biến đổi ngẫu nhiên

1.4. Khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư dựa trên phương pháp tính toán bảo mật nhiều thành viên

1.5. Khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư dựa trên phương pháp ẩn danh

1.6. Xác định các vấn đề luận án cần giải quyết

1.7. Kết luận chương

2. CHƯƠNG 2: PHÁT TRIỂN PHƯƠNG PHÁP TÍNH TOÁN BẢO MẬT NHIỀU THÀNH VIÊN

2.1. Giới thiệu chương

2.2. Một số khái niệm cơ bản

2.3. Nhóm cyclic và phần tử sinh

2.4. Bài toán logarithm rời rạc trong nhóm cyclic và các giả thuyết Diffie-Hellman

2.5. Phát biểu bài toán tính toán bảo mật nhiều thành viên

2.6. Các tính chất cơ bản của một giao thức tính toán bảo mật nhiều thành viên

2.7. Mô hình tính toán

2.8. Biến thể của hệ mật ElGamal

2.9. Mô hình bán trung thực

2.10. Một số giao thức tính toán bảo mật nhiều thành viên phổ biến

2.10.1. Giao thức tổng bảo mật

2.10.2. Giao thức tích vô hướng bảo mật

2.10.3. Giao thức đánh giá đa thức bảo mật

2.11. Phát triển một số một số giao thức tính toán bảo mật nhiều thành viên

2.11.1. Giao thức tổng bảo mật cải tiến [CT1]

2.11.2. Giao thức tính tổng bảo mật tổng quát [CT2]

2.11.3. Giao thức tích ba véc tơ bảo mật

2.11.4. Giao thức Bảo mật độ hỗ trợ

2.11.5. Giao thức Tính độ hỗ trợ bảo mật [CT5]

2.12. Kết luận chương

3. CHƯƠNG 3: ĐỀ XUẤT MỘT SỐ GIẢI PHÁP KHAI PHÁ DỮ LIỆU CÓ ĐẢM BẢO TÍNH RIÊNG TƯ DỰA TRÊN PHƯƠNG PHÁP TÍNH TOÁN BẢO MẬT NHIỀU THÀNH VIÊN

3.1. Giới thiệu chương

3.2. Xây dựng giải pháp phân lớp dữ liệu Naive Bayes có đảm bảo tính riêng tư cho mô hình dữ liệu phân tán ngang

3.3. Bài toán phân lớp Naïve Bayes trong mô hình dữ liệu phân tán ngang có ràng buộc tính riêng tư

3.4. Giao thức phân lớp Naive Bayes có đảm bảo tính riêng tư. Đánh giá giao thức đề xuất

3.5. Giải pháp khai phá luật kết hợp có đảm bảo tính riêng tư cho mô hình dữ liệu phân mảnh dọc trên ba thành viên

3.6. Bài toán khai phá luật kết hợp trong mô hình dữ liệu phân mảnh dọc trên ba thành viên

3.7. Giao thức khai phá luật kết hợp đảm bảo tính riêng tư cho mô hình dữ liệu phân mảnh dọc trên ba thành viên

3.8. Đánh giá giao thức đề xuất

3.9. Kết luận chương

DANH MỤC CÁC CÔNG TRÌNH KHOA HỌC ĐÃ CÔNG BỐ

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Giải pháp khai phá dữ liệu

Luận án tập trung vào việc đề xuất các giải pháp khai phá dữ liệu hiệu quả, đặc biệt trong bối cảnh dữ liệu phân tán. Các phương pháp được nghiên cứu nhằm đảm bảo tính riêng tư của dữ liệu trong quá trình khai phá. Luận án đánh giá các phương pháp hiện có và đề xuất các kỹ thuật mới để cải thiện hiệu quả và bảo mật. Các giải pháp khai phá dữ liệu được đề xuất bao gồm việc sử dụng các giao thức tính toán bảo mật nhiều thành viên (SMC) để đảm bảo rằng thông tin riêng tư không bị tiết lộ trong quá trình xử lý dữ liệu.

1.1. Phương pháp biến đổi ngẫu nhiên

Phương pháp này sử dụng các kỹ thuật biến đổi ngẫu nhiên để che giấu thông tin nhạy cảm trong dữ liệu. Bằng cách thêm nhiễu hoặc thay đổi giá trị dữ liệu, phương pháp này giúp đảm bảo tính riêng tư mà vẫn duy trì được tính hữu ích của dữ liệu cho mục đích khai phá.

1.2. Phương pháp ẩn danh dữ liệu

Phương pháp ẩn danh dữ liệu tập trung vào việc loại bỏ hoặc thay thế các thông tin nhận dạng cá nhân trong dữ liệu. Điều này giúp ngăn chặn việc tái định danh cá nhân từ dữ liệu đã được công bố, đảm bảo tính riêng tư của người dùng.

II. Dữ liệu phân tán

Luận án nghiên cứu các mô hình dữ liệu phân tán và cách thức khai phá dữ liệu trong các mô hình này. Dữ liệu phân tán có thể được phân mảnh theo chiều ngang hoặc chiều dọc, và mỗi mô hình đòi hỏi các phương pháp khai phá khác nhau. Luận án đề xuất các giải pháp khai phá dữ liệu phân tán đảm bảo tính riêng tư, đặc biệt là trong các mô hình phân mảnh dọc và ngang.

2.1. Phân mảnh dữ liệu theo chiều ngang

Trong mô hình phân mảnh ngang, dữ liệu được chia thành các phần nhỏ, mỗi phần chứa một số bản ghi với cùng bộ thuộc tính. Luận án đề xuất các giao thức khai phá dữ liệu đảm bảo tính riêng tư trong mô hình này, giúp các bên tham gia có thể hợp tác mà không tiết lộ dữ liệu riêng của mình.

2.2. Phân mảnh dữ liệu theo chiều dọc

Trong mô hình phân mảnh dọc, dữ liệu được chia theo các thuộc tính, mỗi bên sở hữu một phần dọc của dữ liệu. Luận án đề xuất các giao thức khai phá dữ liệu đảm bảo tính riêng tư trong mô hình này, đặc biệt là trong các kịch bản ba thành viên hợp tác.

III. Đảm bảo tính riêng tư

Luận án nhấn mạnh tầm quan trọng của việc đảm bảo tính riêng tư trong quá trình khai phá dữ liệu. Các giải pháp được đề xuất nhằm đảm bảo rằng thông tin nhạy cảm không bị tiết lộ trong quá trình xử lý dữ liệu. Luận án sử dụng các kỹ thuật như mã hóa đồng cấu (Homomorphic Encryption) và tính toán bảo mật nhiều thành viên (SMC) để đạt được mục tiêu này.

3.1. Mã hóa đồng cấu

Mã hóa đồng cấu cho phép thực hiện các phép tính trên dữ liệu đã được mã hóa mà không cần giải mã. Điều này giúp đảm bảo tính riêng tư của dữ liệu trong quá trình khai phá.

3.2. Tính toán bảo mật nhiều thành viên

Các giao thức SMC cho phép nhiều bên tham gia tính toán trên dữ liệu của họ mà không tiết lộ thông tin riêng tư. Luận án đề xuất các giao thức SMC mới để cải thiện hiệu quả và bảo mật trong quá trình khai phá dữ liệu phân tán.

IV. Luận án tiến sĩ

Luận án tiến sĩ này đóng góp vào lĩnh vực khai phá dữ liệu phân tán đảm bảo tính riêng tư bằng cách đề xuất các giải pháp mới và hiệu quả. Các kết quả nghiên cứu có thể được áp dụng trong các ứng dụng thực tế như khai phá dữ liệu y tế, tài chính và mạng xã hội. Luận án cũng mở ra hướng nghiên cứu mới trong việc phát triển các kỹ thuật bảo mật dữ liệu trong tương lai.

4.1. Đóng góp khoa học

Luận án đã phát triển các giao thức tính toán bảo mật nhiều thành viên mới, giúp cải thiện hiệu quả và bảo mật trong quá trình khai phá dữ liệu phân tán.

4.2. Ứng dụng thực tiễn

Các giải pháp được đề xuất trong luận án có thể được áp dụng trong các lĩnh vực như y tế, tài chính và mạng xã hội, giúp đảm bảo tính riêng tư của dữ liệu trong quá trình khai phá.

13/02/2025

Trích đoạn nội dung tài liệu

Chương 1 trình bày tổng quan về khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư. - Chương 2 trình bày các khái niệm cơ bản về mật mã và tính toán bảo mật nhiều thành viên; phân tích đánh giá một số giao thức tính toán bảo mật nhiều thành viên điển hình để từ đó phát triển các giao thức tính toán bảo mật nhiều thành viên, bao gồm: giao thức tính tổng bảo mật cải tiến, giao thức tính tổng bảo mật tổng quát, giao thức tính tích vô hướng bảo mật trong mô hình ba thành viên, hai giao thức tính độ hỗ trợ bảo mật cũng cho mô hình tính toán ba thành viên. 5 - Chương 3 đề xuất các giải pháp khai phá dữ liệu đảm bảo tính riêng tư cho mô hình dữ liệu phân tán dựa trên các giao thức tính toán bảo mật nhiều thành viên mới được trình bày trong chương 2. Trong trường hợp dữ liệu phân mảnh ngang: luận án đề xuất giao thức tính tổng bảo mật tổng quát nhằm nâng cao hiệu quả trong phân lớp dữ liệu Naive Bayes có đảm bảo tính riêng tư.

Với dữ liệu phân mảnh dọc, luận án đề xuất giải pháp khai phá luật kết hợp đảm bảo tính riêng tư trong kịch bản ba thành viên hợp tác về mặt dữ liệu dựa trên giao thức tính tích vô hướng bảo mật của ba thành viên đã phát triển. TỔNG QUAN VỀ KHAI PHÁ DỮ LIỆU TỪ NHIỀU NGUỒN CÓ ĐẢM BẢO TÍNH RIÊNG TƯ 1. Giới thiệu chương Trong chương này, luận án trình bày tổng quan về khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư, trong đó giới thiệu một số phương pháp phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư phổ biến: Phương pháp biến đổi ngẫu nhiên, phương pháp tính toán bảo mật nhiều thành viên, phương pháp ẩn danh dữ liệu. Cuối chương này, luận án đánh giá một số giải pháp khai phá luật kết hợp từ nhiều nguồn có đảm bảo có đảm bảo tính riêng tư và xác định các vấn đề luận án cần giải quyết.

Giới thiệu về khai phá dữ liệu có đảm bảo tính riêng tư Khai phá dữ liệu là một hướng nghiên cứu điển hình trong khoa học dữ liệu nhằm tìm ra thông tin hoặc tri thức từ một tập dữ liệu lớn [3]. Tuy nhiên, quá trình khai phá có thể tiết lộ thông tin nhạy cảm về các cá nhân/tổ chức và xâm phạm quyền riêng tư của họ. Với sự phát triển nhanh chóng của Internet, công nghệ lưu trữ dữ liệu và xử lý dữ liệu, khai phá dữ liệu có đảm bảo tính riêng tư (PPDM: Privacy Preserving Data Mining) đã trở thành một lĩnh vực nghiên cứu ngày càng quan trọng [4]. Mục đích chính của lĩnh vực PPDM là xây dựng các kỹ thuật khác nhau nhằm tìm kiếm ra các tri thức hoặc thông tin có giá trị trong khi dữ liệu và thông tin nhạy cảm vẫn được giữ riêng bởi các nhà sở hữu.

Nói một cách khác, dữ liệu cần thiết cho các nhiệm vụ khai phá quan trọng vẫn được nắm giữ bởi một số thành viên mà không cần họ chia sẻ trực tiếp. Như đã đề cập, để đảm bảo tính riêng tư, dữ liệu vẫn được nắm giữ bởi các thành viên sở hữu nên lĩnh vực khai phá dữ liệu có đảm bảo tính riêng tư thường xuyên phải làm việc với mô hình dữ liệu phân tán (DDM: Distributed Data Mining). Các nghiên cứu về khai phá dữ liệu phân tán có đảm bảo quyền riêng tư liên quan đến ba vấn đề chính sau đây [5]. Thứ nhất, các tổ chức như các cơ quan chính phủ muốn công bố dữ liệu cho các nhà nghiên cứu hay cộng đồng.

Tuy nhiên, do các ràng buộc khác nhau mà họ phải bảo vệ quyền riêng tư dữ liệu, ví 7 dụ dữ liệu riêng tư về sức khỏe và tài chính. Thứ hai, một nhóm các tổ chức mong muốn cùng nhau đạt được kết quả khai phá trên tập dữ liệu chung mà không tiết lộ tập dữ liệu riêng của mỗi bên. Thứ ba, một người khai phá dữ liệu muốn triển khai các mô hình khai phá dữ liệu từ dữ liệu người dùng, trong khi mỗi người vẫn giữ bí mật dữ liệu của họ. Do đó, PPDM hình thành ba nhóm bài toán sau: - Công bố dữ liệu đảm bảo tính riêng tư: mô hình của nhóm bài toán này chỉ bao gồm một chủ sở hữu dữ liệu đáng tin cậy, họ muốn chia sẻ dữ liệu của mình cho người khác hoặc cộng đồng nghiên cứu với mối quan tâm là làm thế nào để công bố dữ liệu hữu ích cho các ứng dụng khai phá dữ liệu mà vẫn bảo vệ được thông tin riêng tư trong bộ dữ liệu.

Ví dụ, một số bệnh viện chia sẻ dữ liệu bệnh nhân để sử dụng cho các nghiên cứu y tế cần thiết [6]. Có nhiều bằng chứng cho thấy dữ liệu công bố có thể làm mất quyền riêng tư của cá nhân. Cuộc tấn công tái định danh như đã chỉ ra trong [7] rằng 87% dân số Mỹ có các đặc điểm cho phép chúng ta định danh duy nhất ra họ dựa trên một số thuộc tính công bố, cụ thể là mã zip, ngày sinh và giới tính. Công bố dữ liệu đảm bảo tính riêng tư đã nhận được sự quan tâm trong những năm gần đây nhằm mục đích ngăn chặn cuộc tấn công tái định danh, trong khi vẫn đảm bảo thông tin hữu ích cho các ứng dụng khai phá từ dữ liệu được công bố [8].

- Khai phá dữ liệu phân tán có đảm bảo tính riêng tư: bài toán này nhằm triển khai các thuật toán khai phá trên nhiều bộ dữ liệu khác nhau mà không cần truy cập dữ liệu gốc [9], [10], [11]. Khác với công bố dữ liệu đảm bảo tính riêng tư, nghiên cứu về khai phá dữ liệu phân tán đảm bảo tính riêng tư thường để giải quyết nhiệm vụ khai phá dữ liệu cụ thể. Mô hình nghiên cứu này bao gồm một số thành viên, mỗi thành viên có một bộ dữ liệu riêng. Mục đích là cho phép các thành viên cùng khai phá trên tập hợp các bộ dữ liệu riêng của họ để có được các mô hình khai phá dữ liệu mà không tiết lộ thông tin cá nhân cho các thành viên tham gia khác.

Ở đây, cách phân mảnh dữ liệu đóng vai trò quan trọng, dữ liệu có thể được phân thành nhiều mảnh theo chiều dọc hoặc chiều ngang. 8  Phân mảnh dữ liệu theo chiều ngang: một bộ dữ liệu được phân mảnh thành nhiều phần, mỗi phần chứa một số bản ghi với cùng một bộ thuộc tính. Ví dụ cơ sở dữ liệu khách hàng được tập hợp từ các ngân hàng khác nhau.  Phân mảnh dữ liệu theo chiều dọc: một bộ dữ liệu được phân chia cho một số thành viên.

Mỗi thành viên sở hữu một phần dọc của mỗi bản ghi trong cơ sở dữ liệu (giữ các bản ghi là tập con của tập thuộc tính). Ví dụ trong [12], Jaideep Vaidya và cộng sự minh họa về hai cơ sở dữ liệu phân mảnh dọc, một cơ sở dữ liệu chứa hồ sơ y tế, một cơ sở dữ liệu chứa thông tin điện thoại di động của cùng một nhóm người. Khai phá cơ sở dữ liệu dùng chung này có thể đạt được thông tin có giá trị, ví dụ như mối quan hệ giữa việc sử dụng điện thoại di động với pin Li/Ion dẫn đến khối u não ở bệnh nhân tiểu đường. - Khai phá dữ liệu người dùng có đảm bảo tính riêng tư: trong bài toán này, tồn tại một bên khảo sát một lượng lớn người dùng để tìm ra tri thức và thông tin hữu ích dựa trên dữ liệu người dùng trong khi các thuộc tính nhạy cảm của họ vẫn được giữ nguyên bí mật [13], [14].

Trong tình huống này, mỗi người dùng chỉ giữ một bản ghi dữ liệu, giống với cơ sở dữ liệu được phân mảnh theo chiều ngang, trong đó mỗi giao dịch được sở hữu bởi một người dùng khác nhau. Một ví dụ điển hình của bài toán này là Du và cộng sự [15] nghiên cứu xây dựng cây quyết định trên dữ liệu riêng tư. Trong nghiên cứu này, một người khai phá muốn thu thập dữ liệu từ người dùng và tạo cơ sở dữ liệu trung tâm, sau đó tiến hành khai phá dữ liệu trên cơ sở dữ liệu này. Họ đưa ra một cuộc khảo sát có chứa một số câu hỏi, mỗi người dùng được yêu cầu trả lời những câu hỏi đó, tuy nhiên có chứa một số câu hỏi nhạy cảm và người dùng có thể cảm thấy không thoải mái khi tiết lộ câu trả lời của mình.

Vấn đề là làm thế nào người khai phá vẫn có thể đạt được kết quả khai phá dữ liệu mà không cần người dùng cung cấp trực tiếp câu trả lời của một số câu hỏi nhạy cảm. Một yêu cầu quan trọng nữa đối với các giải pháp PPDM cho bài toán này là không có bất kỳ tương tác nào giữa các cặp người dùng, mỗi người dùng chỉ giao tiếp với người khai phá dữ liệu. Tổng quan về các phương pháp khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư Những năm gần đây, đã có rất nhiều nghiên cứu lý thuyết và ứng dụng của lĩnh vực khai phá dữ liệu đã được công bố trên các hội nghị và tạp chí hàng đầu quốc tế. Trong quá trình khai phá dữ liệu nói chung, các nhà khai phá thường phải sử dụng dữ liệu từ nhiều nguồn khác nhau, ví dụ các tổ chức tài chính muốn xây dựng mô hình phát hiện hành vi gian lận từ dữ liệu giao dịch do ngân hàng cung cấp và dữ liệu mua sắm trực tuyến do bên bán hàng cung cấp.

Trong các trường hợp như vậy, dữ liệu thường được phân tán tại nơi mà các tổ chức sở hữu. Vì vậy, việc nghiên cứu và phát triển các giải pháp khai phá dữ liệu phân tán đảm bảo tính riêng tư (PPDDM) trở thành vấn đề trọng tâm và thách thức [4], [16], [17]. Về cơ bản, có ba hướng tiếp cận để xây dựng một giải pháp PPDM: ngẫu nhiên (randomization), ẩn danh (anonymity), và tính toán bảo mật nhiều thành viên (secure multi-party computation-SMC). Khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư dựa trên phương pháp biến đổi ngẫu nhiên Ý tưởng cơ bản của phương pháp biến đổi ngẫu nhiên: cơ sở dữ liệu ban đầu chứa những thông tin riêng tư được biến đổi thành một cơ sở dữ liệu mới nhằm che giấu các thông tin riêng tư nhưng kết quả của quá trình khai phá dữ liệu trên cơ sở dữ liệu ban đầu và cơ sở dữ liệu sau khi đã được biến đổi là tương đồng hoặc độ chính xác có sự sai lệch không đáng kể.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Giải pháp khai phá dữ liệu phân tán đảm bảo tính riêng tư trong luận án tiến sĩ" trình bày các phương pháp và kỹ thuật nhằm khai thác dữ liệu phân tán mà vẫn bảo vệ tính riêng tư của người dùng. Luận án này không chỉ nêu rõ các thách thức trong việc xử lý dữ liệu phân tán mà còn đề xuất các giải pháp hiệu quả để đảm bảo an toàn thông tin. Độc giả sẽ tìm thấy những lợi ích thiết thực từ việc áp dụng các phương pháp này trong nghiên cứu và thực tiễn, giúp nâng cao khả năng bảo mật và tính toàn vẹn của dữ liệu.

Nếu bạn muốn mở rộng kiến thức về các ứng dụng và kỹ thuật liên quan, hãy tham khảo thêm tài liệu Luận văn thạc sĩ khoa học máy tính về tăng cường dữ liệu không giám sát, nơi bạn có thể tìm hiểu về các phương pháp phân cụm dữ liệu trong lĩnh vực metagenomic. Bên cạnh đó, tài liệu Luận văn thạc sĩ nghiên cứu về chữ ký số PKI sẽ cung cấp cái nhìn sâu sắc về bảo mật trong quản lý tài liệu. Cuối cùng, bạn cũng có thể tham khảo Luận văn thạc sĩ nghiên cứu giải pháp an toàn thông tin cho cổng giao tiếp điện tử Hà Nội để hiểu rõ hơn về các giải pháp bảo mật thông tin trong môi trường điện tử. Những tài liệu này sẽ giúp bạn có cái nhìn toàn diện hơn về lĩnh vực khai thác dữ liệu và bảo mật thông tin.