Chương 1 trình bày tổng quan về khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư. - Chương 2 trình bày các khái niệm cơ bản về mật mã và tính toán bảo mật nhiều thành viên; phân tích đánh giá một số giao thức tính toán bảo mật nhiều thành viên điển hình để từ đó phát triển các giao thức tính toán bảo mật nhiều thành viên, bao gồm: giao thức tính tổng bảo mật cải tiến, giao thức tính tổng bảo mật tổng quát, giao thức tính tích vô hướng bảo mật trong mô hình ba thành viên, hai giao thức tính độ hỗ trợ bảo mật cũng cho mô hình tính toán ba thành viên. 5 - Chương 3 đề xuất các giải pháp khai phá dữ liệu đảm bảo tính riêng tư cho mô hình dữ liệu phân tán dựa trên các giao thức tính toán bảo mật nhiều thành viên mới được trình bày trong chương 2. Trong trường hợp dữ liệu phân mảnh ngang: luận án đề xuất giao thức tính tổng bảo mật tổng quát nhằm nâng cao hiệu quả trong phân lớp dữ liệu Naive Bayes có đảm bảo tính riêng tư.
Với dữ liệu phân mảnh dọc, luận án đề xuất giải pháp khai phá luật kết hợp đảm bảo tính riêng tư trong kịch bản ba thành viên hợp tác về mặt dữ liệu dựa trên giao thức tính tích vô hướng bảo mật của ba thành viên đã phát triển. TỔNG QUAN VỀ KHAI PHÁ DỮ LIỆU TỪ NHIỀU NGUỒN CÓ ĐẢM BẢO TÍNH RIÊNG TƯ 1. Giới thiệu chương Trong chương này, luận án trình bày tổng quan về khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư, trong đó giới thiệu một số phương pháp phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư phổ biến: Phương pháp biến đổi ngẫu nhiên, phương pháp tính toán bảo mật nhiều thành viên, phương pháp ẩn danh dữ liệu. Cuối chương này, luận án đánh giá một số giải pháp khai phá luật kết hợp từ nhiều nguồn có đảm bảo có đảm bảo tính riêng tư và xác định các vấn đề luận án cần giải quyết.
Giới thiệu về khai phá dữ liệu có đảm bảo tính riêng tư Khai phá dữ liệu là một hướng nghiên cứu điển hình trong khoa học dữ liệu nhằm tìm ra thông tin hoặc tri thức từ một tập dữ liệu lớn [3]. Tuy nhiên, quá trình khai phá có thể tiết lộ thông tin nhạy cảm về các cá nhân/tổ chức và xâm phạm quyền riêng tư của họ. Với sự phát triển nhanh chóng của Internet, công nghệ lưu trữ dữ liệu và xử lý dữ liệu, khai phá dữ liệu có đảm bảo tính riêng tư (PPDM: Privacy Preserving Data Mining) đã trở thành một lĩnh vực nghiên cứu ngày càng quan trọng [4]. Mục đích chính của lĩnh vực PPDM là xây dựng các kỹ thuật khác nhau nhằm tìm kiếm ra các tri thức hoặc thông tin có giá trị trong khi dữ liệu và thông tin nhạy cảm vẫn được giữ riêng bởi các nhà sở hữu.
Nói một cách khác, dữ liệu cần thiết cho các nhiệm vụ khai phá quan trọng vẫn được nắm giữ bởi một số thành viên mà không cần họ chia sẻ trực tiếp. Như đã đề cập, để đảm bảo tính riêng tư, dữ liệu vẫn được nắm giữ bởi các thành viên sở hữu nên lĩnh vực khai phá dữ liệu có đảm bảo tính riêng tư thường xuyên phải làm việc với mô hình dữ liệu phân tán (DDM: Distributed Data Mining). Các nghiên cứu về khai phá dữ liệu phân tán có đảm bảo quyền riêng tư liên quan đến ba vấn đề chính sau đây [5]. Thứ nhất, các tổ chức như các cơ quan chính phủ muốn công bố dữ liệu cho các nhà nghiên cứu hay cộng đồng.
Tuy nhiên, do các ràng buộc khác nhau mà họ phải bảo vệ quyền riêng tư dữ liệu, ví 7 dụ dữ liệu riêng tư về sức khỏe và tài chính. Thứ hai, một nhóm các tổ chức mong muốn cùng nhau đạt được kết quả khai phá trên tập dữ liệu chung mà không tiết lộ tập dữ liệu riêng của mỗi bên. Thứ ba, một người khai phá dữ liệu muốn triển khai các mô hình khai phá dữ liệu từ dữ liệu người dùng, trong khi mỗi người vẫn giữ bí mật dữ liệu của họ. Do đó, PPDM hình thành ba nhóm bài toán sau: - Công bố dữ liệu đảm bảo tính riêng tư: mô hình của nhóm bài toán này chỉ bao gồm một chủ sở hữu dữ liệu đáng tin cậy, họ muốn chia sẻ dữ liệu của mình cho người khác hoặc cộng đồng nghiên cứu với mối quan tâm là làm thế nào để công bố dữ liệu hữu ích cho các ứng dụng khai phá dữ liệu mà vẫn bảo vệ được thông tin riêng tư trong bộ dữ liệu.
Ví dụ, một số bệnh viện chia sẻ dữ liệu bệnh nhân để sử dụng cho các nghiên cứu y tế cần thiết [6]. Có nhiều bằng chứng cho thấy dữ liệu công bố có thể làm mất quyền riêng tư của cá nhân. Cuộc tấn công tái định danh như đã chỉ ra trong [7] rằng 87% dân số Mỹ có các đặc điểm cho phép chúng ta định danh duy nhất ra họ dựa trên một số thuộc tính công bố, cụ thể là mã zip, ngày sinh và giới tính. Công bố dữ liệu đảm bảo tính riêng tư đã nhận được sự quan tâm trong những năm gần đây nhằm mục đích ngăn chặn cuộc tấn công tái định danh, trong khi vẫn đảm bảo thông tin hữu ích cho các ứng dụng khai phá từ dữ liệu được công bố [8].
- Khai phá dữ liệu phân tán có đảm bảo tính riêng tư: bài toán này nhằm triển khai các thuật toán khai phá trên nhiều bộ dữ liệu khác nhau mà không cần truy cập dữ liệu gốc [9], [10], [11]. Khác với công bố dữ liệu đảm bảo tính riêng tư, nghiên cứu về khai phá dữ liệu phân tán đảm bảo tính riêng tư thường để giải quyết nhiệm vụ khai phá dữ liệu cụ thể. Mô hình nghiên cứu này bao gồm một số thành viên, mỗi thành viên có một bộ dữ liệu riêng. Mục đích là cho phép các thành viên cùng khai phá trên tập hợp các bộ dữ liệu riêng của họ để có được các mô hình khai phá dữ liệu mà không tiết lộ thông tin cá nhân cho các thành viên tham gia khác.
Ở đây, cách phân mảnh dữ liệu đóng vai trò quan trọng, dữ liệu có thể được phân thành nhiều mảnh theo chiều dọc hoặc chiều ngang. 8 Phân mảnh dữ liệu theo chiều ngang: một bộ dữ liệu được phân mảnh thành nhiều phần, mỗi phần chứa một số bản ghi với cùng một bộ thuộc tính. Ví dụ cơ sở dữ liệu khách hàng được tập hợp từ các ngân hàng khác nhau. Phân mảnh dữ liệu theo chiều dọc: một bộ dữ liệu được phân chia cho một số thành viên.
Mỗi thành viên sở hữu một phần dọc của mỗi bản ghi trong cơ sở dữ liệu (giữ các bản ghi là tập con của tập thuộc tính). Ví dụ trong [12], Jaideep Vaidya và cộng sự minh họa về hai cơ sở dữ liệu phân mảnh dọc, một cơ sở dữ liệu chứa hồ sơ y tế, một cơ sở dữ liệu chứa thông tin điện thoại di động của cùng một nhóm người. Khai phá cơ sở dữ liệu dùng chung này có thể đạt được thông tin có giá trị, ví dụ như mối quan hệ giữa việc sử dụng điện thoại di động với pin Li/Ion dẫn đến khối u não ở bệnh nhân tiểu đường. - Khai phá dữ liệu người dùng có đảm bảo tính riêng tư: trong bài toán này, tồn tại một bên khảo sát một lượng lớn người dùng để tìm ra tri thức và thông tin hữu ích dựa trên dữ liệu người dùng trong khi các thuộc tính nhạy cảm của họ vẫn được giữ nguyên bí mật [13], [14].
Trong tình huống này, mỗi người dùng chỉ giữ một bản ghi dữ liệu, giống với cơ sở dữ liệu được phân mảnh theo chiều ngang, trong đó mỗi giao dịch được sở hữu bởi một người dùng khác nhau. Một ví dụ điển hình của bài toán này là Du và cộng sự [15] nghiên cứu xây dựng cây quyết định trên dữ liệu riêng tư. Trong nghiên cứu này, một người khai phá muốn thu thập dữ liệu từ người dùng và tạo cơ sở dữ liệu trung tâm, sau đó tiến hành khai phá dữ liệu trên cơ sở dữ liệu này. Họ đưa ra một cuộc khảo sát có chứa một số câu hỏi, mỗi người dùng được yêu cầu trả lời những câu hỏi đó, tuy nhiên có chứa một số câu hỏi nhạy cảm và người dùng có thể cảm thấy không thoải mái khi tiết lộ câu trả lời của mình.
Vấn đề là làm thế nào người khai phá vẫn có thể đạt được kết quả khai phá dữ liệu mà không cần người dùng cung cấp trực tiếp câu trả lời của một số câu hỏi nhạy cảm. Một yêu cầu quan trọng nữa đối với các giải pháp PPDM cho bài toán này là không có bất kỳ tương tác nào giữa các cặp người dùng, mỗi người dùng chỉ giao tiếp với người khai phá dữ liệu. Tổng quan về các phương pháp khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư Những năm gần đây, đã có rất nhiều nghiên cứu lý thuyết và ứng dụng của lĩnh vực khai phá dữ liệu đã được công bố trên các hội nghị và tạp chí hàng đầu quốc tế. Trong quá trình khai phá dữ liệu nói chung, các nhà khai phá thường phải sử dụng dữ liệu từ nhiều nguồn khác nhau, ví dụ các tổ chức tài chính muốn xây dựng mô hình phát hiện hành vi gian lận từ dữ liệu giao dịch do ngân hàng cung cấp và dữ liệu mua sắm trực tuyến do bên bán hàng cung cấp.
Trong các trường hợp như vậy, dữ liệu thường được phân tán tại nơi mà các tổ chức sở hữu. Vì vậy, việc nghiên cứu và phát triển các giải pháp khai phá dữ liệu phân tán đảm bảo tính riêng tư (PPDDM) trở thành vấn đề trọng tâm và thách thức [4], [16], [17]. Về cơ bản, có ba hướng tiếp cận để xây dựng một giải pháp PPDM: ngẫu nhiên (randomization), ẩn danh (anonymity), và tính toán bảo mật nhiều thành viên (secure multi-party computation-SMC). Khai phá dữ liệu từ nhiều nguồn có đảm bảo tính riêng tư dựa trên phương pháp biến đổi ngẫu nhiên Ý tưởng cơ bản của phương pháp biến đổi ngẫu nhiên: cơ sở dữ liệu ban đầu chứa những thông tin riêng tư được biến đổi thành một cơ sở dữ liệu mới nhằm che giấu các thông tin riêng tư nhưng kết quả của quá trình khai phá dữ liệu trên cơ sở dữ liệu ban đầu và cơ sở dữ liệu sau khi đã được biến đổi là tương đồng hoặc độ chính xác có sự sai lệch không đáng kể.