Nhận Diện Sự Mâu Thuẫn Giữa Hành Vi Ứng Dụng Android và Mô Tả

Luận văn tốt nghiệp kỹ thuật nghiên cứu tốt nghiệp công nghệ thông tin nhận diện sự mâu thuẫn giữa hành vi của ứng dụng android và mô tả, điều tra thực trạng, phân tích số liệu,

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2023

102
4
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN

1.1. TỔNG QUAN ĐỀ TÀI

1.2. BÀI TOÁN PHÂN LOẠI VĂN BẢN

1.3. VẤN ĐỀ THÁCH THỨC

1.4. TÍNH ỨNG DỤNG CỦA ĐỀ TÀI

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT

2.1. HỆ ĐIỀU HÀNH ANDROID

2.2. ĐẶC ĐIỂM CỦA HỆ ĐIỀU HÀNH ANDROID

2.3. CẤU TRÚC HỆ ĐIỀU HÀNH ANDROID

2.4. TẬP TIN APK

2.5. PHÂN QUYỀN TRONG HỆ ĐIỀU HÀNH ANDROID

2.6. XỬ LÝ NGÔN NGỮ TỰ NHIÊN

3. CHƯƠNG 3: CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN

3.1. CÔNG TRÌNH NGHIÊN CỨU TRÊN THẾ GIỚI

3.2. BỘ DỮ LIỆU

4. CHƯƠNG 4: BỘ DỮ LIỆU

4.1. ĐỊNH NGHĨA BỘ DỮ LIỆU

4.2. QUY TRÌNH XÂY DỰNG BỘ DỮ LIỆU

4.3. ĐÁNH GIÁ ĐỘ ĐỒNG THUẬN

4.4. BỘ DỮ LIỆU SAU KHI HOÀN CHỈNH

4.5. PHÂN TÍCH ĐẶC ĐIỂM BỘ DỮ LIỆU

4.6. THỐNG KÊ PHÂN TÍCH BỘ DỮ LIỆU

5. CHƯƠNG 5: CÁC MÔ HÌNH SỬ DỤNG

5.1. CÁC MÔ HÌNH THỰC NGHIỆM

5.2. MÔ HÌNH HỌC MÁY

5.3. MÔ HÌNH HỌC SÂU

5.4. MÔ HÌNH HỌC CHUYỂN TIẾP

5.5. MÔ HÌNH KẾT HỢP

6. CHƯƠNG 6: CÀI ĐẶT, KẾT QUẢ VÀ ĐÁNH GIÁ

6.1. TIỀN XỬ LÝ DỮ LIỆU

6.2. CÀI ĐẶT THỬ NGHIỆM

6.3. PHÂN TÍCH VÀ THẢO LUẬN VỀ KẾT QUẢ THỬ NGHIỆM

6.4. PHÂN TÍCH LỖI DỰA TRÊN MA TRẬN NHẦM LẪN

6.5. PHÂN TÍCH LỖI DỰA TRÊN ĐỘ DÀI CỦA CÂU

6.6. PHÂN TÍCH LỖI DỰA TRÊN VIỆC DỰ ĐOÁN NHÃN DẠNG CÂU DANH SÁCH

6.7. ĐỀ XUẤT HỆ THỐNG ỨNG DỤNG

7. CHƯƠNG 7: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về nhận diện sự mâu thuẫn giữa hành vi ứng dụng Android và mô tả

Nhận diện sự mâu thuẫn giữa hành vi ứng dụng Android và mô tả là một vấn đề quan trọng trong lĩnh vực phát triển ứng dụng di động. Sự phát triển nhanh chóng của các ứng dụng Android đã dẫn đến nhiều thách thức về bảo mật và quyền riêng tư của người dùng. Việc phân tích hành vi người dùng và mô tả ứng dụng giúp phát hiện các mâu thuẫn có thể xảy ra, từ đó nâng cao trải nghiệm người dùng.

1.1. Định nghĩa và tầm quan trọng của nhận diện mâu thuẫn

Nhận diện mâu thuẫn giữa hành vi và mô tả ứng dụng là quá trình phân tích để xác định sự không nhất quán giữa các quyền truy cập mà ứng dụng yêu cầu và những gì được mô tả trong chính sách bảo mật. Điều này rất quan trọng để bảo vệ quyền lợi của người dùng.

1.2. Các yếu tố ảnh hưởng đến sự mâu thuẫn

Sự mâu thuẫn có thể xuất phát từ nhiều yếu tố như thiếu thông tin, sự hiểu biết hạn chế của người dùng về quyền truy cập, và các ứng dụng không minh bạch trong việc mô tả chức năng của mình.

II. Vấn đề và thách thức trong nhận diện mâu thuẫn ứng dụng Android

Vấn đề chính trong nhận diện mâu thuẫn giữa hành vi ứng dụng và mô tả là sự thiếu hiểu biết của người dùng về quyền truy cập. Nhiều ứng dụng yêu cầu quyền truy cập không cần thiết, dẫn đến nguy cơ lộ thông tin cá nhân. Thách thức lớn nhất là phát hiện và phân tích các hành vi này một cách hiệu quả.

2.1. Thiếu hiểu biết về quyền truy cập

Nhiều người dùng không hiểu rõ các quyền mà ứng dụng yêu cầu, dẫn đến việc họ vô tình cấp quyền cho các ứng dụng không đáng tin cậy. Điều này tạo ra rủi ro lớn cho thông tin cá nhân.

2.2. Khó khăn trong việc phát hiện mâu thuẫn

Việc phát hiện sự mâu thuẫn giữa hành vi và mô tả ứng dụng đòi hỏi các phương pháp phân tích phức tạp, bao gồm cả việc sử dụng các thuật toán học máy để đánh giá hành vi của ứng dụng.

III. Phương pháp nhận diện mâu thuẫn giữa hành vi và mô tả ứng dụng Android

Để nhận diện mâu thuẫn, cần áp dụng các phương pháp phân tích hành vi người dùng và mô tả ứng dụng. Các phương pháp này bao gồm phân tích tĩnh và động, sử dụng các mô hình học máy để phát hiện sự không nhất quán.

3.1. Phân tích tĩnh và động

Phân tích tĩnh giúp kiểm tra mã nguồn của ứng dụng để xác định các quyền truy cập, trong khi phân tích động theo dõi hành vi của ứng dụng trong thời gian thực để phát hiện các hành vi không mong muốn.

3.2. Sử dụng mô hình học máy

Các mô hình học máy như Naive Bayes, Logistic Regression, và LSTM có thể được áp dụng để phân tích và dự đoán sự mâu thuẫn giữa hành vi và mô tả ứng dụng.

IV. Ứng dụng thực tiễn và kết quả nghiên cứu

Nghiên cứu về nhận diện sự mâu thuẫn giữa hành vi ứng dụng và mô tả đã cho thấy nhiều kết quả khả quan. Việc xây dựng bộ dữ liệu ViDPApp với 12,961 mẫu đã giúp cải thiện khả năng phát hiện mâu thuẫn và nâng cao chất lượng ứng dụng.

4.1. Bộ dữ liệu ViDPApp

Bộ dữ liệu ViDPApp được xây dựng từ các mô tả và chính sách bảo mật của ứng dụng trên Google Play, cung cấp một nguồn tài nguyên quý giá cho nghiên cứu và phát triển.

4.2. Kết quả thử nghiệm mô hình

Các mô hình học máy đã được thử nghiệm trên bộ dữ liệu ViDPApp, cho thấy khả năng phát hiện mâu thuẫn cao và chính xác, từ đó giúp cải thiện trải nghiệm người dùng.

V. Kết luận và hướng phát triển tương lai

Nhận diện sự mâu thuẫn giữa hành vi ứng dụng và mô tả là một lĩnh vực nghiên cứu quan trọng. Kết quả nghiên cứu hiện tại mở ra nhiều hướng phát triển mới cho các ứng dụng Android, nhằm bảo vệ quyền riêng tư của người dùng và nâng cao chất lượng ứng dụng.

5.1. Tầm quan trọng của nghiên cứu

Nghiên cứu này không chỉ giúp phát hiện mâu thuẫn mà còn nâng cao nhận thức của người dùng về quyền truy cập của ứng dụng, từ đó bảo vệ thông tin cá nhân.

5.2. Hướng phát triển trong tương lai

Cần tiếp tục nghiên cứu và phát triển các mô hình mới, cải thiện độ chính xác trong việc phát hiện mâu thuẫn, đồng thời mở rộng bộ dữ liệu để bao quát nhiều loại ứng dụng hơn.

10/07/2025
Khóa luận tốt nghiệp công nghệ thông tin nhận diện sự mâu thuẫn giữa hành vi của ứng dụng android và mô tả

Trích đoạn nội dung tài liệu

Chương 1: Tổng quan Giới thiệu tổng quan về bài phân loại văn bản, các thách thức phải đối mặt, tầm quan trọng cũng như tính ứng dụng của đề tài mà tôi thực hiện. - _ Chương 2: Cơ sở lý thuyết Chương này tôi tìm hiểu về các cơ sở lý thuyết mà mình thực hiện cho các chương ở phía sau. - _ Chương 3: Các công trình nghiên cứu liên quan Tôi thực hiện nghiên cứu và trình bày các công trình nghiên cứu có cùng đề tài với bài toán về khía cạnh những nghiên cứu đã làm được trước đó trên nền tảng tiếng Anh (vì chưa có trên tiếng Việt). Bên cạnh đó, tôi còn thực hiện nghiên cứu những bộ dữ liệu đã được tạo cho bài toán nhận diện sự mâu thuẫn giữa hành vi của ứng dụng android và mô tả dé dựa vào đó phát triển cho bộ dữ liệu được trình bày ở Chương 4.

- _ Chương 4: Bộ dữ liệu Ở chương 4, tôi mô tả quy trình các bước tạo bộ dữ liệu, từ thu thập dữ liệu, tiền xử lý, các quy định, quy tắc trong quá trình thực hiện chỉnh sửa, cải thiện chất lượng bộ dữ liệu. Tiếp đó, từ bộ dữ liệu thu được, chúng tôi phân tích rõ các đặc điểm của bộ dữ liệu bằng các phương pháp thống kê (số lượng câu, số nhãn, độ dài của câu, các từ đặc trưng của bộ dit liệu và tập nhãn). - _ Chương 5: Các mô hình sử dung Chương này tôi thực hiện tìm hiệu các nội dung liên quan đên các mô hình mà mình lựa chọn dé phục vụ cho chương 6. - Chương 6: Cai đặt, kết quả và đánh giá Trong chương 6, tôi sẽ trình bày các bước của giai đoạn tiền xử lý dữ liệu, các tham số cài đặt cho các mô hình, kết quả của các mô hình, đánh giá nhận xét các kết quả thu được, và cuối cùng phân tích lỗi.

- _ Chương 7: Kết luận va hướng phát triển Trình bày các kết quả thu được trong khóa luận tốt nghiệp này. Các mặt hạn chế cũng như là các hướng phát trién và mở rộng đề tài trong tương lai. TONG QUAN DE TÀI 1. Bài toán phan loại văn ban Nhằm mục dich sử dụng dé thực hiện phân loại văn bản.

Đây thực chất là một bài toán supervised learning (học có giám sát) trong machine learning (hoc máy), bởi lẽ các văn bản này đã được thực hiện gán nhãn. Với mục tiêu dự đoán xem một văn bản thuộc thé loại nào, thì một hệ thống phân loại văn bản phải đạt được việc phân loại một văn bản cho trước. Sau đây là một số ví dụ về những ứng dụng mà một hệ thống phân loại văn bản có: phân loại các bai báo điện tử, phân loại các bình luận của khách hàng trên nền tảng thương mại điện tử là spam hoặc không spam, đánh bình luận người dùng Facebook hoặc Twitter,. Hiện nay các đề tài về phân loại văn bản như phân loại bình luận mạng xã hội Facebook, Twitter,.

phân loại email, các bai báo điện tử được phát triển mạnh mẽ trên cả tiếng Anh, tiếng Trung, tiếng Việt, và các thứ tiếng khác. Tuy nhiên, Trong khóa luận tốt nghiệp này, với bài toán nhận diện sự mâu thuẫn giữa hành vi của ứng dụng android và mô tả thì dường như chưa có ai thực hiện trên miền dữ liệu tiếng Việt. Dựa vào nhiều cách tiếp cận, tôi tìm hiểu và thực hiện chạy model từ đơn giản đến phức tạp cho bài toán, sau đó đúc kết và tự thiết lập cho mình một hệ thong riêng dé tối ưu hóa bài toán đặt ra. Sau khi thực hiện xong bài khóa luận, tôi mong mang đến một ứng dụng giúp người dùng cuối có thể kiểm tra được tính nhất quán giữa hành vi của ứng dụng android và mô tả của chúng.

Mô tả đầu vào và đầu ra của bài toán: - PAu vào (Input) gồm có hai luồng: e Doan nội dung mô tả hoặc chính sách của một ứng dung. e File APK của một ứng dụng. - Đầura (Output): Ung dung có mâu thuẫn hoặc không mâu thuẫn. | (4 Zody là một ứng dụng của hệ điêu hành Android giúp người dũng `) ị APK File mô tả hoặc chính sách : : tiêp cận được đên các phân thưởng trong hoạt động hăng ngày.

k Ngoài ra, Zody có các tính năng: D6 các nơi có các khuyên mãi quanh bạn. - Nhăn tin với chủ quan dé gửi những phản hồi. Gia nhập vòng quay smartphone, iphone. cho khách hang tích điểm.

Z ca hệ chúng tôi qua email: zody@gmail.com (G 5 m và 1¬ hâê cả — 1. Zody là một ứng dung của hệ điêu hành ời dùng tiếp cận được đến > Nhãn 0 C ——* | Ngoài ra, Zody có các tir : Nhãn 1và2 |e có các khuyên mãi quai Nhãn 0 (Not): câu không có quyền. chủ quán dé gửi những ph hôi Gia nhập — PB. +> Nhãn 1và2 Nhãn 1 (Source): câu có liên quan vòng quay smartphone, iphone cho khách | đến quyên truy cập dữ liêu người (hàng tích điêm ) dùng Nhãn 2 (Sink): câu có liên quan đến quyền gửi dữ liệu người dùng.

Liên hệ chúng tôi qua email zody@gmail.com > Nhãn 2 Hình 1- 1. Mô tả bài toán M6 tả bài toán: Dữ liệu các App được lấy từ CH Play. Dựa trên một App ta sẽ lay dữ liệu của 3 file là Description (mô tả), Policy (chính sách) và APK để phục vụ bài toán. Ta có thể hình dung bài toán được giải quyết theo các bước sau: - B1: Đầu vào là một Passage (nội dung lần lượt là file Description (mô tả) hoặc Policy (chính sách)).

- B2: Thực hiện tách Passage thành các câu và dự đoán lân lượt các câu với các nhãn trên câu tương ứng. Đầu ra sẽ là một danh sách nhãn (1). - B3: File APK được đưa vào Androguard cho ra một danh sách nhãn (2). - B4: Kiểm App đó có lạm dụng quyền bằng việc đối chiếu giữa (1) và (2) có cùng các quyền với nhau không.

Nếu cùng các quyền thì App đó không mâu thuẫn và ngược lại. Vi du 1 (Nội dung mô ta một App có quyên): - Dau vào: 1. Zody là một ứng dụng được tạo ra giúp người dùng tiếp cận được đến các phan thưởng trong hoạt động hang ngày. Ngoài ra, Zody có các tinh năng: - D6 các nơi có các khuyến mãi quanh bạn.

- Nhan tin với chủ quán dé gửi những phản hôi. - Gia nhập vòng quay smartphone, iphone. cho khách hàng tích điểm. Liên hệ chúng tôi qua email: zody@ gmail.com - Với đoạn văn bản trên có các dòng sau có các câu liên quan đến các quyền: e_ Dò các nơi có các khuyến mãi quanh bạn.

(quyền Location) —> Nhãn 1 e Nhắn tin với chủ quan dé gửi những phản hồi. (quyền Internet) > Nhãn 2 - Đầura: 1,2 Ví dụ 2 (Nội dung mô tả một App không có quyền): - Đầu vào: Thánh Troll hỏi xoáy toàn nhưng câu đồ hại não, cẩn thận khi chơi nhé :)) - __ Với văn bản trên không đề cập đến quyền nào —> Nhãn 0 - Đầura:0 1. Vấn đề thách thức Giai đoạn chiếm hau hết thời gian trong một dự án chắc chan là giai đoạn xây dựng bộ dữ liệu. Việc thực hiện thu thập dữ liệu các nội dung file mô tả và chính sách cũng như file APK của ứng dụng gặp nhiều khó khăn khi không có sẵn trên các phương tiện tìm kiếm.

Bên cạnh đó khi thu thập về còn phải thực hiện tiền xử lý dữ liệu bằng cách tách đoạn thành câu trên văn bản tiếng Việt. Dành nhiều thời gian đê thực hiện training cho các annotators phục vụ cho việc gan nhãn trên 10 các mẫu dữ liệu. Vì thế, việc xây dựng bộ dữ liệu đủ lớn cả về số lượng cũng như về chat lượng thi sẽ tôn rat nhiêu thời gian và công sức. Các mô hình của bài toán phân loại văn bản phức tạp, khó hiểu và khó triển khai.

Hơn thế, đây là một bài toán khá mới mẻ ở Việt Nam, tài liệu tham khảo cũng như tài nguyên về lĩnh vực này chủ yếu trên tiếng Anh, trong khi đó trên tiếng Việt không có bài nghiên cứu trước đó, việc này gây khó khăn trong quá trình tìm hiểu và nghiên cứu bài toán. Ngoài ra, tiếng Việt mang những đặc điểm, độ khó nhất định (ví dụ như từ ghép, từ đa nghĩa). Việc xử lý ngôn ngữ tiếng Việt cũng là một thách thức lớn đòi hỏi tôi không ngừng tìm tòi, nghiên cứu. Tính ứng dụng của đề tài Nhận diện sự mâu thuẫn giữa hành vi của ứng dụng android và mô tả có tính ứng dụng cao và mang lại ý nghĩa to lớn cho xã hội, bởi vì: - Pau tiên, với việc xây dựng một bộ dữ liệu mới, tôi đã có sự đóng góp và góp phần làm giàu nguồn dữ liệu cho lĩnh vực xử lý ngôn ngữ tự nhiên tiếng Việt.

Bởi vì, ở thời điểm hiện tại, số lượng các bộ dữ liệu chất lượng tiếng Việt phục vụ cho cộng đồng vẫn còn khá ít và không đa dạng. Không những thế, bộ dữ liệu trong dé tài về mô tả và chính sách của ứng dụng trên miền dữ liệu tiếng Việt vô cùng hạn chế. Chính vì thế, việc xây dựng một bộ dữ liệu mới sẽ góp phần bổ sung và thúc day những nghiên cứu sau này của lĩnh vực xử lý ngôn ngữ tự nhiên tại Việt Nam nói chung và bài toán cùng đề tài nói riêng. Tiếp đó, tôi cũng sẽ thực hiện chạy thử nghiệm các mô hình nhằm mục đích đánh giá bộ dữ liệu đã tạo và lựa chọn mô hình tốt nhất dé tạo một hệ thông nhăm trực quan hóa cho bài toán của mình.

- Đối với Appstore, họ thực hiện các phương pháp kiểm tra những quyền có trong ứng dụng được khai báo trong file APK và file mô tả có khớp với nhau hay không, những ứng dụng khi được phát hành chính thức trên Appstore đều được kiểm tra ở phương diện này. Tuy nhiên, CH Play thì không như lãi vậy và người dùng cuối sẽ phải làm điều này. Họ phải thực hiện đọc các nội dung mô tả để xem các ứng dụng có yêu cầu cấp những quyền nằm ngoài phạm vi tính năng hay không, nhưng thông thường một người dùng tải các ứng dụng Android thì sẽ hiếm đọc những nội dung mô tả của ứng dụng hoặc nếu có đọc thì cũng sẽ khó khăn trong việc xác định những quyền mà ứng dụng có thể yêu cầu. Đây cũng chính là một trong những nguyên nhân dẫn đến dữ liệu riêng tư của người dùng bị truy cập hoặc đánh cấp khi sử dụng một ứng dụng không an toàn nào đó.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề "Nhận Diện Sự Mâu Thuẫn Giữa Hành Vi Ứng Dụng Android và Mô Tả" khám phá những mâu thuẫn có thể xảy ra giữa hành vi của người dùng trong các ứng dụng Android và cách mà các mô tả ứng dụng có thể không phản ánh chính xác trải nghiệm thực tế. Tài liệu này cung cấp cái nhìn sâu sắc về cách mà sự không nhất quán này có thể ảnh hưởng đến sự hài lòng của người dùng và cách các nhà phát triển có thể cải thiện mô tả ứng dụng để thu hút và giữ chân người dùng tốt hơn.

Để mở rộng thêm kiến thức của bạn về các chủ đề liên quan, bạn có thể tham khảo tài liệu Nghiên cứu trích rút một số khái niệm trong văn bản y khoa tiếng việt, nơi bạn sẽ tìm thấy các phương pháp trích xuất thông tin có thể áp dụng trong việc cải thiện mô tả ứng dụng. Ngoài ra, tài liệu Nghiên cứu một số kỹ thuật nlp và ứng dụng phân loại văn bản tiếng việt sẽ giúp bạn hiểu rõ hơn về các kỹ thuật xử lý ngôn ngữ tự nhiên có thể hỗ trợ trong việc phân tích hành vi người dùng. Cuối cùng, tài liệu Phân tích ý định từ văn bản ngắn trực tuyến tiếng việt sẽ cung cấp thêm thông tin về cách phân tích ý định của người dùng, từ đó giúp cải thiện trải nghiệm ứng dụng.

Những tài liệu này không chỉ mở rộng kiến thức của bạn mà còn cung cấp những góc nhìn mới mẻ về cách tối ưu hóa ứng dụng và mô tả của chúng.