Nghiên Cứu Phương Pháp Dự Đoán Liên Kết Trong Mạng Xã Hội Dựa Trên Mạng Nơ-Ron Đồ Thị

Khóa luận nghiên cứu các phương pháp dự đoán liên kết trong mạng xã hội dựa trên đồ thị mạng nơ ron, mang lại cái nhìn sâu sắc về công nghệ hiện đại.

Chuyên ngành

Công Nghệ Thông Tin

Người đăng

Ẩn danh

Thể loại

Khóa Luận Tốt Nghiệp

2023

78
3
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CAM ĐOAN

1. CHƯƠNG 1: TỔNG QUAN ĐỀ TÀI

1.1. Giới thiệu bài toán

1.2. Giới hạn và phạm vi nghiên cứu

1.3. Bố cục của khoá luận tốt nghiệp

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT VÀ CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN

2.1. Graph Neural Network

2.2. Các công trình nghiên cứu liên quan

3. CHƯƠNG 3: THỰC NGHIỆM

3.1. Quy trình thực nghiệm

3.2. Giới thiệu dữ liệu

3.3. Môi trường thực nghiệm

4. CHƯƠNG 4: KẾT LUẬN

4.1. Kết quả đạt được

4.2. Hướng phát triển

4.3. Tỷ lệ đóng góp

DANH MỤC HÌNH ẢNH

DANH MỤC BẢNG

Tóm tắt

I. Tổng Quan Về Nghiên Cứu Dự Đoán Liên Kết Trong Mạng Xã Hội

Bài toán dự đoán liên kết trong mạng xã hội đang trở thành một lĩnh vực nghiên cứu quan trọng. Với sự phát triển của công nghệ thông tin, việc khai thác dữ liệu từ các nền tảng mạng xã hội đã mở ra nhiều cơ hội mới. Nghiên cứu này tập trung vào việc áp dụng mạng nơ-ron đồ thị để dự đoán các liên kết tiềm năng giữa các người dùng. Mục tiêu là tìm hiểu cách mà các mô hình học máy có thể cải thiện độ chính xác trong việc dự đoán các mối quan hệ mới.

1.1. Định Nghĩa Bài Toán Dự Đoán Liên Kết

Bài toán dự đoán liên kết (Link Prediction) đặt ra câu hỏi liệu hai đỉnh trong đồ thị có thể liên kết với nhau hay không. Điều này có thể áp dụng cho nhiều lĩnh vực, từ mạng xã hội đến hệ thống gợi ý sản phẩm.

1.2. Tầm Quan Trọng Của Mạng Xã Hội

Mạng xã hội chứa đựng một lượng lớn dữ liệu về hành vi và sở thích của người dùng. Việc phân tích dữ liệu này giúp các doanh nghiệp tối ưu hóa chiến lược tiếp thị và cải thiện trải nghiệm người dùng.

II. Thách Thức Trong Dự Đoán Liên Kết Trong Mạng Xã Hội

Mặc dù có nhiều tiềm năng, nhưng việc dự đoán liên kết trong mạng xã hội cũng gặp phải nhiều thách thức. Các vấn đề như độ phức tạp của dữ liệu, sự biến động của hành vi người dùng và tính không đồng nhất của mạng xã hội là những yếu tố cần được xem xét. Các mô hình hiện tại cần phải được cải tiến để có thể xử lý tốt hơn những thách thức này.

2.1. Độ Phức Tạp Của Dữ Liệu

Dữ liệu trong mạng xã hội thường rất phức tạp và không đồng nhất. Việc xử lý và phân tích dữ liệu này đòi hỏi các phương pháp tiên tiến để đảm bảo tính chính xác trong dự đoán.

2.2. Sự Biến Động Của Hành Vi Người Dùng

Hành vi của người dùng trên mạng xã hội có thể thay đổi nhanh chóng. Điều này tạo ra khó khăn trong việc dự đoán các liên kết mới, vì các mô hình cần phải cập nhật thường xuyên để phản ánh sự thay đổi này.

III. Phương Pháp Dự Đoán Liên Kết Bằng Mạng Nơ Ron Đồ Thị

Mạng nơ-ron đồ thị (Graph Neural Network - GNN) là một trong những phương pháp tiên tiến nhất hiện nay trong việc dự đoán liên kết. GNN cho phép mô hình hóa các mối quan hệ phức tạp giữa các nút trong đồ thị, từ đó cải thiện độ chính xác của dự đoán. Các nghiên cứu đã chỉ ra rằng GNN có thể xử lý tốt hơn các đặc trưng của mạng xã hội so với các phương pháp truyền thống.

3.1. Cấu Trúc Của Mạng Nơ Ron Đồ Thị

Mạng nơ-ron đồ thị bao gồm các lớp đầu vào, lớp ẩn và lớp đầu ra. Mỗi lớp thực hiện các phép toán để xử lý thông tin và tạo ra các dự đoán chính xác hơn.

3.2. Các Kỹ Thuật Học Máy Trong GNN

GNN sử dụng nhiều kỹ thuật học máy khác nhau để tối ưu hóa quá trình dự đoán. Các phương pháp như học sâu và phân tích đồ thị giúp cải thiện khả năng dự đoán liên kết.

IV. Ứng Dụng Thực Tiễn Của Dự Đoán Liên Kết Trong Mạng Xã Hội

Dự đoán liên kết có nhiều ứng dụng thực tiễn trong mạng xã hội. Từ việc gợi ý bạn bè đến việc cá nhân hóa nội dung, các mô hình dự đoán liên kết giúp cải thiện trải nghiệm người dùng. Các hệ thống gợi ý như Spotify và Netflix đã áp dụng thành công các phương pháp này để tăng cường sự tương tác của người dùng.

4.1. Hệ Thống Gợi Ý Bạn Bè

Các hệ thống gợi ý bạn bè sử dụng dự đoán liên kết để xác định những người dùng có khả năng kết nối với nhau. Điều này giúp tăng cường mạng lưới xã hội và tạo ra các mối quan hệ mới.

4.2. Cá Nhân Hóa Nội Dung

Dự đoán liên kết cũng được sử dụng để cá nhân hóa nội dung mà người dùng nhận được. Điều này giúp tăng cường sự hài lòng và giữ chân người dùng trên nền tảng.

V. Kết Luận Và Hướng Phát Triển Tương Lai

Nghiên cứu về dự đoán liên kết trong mạng xã hội dựa trên mạng nơ-ron đồ thị đã mở ra nhiều cơ hội mới. Tuy nhiên, vẫn còn nhiều thách thức cần được giải quyết. Hướng phát triển tương lai có thể bao gồm việc cải tiến các mô hình hiện tại và áp dụng các kỹ thuật mới để nâng cao độ chính xác và khả năng dự đoán.

5.1. Cải Tiến Mô Hình Dự Đoán

Cần nghiên cứu và phát triển các mô hình dự đoán mới để cải thiện độ chính xác và khả năng xử lý dữ liệu phức tạp trong mạng xã hội.

5.2. Nghiên Cứu Các Kỹ Thuật Mới

Việc áp dụng các kỹ thuật học máy mới có thể giúp nâng cao hiệu suất của các mô hình dự đoán liên kết, từ đó tạo ra những giá trị mới cho người dùng.

10/07/2025
Khóa luận tốt nghiệp nghiên cứu các phương pháp dự đoán liên kết trong mạng xã hội dựa trên đồ thị mạng nơ ron

Trích đoạn nội dung tài liệu

đặt vấn đề về bài toán dự đoán liên kết, từ đó xác định mục tiêu nghiên cứu và giới hạn phạm vi của nghiên cứu. Ngoài ra, mô tả bố cục và tóm tắt ý nghĩa từng chương. Cơ sở lý thuyết và các công trình nghiên cứu liên quan Trình bày cơ sở lý thuyết và liệt kê các phương pháp tiếp cận của bài toán. Ngoài ra, trình bày một số công trình nghiên cứu liên quan.

Thực nghiệm Giới thiệu thông tin và thống kê mô tả về hai bộ dữ liệu sử dụng thực nghiệm là Movielens Latest-small và Yelp2018. Ngoài ra, mô tả cách thức sử dụng dữ liệu, môi trường thực nghiệm và kết quả từ thực nghiệm các mô hình đã đề xuất. Kết luận Tóm tắt kết quả đạt được từ thực hiện khoá luận tốt nghiệp, hạn chế, đề xuất các hướng phát triển cho công trình và tỷ lệ đóng góp công việc của sinh viên. Tài liệu tham khảo: Trích dẫn các nguồn tài liệu tham khảo được sử dụng để làm cơ sở cho khoá luận tốt nghiệp.

11 CHƯƠNG 2: CƠ SỞ LÝ THUYET VÀ CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN 2. Link Prediction Xem xét một mạng G(V, E) tại một thời điểm nhất định t, với V va E tương ứng là các tập nút và cạnh. Mục đích của dự đoán liên kết là dự đoán các liên kết mới hoặc bị loại bỏ giữa các nút cho một thời điểm trong tương lai t’ (t’ > £), hoặc các liên kết còn thiếu hoặc không được quan sát trong mạng đang quan sát hiện tại. Van đề này được lý giải bởi một mạng xã hội đơn giản bao gồm năm người trong Hình 1.1, với các cạnh nét liền thể hiện những mối liên kết đã tồn tai giữa các thực thể trong mạng tại thời điểm £, và cạnh nét đứt thé hiện những những mối liên kết mới sẽ xuất hiện trong suốt khoảng thời gian [t, t’].

Tại thời điểm t, Alice và Bob là ban, Alice cũng là bạn của Nick. Tại thời điểm £, có khả năng Alice sẽ giới thiệu Bob cho Nick, từ đó Bob và Nick cũng trở thành bạn của nhau. Tương tự, Nick và Amy cũng sẽ trở thành bạn tại thời điểm £'. Mục đích của dự đoán liên kết đối với trường hợp này là dé dự đoán sự xuất hiện của các mối quan hệ bạn bè mới giữa năm người trong mạng đang quan sát này.

Để giải quyết bài toán dự đoán liên kết, cần phải xác định khả năng hình thành hoặc hủy bỏ của các liên kết giữa các cặp nút với nhau. Thông thường, những khả năng này được do bởi mức độ tương đồng hoặc xếp hạng liên quan giữa các cặp nút. Minh họa khuôn khổ chung của bai toán dự đoán liên kết tại Hình 2. Với một mạng khởi tạo ban đầu, có hai cách để dự đoán sự xuất hiện của liên kết là cách tiếp cận dựa trên sự tương đồng (similarity-based approaches) và cách tiếp cận dựa trên học tập (learning-based approaches).

Phương pháp similarity-based sẽ tính toán sự tương đồng của các cặp nút không liên kết với nhau trong một mạng, cụ thể là dựa trên các biện pháp phân tích sự gần gũi của ác nút. Từng cặp nút (x, y) tiềm năng sẽ được gán một số điểm xác suất, với số điểm càng cao thì khả năng càng cao xác suất x và y sẽ được liên kết trong tương lai và ngược lại. Từ đó có được một danh sách được xếp hạng theo thứ tự giảm dần của điểm xác suất và những liên kết xuất hiện ở đầu danh sách có khả năng xuất hiện cao nhất. Phương 12 pháp learning-based lại xem bài toán dự đoán liên kết như một tác vụ phân loại.

Do đó, một số mô hình học máy điển hình như mô hình phân loại (classifier) và mô hình xác suất (probabilistic) có thé được sử dụng đề giải quyết bài toán này. Từng cặp nút không liên kết tương ứng với một thể hiện với các tính năng mô tả các nút và nhãn lớp. Nếu có một liên kết tiềm năng giữa cặp nút, cặp nút đó sẽ được gắn nhãn positive, ngược lại sẽ gắn nhãn negative. Đối với phương pháp learning-based, các đặc trưng bao gồm hai phần: một là các đặc trưng về sự tương đồng từ phương pháp similarity-based, hai là các đặc trưng bắt nguồn từ chính mạng quan sát.

Dự đoán liên kết bị xóa bỏ hoặc biến mất cũng được giải quyết tương tự. Similarity-based approach Similarity ; = >} Order scores —> —. pairs ed earning-based approac! Learning models Similarity ¿2—— Clasifer features / * iti J ~___ | Probabilistic model Positive / Other instances / features _/ ` a Hình 2. Minh hoa khuôn khổ bài toán dự đoán liên kết.

[1] Có rất nhiều công trình nghiên cứu về bài toán dự đoán liên kết mà tập trung vào các kỹ thuật dự đoán liên kết, thảo luận về các vấn đề dự đoán liên kết đặc biệt và sử dụng các kỹ thuật dự đoán liên kết hiện có để ứng dụng vào các mục đích khác nhau. Dé phân loại rõ ràng các công trình hiện có này, một danh mục dự đoán liên kết mới với hai khía cạnh đã được đề xuất: khía cạnh kỹ thuật và khía cạnh dựa vào vấn đề.2 mô tả danh mục của các kỹ thuật dự đoán liên kết và các van đề dự đoán liên kết. Đối với các kỹ thuật dự đoán liên kết, có thé được chia thành bốn cấp độ từ trên xuống dưới: (1) Dựa theo thông tin mạng cơ bản được sử dụng trong dự đoán, cấp độ đầu tiên và cao nhất bao gồm nút, cấu trúc liên kết và lý thuyết xã hội. (3) Mức độ thứ ba bao gồm các kỹ thuật dự đoán liên kết cơ bản phổ biến dựa vào nút, hàng xóm, đường dẫn, bước ngẫu nhiên và lý thuyết xã hội.

(4) Mức độ thứ tư, bao gồm các kỹ thuật dự đoán cơ bản và các thông tin bên ngoài, bao gồm weights, attributes và kho tri thức, cung cấp đặc trưng cho các kỹ thuật learning-based phức tạp, như feature-based classification, kernel-based learning, probabilistic model và matrix factorization. Tất cả các kỹ thuật dự đoán liên kết gần tương tự nhau và có thể được sử dung dé giải quyết các van dé và ứng dung dự đoán liên kết khác nhau. Từ khía cạnh khác, bài toán dự đoán liên kết được sắp xếp theo ba mức độ từ dưới lên trên: (1) Dựa theo đối tượng mà bài toán dự đoán liên kết quan tâm, mức độ đầu tiên và thấp nhất chia bài toán dự đoán liên kết thành mạng (network) liên quan đến đặc tính toàn cầu của mạng, và liên kết (link) liên quan đến đặc tính liên kết của mạng. (3) Mực độ thứ ba là bài toán dự đoán liên kết được dựa trên các kỹ thuật dự đoán liên kết; do đó hai khía cạnh có sự giao thoa ở mức này và có sự liên quan mật thiết.

Đối với các chỉ số đánh giá được sử dụng trong dự đoán liên kết, thông thường chia làm hai loại: chi số ngưỡng cố định (fixed threshold metrics) và đường cong ngưỡng (threshold curves). Precision và recall trên các dự đoán top-N là các chỉ số fixed threshold điển hình. Một loại số liệu khác là các đường cong ngưỡng, chẳng hạn như (ROC) curves và precision-recall curves được sử dụng rộng rãi trong đánh giá dự đoán liên kết. Ngoài ra, AUC (Khu vực dưới ROC) được xem là thước đo mạnh mẽ khi có sự mat cân bằng [6].

AUC có thé được hiểu là xác suất mà một liên kết bị thiếu được chọn ngẫu nhiên có điểm số cao hơn một liên kết không tồn tại được chọn ngẫu nhiên. Khó có thể xác định và giải thích các chiến lược đánh giá dy đoán liên kết hơn so với phân loại tiêu chuẩn trong đó chi 14 định đầy đủ một tập dữ liệu là đủ, do đó các phương pháp đánh giá mới hoặc chỉ số hiệu suất cũng được đề xuất [7]. Link prediction techniques ~ — a : ; Neighbo r Path Random ‘walk Community Triad Structur hole Tie h Homophily al strengtl ⁄ ÀS NN a Node-based ⁄ -Node similarity Neighbor-based cn | = -Katz sed | | Serre] SimRank F Social Theory-based Structural hoe -feudmlaiy | | IC | | PropFtow _ -LHN | | -Friend Link TT | -PA | -ver pcr “RA |= -CST 7. T ¬ External information: weights, attributes, statistics, knowledge repository,.

y PY 4 Learning-based techniques Feature-based classification | Kernel-based | Matrix factorization Probabilistic model Ỳ Ỳ Ỳ Ỳ Ỷ Ỳ Ỷ Link prediction | Link prediction | Link prediction | Link prediction Link prediction Link prediction | Link prediction in in in Í in for for for heterogeneous location temporal bipartite multi-relation | active/unactive | disappearing network network network | network | links links links Heterogeneous Location Temporal Bipartite Multi-relation Active/unactive Disappearing network network network network link link link Hình 2. Danh mục phân loại kỹ thuật và bài toán dự đoán liên kết. Neural Network Neural Network [49] hay con gọi là mạng nơ-ron nhân tao, là một mô hình toán phức tạp được phát triển dựa theo mô hình hoạt động của các tế bào thần kinh não người nhằm tăng độ chính xác cho các thuật toán học máy. Mô phỏng mô hình than kinh con người.

16 Kiến trúc mạng nơ-ron là việc đi mô phỏng các tế bào thần kinh bằng các nút và các dây thần kinh liên kết các nút với nhau. Các nút x„ va a, mô phỏng cho các tế bao thần kinh và đường liên kết mô phỏng cho các dây thần kinh nối, một mô hình mạng nơ-ron bao gồm ba tầng chính: © Tang vào (Input Layer): Tang này nhận các dit liệu đầu vào tương ứng cho các nút. © Tang ẩn (Hidden Layer): Tầng nay thể hiện cho quá trình xử lý thông tin và suy luận của mạng, tại đây nhận các thông tin đầu vào và trả kết quả đầu ra thông qua các hàm kích hoạt. e Tầng ra (Output Layer): Tang này thé hiện cho đầu ra của mạng nơ-ron sau khi trải qua quá trình tổng hợp và xử lý ở các hidden layers.

17 Giá trị các nút là: a? )= = 9(W,An ) ro + Wey + Wer + Wes) a?) = = g(Wj)zo +W,Oo, + Wx. + WLas) a?) = g WL) 29 Wray Wo x5 Ws) at) = g(WĐzg Wray Wax. Was) g= a3 = = 9 WY a2 + Ww a) + wj al) + w a’) + Ww? at) Với W* là ma trận hệ số giữa lớp (k— 1) và lớp k, trong đó wh là hệ số kết nối từ node thứ i của layer (k — 1) đến node thứ j của layer k, x, là nút input đầu vào tương ứng với từng layer, vector aŸ là giá trị của nút trong layer k khi áp đụng activation function. Mạng nơ-ron được sử dụng nhằm giải quyết tính tuyến tính của các thuật toán học máy thông thường, tăng độ phức tạp và chính xác cho các mô hình.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề Nghiên Cứu Phương Pháp Dự Đoán Liên Kết Trong Mạng Xã Hội Dựa Trên Mạng Nơ-Ron Đồ Thị cung cấp cái nhìn sâu sắc về cách mà các mạng nơ-ron đồ thị có thể được áp dụng để dự đoán các mối liên kết trong mạng xã hội. Nghiên cứu này không chỉ làm rõ các phương pháp kỹ thuật mà còn chỉ ra những lợi ích tiềm năng cho việc tối ưu hóa các thuật toán trong phân tích mạng xã hội. Độc giả sẽ tìm thấy những thông tin hữu ích về cách mà các mô hình này có thể cải thiện khả năng dự đoán và phân tích dữ liệu, từ đó nâng cao hiệu quả trong việc kết nối và tương tác giữa người dùng.

Nếu bạn quan tâm đến các ứng dụng khác trong lĩnh vực khoa học dữ liệu, hãy khám phá thêm tài liệu Khóa luận tốt nghiệp khoa học dữ liệu phân loại và xác định tự động yếu tố bất thường trong tin tuyển dụng tiếng việt, nơi bạn sẽ tìm thấy những phương pháp phân tích dữ liệu thú vị. Ngoài ra, tài liệu Khóa luận tốt nghiệp hệ thống thông tin xây dựng mô hình phân loại sớm bất thường tim mạch dựa trên tín hiệu điện tâm đồ cũng sẽ cung cấp cho bạn cái nhìn về cách mà các mô hình phân loại có thể được áp dụng trong lĩnh vực y tế. Những tài liệu này sẽ giúp bạn mở rộng kiến thức và khám phá thêm nhiều khía cạnh khác nhau trong lĩnh vực khoa học dữ liệu.