Luận văn thạc sĩ: Giải quyết vấn đề mất cân bằng dữ liệu trong dự báo thuê bao rời bỏ nhà mạng

Luận văn thạc sĩ nghiên cứu máy tính giải quyết vấn đề mất cân bằng dữ liệu trong bài toán dự báo thuê bao rời bỏ nhà mạng, đánh giá hiện trạng, phân tích vấn đề, đề xuất biện

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

luận văn thạc sĩ

2020

80
3
0

Phí lưu trữ

30 Point

Tóm tắt

I. Tổng quan về vấn đề mất cân bằng dữ liệu

Trong lĩnh vực dự báo thuê bao rời bỏ nhà mạng, mất cân bằng dữ liệu là một vấn đề nghiêm trọng. Dữ liệu thường có sự phân bố không đồng đều, với nhóm khách hàng rời bỏ chiếm tỷ lệ rất nhỏ so với nhóm khách hàng giữ lại. Điều này dẫn đến việc các thuật toán học máy truyền thống không thể học tốt từ dữ liệu, gây ra các dự đoán không chính xác. Việc hiểu rõ hành vi khách hàng và xây dựng các mô hình dự đoán hiệu quả là rất quan trọng. Nghiên cứu đã chỉ ra rằng việc áp dụng các kỹ thuật như SMOTE và Deep Belief Network có thể cải thiện đáng kể khả năng phân loại trong các bài toán này. Cụ thể, việc áp dụng các kỹ thuật lấy mẫu có thể tạo ra các bản sao của các mẫu thiểu số, từ đó cân bằng dữ liệu và nâng cao hiệu suất của mô hình.

1.1. Tác động của mất cân bằng dữ liệu đến dự báo

Mất cân bằng dữ liệu ảnh hưởng trực tiếp đến hiệu suất của các mô hình học máy. Khi tỷ lệ giữa các nhóm không đồng đều, mô hình có xu hướng thiên về nhóm chiếm ưu thế, dẫn đến việc bỏ qua các đặc điểm quan trọng của nhóm thiểu số. Điều này đặc biệt nghiêm trọng trong bài toán dự báo thuê bao rời bỏ nhà mạng, nơi mà việc nhận diện đúng nhóm khách hàng có nguy cơ rời bỏ là rất cần thiết. Việc áp dụng các phương pháp như hàm mất mát Focalhàm mất mát Entropy theo trọng số đã cho thấy hiệu quả cao trong việc điều chỉnh trọng số cho các lớp không cân bằng, từ đó cải thiện độ chính xác của mô hình.

II. Phân tích các phương pháp xử lý dữ liệu mất cân bằng

Để giải quyết vấn đề mất cân bằng dữ liệu, nhiều phương pháp đã được đề xuất. Một trong những phương pháp phổ biến là kỹ thuật lấy mẫu, trong đó SMOTE được sử dụng để tạo ra các mẫu mới từ các mẫu thiểu số. Phương pháp này đã chứng minh được tính hiệu quả trong việc cải thiện khả năng phân loại của các mô hình học máy. Ngoài ra, Deep Belief Network (DBN) cũng được áp dụng để tăng cường khả năng học của mô hình từ dữ liệu không cân bằng. Việc sử dụng các hàm mất mát như Focal Loss và Weighted Cross Entropy Loss đã cho thấy sự cải thiện rõ rệt trong hiệu suất dự đoán, nhờ vào khả năng điều chỉnh trọng số cho các lớp không cân bằng.

2.1. Kỹ thuật SMOTE

Kỹ thuật SMOTE (Synthetic Minority Over-sampling Technique) là một phương pháp hiệu quả trong việc xử lý dữ liệu mất cân bằng. SMOTE tạo ra các mẫu mới bằng cách nội suy giữa các mẫu thiểu số, từ đó làm tăng số lượng mẫu của nhóm thiểu số. Kết quả thực nghiệm cho thấy rằng việc áp dụng SMOTE giúp cải thiện đáng kể độ chính xác của mô hình trong bài toán dự báo thuê bao rời bỏ nhà mạng. Cụ thể, mô hình được huấn luyện với dữ liệu đã cân bằng cho thấy khả năng phân loại tốt hơn so với mô hình sử dụng dữ liệu gốc.

2.2. Kỹ thuật Deep Belief Network

Deep Belief Network (DBN) là một mô hình học sâu có khả năng học từ các đặc trưng phức tạp của dữ liệu. DBN có thể được áp dụng để cải thiện khả năng phân loại trong các bài toán dữ liệu mất cân bằng. Bằng cách sử dụng DBN, mô hình có thể tự động trích xuất các đặc trưng quan trọng từ dữ liệu, từ đó nâng cao hiệu suất phân loại. Nghiên cứu cho thấy rằng DBN có thể giúp phát hiện các mẫu hành vi của khách hàng có nguy cơ rời bỏ, từ đó hỗ trợ các nhà mạng trong việc phát triển các chiến lược giữ chân khách hàng hiệu quả.

III. Giải pháp và ứng dụng thực tiễn

Trong bối cảnh cạnh tranh gay gắt giữa các nhà mạng, việc áp dụng các giải pháp để xử lý mất cân bằng dữ liệu trong dự báo thuê bao rời bỏ là cực kỳ cần thiết. Các phương pháp như tìm kiếm đối khángnghịch đảo trọng số đã được áp dụng để cải thiện khả năng phân loại của các mô hình học máy. Các kết quả thực nghiệm cho thấy rằng việc sử dụng các kỹ thuật này không chỉ giúp cải thiện độ chính xác mà còn giúp mô hình tự động điều chỉnh theo sự thay đổi của dữ liệu theo thời gian. Điều này mở ra tiềm năng lớn cho việc triển khai các mô hình dự đoán trong thực tế, giúp các nhà mạng tối ưu hóa chi phí và nâng cao doanh thu.

3.1. Tìm kiếm đối kháng

Tìm kiếm đối kháng là một kỹ thuật giúp mô hình tự phát hiện và thích ứng với sự thay đổi của dữ liệu theo thời gian. Kỹ thuật này cho phép mô hình học từ các mẫu mới và điều chỉnh dự đoán của mình dựa trên các thay đổi trong hành vi khách hàng. Việc áp dụng tìm kiếm đối kháng đã cho thấy hiệu quả cao trong việc cải thiện khả năng phân loại, đặc biệt trong các bài toán mà dữ liệu có xu hướng thay đổi theo thời gian.

3.2. Nghịch đảo trọng số

Phương pháp nghịch đảo trọng số của hệ số xu hướng giúp cân bằng phân bố dữ liệu trong tập huấn luyện và tập kiểm thử. Bằng cách sử dụng phương pháp này, mô hình có thể học tốt hơn từ các mẫu thiểu số, từ đó cải thiện hiệu suất dự đoán. Kết quả thực nghiệm cho thấy rằng việc áp dụng phương pháp nghịch đảo trọng số giúp tăng cường khả năng phát hiện khách hàng có nguy cơ rời bỏ, từ đó hỗ trợ các nhà mạng trong việc phát triển các chiến lược giữ chân khách hàng hiệu quả.

05/01/2025
Luận văn thạc sĩ khoa học máy tính giải quyết vấn đề mất cân bằng dữ liệu trong bài toán dự báo thuê bao rời bỏ nhà mạng

Trích đoạn nội dung tài liệu

CHƯƠNG 1 GIỚI THIỆU nhằm giới thiệu tổng quan về bài toán dự báo thuê bao rời bỏ nhà mạng bao gồm phần giới thiệu vấn đề, mục đích, đối tượng và phạm vi nghiên cứu và kết quả đạt được. CHƯƠNG 2 CÁC NGHIÊN CỨU LIÊN QUAN bao gồm các công trình nghiên cứu liên quan đến bài toán dự đoán thuê bao rời bỏ nhà mạng. Đặc biệt trình bày các nghiên cứu gần đây để giải quyết vấn đề mất cân bằng dữ liệu và vấn đề độ lệch phân bố dữ liệu thay đổi theo thời gian. CHƯƠNG 3 CƠ SỞ LÝ THUYẾT đầu tiên trình bày sơ lược về vấn đề dữ liệu mất cân bằng và các phương pháp cơ bản để giải quyết.

Tiếp theo đó trình bày bốn phương pháp chính được chọn trong luận văn để giải quyết vấn đề dữ liệu mất cân bằng, các phương pháp bao gồm: SMOTE, DBN, hàm mất mát Focal và hàm mất mát entropy theo trọng số. Tiếp theo trình bày vấn đề độ lệch phân bố dữ liệu và các phương pháp cơ bản để giải quyết trong đó nhấn mạnh hai kĩ thuật: kĩ thuật tìm kiếm đối xứng và kĩ thuật đảo ngược trọng số của hệ số xu hướng. CHƯƠNG 4 PHƯƠNG PHÁP TIẾP CẬN bao gồm 2 phương pháp chính là giải quyết dữ liệu mất cân bằng và độ lệch phân bố dữ liệu. CHƯƠNG 5 HIỆN THỰC VÀ THỰC NGHIỆM là kết quả thực nghiệm dựa trên các phương pháp thực hiện ở CHƯƠNG 4.

CHƯƠNG 6 KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN nêu ra một số kết luận và nhận xét được đúc kết trong quá trình hiện thực nhằm mục tiêu cải thiện hiệu năng phân lớp cho bài toán dự báo thuê bao rời bỏ nhà mạng. Phần cuối là trình bày các hướng phát triển trong tương lai. Các công trình liên quan Chương này trình bày các công trình liên quan được chúng tôi tìm hiểu nghiên cứu trong quá trình hiện thực đề tài luận văn. Dựa vào mô hình dự đoán được xây dựng trên nền tảng lý thuyết cũng như các giải thuật khác nhau, qua quá trình tìm hiểu có thể phân thành các nhóm sau đây: • Mô hình áp dụng các giải thuật học máy căn bản và mạng nơron học sâu • Mô hình áp dụng các kĩ thuật học chuyển giao (transfer learning) • Mô hình giải quyết dữ liệu mất cân bằng • Mô hình giải quyết vấn đề độ lệch phân bố dữ liệu thay đổi theo thời gian 2.1 Mô hình áp dụng các giải thuật học máy căn bản và mạng nơron học sâu Trong bài toán dự báo thuê bao rời bỏ nhà mạng, các phương pháp khai phá dữ liệu theo hướng thống kê truyền thống cũng như sử dụng các giải thuật học máy được áp dụng rộng rãi.

Kĩ thuật khai quá dữ liệu tiếp cận theo phương pháp thống kê truyền thống như Hồi Quy Logistics [1], mô hình phi tham số như k lân cận gần nhất ([2], [3]), cây quyết định ([4], [5]), mạng nơron nhân tạo ([6], [7]), máy vector hỗ trợ [8], các mô hình tổ hợp bộ phân lớp (kĩ thuật ensemble) ([9], [10]). Tuy nhiên bài toán dự báo thuê bao rời bỏ nhà mạng thường gặp phải vấn đề dữ liệu mất cân bằng, trong đó nhóm dữ liệu rời bỏ thường chiếm tỉ lệ rất thấp, trung bình chỉ chiếm khoảng 2% thuê bao. Các phương pháp truyền thống gặp nhiều khó khăn khi làm việc trên dữ liệu mất cân bằng, do các phương pháp này được thiết kế chỉ chú trọng vào tính chất của dữ liệu nhóm đa số, trong trường hợp này là nhóm không rời bỏ nhà mạng. Sự thành công của mô hình mạng nơ ron học sâu trong lĩnh vực xử lí ảnh, xử lí ngôn ngữ tự nhiên… nhờ khả năng tạo được đặc trưng bậc cao và khả năng học được lượng lớn dữ liệu.

Với bài toán thuê bao rời bỏ nhà mạng, trong thực tế tập dữ liệu khách hàng đến từ nhiều nguồn khác nhau, đặc trưng và tính chất khác nhau, đối với mô hình học truyền thống việc trích xuất đặc trưng thủ công sẽ mất nhiều thời gian và không có khả năng được áp dụng cho tập dữ liệu từ nguồn khác. Spanoudes và Nguyen năm 2017 [11] cố gắng giải bài toán này 5 bằng việc sử dụng mạng nơ ron học sâu để tự động trích xuất được đặc trưng từ nhiều nguồn dữ liệu khác nhau, cách tiếp cận này phù hợp với thực tế về tính linh động của mô hình học với sự thay đổi dữ liệu huấn luyện từ nhiều nguồn khác nhau nhưng kết quả còn hạn chế vì một số đặc trưng đặc biệt cần được trích xuất tường minh bằng sự hiểu biết sâu về tính chất của hành vi khách hàng rời bỏ nhà mạng. Một số nghiên cứu áp dụng mô hình mạng nơ ron tích chập (convolutional neural networks - CNN) và auto-encoder [12], trong đó hành vi người dùng được lấy trong một khoảng thời gian để xây dựng nên không gian vector hai chiều tương tự dữ liệu hình ảnh, trong mô hình này phụ thuộc vào dữ liệu thu thập được từ nhiều ngày từ nhà cung cấp dịch vụ mạng để xây dựng được hành vi người dùng theo thời gian. Nghiên cứu [13] áp dụng nhiều mô hình CNN làm bộ phân lớp cơ sở cho mô hình học kết hợp giữa giải thuật di truyền kết hợp với kĩ thuật Ada Boosting.

Do dữ liệu ban đầu trên không gian một chiều nên tác giả đã ánh xạ qua không gian hai chiều để làm đầu vào cho mạng CNN, việc ánh xạ sử dụng kĩ thuật nội suy thử nhiều lần để kết quả nội suy gần với không gian vector ban đầu nhất, quá trình huấn luyện tốn rất nhiều thời gian vì sử dụng nhiều bộ phân lớp CNN được chọn lọc, tinh chỉnh từ không gian cá thể ban đầu qua sự kết hợp giữa cách tạo ra quần thể mô hình thế hệ tiếp theo và sự chọn lựa cá thể đi tiếp dựa trên giải thuật Ada Boosting. Qua các nghiên cứu gần đây chúng tôi thấy được bài toán dự báo thuê bao rời bỏ nhà mạng được áp dụng nhiều kĩ thuật học máy mới nhất hiện nay như mạng nơron học sâu kết hợp với kĩ thuật học chuyển giao và các kĩ thuật phối hợp, tăng cường nhiều bộ phân lớp như giải thuật di truyền, giải thuật boosting. Song song bên cạnh đó, các kĩ thuật xử lí dữ liệu để tránh tập dữ liệu bị mất cân bằng cũng được áp dụng kèm theo. Chúng tôi thấy rằng, với sự kết hợp các kĩ thuật mới nhất của lĩnh vực học máy và tối ưu đem lại tiềm năng to lớn đối với mô hình dự báo thuê bao nhà mạng nói riêng và các bài toán phân lớp nói chung, để giải quyết hai tính chất quan trọng nhất của bài toán phân lớp trong thực tế là tập dữ liệu thường bị mất cân bằng và tính dịch chuyển, không đồng nhất của phân bố xác xuất tập dữ liệu huấn luyện và tập dữ liệu kiểm thử thực tế.

Chúng tôi tập trung tìm hiểu các công trình liên quan đến vấn đề giải quyết tập dữ liệu mất cân bằng và vấn đề phân bố dữ liệu thay đổi theo thời gian.2 Mô hình áp dụng các kĩ thuật học chuyển giao (transfer learning) Gần đây với xu hướng học chuyển giao (transfer learning) được áp dụng thành công trong mảng xử lí ảnh dùng kĩ thuật học sâu, học chuyển giao đã được áp dụng vào bài toán xác định thuê bao rời bỏ nhà mạng đạt được kết quả khả quan. Với giả định thực tế là khi tập khách hàng đến từ các vùng miền khác nhau có đặc trưng khác nhau về kinh tế, vùng miền, nghề nghiệp… thì tập dữ liệu trong công tác nguồn và tập dữ liệu trong công tác đích sẽ có phân bố xác suất khác nhau, thậm chí trong trường hợp tập dữ liệu trong công tác nguồn và tập dữ liệu trong công tác đích có cùng phân bố xác xuất thì có thể xảy ra trường hợp tập dữ liệu huấn luyện và tập kiểm thử có sự khác biệt phân bố vì hành vi khách hàng sử dụng sẽ thay đổi theo thời gian. Vấn đề này gây khó khăn với cái giải thuật học máy căn bản vì các giải thuật này giả định rằng phân bố tập huấn luyện và tập kiểm thử phải cùng phân bố xác suất. Học chuyển giao sẽ giải quyết vấn đề này khi áp dụng kiến thức được học từ một tập công tác nguồn sau đó lấy kiến thức kết hợp với tập dữ liệu mục tiêu để áp dụng lên mô hình học.

Hình 1 và hình 2 diễn tả sự khác biệt của mô hình học truyền thống và mô hình học chuyển giao. Mô hình học truyền thống [14] Hình 2. Mô hình học chuyển giao [14] Xiao và các cộng sự năm 2014 [14] đã kết hợp mô hình học chuyển giao với kĩ thuật lựa chọn đặc trưng (Feature Selection) nhằm trích xuất đặc trưng từ tập trong công tác nguồn sau đó kết hợp với tập dữ liệu trong công tác đích để tạo nhiều đặc trưng bậc cao trong đó nhóm đặc trưng mới này chứa đựng nhiều thông tin giao hỗ tương giữa tập công tác nguồn và tập công tác đích. Mô hình này đạt kết quả khá cao so với các mô hình truyền thống, 7 chứng tỏ khả năng áp dụng tốt của học chuyển giao với bài toán dự báo thuê bao rời bỏ nhà mạng.

Với các nghiên cứu gần đây về kĩ thuật học chuyển giao nhằm giải quyết vấn đề Covariate Shift có một số kĩ thuật như: • Học chuyển giao dựa trên chiến lược lựa chọn đặc trưng TFS • Học chuyển giao dựa trên chiến lược lựa chọn mẫu TrBagg • Học chuyển giao dựa trên chiến lược lựa chọn mẫu TrAdaBoos Giải thuật TFS dựa vào kĩ thuật lựa chọn đặc trưng theo chiều tiến có giám sát (Supervised Forward Feature Selection - SFFS), đầu tiên áp dụng SFFS để chọn tập đặc trưng tốt nhất trên tập dữ liệu mục tiêu, sau đó dựa trên tập đặc trưng này để tính độ tin cậy (confidence score) của từng mẫu trong tập dữ liệu nguồn. Tiếp đến một số mẫu trong tập dữ liệu nguồn được chọn dựa trên tiêu chí độ tin cậy kết hợp với tập dữ liệu nguồn để sinh ra tập dữ liệu mới, trên tập dữ liệu mới này dùng SFFS để chọn ra một tập đặc trưng mới, nếu các đặc trưng mới này có tần số xuất hiện nhiều lần qua các lần lặp thì được thêm vào tập đặc trưng được chọn. Quá trình cứ lặp lại nhiều lần để cuối cùng tập đặc trưng tiến tới con số định trước thì giải thuật dừng. Cuối cùng dùng tập đặc trưng được chọn để huấn luyện trên tập dữ liệu mục tiêu [15].

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Bài viết "Luận văn thạc sĩ: Giải quyết vấn đề mất cân bằng dữ liệu trong dự báo thuê bao rời bỏ nhà mạng" của tác giả Nguyễn Nhật Nam, dưới sự hướng dẫn của PGS. TS Dương Tuấn Anh tại Đại học Bách Khoa - ĐHQG TP.HCM, tập trung vào việc phát hiện và giải quyết tình trạng mất cân bằng dữ liệu trong lĩnh vực dự báo thuê bao rời bỏ nhà mạng. Bài luận văn này không chỉ đề xuất các phương pháp phân tích và xử lý dữ liệu hiệu quả mà còn cung cấp những giải pháp thực tiễn giúp các nhà mạng cải thiện khả năng giữ chân khách hàng.

Người đọc có thể mở rộng kiến thức của mình qua các tài liệu liên quan như Luận Văn Thạc Sĩ Về Phân Tích Dữ Liệu Sinh Viên Ngành CNTT Tại Trường Đại Học Tài Chính Marketing, trong đó phân tích dữ liệu sinh viên để dự báo tiến độ học tập, hay Nghiên cứu phát triển kỹ thuật hỗ trợ phát hiện đạo văn trong văn bản tiếng Việt, nghiên cứu về cách xử lý và phân tích văn bản, có thể liên quan đến cách xử lý dữ liệu trong luận văn của Nam. Cuối cùng, Luận văn thạc sĩ về phát triển năng lực tư duy cho học sinh trong dạy học cũng mang đến những góc nhìn thú vị về việc phát triển kỹ năng phân tích dữ liệu trong giáo dục. Những tài liệu này sẽ giúp bạn có cái nhìn sâu sắc hơn về cách mà dữ liệu và phân tích có thể ảnh hưởng đến các lĩnh vực khác nhau.