CHƯƠNG 1: GIỚI THIỆU BÀI TOÁN ỨNG DỤNG 1. Lý do lựa chọn đề tài Những năm gần đây, công nghệ thông tin đang phát triển mạnh mẽ khiến cho số lượng lớn thông tin không ngừng tăng lên vượt qua mức kiểm soát. Các doanh nghiệp phải đối mặt với những vấn đề hết sức nan giải: luồng thông tin phân tán ở nhiều nơi, dữ liệu định dạng ở nhiều góc độ khác nhau… Câu hỏi đặt ra ở đây là: Làm sao có thể dễ dàng sử dụng và truy cập dữ liệu một cách nhanh nhất?”. Và thế là kỹ thuật khai phá dữ liệu ra đời để có thể lưu trữ tất cả thông tin một cách hiệu quả và chính xác nhất.
Với thời đại ngày nay, việc áp dụng kỹ thuật khai phá dữ liệu ngày càng phổ biến trong nhiều lĩnh vực khác nhau, đặc biệt là trong ứng dụng Marketing. Trong hoạt động Marketing, khai phá dữ liệu nổi lên như một công cụ giúp cho các doanh nghiệp có cái nhìn toàn diện và khách quan hơn về đối tượng khách hàng mình đang hướng đến. Có thể nói, khai phá dữ liệu giống như bộ máy có thể sàng lọc những thông tin hữu ích, những khám phá mới lạ về khách hàng, qua đó doanh nghiệp sẽ tìm cách giải quyết những vấn đề khách hàng cần. Trong điều kiện kinh tế thị trường đầy biến động, đặc biệt là xu thế cạnh tranh ngày càng khốc liệt, Marketing được coi là một trong những công cụ không thể thiếu trong hoạt động sản xuất kinh doanh, góp phần giúp doanh nghiệp tạo lập uy tín và vị thế vững chắc trước đối thủ.
Các doanh nghiệp cũng có thể ứng dụng khai phá dữ liệu để phân khúc thị trường trong lĩnh vực Marketing. Đây là chiến lược mà các doanh nghiệp đang dần tiếp cận ngày càng nhiều, trong đó có Starbucks Coffee - thương hiệu cà phê nổi tiếng trên toàn thế giới. Phân khúc thị trường rất quan trọng trong việc phân tích dữ liệu kinh doanh. Nó giúp cho các doanh nghiệp nắm được sự hiểu biết chi tiết về nhóm khách hàng tiềm năng của mình và sau đó trực tiếp tiếp cận khách hàng.
Theo một khảo sát, các chiến dịch được phân đoạn dựa trên sự quan tâm của khách hàng đạt tỷ lệ trung bình cao hơn 74% so với các chiến dịch không được phân khúc. Qua đó, Starbucks Coffee có thể tìm hiểu sở thích 1 Downloaded by vu ga (vuchinhhp2@gmail.com) lOMoARcPSD|18034504 của từng nhóm khách hàng và tung ra thị trường những sản phẩm phù hợp, bắt mắt và thu hút đối tượng tiêu dùng. Sự thành công của phân khúc thị trường đã làm cho Starbucks Coffee vượt qua những đối thủ đáng gờm để nắm chắc vị thế và sự uy tín đối với khách hàng. Vậy làm cách nào mà Starbucks có thể giữ chân khách hàng và mức độ trung thành của khách hàng đối với thương hiệu như thế nào? Để trả lời cho câu hỏi trên, bằng việc khai phá và phân tích dữ liệu, nhóm chúng em đã quyết định chọn đề tài “Ứng dụng máy học trong việc dự đoán khách hàng trung thành và phân khúc khách hàng đối với thương hiệu Starbucks Coffee” để có thể tìm hiểu sâu hơn cách thức tiếp cận từng nhóm khách hàng cũng như dự đoán mức độ trung thành của khách hàng đối với thương hiệu Starbucks Coffee.
Mục tiêu nghiên cứu Bài nghiên cứu “Ứng dụng máy học trong việc dự đoán khách hàng trung thành và phân khúc khách hàng đối với thương hiệu Starbucks Coffee” tập trung vào những mục tiêu sau: Tiến hành phân tích các lý thuyết tổng quan của khai phá dữ liệu, cụ thể là thuật toán phân lớp dữ liệu và phân cụm dữ liệu bằng Orange để có thể làm rõ những vấn đề bài nghiên cứu. Xác định mô hình nào mang lại đánh giá có độ chính xác cao nhất trong việc nghiên cứu sự trung thành của khách hàng đối với Starbucks. Dựa trên mô hình đã được huấn luyện, sau đó đưa ra mức độ trung thành của khách hàng cũng như các hướng giải quyết mức độ này. Tiến hành phân cụm dữ liệu bằng Orange, từ đó phân tích các nhóm khách hàng tiềm năng sử dụng thương hiệu Starbucks Coffee.
Phương pháp thực hiện Sử dụng công cụ khai phá dữ liệu Orange và công cụ Excel để xử lý dữ liệu, biểu diễn dữ liệu cũng như so sánh các mô hình. 2 Downloaded by vu ga (vuchinhhp2@gmail. Đối tượng nghiên cứu Đối tượng nhắm đến khách hàng sử dụng thương hiệu Starbucks Coffee. Bộ dữ liệu được thu thập trên kaggle.
Bộ dữ liệu đã được gửi đến 107 người để khảo sát hành vi mua hàng của khách hàng. Tập dữ liệu này bao gồm thông tin dữ liệu thô chứa 107 hàng dữ liệu (khách hàng) và 14 cột (đặc tính). CHƯƠNG 2: CƠ SỞ LÝ THUYẾT 2. Khai phá dữ liệu 2.
Khái niệm khai phá dữ liệu Khai phá dữ liệu (Data Mining) là quá trình tính toán để tìm ra các mẫu trong các bộ dữ liệu lớn liên quan đến các phương pháp tại giao điểm của máy học, thống kê và các hệ thống cơ sở dữ liệu nhằm giải quyết các vấn đề thông qua việc phân tích dữ liệu. Mục tiêu tổng thể của quá trình khai thác dữ liệu là trích xuất thông tin từ một bộ dữ liệu và chuyển nó thành một cấu trúc dễ hiểu để sử dụng tiếp. Ngoài bước phân tích thô, nó còn liên quan tới cơ sở dữ liệu và các khía cạnh quản lý dữ liệu, xử lý dữ liệu trước, suy xét mô hình và suy luận thống kê, các thước đo thú vị, các cân nhắc phức tạp, xuất kết quả về các cấu trúc được phát hiện, hiện hình hóa và cập nhật trực tuyến. Các tính năng chính của khai phá dữ liệu Một số tính năng chính của Data Mining: Dự đoán các mẫu dựa trên xu hướng trong dữ liệu.
Tính toán dự đoán kết quả. Tạo thông tin phản hồi để phân tích. Tập trung vào cơ sở dữ liệu lớn hơn. Phân cụm dữ liệu trực quan.
3 Downloaded by vu ga (vuchinhhp2@gmail. Quy trình khai phá dữ liệu Quy trình khai phá dữ liệu gồm 7 bước, cùng với đó là quy trình khai phá dữ liệu được trình bày dưới dạng sơ đồ hình vẽ thông qua hình 2.1 như sau: Bước 1: Làm sạch dữ liệu. Đây được đánh giá là bước khá quan trọng bởi những dữ liệu bẩn sẽ gây ra sự nhầm lẫn, tạo ra kết quả không được chính xác nên bước này sẽ giúp làm sạch những nguồn dữ liệu đó. Bước 2: Tích hợp dữ liệu.
Đây là một trong những kỹ thuật khai thác hàng đầu để hợp lý hóa toàn bộ quá trình trích xuất, chuyển đổi và nhiều nguồn dữ liệu sẽ kết hợp lại làm một. Bước này giúp độ chính xác cung như tốc độ khai phá dữ liệu được cải thiện. Bước 3: Làm giảm dữ liệu. Ở bước này giúp kích thước dữ liệu có khối lượng nhỏ nhưng nó đảm bảo và duy trì về tính toàn diện.
Bước 4: Chuyển đổi dữ liệu. Trong bước này, dữ liệu sẽ được chuyển đổi để thực hiện phân tích tóm tắt cũng như các hoạt động tổng hợp giúp cho quy trình khai phá dữ liệu có thể hiệu quả và dễ hiểu hơn. Bước 5: Khai phá dữ liệu. Đây là bước trích xuất dữ liệu và khai thác dữ liệu để xác định các mẫu và một lượng lớn dữ liệu.
Bước 6: Đánh giá mẫu. Bước này sẽ cho biết những dữ liệu nào là cần thiết, dữ liệu nào là dư thừa và sẽ bị loại bỏ. Các phương pháp trực quan hóa và tóm tắt dữ liệu được sử dụng để người dùng có thể hiểu được bộ dữ liệu của mình. Bước 7: Trình bày thông tin.
Trong bước cuối cùng, dữ liệu sẽ được trình bày dưới dạng cây, bảng, biểu đồ,…và sau đó gửi cho bên bộ phân xử lý thông tin này. 4 Downloaded by vu ga (vuchinhhp2@gmail.com) lOMoARcPSD|18034504 Hình 2.1: Quy trình khai phá dữ liệu 2. Phương pháp khai phá dữ liệu Phân cụm (Clustering): Phân cụm dữ liệu giúp gom nhóm các đối tượng dữ liệu thành từng cụm sao cho các đối tượng trong cùng một cụm có sự tương đồng theo một tiêu chí nào đó giúp cho việc mô tả dữ liệu dễ dàng hơn. Chúng tôi sẽ sử dụng phương pháp này trong bài để dự báo số liệu.
Phân lớp (Classification): Phương pháp này dùng để phân chia dữ liệu vào các lớp và dự báo dữ liệu thông qua bộ dữ liệu huấn luyện. Hồi quy (Regression): Phương pháp này sử dụng để dùng để khám phá và ánh xạ dữ liệu. Tổng hợp (Summarization): Tổng hơp cho phép người làm tìm kiếm một mô tả nhỏ gọn. 5 Downloaded by vu ga (vuchinhhp2@gmail.com) lOMoARcPSD|18034504 Mô hình ràng buộc (Dependency modeling): Phương pháp này giúp người làm tìm được mô hình cục bộ mô tả các phụ thuộc.
Dò tìm biến đổi và độ lệch (Change and Deviation Dectection): Đây là phương pháp nhằm tìm ra những thay đổi quan trọng 2. Ứng dụng của khai phá dữ liệu trong đời sống Khai phá dữ liệu ứng dụng rất nhiều trong đời sống của chúng ta, đặc biệt là trong các lĩnh vực: kinh doanh, viễn thông, ngân hàng, thương mại điện tử và bán lẻ, tài chính, y tế và chăm sóc sức khỏe, an ninh, bảo mật mạng… 2. Công cụ khai phá dữ liệu sử dụng trong bài nghiên cứu – Orange Phần mềm Orange biết đến bởi việc tích hợp các công cụ khai phá dữ liệu mã nguồn mở và học máy thông minh, đơn giản, được lập trình bằng Python với giao diện trực quan và tương tác dễ dàng. Với nhiều chức năng, phần mềm này có thể phân tích được những dữ liệu từ đơn giản đến phức tạp, tạo ra những đồ họa đẹp mắt và thú vị và còn giúp việc khai thác dữ liệu và học máy trở nên dễ dàng hơn cho cả người dùng mới và chuyên gia.
Orange có Widget cung cấp các chức năng cơ bản như đọc dữ liệu, hiển thị dữ liệu dạng bảng, lựa chọn thuộc tính đặc điểm của dữ liệu, huấn luyện dữ liệu để dự đoán, so sánh các thuật toán máy học, trực quan hóa các phần tử dữ liệu,… 2. Phân lớp dữ liệu 2. Khái niệm phân lớp dữ liệu Là quá trình phân một đối tượng dữ liệu vào một hay nhiều lớp (loại) đã cho trước nhờ một mô hình phân lớp. Mô hình này được xây dựng dựa trên một tập dữ liệu đã được gán nhãn trước đó (thuộc về lớp nào).
Quá trình gán nhãn (thuộc lớp nào) cho đối tượng dữ liệu chính là quá trình phân lớp dữ liệu. 6 Downloaded by vu ga (vuchinhhp2@gmail.