BO GIAO DUC VA DAO TAO TRƯỜNG ĐẠI HỌC SU PHAM KY THUAT TP.HO CHI MINH KHOA: KINH TE TIEU LUAN MON HOC: MAY HOC DE TAI: UNG DUNG MACHINE LEARNING DE DU DOAN DOANH SO BAN HANG GVHD: Tran Vii Hoang NHOM: 3 SVTH: 1. Huynh Pham Toan 22126134 2. Lê Thị Bảo Trâm 22126137 3. Lê Quốc Thịnh 22126114 5.
Nguyen Thao Nhi 22126114 Ma mon hoc: MALE433908_23_2 01 Tp. Hồ Chí Minh, tháng 6 năm 2024 NHAN XET CUA GIANG VIEN Ngày. Giáo viên châm diém TOM TAT Khả năng dự đoán doanh số bán hàng trong tương lai là điều cần thiết đối với các công ty hiện đại. Công việc vốn đã khó khăn của việc dự báo doanh số bán hàng trở nên khó khăn hơn nhiều do thiếu dữ liệu.
thiếu giá trị dữ liệu hoặc các giá trị ngoại lệ. Hồi quy có mỗi quan hệ chặt chẽ hơn với độ phức tạp của dự báo doanh số sO với chuỗi thời gian. Phức tạp trong các mô hình dự đoán doanh số bán hàng cũng liên quan đến một loạt các yếu tố rủi ro có thể được phát hiện bằng cách sử dụng thuật toán học máy và kỹ thuật học máy có giám sát. Doanh số bán hàng của một công ty dự đoán cần phải chính xác.
Bằng cách sử dụng mô hình dự báo đoanh số bán hàng đáng tin cậy, các doanh nghiệp có thể xác định những rủi ro tiềm ân và đưa ra quyết định thông minh hơn. Trong nghiên cứu này, dữ liệu bán hàng của Rossmann sẽ được được phân tích bằng cách sử dụng Tăng cường độ dốc cực cao (XGBoost). Giúp công ty có thể giảm chỉ phí liên quan đến sự dư thừa tồn kho, lập kế hoạch trong tương lai và tăng lợi nhuận bằng cách sử dụng dự báo bán hàng chính xác. Vì thế, mô hình cần được đánh giá bằng các kỹ thuật thông kê như: RMSE và MAE.
Đề xác định xem mô hình dự đoán doanh thu chính xác hay không thì kết quả sẽ được sử dụng. CHUONG I: TONG QUAN 1.1 Ly do chon dé tai Việc dự đoán doanh số bán hàng là một trong những thách thức lớn mà các doanh nghiệp phải đối mặt trong quá trình quản lý hoạt động kinh doanh. Khi tiễn hành thực hiện đề tài này chúng tôi mong muốn tìm ra cơ chế dự đoán doanh số bán hàng đáng tin cậy không chỉ giúp doanh nghiệp tối ưu hóa lợi nhuận mả còn nâng cao hiệu quả quản lý hàng tồn kho. Bên cạnh đó, hiện nay các doanh nghiệp đang rất quan tâm đến việc quản lý mức hàng tồn kho, vì dự trữ quá nhiều sẽ làm tăng vốn đầu tư do chi phi lưu kho và nguy cơ hàng hóa lỗi thời, trong khi dự trữ quá ít dẫn đến việc bỏ lỡ cơ hội bán hàng, ảnh hưởng tiêu cực đến doanh thu và uy tín.
Chính vì vậy, đề tài nghiên cứu “Ứng dụng machine learning vào dự đoán doanh số bán hàng” là vô cùng cần thiết. Machine learnine có thể phân tích và học hỏi từ các dữ liệu bán hàng trong quá khứ, từ đó đưa ra các dự báo chính xác hơn về nhu cầu thị trường. Điều nảy sẽ giúp doanh nghiệp duy trì mức tồn kho hợp lý, tối ưu hóa chi phí và tận dụng tốt các cơ hội bán hàng. Việc chọn đề tài này không chỉ đáp ứng nhu cầu cấp thiết của doanh nghiệp mà còn mở ra cơ hội ứng dụng công nghệ tiên tiến trong quản lý kinh doanh.2 Mục tiêu của đề tài Mục tiêu của đề tài nghiên cứu ứng dụng machine learning vào dự đoán doanh số bán hàng là nhằm giúp các cửa hàng lập kế hoạch kinh doanh và quản lý hàng tồn kho một cách hiệu quả hơn.
Bằng cách phân tích dữ liệu bán hàng trong quá khứ và dự đoán chính xác xu hướng doanh số trong tương lai, các cửa hàng có thê điều chỉnh kế hoạch kinh đoanh phù hợp với nhu cầu thị trường. Việc này không chỉ giúp đảm bao rằng luôn có đủ nguồn cung để đáp ứng nhu cầu của khách hàng mà còn giúp tránh tình trạng thiếu hụt hàng hóa, từ đó cải thiện trải nghiệm khách hàng và nâng cao doanh thu. Bên cạnh đó, kết quả nghiên cứu giúp chúng ta hiểu biết sâu hơn về hành vi mua sắm của khách hàng. Bằng cách áp dụng các thuật toán machine learning, doanh nghiệp có thể phân tích các mẫu hành vi mua hàng, xác định các yếu tố ảnh hướng đến quyết định mua sắm và dự đoán nhu cầu của khách hảng trong tương lai.
Thông tin này giúp doanh nghiệp không chỉ tối ưu hóa lượng hàng tổn kho mà còn điều chỉnh chiến lược tiếp thị và bán hàng, nâng cao khả năng đáp ứng nhu cầu của khách hàng, cải thiện sự hài lòng và tăng cường lòng trung thành của họ.3 Giới hạn của đề tài Dữ liệu chỉ được thu thập từ 1/1/2013 đến 17/9/2015 của Rossmann Store, nên có thể một số đặc trưng quan trọng lúc đó sẽ không ảnh hưởng quá nhiều đến quá trình tăng (giảm) doanh số bán hàng hiện nay (2024) do sự biến đôi của thị thường là phát triển không ngừng, không tuân theo quy luật nảo. Đề tài chỉ lấy dữ liệu đã được thu thập trước đó, học những quy luật trong quá khứ để đưa ra kết quả dự đoán trong tương lai, nên nếu trong tương lai không xảy ra bất kì sự thay đổi lớn nào trên thị trường (Ví dụ như: dịch covid-19 đã làm thay đổi hành vi mua sắm của khách hàng từ mua sam offline sang mua sắm online, người dân tiết kiệm hơn, ít mua sắm hơn.) thì đoanh số dự đoán mà mô hình cho ra được sẽ khá hữu ích. Do sự giới hạn về thời gian (2 tháng) nên bài nghiên cứu của chúng tôi chỉ lay dit liệu của Rossmamn Store để đi phân tích và xây dựng mô hình. Lấy những đặc trưng quan trọng và loại bỏ bớt những đặc trưng không quan trọng, sau đó đưa dữ liệu vào dé train mô hình và lấy dữ liệu từ 1/8/2015 đến 17/9/2015 để test rồi cho ra kết quả dự đoán.
Vì vậy, nếu đưa một dataset của cửa hàng khác vào thì sẽ không thể cho ra kết quả được.5 Giới thiệu về nhóm CHUONG II: CO SO LY THUYET 2.1 Các thách thức của dé tai 2.1 Dữ liệu phí tuyến Dữ liệu phi tuyến trong doanh số bán hàng là loại đữ liệu mà mỗi quan hệ giữa các yếu tố ảnh hưởng và doanh số bán hàng không thê được biếu diễn đơn giản bằng các đường thắng hay phương trình tuyến tính. Thay vào đó, mối quan hệ này phức tạp hơn và có thể chứa nhiều biến tác động lẫn nhau theo nhiều cách khác nhau. Ví dụ như: Promo tác động của các chương trình khuyến mãi thường không tuyến tính. Một chương trình khuyến mãi có thể dẫn đến sự tăng vọt doanh số ban đầu, sau đó chững lại hoặc giam dần hoặc doanh số có thể tăng đột biến vào các dip lễ, cuối tuần hoặc mùa mua sắm cao điểm và giảm vào các thời điểm khác trong năm.
Hậu quả Độ chính xác thấp, khó khăn trong việc lựa chọn mô hình phủ hợp và có thể dẫn đến tinh trang overfitting.2 Sự phụ thuộc dai han Một trong những thách thức lớn khi dự đoán doanh số bán hàng lả việc năm bắt sự phụ thuộc lâu dải trong đữ liệu. Các phương pháp truyền thống như: mô hình tuyến tính hoặc hồi quy đơn giản, thường øặp khó khăn trong việc xử lý các yếu tô lịch sử phức tạp và dài hạn. Doanh số bán hàng không chỉ chịu ảnh hưởng từ các yếu tố ngắn hạn như: các chiến dịch khuyến mãi hay xu hướng thời vụ, mà còn tử các yếu tố lâu dài như: xu hướng kinh tế, hành ví mua sắm của khách hàng theo thời gian, và các sự kiện đặc biệt đã xảy ra trong quá khứ. Nếu không thể mô hình hóa được những ảnh hưởng này, các phương pháp truyền thống sẽ gặp hạn chế trong việc đưa ra dự đoán chính xác cho tương lai.
Để khắc phục vấn để này, các mô hình phức tạp hơn như: mạng nơ-ron hồi tiếp (RNN) hoặc LSTM (Long Short-Term Memory) được sử dụng để nắm bắt các mối quan hệ phụ thuộc dài hạn trong dữ liệu, øiúp cải thiện độ chính xác của dự đoán doanh số bán hàng. Hậu quả Dự đoán không chính xác: Nếu mô hình Machine Learning phy thuéc qua nhiéu vào đữ liệu lịch sử mà không cập nhật hoặc không tính đến các yếu tố mới, nó có thê không thể dự đoán chính xác các biến động trong thị trường hoặc hành vị của khách hàng.3 Xử lý dữ liệu nhiễu Xử lý đữ liệu nhiễu và ngoại lệ là một phần quan trọng của việc phân tích dữ liệu bán hàng trong thế giới thực. Dữ liệu này thường phức tạp và đa dạng, chứa các mức tăng đột biến do các chiến dịch quảng cáo hoặc sự kiện đặc biệt, cũng như các giảm đột ngột do những thay đổi trong môi trường kinh doanh. Ngoài ra, có thể xuất hiện các giá trị ngoại lệ, làm mờ đi sự phân tích chính xác và đưa ra dự đoán dang tin cay.
Đề xử lý đữ liệu này, các nhà phân tích thường áp dụng các kỹ thuật như lọc nhiễu đề loại bỏ các giá trị bất thường không thực tế và làm giảm độ nhiễu trong đữ liệu. Họ cũng sử dụng các phương pháp smoothing để làm mịn các biến động đột biến và p1úp dự báo trở nên ổn định hơn. Ngoài ra, việc sử dụng các mô hình dự báo linh hoạt có khả năng tự động điều chỉnh đề thích ứng với các biến động đặc biệt trong dữ liệu cũng rất quan trọng. Bang cách này, việc xử lý dữ liệu nhiều và ngoại lệ không chỉ p1úp tạo ra các dự đoán chính xác hơn mà còn giúp nhận diện và hiểu rõ hơn về các xu hướng và biên động trong thị trường bán hàng, từ đó giúp doanh nghiệp đưa ra các quyết định chiến lược hiệu quả.
Hậu quả ÁMô hình không chính xác: Dữ liệu nhiễu có thê làm sai lệch kết quả của mô hình, khiến cho dự đoán trở nên không chính xác. Điều này có thể dẫn đến việc ra quyết định sai lầm và không hiệu quả về kế hoạch kinh doanh. Overfìting: Dữ liệu nhiễu có thê gây ra hiện tượng overfitting, trong đó mô hình học máy "nhớ" đữ liệu huấn luyện một cách quá mức, không thể tông quát hóa cho đữ liệu mới. Điều này dẫn đến hiệu suất dự đoán kém trên đữ liệu mới.
Under/itnae: Ngược lại, đữ liệu nhiễu cũng có thể làm cho mô hình không đủ linh hoạt để học được các mẫu quan trọng trong dữ liệu, dẫn đến hiện tượng underfÑtting, trong đó mô hình không thể dự đoán một cách chính xác trên dữ liệu thực tế.