Bối cảnh và vấn đề nghiên cứu

Trong lĩnh vực bán lẻ hiện đại, việc gia tăng trải nghiệm mua sắm và tối đa hóa doanh thu tại điểm bán là mục tiêu hàng đầu của các chuỗi cửa hàng tiện lợi và siêu thị. Tại hệ thống chuỗi cửa hàng Bách Hóa Xanh, mật độ hàng hóa lớn và số lượng giao dịch hàng ngày cao đòi hỏi một phương pháp bố trí, trưng bày sản phẩm trên quầy kệ mang tính khoa học. Việc sắp xếp hợp lý giúp khách hàng dễ dàng tìm kiếm hàng hóa, đồng thời thúc đẩy hành vi mua chéo các sản phẩm có liên quan. Tuy nhiên, việc nhận diện chính xác các mối quan hệ tương quan giữa hàng nghìn mặt hàng từ các hóa đơn thanh toán truyền thống là thách thức lớn nếu chỉ dựa vào cảm tính hoặc kinh nghiệm quản lý thủ công.

Nhằm giải quyết vấn đề trên, đề tài tập trung nghiên cứu và ứng dụng kỹ thuật khai phá luật kết hợp thông qua thuật toán Apriori. Bằng cách phân tích lịch sử giao dịch mua sắm của người tiêu dùng tại cửa hàng Bách Hóa Xanh, nghiên cứu hướng tới việc phát hiện các tập sản phẩm thường xuyên xuất hiện cùng nhau và thiết lập các quy tắc kết hợp có độ tin cậy cao, từ đó đề xuất giải pháp tối ưu hóa vị trí trưng bày sản phẩm trên quầy kệ.

Phạm vi và nhiệm vụ nghiên cứu của đề tài được xác định qua 6 nội dung cụ thể:

  1. Nghiên cứu cơ sở lý thuyết về thuật toán Apriori, bao gồm nguyên lý hoạt động, các khái niệm cốt lõi (tập phổ biến, tập ứng viên, ngưỡng hỗ trợ tối thiểu - minSupp, độ tin cậy tối thiểu - minConf) và các biến thể liên quan như Apriori cổ điển, Eclat, FP-Growth.
  2. Tìm hiểu mô hình kinh doanh, hệ thống phân phối và các phương pháp trưng bày sản phẩm hiện tại của chuỗi cửa hàng Bách Hóa Xanh.
  3. Thu thập dữ liệu giao dịch bán hàng và danh mục sản phẩm kinh doanh tại Bách Hóa Xanh.
  4. Thực hiện tiền xử lý dữ liệu: làm sạch, loại bỏ thông tin dư thừa, xử lý lỗi và chuyển đổi định dạng dữ liệu phù hợp cho các mô hình khai phá.
  5. Áp dụng thuật toán Apriori với các ngưỡng hỗ trợ và độ tin cậy phù hợp để tìm kiếm các tập mục phổ biến và sinh luật kết hợp, từ đó đề xuất phương án sắp xếp sản phẩm trên cùng kệ hoặc tại các vị trí liền kề.
  6. Đánh giá kết quả mô hình và so sánh hiệu quả của phương án sắp xếp dựa trên khai phá dữ liệu với phương pháp trưng bày truyền thống.

Đối tượng nghiên cứu là các giao dịch mua hàng và quy luật kết hợp giữa các mặt hàng tại hệ thống siêu thị Bách Hóa Xanh. Đồ án được thực hiện tại Khoa Công nghệ Thông tin, Trường Đại học Tài chính – Marketing, TP. Hồ Chí Minh (hoàn thành vào tháng 4 năm 2023).


Cơ sở lý thuyết và phương pháp

Khung lý thuyết và mô hình nghiên cứu

Đề tài xây dựng nền tảng dựa trên các khái niệm và cấu trúc dữ liệu tiêu chuẩn trong lĩnh vực Kho dữ liệu (Data Warehouse) và Khai phá dữ liệu (Data Mining):

  • Hệ thống Kho dữ liệu (Data Warehousing): Là hệ thống tích hợp dữ liệu từ nhiều nguồn khác nhau phục vụ công tác phân tích và hỗ trợ ra quyết định. Báo cáo hệ thống hóa các dạng lược đồ kho dữ liệu chính:
    • Star Schema (Mô hình hình sao): Gồm một bảng sự kiện trung tâm (fact table) liên kết trực tiếp với các bảng chiều (dimension tables) qua khóa ngoại.
    • Snowflake Schema (Mô hình bông tuyết): Mở rộng từ Star Schema nhưng các bảng chiều được chuẩn hóa thành nhiều cấp bảng con nhằm giảm trùng lặp dữ liệu.
    • Hybrid Schema (Mô hình lai): Kết hợp đồng thời các bảng chiều dạng hình sao và dạng bông tuyết.
    • Galaxy Schema (Mô hình thiên hà/vũ trụ): Kiến trúc chứa nhiều bảng sự kiện chia sẻ chung các bảng chiều.
  • Mô hình dữ liệu đa chiều (Multidimensional Data Model): Được xây dựng dựa trên khái niệm khối dữ liệu (data cube) với các chiều (dimensions) và chỉ số đo lường (measures). Các thao tác phân tích dữ liệu đa chiều được khảo sát bao gồm: Drill-down (phân tích từ tổng quan xuống chi tiết), Roll-up (tổng hợp từ chi tiết lên mức cao hơn), Slice (cắt lát dữ liệu theo một chiều), và Dice (chọn khối dữ liệu con theo nhiều chiều). Hai phương pháp tạo khối được trình bày gồm Bottom-up và Top-down.
  • Quy trình Khai phá dữ liệu: Gồm 6 giai đoạn tiêu chuẩn:
    1. Giai đoạn xác định vấn đề (Business Understanding).
    2. Giai đoạn hiểu dữ liệu (Data Understanding).
    3. Giai đoạn chuẩn bị dữ liệu (Data Preparation - chiếm phần lớn thời lượng dự án).
    4. Giai đoạn lập mô hình (Modeling).
    5. Giai đoạn đánh giá (Evaluation).
    6. Giai đoạn triển khai (Deployment).
  • Thuật toán Apriori: Thuật toán khai thác luật kết hợp dựa trên nguyên lý tiên đề: tất cả các tập con của một tập mục phổ biến đều phải là tập mục phổ biến. Quá trình thực thi diễn ra qua 2 giai đoạn:
    • Giai đoạn 1: Xác định các tập món hàng có độ hỗ trợ lớn hơn hoặc bằng ngưỡng hỗ trợ tối thiểu ($\text{Support} \ge \text{minSupp}$).
    • Giai đoạn 2: Sinh ra các quy tắc kết hợp thỏa mãn ngưỡng độ tin cậy tối thiểu ($\text{Confidence} \ge \text{minConf}$).

Phương pháp nghiên cứu và công cụ thực nghiệm

Nghiên cứu sử dụng phương pháp phân tích định lượng kết hợp thực nghiệm trên các phần mềm khai phá dữ liệu mã nguồn mở và hệ quản trị cơ sở dữ liệu:

  • Phần mềm WEKA (Waikato Environment for Knowledge Analysis): Sử dụng các module Explorer (tiền xử lý, lọc NumericToNominal, chạy thuật toán Apriori), Experimenter (chạy đối sánh các thuật toán phân loại và kiểm định thống kê), và Knowledge Flow (thiết kế luồng xử lý dữ liệu trực quan từ nguồn ArffLoader qua Apriori đến TextViewer).
  • Môi trường lập trình R: Thực hiện đọc dữ liệu giao dịch, ép kiểu sang cấu trúc transactions, tính toán tần suất xuất hiện với hàm itemFrequency, sắp xếp tần suất qua hàm sort, áp dụng hàm apriori để sinh luật và trực quan hóa kết quả.
  • Hệ quản trị cơ sở dữ liệu SQL Server: Lưu trữ tập dữ liệu DLBachHoaXanh, cấu hình chuỗi kết nối Database URL để nạp trực tiếp dữ liệu từ SQL vào WEKA phục vụ truy vấn và khai phá.

Thiết kế và triển khai thực nghiệm

Quy trình thực nghiệm kỹ thuật trong đồ án được thiết kế đồng bộ qua các môi trường công nghệ như sau:

[SQL Server Database] ---> (Kết nối JDBC/Database URL) ---> [WEKA Explorer / Knowledge Flow]
                                                                    |
                                                            [Bộ lọc NumericToNominal]
                                                                    |
                                                            [Thuật toán Apriori]
                                                                    |
[Tập tin DLBachHoaXanh.csv] ---> [Môi trường R Script] ---------> [Phát hiện Luật kết hợp & Xuất Biểu đồ]
  1. Chuẩn bị và kết nối dữ liệu từ SQL Server:
    • Khởi tạo cơ sở dữ liệu trên SQL Server bằng tài khoản quản trị sa.
    • Thực hiện nhập tập tin dữ liệu DLBachHoaXanh.csv, kiểm tra cấu trúc bảng và điều chỉnh các trường thông tin tương ứng.
    • Cấu hình Database URL trên giao diện WEKA, kiểm tra kết nối thành công và thực hiện các câu lệnh SQL để truy vấn trực tiếp tập dữ liệu vào không gian làm việc của WEKA.
  2. Triển khai trên WEKA Explorer:
    • Nạp tập tin dữ liệu sản phẩm DLBachHoaXanh.
    • Áp dụng bộ lọc NumericToNominal để chuyển đổi các thuộc tính số thành kiểu định danh nhị phân đại diện cho sự hiện diện của món hàng trong giao dịch.
    • Truy cập phân hệ Associate, chọn thuật toán Apriori, thiết lập thông số lowerBoundMinSupport (giá trị thực nghiệm 0.7 và 0.85) và khởi chạy mô hình để xuất các luật kết hợp tối ưu.
  3. Mở rộng thí nghiệm với WEKA Experimenter và Knowledge Flow:
    • Trong Experimenter, thiết lập kiểm thử so sánh ba thuật toán phân loại gồm J48, Naive Bayes, và Multilayer Perceptron trên tập dữ liệu Chayweka- weka, sử dụng độ đo đánh giá $F\text{-measure}$ và kiểm định $t\text{-test}$ điều chỉnh theo cặp.
    • Trong Knowledge Flow, xây dựng mô hình trực quan hóa bằng cách liên kết các khối thành phần: ArffLoader $\to$ Apriori (trong nhóm Associations) $\to$ TextViewer (trong nhóm Visualization).
  4. Triển khai phân tích trên môi trường R:
    • Đọc tập tin dữ liệu CSV vào R, chuyển đổi cấu trúc bảng thành dạng dữ liệu giao dịch chuyên dụng (transactions).
    • Sử dụng hàm itemFrequency để tính toán tỷ lệ xuất hiện của từng mặt hàng, dùng hàm sort để xếp hạng mức độ phổ biến của sản phẩm.
    • Chạy thuật toán Apriori với tham số support = 0.7, trích xuất các luật kết hợp và lập biểu đồ phân phối luật.

Nội dung chính theo từng chương

Chương 1: Tổng quan

Chương 1 trình bày bối cảnh phát triển của các hệ thống bán lẻ hiện đại, sự cần thiết của việc nâng cao trải nghiệm khách hàng và tối ưu hóa không gian quầy kệ tại Bách Hóa Xanh. Tác giả xác định rõ mục tiêu đề tài là khai thác luật kết hợp bằng thuật toán Apriori từ dữ liệu bán hàng thực tế. Chương này cũng phân định rõ 6 nội dung nằm trong phạm vi nghiên cứu, bao gồm từ bước nghiên cứu lý thuyết thuật toán, khảo sát mô hình cửa hàng, thu thập dữ liệu, tiền xử lý, chạy mô hình cho đến việc đối sánh kết quả với phương pháp trưng bày truyền thống.

Chương 2: Cơ sở lý thuyết

Chương 2 cung cấp hệ thống lý thuyết toàn diện về Data Warehousing và Data Mining:

  • Trình bày chi tiết các mô hình lược đồ kho dữ liệu (Star, Snowflake, Hybrid, Galaxy Schema) và các thao tác trên khối dữ liệu đa chiều (Drill-down, Roll-up, Slice, Dice).
  • Phân tích 6 giai đoạn của quy trình khai phá dữ liệu và giới thiệu các phương pháp khai phá phổ biến: hồi quy, phân tích nhân tố, luật kết hợp, phân cụm, mạng nơ-ron nhân tạo, phân tích văn bản, phân tích đồ thị, học máy.
  • Khảo sát 9 nhóm ứng dụng thực tiễn của khai phá dữ liệu: xét duyệt tín dụng/khoản vay, phân khúc thị trường, phát hiện gian lận, tối ưu tiếp thị, phân tích xu hướng, phân tích giỏ hàng (Market basket analysis), dự đoán khách hàng rời bỏ (Customer churn), thiết kế website, phân tích doanh nghiệp và quản trị rủi ro.
  • Trình bày cơ chế tính toán chi tiết của thuật toán Apriori qua bài toán mẫu gồm 5 giao dịch và 6 món hàng tại Bách Hóa Xanh với $\text{minSupp} = 50%$ (tương đương tần suất xuất hiện tối thiểu 2.5 lần) và $\text{minConf} = 75%$. Chương trình bày từng bước tính toán từ tập ứng viên $C_1 \to L_1 \to C_2 \to L_2 \to C_3$, chứng minh không tạo được $L_3$, sau đó sinh các luật kết hợp từ $L_2$ (giữa các sản phẩm: Gạo ST24, Sữa chua Vinamilk, Trà Lipton, Mì gói Omachi, Bánh mì đen) và loại bỏ 2 luật không đạt $\text{minConf}$.

Chương 3: Phần mềm khai phá dữ liệu mã nguồn mở

Chương 3 giới thiệu tổng quan và các tính năng kỹ thuật của hai công cụ mã nguồn mở được ứng dụng trong đề tài:

  • Weka: Nêu rõ lịch sử phát triển từ Đại học Waikato (New Zealand) và 5 nhóm chức năng chính: xử lý dữ liệu, phân tích/phân loại dữ liệu (cây quyết định, mạng nơ-ron, SVM...), xây dựng mô hình học máy, hiển thị kết quả trực quan (biểu đồ, đồ thị) và thực hiện thí nghiệm/đánh giá hiệu suất mô hình.
  • Môi trường R: Trình bày khả năng tính toán thống kê, xử lý dữ liệu lớn, tích hợp đa nền tảng (Python, SQL, Excel), các gói công cụ phân tích và trực quan hóa chuyên dụng (ggplot2, dplyr, tidyr) cùng các gói kết nối cơ sở dữ liệu (RMySQL, RSQLite, RODBC).

Chương 4: Khai phá dữ liệu

Chương 4 là phần thực nghiệm trọng tâm của đồ án, mô tả chi tiết quy trình xử lý trên bộ dữ liệu bán hàng Bách Hóa Xanh:

  • Tập dữ liệu thực nghiệm: Bảng dữ liệu gồm 20 giao dịch mẫu ($T_1$ đến $T_{20}$) với sự kết hợp của 14 nhóm mặt hàng đại diện:
Mã GD Danh mục các sản phẩm trong giao dịch
T1 ST24, Dầu ăn Cái Lân, Sữa chua Vinamilk, Trà Lipton, Bánh quy Nabisco
T2 ST24, Dầu ăn Cái Lân, Sữa chua Vinamilk, Trà Lipton, Bánh quy Nabisco, Bánh mì đen
T3 ST24, Trà Lipton, Bánh quy Nabisco
T4 ST24, Trà Lipton, Bánh quy Nabisco
T5 ST24, Trà Lipton
T6 ST24, Trà Lipton, Bánh quy Nabisco, Bia Tiger, Bánh mì đen, Sữa tươi Vinamilk
T7 ST24, Dầu ăn Cái Lân, Trà Lipton, Bia Heineken, Sữa tươi Vinamilk
T8 ST24, Trà Lipton, Bánh quy Nabisco, Bánh quy Oreo, Bia Tiger, Bánh mì đen, Kẹo Mentos
T9 ST24, Sữa chua Vinamilk, Trà Lipton, Bánh quy Nabisco, Bia Heineken, Sữa tươi Vinamilk
T10 ST24, Dầu ăn Cái Lân, Sữa chua Vinamilk, Trà Lipton, Bánh quy Nabisco, Kẹo Milky, Bia Heineken
T11 ST24, Bánh quy Nabisco, Bánh mì đen, Kẹo Snickers
T12 ST24, Dầu ăn Cái Lân, Sữa chua Vinamilk, Trà Lipton, Kẹo Milky, Kẹo Mentos
T13 ST24, Bánh quy Nabisco, Bánh mì đen, Kẹo Snickers
T14 ST24, Trà Lipton, Bánh quy Nabisco, Bia Heineken, Kẹo Mentos
T15 ST24, Trà Lipton, Bánh quy Nabisco, Kẹo Milky, Bia Tiger, Bánh mì đen
T16 ST25, Sữa chua Vinamilk, Bánh quy Nabisco, Kẹo Snickers
T17 ST26, Bánh quy Oreo, Bia Heineken, Bánh mì đen, Kẹo Mentos
T18 ST27, Dầu ăn Cái Lân, Sữa chua Vinamilk, Trà Lipton, Bánh quy Nabisco, Bia Heineken, Bánh mì đen, Sữa tươi Vinamilk
T19 ST28, Trà Lipton, Bánh quy Nabisco, Bia Heineken, Nước ngọt Coca Cola
T20 ST29, Dầu ăn Cái Lân, Sữa chua Vinamilk
  • Kết quả mô hình Apriori: Với mức hỗ trợ tối thiểu ghi nhận $\text{minSupp} = 0.85$ (tương ứng xuất hiện trong ít nhất 17/20 giao dịch), mô hình tìm ra 6 tập phổ biến kích thước 1 và 5 tập phổ biến kích thước 2. Các luật kết hợp đạt độ tin cậy $\ge 0.7$ được trích xuất trong mục "Best rules found" (tiêu biểu như luật: mua Bánh quy Oreo $\to$ mua Gạo ST24 với độ tin cậy $\text{conf} = 1.0$).
  • Đề xuất sắp xếp quầy kệ:
    • Bố trí Gạo ST24 ở vị trí trung tâm của kệ hàng do đây là sản phẩm có mối liên kết với nhiều nhóm hàng nhất.
    • Sắp xếp các sản phẩm có độ tin cậy mua kèm cao gồm Bánh quy Oreo, Nước ngọt Coca Cola, Kẹo Milky, Bia Tiger và Kẹo Snickers ở các vị trí liền kề xung quanh ST24.
  • Các thử nghiệm bổ trợ:
    • WEKA Experimenter: Thử nghiệm phân loại với J48, Naive Bayes, Multilayer Perceptron trên tập Chayweka- weka, ghi nhận giá trị F-measure của cả 3 thuật toán là 0 cùng chỉ số kiểm định $t\text{-test}$ theo cặp.
    • WEKA Knowledge Flow: Xây dựng mô hình luồng dữ liệu tự động qua 3 nút chức năng.
    • Phân tích trên R: Xác định Bánh mì đen và Bánh quy Nabisco có tần suất xuất hiện cao nhất, trong khi một số mặt hàng khác đạt tần suất 0.04761905.
    • Tích hợp SQL Server: Hoàn tất quy trình nhúng dữ liệu vào SQL và thiết lập kết nối Database URL sang WEKA.

Chương 5: Kết luận và hướng phát triển

Chương 5 đúc kết các kết quả đạt được, phân tích thẳng thắn 3 hạn chế chính của đề tài (nhiễu từ sản phẩm không liên quan trong hóa đơn, dung lượng dữ liệu còn nhỏ, biến động thói quen mua sắm khi khách không dùng thẻ thành viên). Trên cơ sở đó, tác giả đưa ra các biện pháp khắc phục tương ứng và đề xuất 3 hướng mở rộng nghiên cứu trong tương lai.


Kết quả và đóng góp

Kết quả nghiên cứu chính

  1. Phát hiện các tập mục phổ biến và luật kết hợp: Phân tích dữ liệu thực tế tại Bách Hóa Xanh đã xác định được các quy luật kết hợp có giá trị cao giữa nhóm lương thực (Gạo ST24) và nhóm hàng tiêu dùng nhanh/bánh kẹo/đồ uống:
    • Mua Bánh quy Oreo hoặc Nước ngọt Coca Cola $\to$ có xu hướng mua Gạo ST24 (độ tin cậy đạt mức tuyệt đối 100% đối với Oreo).
    • Mua Kẹo Milky, Bia Tiger hoặc Kẹo Snickers $\to$ có xu hướng mua Gạo ST24.
    • Mua Gạo ST24 $\to$ có xu hướng mua kèm Bánh quy Oreo, Coca Cola, Kẹo Milky, Bia Tiger hoặc Kẹo Snickers.
  2. Đề xuất sơ đồ bố trí không gian quầy kệ: Chuyển hóa các luật kết hợp định lượng thành nguyên tắc sắp xếp cụ thể tại cửa hàng:
    • Chọn sản phẩm cốt lõi có tần suất liên kết cao nhất (Gạo ST24) đặt ở vị trí trung tâm kệ hàng.
    • Đặt các mặt hàng có quan hệ kết hợp chặt chẽ (Bánh quy Oreo, Coca Cola, Kẹo Milky, Bia Tiger, Kẹo Snickers) xung quanh sản phẩm trung tâm để kích thích hành vi mua chéo.
  3. Làm chủ quy trình và công cụ phân tích: Đồ án đã triển khai hoàn chỉnh quy trình xử lý dữ liệu qua nhiều nền tảng công nghệ: từ quản trị cơ sở dữ liệu trên SQL Server, tiền xử lý và chạy luật trên WEKA (Explorer, Experimenter, Knowledge Flow) đến lập trình phân tích thống kê và trực quan hóa trên ngôn ngữ R.

Đóng góp thực tiễn

  • Cung cấp giải pháp khoa học thay thế cho phương pháp trưng bày cảm tính, truyền thống tại Bách Hóa Xanh.
  • Xây dựng tài liệu hướng dẫn chi tiết các bước tiền xử lý, cấu hình tham số thuật toán Apriori trên các phần mềm mã nguồn mở ứng dụng vào bài toán phân tích giỏ hàng bán lẻ.

Hạn chế và hướng nghiên cứu tiếp

Hạn chế được xác định trong đồ án

  • Độ chính xác chịu ảnh hưởng bởi sản phẩm ngẫu nhiên: Thuật toán Apriori dựa trên sự đồng xuất hiện trong hóa đơn, do đó các sản phẩm mua ngẫu nhiên không có nhu cầu liên quan thực sự vẫn có thể bị tính toán vào quy tắc nếu xuất hiện chung.
  • Quy mô tập dữ liệu còn hạn chế: Tập dữ liệu thực nghiệm mới dừng lại ở quy mô mẫu (20 giao dịch mẫu với 14 thuộc tính), chưa phản ánh toàn diện toàn bộ danh mục hàng hóa đa dạng của hệ thống Bách Hóa Xanh.
  • Sự gián đoạn dữ liệu do hành vi khách hàng: Việc khách hàng thay đổi thói quen mua sắm hoặc không quét mã thẻ thành viên khiến việc ghi nhận lịch sử giao dịch bị thiếu hụt, ảnh hưởng đến độ chính xác dài hạn của mô hình.

Hướng khắc phục và mở rộng đề tài

  • Hướng khắc phục hạn chế:
    • Áp dụng thêm kỹ thuật lọc sản phẩm nhằm loại bỏ các mặt hàng gây nhiễu trước khi chạy thuật toán Apriori.
    • Tích hợp thêm các nguồn dữ liệu bổ sung từ bên ngoài để mở rộng quy mô mẫu.
    • Kết hợp các công cụ khảo sát và ghi nhận hành vi liên tục nhằm kịp thời cập nhật sự thay đổi trong thói quen tiêu dùng.
  • Hướng mở rộng đề tài:
    • Tối ưu hóa quản lý hàng tồn kho: Sử dụng luật kết hợp để phân tích các mặt hàng bán chạy, hỗ trợ việc lập kế hoạch nhập hàng mới hoặc áp dụng chính sách giảm giá cho hàng tồn đọng.
    • Kết hợp với Kỹ thuật Học sâu (Deep Learning): Ứng dụng các mô hình học sâu để dự đoán xu hướng tiêu dùng trong tương lai từ dữ liệu chuỗi thời gian.
    • Triển khai trên quy mô đa cửa hàng: Mở rộng mô hình áp dụng đồng thời cho toàn bộ chuỗi hệ thống Bách Hóa Xanh với các đặc thù vị trí địa lý khác nhau.

Giá trị tham khảo

Báo cáo đồ án mang lại giá trị tham khảo thiết thực cho các đối tượng sau:

  • Sinh viên ngành Công nghệ thông tin, Khoa học dữ liệu và Hệ thống thông tin: Có thể tham khảo chi tiết quy trình từng bước áp dụng thuật toán Apriori, cách tiền xử lý dữ liệu với bộ lọc NumericToNominal trên WEKA, cách sử dụng module Knowledge Flow và các lệnh thao tác dữ liệu giao dịch trên môi trường R.
  • Nhà quản lý bán lẻ và nhân viên phân tích kinh doanh: Cung cấp phương pháp luận và cách thức chuyển hóa các luật kết hợp toán học thành giải pháp sắp xếp quầy kệ thực tế nhằm gia tăng doanh số và tối ưu hóa không gian siêu thị.
  • Tài liệu học tập môn Khai phá dữ liệu: Cung cấp ví dụ tính toán tay cụ thể qua từng bước sinh tập ứng viên ($C_k$) và tập phổ biến ($L_k$), giúp người học nắm vững nguyên lý vận hành của thuật toán khai phá luật kết hợp.

Câu hỏi thường gặp

1. Đồ án đã sử dụng những công cụ và phần mềm nào để thực hiện khai phá dữ liệu?

Đồ án sử dụng phần mềm WEKA (gồm các phân hệ Explorer, Experimenter, Knowledge Flow), ngôn ngữ lập trình R (sử dụng các thư viện phân tích và trực quan hóa), và hệ quản trị cơ sở dữ liệu SQL Server kết nối trực tiếp với WEKA qua cấu hình Database URL.

2. Nguyên lý hai giai đoạn của thuật toán Apriori được mô tả như thế nào trong đồ án?

Giai đoạn 1 tập trung xác định các tập món hàng có độ hỗ trợ lớn hơn hoặc bằng ngưỡng hỗ trợ tối thiểu ($\text{Support} \ge \text{minSupp}$). Giai đoạn 2 thực hiện sinh các quy tắc kết hợp từ các tập phổ biến tìm được và chỉ giữ lại những luật có độ tin cậy thỏa mãn ngưỡng độ tin cậy tối thiểu ($\text{Confidence} \ge \text{minConf}$).

3. Tập dữ liệu thực nghiệm tại Bách Hóa Xanh có cấu trúc ra sao và cho ra phát hiện gì nổi bật?

Tập dữ liệu gồm 20 giao dịch mẫu ($T_1$ đến $T_{20}$) với 14 thuộc tính mặt hàng. Kết quả thực nghiệm cho thấy Gạo ST24 có mối tương quan mạnh nhất với nhiều sản phẩm khác; tiêu biểu là luật khách hàng mua Bánh quy Oreo thì có xu hướng mua Gạo ST24 với độ tin cậy đạt 100%.

4. Tác giả đề xuất phương án sắp xếp sản phẩm trên quầy kệ như thế nào?

Tác giả đề xuất đặt sản phẩm có mức độ liên kết cao nhất là Gạo ST24 ở vị trí trung tâm của kệ hàng, đồng thời bố trí các sản phẩm thường xuyên được mua kèm gồm Bánh quy Oreo, Coca Cola, Kẹo Milky, Bia Tiger và Kẹo Snickers ở các vị trí liền kề xung quanh.

5. Đồ án chỉ ra những hạn chế chính nào và đề xuất hướng khắc phục ra sao?

Các hạn chế gồm: độ chính xác bị ảnh hưởng bởi sản phẩm mua ngẫu nhiên trong hóa đơn, tập dữ liệu mẫu còn nhỏ và dữ liệu bị gián đoạn khi khách hàng không dùng thẻ thành viên. Hướng khắc phục là áp dụng kỹ thuật lọc sản phẩm gây nhiễu, mở rộng nguồn dữ liệu bên ngoài và triển khai khảo sát ghi nhận hành vi liên tục.


Kết luận

Báo cáo đồ án "Sử dụng thuật toán Apriori để sắp xếp sản phẩm trưng bày tại Bách Hóa Xanh" đã hoàn thành việc nghiên cứu cơ sở lý thuyết và triển khai thực nghiệm kỹ thuật khai phá luật kết hợp trên dữ liệu bán lẻ. Thông qua việc ứng dụng công cụ WEKA, ngôn ngữ R và hệ quản trị SQL Server, nghiên cứu đã phát hiện các quy tắc mua sắm đồng thời và đề xuất giải pháp bố trí quầy kệ lấy sản phẩm trọng tâm làm hạt nhân. Mặc dù còn hạn chế về quy mô dữ liệu mẫu, đồ án đã chứng minh tính khả thi của việc ứng dụng Khai phá dữ liệu vào tối ưu hóa vận hành bán lẻ và mở ra các định hướng mở rộng sang quản lý kho hàng và tích hợp học sâu.