ĐẠI HỌC QUỐC GIA TP. HCM TRƢỜNG ĐẠI HỌC BÁCH KHOA -------------------- LÊ MINH CHÂU KHAI PHÁ CỤM HƢỚNG THỜI GIAN TRÊN DỮ LIỆU GIÁO DỤC Ngành: KHOA HỌC MÁY TÍNH Mã số: 60480101 LUẬN VĂN THẠC SĨ TP. HỒ CHÍ MINH, tháng 06 năm 2018 CÔNG TRÌNH ĐƢỢC HOÀN THÀNH TẠI TRƢỜNG ĐẠI HỌC BÁCH KHOA –ĐHQG –HCM Cán bộ hƣớng dẫn khoa học: TS. Võ Thị Ngọc Châu Cán bộ chấm nhận xét 1: PGS.
Quản Thành Thơ Cán bộ chấm nhận xét 2: PGS. Hồ Bảo Quốc Luận văn thạc sĩ đƣợc bảo vệ tại Trƣờng Đại học Bách Khoa, ĐHQG TP.HCM ngày 17 tháng 07 năm 2018 Thành phần Hội đồng đánh giá luận văn thạc sĩ gồm: 1. Chủ tịch hội đồng: PGS. Dƣơng Tuấn Anh 2.
Nguyễn Hồ Mẫn Rạng 3. GV phản biện 1: PGS. Quản Thành Thơ 4. GV phản biện 2: PGS.
Hồ Bảo Quốc 5. Ủy viên: TS. Lê Thanh Vân Xác nhận của Chủ tịch Hội đồng đánh giá LV và Trƣởng Khoa quản lý chuyên ngành sau khi luận văn đã đƣợc sửa chữa (nếu có). CHỦ TỊCH HỘI ĐỒNG TRƢỞNG KHOA KH&KTMT ĐẠI HỌC QUỐC GIA TP.HCM CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM TRƢỜNG ĐẠI HỌC BÁCH KHOA Độc lập - Tự do - Hạnh phúc NHIỆM VỤ LUẬN VĂN THẠC SĨ Họ tên học viên: Lê Minh Châu MSHV: 7140818 Ngày, tháng, năm sinh: 31/08/1983 Nơi sinh: TP.Hồ Chí Minh Ngành: Khoa Học Máy Tính Mã số : 60480101 I.
TÊN ĐỀ TÀI: Khai phá cụm hƣớng thời gian trên dữ liệu giáo dục. NHIỆM VỤ VÀ NỘI DUNG: - Tìm hiểu lý thuyết và các công trình liên quan về mô hình chủ đề và mô hình chủ đề hƣớng thời gian. - Mô hình hóa dữ liệu học tập của sinh viên khoa Khoa Học Máy Tính, trƣờng Đại học Bách Khoa TP.HCM theo mô hình chủ đề hƣớng thời gian. - Thực nghiệm mô hình chủ đề, mô hình chủ đề hƣớng thời gian và giải thuật K-Means trên dữ liệu học tập của sinh viên.
- Phân tích đánh giá cụm nhằm xác định tiến độ học tập của sinh viên và các môn học ảnh hƣởng đến kết quả học tập của sinh viên. - Trực quan hóa các cụm chủ đề. NGÀY GIAO NHIỆM VỤ: 15/01/2018 IV.NGÀY HOÀN THÀNH NHIỆM VỤ: 17/06/2018 V. CÁN BỘ HƢỚNG DẪN : TS.
Võ Thị Ngọc Châu TP. HCM, ngày 17 tháng 06 năm 2018 CÁN BỘ HƢỚNG DẪN TRƢỞNG KHOA KH & KTMT (Họ tên và chữ ký) (Họ tên và chữ ký) LỜI CÁM ƠN Tôi xin gửi lời cám ơn chân thành đến và sâu sắc đến TS. Võ Thị Ngọc Châu – khoa Khoa học máy tính – Trƣờng ĐH Bách Khoa TP. Trong suốt quá trình thực hiện đề tài, Cô đã bỏ ra nhiều công sức và thời gian tận tình hƣớng dẫn và tạo mọi điều kiện để tôi có thể hoàn thành tốt luận văn này.
Tôi cũng gửi lời cám ơn chân thành đến các Thầy Cô trong khoa Khoa học máy tính. Các Thầy Cô đã tận tình chỉ dạy và trang bị những kiến thức, tạo mọi điều kiện để tôi hoàn thành luận văn này. Tôi xin gửi lời cám ơn đến gia đình, đồng nghiệp, bạn bè đã tạo điều kiện giúp đỡ tôi về thời gian và tinh thần trong thời gian tôi hoàn thành luận văn. Trong thời gian thực hiện luận văn, đƣợc sự hỗ trợ và giúp đỡ của Thầy Cô, gia đình, bạn bè và đồng nghiệp.
Tôi đã cố gắng hoàn thành luận văn với hết khả năng có thể của bản thân. Tuy nhiên cũng sẽ không tránh khỏi những thiếu sót. Kính mong quý Thầy Cô và các bạn tận tình chỉ bảo và góp ý để luận văn đƣợc hoàn thiện hơn. Hồ Chí Minh, ngày 17 tháng 06 năm 2018 Học viên Lê Minh Châu TÓM TẮT LUẬN VĂN Trong những năm gần đây, khả năng tính toán của các máy tính đƣợc nâng lên một tầm cao mới và lƣợng dữ liệu ngày càng lớn.
Việc nghiên cứu dữ liệu lớn và ứng dụng học máy trong xử lý dữ liệu đang dần trở thành một nhu cầu cấp thiết. Trong các bài toán xử lý dữ liệu, bài toán gom cụm dữ liệu luôn là thách thức không nhỏ với cộng đồng các nhà khoa học dữ liệu. Giải thuật mô hình chủ đề Latent Dirichlet Allocation (LDA) đƣợc đề xuất nhƣ là một giải pháp ứng dụng nền tảng toán học thống kê trong việc giải quyết bài toán gom cụm.Hiện nay, nhiều nghiên cứu mở rộng mô hình LDA nhằm đáp ứng yêu cầu đa dạng trong khai phá dữ liệu văn bản, nổi bật trong số đó là mô hình chủ đề hƣớng thời gian Dynamic Topic Model (DTM) với tính năng xác định sự tiến triển của chủ đề theo từng khung thời gian. Trong luận văn này, đề tài đề xuất áp dụng mô hình chủ đề hƣớng thời gian DTM nhƣ là một giải pháp cho bài toán gom cụm và phân tích dữ liệu học tập của sinh viên khoa Khoa Học Máy Tính, trƣờng Đại Học Bách Khoa TP.HCM, theo thời gian.
Từ việc phân tích các đặc trƣng của cụm sinh viên hoặc cụm môn học, quá trình học tập của sinh viên trong từng học kỳ cũng nhƣ các môn học ảnh hƣởng đến kết quả học tập của sinh viên đƣợc xác định một cách nhanh chóng và hiệu quả. Kết quả đạt đƣợc từ giải pháp của đề tài cho thấy sự vƣợt trội của mô hình DTM trong khám phá cụm so với các mô hình khác (LDA, K-Means). Giá trị độ đo perplexity của mô hình cụm đạt đƣợc từ mô hình DTM thƣờng tốt hơn khi đƣợc đánh giá trên dữ liệu của 6 học kỳ của khóa 2006. ABSTRACT In recent years, the computing power of computers has risen to a new height and the amount of data is growing.
Research big data and apply machine learning in data processing are gradually becoming an urgent needed. In data processing problems, the problem of clustering data is always a challenge to the data scientists. The Latent Dirichlet Allocation (LDA) algorithm was proposed as a statistical mathematical platform solution for solving clustering problems. Currently, many of research extend the LDA algorithm to meet diverse requirements in text data mining, most notably Dynamic Topic Model (DTM), with the ability to determine the evolution of topics of a collection of documents over time.
The thesis propose to apply DTM as a solution for clustering problems and to analyze student records at Computer Science Faculty, Ho Chi Minh city University Of Technology. By analyzing the characteristics of a student cluster or subject cluster, the learning process of the students in each semester as well as subjects affecting the student's academic performance is determined quickly and effective. The results obtained from the proposed solution show that DTM is better than others (LDA, K-Means) in cluster discovery. The perplexity value of this model is usually better when evaluated student records of the six semesters in 2006 course.
LỜI CAM ĐOAN Tôi xin cam đoan rằng ngoài các kết quả, các thông tin đƣợc tham khảo từ các công trình khác nhƣ đã ghi rõ trong luận văn, những công việc, kết quả đƣợc trình bày trong luận văn này là do chính tôi thực hiện và chƣa đƣợc sử dụng để lấy bất kì chứng chỉ, bằng cấp nào khác. HCM, ngày 17 tháng 06 năm 2018 Học viên Lê Minh Châu Mục lục NHIỆM VỤ LUẬN VĂN THẠC SĨ. 7 LỜI CAM ĐOAN .1 Lí do chọn đề tài .2 Mục tiêu nghiên cứu .3 Ý nghĩa khoa học .4 Ý nghĩa thực tiễn .5 Phạm vi thực hiện đề tài .1 Nền tảng lý thuyết .1 Mô hình chủ đề ẩn .1 Phương pháp phân tích mô hình chủ đề ẩn.2 Mô hình sinh trong mô hình chủ đề ẩn .3 Ước lượng tham số và suy diễn với mô hình Gibbs Sampling cho mô hình chủ đề ẩn.2 Mô hình chủ đề hướng thời gian .1 Mô tả giải thuật .2 Ước lượng tham số theo phương pháp lọc Kalman .2 Phương pháp lọc Kalman trong mô hình chủ đề hướng thời gian .3 Định dạng Blei’s lda-c .4 Phương pháp đánh giá mô hình sử dụng Perplexity.2 Các nghiên cứu liên quan .1 Áp dụng mô hình chủ đề trong phân tích chứng khoán [15] .2 Áp dụng mô hình chủ đề hướng thời gian trong phân tích bài báo khoa học [11].1 Mô hình tổng quát .2 Phương hướng giải quyết .3 Dữ liệu minh họa .4 Phương pháp phân tích cụm. Phân tích cụm theo sinh viên.
Phân tích cụm theo môn học .1 Câu hỏi thực nghiệm .2 Môi trường thực nghiệm .3 Chuẩn bị dữ liệu .4 Kết quả thực nghiệm và đánh giá .1 Mô hình DTM .2 Mô hình LDA .3 Giải thuật K-Means.4 So sánh các phương pháp .1 So sánh chất lượng mẫu chuyển cụm .2 So sánh độ đo perplexity.5 Trực quan hóa cụm .1 Các nội dung đã được thực hiện .2 Mức độ đạt được của đề tài .3 Hướng phát triển. 41 TÀI LIỆU THAM KHẢO. 1 PHẦN LÝ LỊCH TRÍCH NGANG. 9 DANH MỤC VIẾT TẮT Từ Nguyên văn BOW Bag of Words pLSA Probabilistic Latent Semantic Analysis LDA Latent Dirichlet Allocation DTM Dynamic Topic Model GS-SGLD Gibbs Sample - Stochastic Gradient Langevin Dynamics NIPS Neural Information Processing Systems S&P500 Standard & Poor’s 500 Stock Index Chƣơng 1 GIỚI THIỆU TỔNG QUAN 1.1 Lí do chọn đề tài Nghiên cứu ứng dụng khai phá dữ liệu vào quản lý giáo dục đào tạo đƣợc xem rất cần thiết cho các nhà quản lý giáo dục, giúp công tác quản lý và hoạch định chiến lƣợc giáo dục ngày càng hiệu quả.
Gần đây có các công trình nghiên cứu ứng dụng kỹ thuật khai phá dữ diệu đem lại nhiều lợi ích trong công tác quản lý giáo dục. Nghiên cứu của Lê Thanh Minh [6] sử dụng khai phá luật kết hợp và logic mờ trên kết quả thi tốt nghiệp THPT và THCS cho mục tiêu đánh giá hiệu quả đào tạo và cung cấp các thông tin cần thiết cho quá trình nâng cao chất lƣợng học sinh. Luận văn thạc sĩ của Phan Đình Thế Huân [16] đã nghiên cứu phƣơng pháp khai mỏ tìm luật kết hợp trên dữ liệu giáo dục. Ứng dụng thực nghiệm trên dữ liệu kết quả học tập của sinh viên trƣờng Đại học Tôn Đức Thắng, nhằm hỗ trợ đánh giá và dự đoán kết quả học tập của sinh viên, qua đó nâng cao chất lƣợng đào tạo.
Nghiên cứu của Nguyễn Thị Vân Hảo [19] đề xuất sử dụng giải thuật máy học cây quyết định và mạng Bayes trong dự đoán kết quả học tập của sinh viên đại học và sau đại học của Trƣờng Đại học Cần Thơ. Nhóm tác giả trƣờng Đại học Quốc Gia St.Agustin, Peru nghiên cứu hệ thống khuyến nghị khóa học trực tuyến sử dụng LDA [8], [24]. Hệ thống phân tích các mô tả ngắn về khóa học trực tuyến từ Cousera, Udacity, Edx … và thực hiên phân cụm các khóa học liên quan để ngƣời dùng dễ dàng tra cứu các khóa học phù hợp.