Nghiên cứu phát triển kỹ thuật lấy mẫu cho bài toán dự đoán điểm sinh viên đại học

Luận văn thạc sĩ nghiên cứu phát triển kỹ thuật lấy mẫu trong hệ thống thông tin quản lý để dự đoán điểm sinh viên đại học hiệu quả.

Người đăng

Ẩn danh

Thể loại

luận văn thạc sĩ

2023

77
2
0

Phí lưu trữ

30 Point

Tóm tắt

I. Giới thiệu đề tài

Nghiên cứu này tập trung vào việc phát triển kỹ thuật lấy mẫu nhằm dự đoán điểm sinh viên trong hệ thống thông tin quản lý. Trong bối cảnh hiện nay, việc ứng dụng dữ liệu sinh viên vào công tác quản lý và dự báo kết quả học tập còn nhiều hạn chế. Do đó, việc nghiên cứu và phát triển các phương pháp lấy mẫu phù hợp là cần thiết. Mục tiêu chính của nghiên cứu là tìm hiểu và áp dụng các kỹ thuật lấy mẫu trong thống kê và học máy để xây dựng mô hình dự đoán điểm số sinh viên. Đặc biệt, nghiên cứu sẽ sử dụng dữ liệu từ trường Đại học Bách Khoa - ĐHQG TPHCM trong giai đoạn từ năm 2014 đến năm 2017. Việc này không chỉ giúp cải thiện chất lượng dự đoán mà còn hỗ trợ cho các quyết định quản lý giáo dục tại trường.

1.1 Đối tượng và phạm vi nghiên cứu

Đối tượng nghiên cứu của luận văn là kết quả học tập của sinh viên hệ Đại học chính quy tại trường Đại học Bách Khoa. Phạm vi nghiên cứu bao gồm dữ liệu điểm số từ năm 2014 đến 2017, nhằm phân tích các đặc trưng của dữ liệu và xây dựng mô hình dự đoán. Sự lựa chọn này giúp đảm bảo tính đại diện của dữ liệu và khả năng áp dụng cho các nghiên cứu tương lai. Nghiên cứu sẽ tập trung vào việc phân tích các đặc điểm của dữ liệu như độ thưa, mật độ phân bố, và các mối quan hệ tương quan đa biến, từ đó xây dựng mô hình dự đoán điểm của sinh viên một cách hiệu quả.

II. Tổng quan nghiên cứu

Chương này sẽ trình bày các khái niệm cơ bản về kỹ thuật lấy mẫu và các phương pháp phân tích dữ liệu hiện có. Việc lựa chọn phương pháp lấy mẫu phù hợp là rất quan trọng trong nghiên cứu giáo dục. Các phương pháp như lấy mẫu theo nhómphân tích dữ liệu sẽ được thảo luận chi tiết. Nghiên cứu sẽ xem xét các ưu điểm và nhược điểm của từng phương pháp, từ đó đưa ra hướng đi phù hợp cho việc dự đoán điểm sinh viên. Đặc biệt, mô hình dự đoán sẽ được xây dựng dựa trên các thuật toán như Gradient BoostingXGBoost, giúp tối ưu hóa độ chính xác của kết quả dự đoán.

2.1 Kỹ thuật lấy mẫu trong giáo dục

Kỹ thuật lấy mẫu trong giáo dục có vai trò quan trọng trong việc thu thập dữ liệu. Việc lựa chọn mẫu đại diện sẽ giúp đảm bảo rằng dữ liệu thu thập được có thể áp dụng cho các phân tích và dự đoán. Các phương pháp như lấy mẫu ngẫu nhiênlấy mẫu theo nhóm sẽ được phân tích. Mỗi phương pháp có ưu điểm và hạn chế riêng, và việc lựa chọn phương pháp phù hợp sẽ ảnh hưởng lớn đến kết quả nghiên cứu. Ngoài ra, chương này cũng sẽ đề cập đến các công trình nghiên cứu nổi bật trong lĩnh vực giáo dục đại học, từ đó rút ra bài học cho nghiên cứu hiện tại.

III. Phân tích và giải pháp

Trong chương này, nghiên cứu sẽ đi sâu vào việc phân tích dữ liệu sinh viên từ trường Đại học Bách Khoa. Dữ liệu sẽ được mô tả chi tiết, bao gồm phân bố điểm và các đặc trưng khác như độ xiênkurtosis. Việc phân tích này sẽ giúp hiểu rõ hơn về cấu trúc dữ liệu và từ đó xây dựng mô hình dự đoán điểm số. Các bước thực hiện tiền xử lý dữ liệu cũng sẽ được trình bày, nhằm đảm bảo rằng dữ liệu đầu vào cho mô hình là chất lượng và có tính đại diện cao.

3.1 Mô tả bài toán và dữ liệu

Bài toán dự đoán điểm sinh viên sẽ được mô tả chi tiết, bao gồm các yếu tố ảnh hưởng đến điểm số và cách thức thu thập dữ liệu. Dữ liệu sinh viên sẽ được phân tích để xác định các đặc trưng quan trọng, từ đó xây dựng mô hình dự đoán hiệu quả. Việc này không chỉ giúp cải thiện độ chính xác của dự đoán mà còn hỗ trợ các quyết định quản lý giáo dục. Hệ thống thông tin quản lý sẽ được áp dụng để theo dõi và đánh giá kết quả học tập của sinh viên, từ đó đưa ra các giải pháp kịp thời.

IV. Kết quả và đánh giá

Chương này sẽ trình bày các kết quả đạt được từ mô hình dự đoán điểm sinh viên. Việc đánh giá độ chính xác của mô hình sẽ được thực hiện thông qua các chỉ số đánh giá như độ chính xác, độ nhạy, và độ đặc hiệu. Các phương pháp như Gradient Boosting RegressionXGBoost sẽ được so sánh để xác định phương pháp nào mang lại kết quả tốt hơn. Ngoài ra, những khó khăn và thuận lợi trong quá trình thực hiện nghiên cứu cũng sẽ được thảo luận.

4.1 Đánh giá độ chính xác của mô hình

Đánh giá độ chính xác của mô hình dự đoán là một bước quan trọng để xác định tính khả thi của phương pháp đã chọn. Các chỉ số như MSE (Mean Squared Error) và (Coefficient of Determination) sẽ được sử dụng để đo lường hiệu quả của mô hình. Kết quả sẽ cho thấy mức độ chính xác của dự đoán và khả năng áp dụng trong thực tiễn. Sự so sánh giữa các phương pháp sẽ giúp xác định phương pháp tối ưu cho việc dự đoán điểm sinh viên.

V. Kết luận

Nghiên cứu này đã chỉ ra tầm quan trọng của việc áp dụng kỹ thuật lấy mẫu trong việc dự đoán điểm sinh viên đại học. Kết quả nghiên cứu không chỉ có giá trị khoa học mà còn có ý nghĩa thực tiễn cao trong việc hỗ trợ quản lý giáo dục và cải thiện kết quả học tập của sinh viên. Các khuyến nghị cho các nghiên cứu tiếp theo cũng sẽ được đưa ra, nhằm tiếp tục phát triển và hoàn thiện mô hình dự đoán. Việc này sẽ góp phần nâng cao chất lượng giáo dục đại học tại Việt Nam.

5.1 Hướng phát triển đề tài

Nghiên cứu mở ra hướng đi mới cho việc áp dụng kỹ thuật lấy mẫu trong giáo dục. Các nghiên cứu tiếp theo có thể tập trung vào việc mở rộng dữ liệu và áp dụng các phương pháp học máy tiên tiến hơn để cải thiện độ chính xác của dự đoán. Bên cạnh đó, việc tích hợp các yếu tố khác như tâm lý học sinh viên và phương pháp giảng dạy cũng có thể là một hướng nghiên cứu thú vị trong tương lai.

10/01/2025

Trích đoạn nội dung tài liệu

Chương 1: Giới thiệu đề tài GVHD: PGS. Thoại Nam Từ đó, nêu lên những giải pháp đề xuất chọn mẫu dữ liệu và xây dựng mô hình phân tích dựa vào học máy cho bài toán dự đoán điểm số của sinh viên dựa trên dữ liệu quá khứ của sinh viên đã học. Chương 4: Kết quả và đánh giá Từ những phân tích và đề xuất giải pháp trong chương 3, nội dung chính của chương này trình bày các thực nghiệm và những kết quả đạt được khi thực hiện gom nhóm lấy mẫu dữ liệu và xây dựng mô hình phân tích dự báo kết quả học tập của sinh viên Đại học của trường Đại học Bách Khoa - ĐHQG - TPHCM. Đánh giá kết quả thực hiện việc lấy mẫu dữ liệu và phân tích dự đoán điểm sinh viên đại học.

Chương 5: Kết luận Tóm lại các nội dung đã trình bày trong các chương, khẳng định lại các vấn đề cần nghiên cứu, đánh giá lại những mặt còn tồn đọng, và nêu lên các đề xuất phát triển trong tương lai. Kết luận chương 1 Phân tích dự đoán kết quả học tập của sinh viên là một lĩnh vực đang được nhiều sự quan tâm, nghiên cứu và vận dụng để cải thiện chất lượng giáo dục, đào tạo hiện nay tại Việt Nam nói chung và Đại học Bách Khoa - ĐHQG - TPHCM nói riêng. Phương pháp lấy mẫu trong thống kê và lấy mẫu dữ liệu để phân tích trong machine learning đóng vai trò quan trọng trong việc giảm chi phí, thời gian và độ phức tạp tính toán, đồng thời đảm bảo đại diện dữ liệu và đưa ra kết quả chính xác. Với mục tiêu vận dụng cơ sở lý thuyết về kỹ thuật lấy mẫu dữ liệu cho phân tích dữ liệu và học máy để đưa ra phương án chọn mẫu dữ liệu phù hợp với bộ dữ liệu điểm sinh viên đại học Bách Khoa và dự đoán kết quả học tập của sinh viên Đại học Bách Khoa khi lựa chọn đăng ký môn học.

Từ đó, đưa ra kết luận giúp cho các trường đại học đang sẵn có dữ liệu điểm sinh viên đại học có thể chọn mẫu dữ liệu tốt nhất, phù hợp với bộ dữ liệu của trường mình. Và nghiên cứu này cũng làm cơ sở tiền đề cho các nghiên cứu tiếp theo trong lĩnh vực giáo dục đại học trong thời gian sắp tới. HV: Trần Thị Thu Trang Trang 6 / 61 Chương 2: Cơ sở lý thuyết GVHD: PGS. Thoại Nam CHƯƠNG 2: TỔNG QUAN NGHIÊN CỨU Nội dung chính của chương này trình bày các kiến thức tổng quan về kiến thức nền tảng, cơ sở lý thuyết để thực hiện luận văn.

Là cơ sở nền tảng cho các phân tích, giải pháp giải quyết ở các chương tiếp theo Gồm các nội dung chính như sau: ➢ Một số khái niệm ➢ Ưu điểm, nhược điểm các phương pháp lấy mẫu theo thống kê truyền thống ➢ Phân biệt phương pháp Lấy mẫu ➢ Phương pháp lấy mẫu theo nhóm ➢ Phương pháp dự đoán điểm sinh viên đại học ➢ Đánh giá độ chính xác của mô hình dự đoán ➢ Các công trình nghiên cứu nổi bật trong giáo dục đại học HV: Trần Thị Thu Trang Trang 7 / 61 Chương 2: Cơ sở lý thuyết GVHD: PGS. Thoại Nam CHƯƠNG 2: TỔNG QUAN NGHIÊN CỨU 2. Một số khái niệm 2. Lấy mẫu (Sampling) là gì ? Theo lý thuyết điều tra chọn mẫu (theory of sample surveys) nhằm mục đích lựa chọn một mẫu đơn vị để đại diện cho một tổng thể lớn hơn.

Sự ra đời của phương pháp đại diện bắt nguồn từ [3], người đề xuất tạo ra các ước tính bằng cách sử dụng mẫu các thành phố và cá nhân được kiểm soát không ngẫu nhiên, thay vì điều tra dân số. Nhưng điều này thực sự với Neyman [4] rằng những điều cơ bản của lấy mẫu khảo sát hiện đại đã được ổn định. Neyman đề xuất một thiết lập chặt chẽ cho các khảo sát ngẫu nhiên, đặt nền móng cho các khảo sát xác suất nhưng có kiểm soát, cho phép kiểm soát thống kê độ chính xác của các công cụ ước tính [1]. “Lấy mẫu là một phương pháp cho phép lấy thông tin về tổng thể (population) dựa trên số liệu thống kê từ một tập hợp con của tổng thể (mẫu) mà không cần phải điều tra từng cá nhân” [20].

1: Định nghĩa Lấy mẫu Tuy nhiên, trong học máy có giám sát và không giám sát trong Machine Learning có thể lấy mẫu [1] theo các dạng sau: ➢ Phương pháp lấy mẫu ngẫu nhiên đơn giản ➢ Lấy mẫu với xác suất không bằng nhau ➢ Thuộc tính thống kê của thiết kế lấy mẫu HV: Trần Thị Thu Trang Trang 8 / 61 Chương 2: Cơ sở lý thuyết GVHD: PGS. 2: Supervised machine learning [24] 2. Cây quyết định (Decision Trees) Cây quyết định tạo ra một mô hình dự đoán nhãn bằng cách đánh giá cây câu hỏi đặc trưng nếu-thì-khác đúng/sai và ước tính số lượng câu hỏi tối thiểu cần thiết để đánh giá xác suất đưa ra quyết định đúng. Cây quyết định có thể được sử dụng để phân loại để dự đoán một danh mục hoặc hồi quy để dự đoán một giá trị số liên tục [24].

Hàm mất mát (Loss function) Hàm mất mát là một trong những tham số cần thiết để xác định mức độ gần của một mạng neuron cụ thể đối với trọng số trong quá trình đào tạo 2. Kỹ thuật xuống đồi (Gradient descent) Kỹ thuật xuống đồi (Gradient descent) là “kỹ thuật có thể giúp sự biến thiên của một hàm số luôn là giảm (xuống đồi) dựa trên sự thay đổi của các tham số cấu tạo nên hàm số này” [8]. Gradient Descent là cơ sở của nhiều trình tối ưu hoá và là một trong những thuật toán tối ưu hoá phổ biến nhất trong Machine Learning và Deep learning. HV: Trần Thị Thu Trang Trang 9 / 61 Chương 2: Cơ sở lý thuyết GVHD: PGS.

Thoại Nam Gradient descent sử dụng đạo hàm cấp một (gradient) của loss function khi cập nhật các tham số. Gradient cho độ dốc của một hàm tại thời điểm đó. Quá trình này bao gồm chuỗi dẫn xuất của giá trị mất mát (loss value) của từng tầng ẩn (hidden layer) từ các dẫn xuất của loss value của lớp trên nó, kết hợp chức năng kích hoạt trong phép tính toán. Trong mỗi lần lặp lại, khi tất cả các neuron có giá trị của gradient của loss funtion tương ứng với chúng, giá trị của tham số được cập nhật theo hướng ngược lại với các giá trị được chỉ ra bởi gradient.

• Mục tiêu: tìm vector các tham số sao cho tối ưu hoá hàm mục tiêu cụ thể P* = arg min P  ( P) • Phương pháp Gradient descent:  ( P)  Gradient: g = { g } = {  P = Pm−1}  m jm  Pi  Parameters: Pm = − m g m Learning rate:  m = arg min   ( Pm −1 −  g m ) =  m=0 Pm * M Target parameters: P Như vậy, kết quả của gradient descent là kết hợp các trọng số (weight) của các độ dốc (gradient). HV: Trần Thị Thu Trang Trang 10 / 61 Chương 2: Cơ sở lý thuyết GVHD: PGS. Ưu điểm, nhược điểm lấy mẫu theo thống kê truyền thống Bảng 2. 1: Ưu điểm, khuyết điểm lấy mẫu theo thống kê truyền thống Phương pháp Ưu điểm Nhược điểm chọn mẫu Cần phải có một danh sách của các Dễ thực hiện, tính khách đơn vị mẫu.

Không dùng được cho Ngẫu quan cao. mẫu lớn hoặc mẫu dao động. nhiên Có thể lồng ghép vào tất Mẫu được chọn có thể phân tán khó đơn cả các kỹ thuật chọn mẫu thu thập. giản xác suất phức tạp khác.

Có khả năng bỏ sót vài nhóm trong tổng thể. Nhanh, dễ thực hiện. Độ Chọn chính xác cao, chọn đối Có thể bị trùng lặp, dẫn đến mẫu thiếu mẫu hệ tượng theo mục đích điều tính đại diện thống tra. Tính đại diện cao hơn.

Chọn Độ chính xác cao. Tính đại Cần thiết lập khung mẫu cho từng mẫu diện cao hơn và dễ quản lý tầng. Điều này thường khó thực hiện phân mẫu ngẫu nhiên đơn giản. trong thực tế.

tầng Chọn Áp dụng cho phạm vi rộng Tổng thể phải lớn. Nếu cùng cỡ mẫu mẫu lớn, độ phân tán cao. tính đại diện hoặc tính chính xác thấp theo Dễ chọn và chi phí rẻ hơn. hơn mẫu ngẫu nhiên đơn giản.

cụm Chọn Hiệu quả trong việc thu Mức độ chủ quan cao. Kết quả nghiên mẫu thập dữ liệu sơ cấp. Hiệu cứu không bao giờ có thể đại diện nhiều quả về chi phí và thời gian. Sự hiện diện của thông tin cấp bậc Mức độ linh hoạt cao.

nhóm là bắt buộc. HV: Trần Thị Thu Trang Trang 11 / 61 Chương 2: Cơ sở lý thuyết GVHD: PGS. Phân biệt các phương pháp Lấy mẫu Bảng 2. 2: Phân biệt các phương pháp Lấy mẫu Lấy mẫu trong Thống kê Lấy mẫu trong Học máy Lấy mẫu trong Học máy Thống kê truyền thống (Statistics) (Machine Learning) (Statistical Machine Learning hoặc Statistical Learning) Phương pháp Phụ thuộc vào dữ liệu (data-driven) Phụ thuộc vào dữ liệu (data-driven) Phụ thuộc vào dữ liệu (data-driven) Việc học Học từ dữ liệu mà không cần hướng Dựa trên rule-based programming và chính thức hoá dữ liệu dẫn được lập trình rõ ràng dưới dạng mối quan hệ giữa các biến (relationship (Learning) Không có (programmed instructions) between variables) Ngữ cảnh Được sử dụng trong lĩnh vực thống Áp dụng các phương pháp thống kê trong việc xây kê truyền thống Xây dựng và huấn luyện mô hình dựng mô hình machine learning Rút ra các kết luận về đặc điểm và thông tin của quần thể dựa trên một Tập trung vào việc chọn một tập dữ mẫu đại diện liệu huấn luyện từ tập dữ liệu ban Xây dựng mô hình dự đoán có hiệu suất cao trên dữ Mục đích - Sử dụng để ước lượng các tham số đầu để xây dựng mô hình hoặc học liệu mới (Purpose) và tính toán khoảng tin cậy, sai số, thuật và độ tin cậy của các ước lượng đối với quần thể - Tạo ra tập dữ liệu huấn luyện để xây dựng mô hình có tính đại diện, Ước lượng và đánh giá thông tin về tổng quát để mô hình có khả năng - Tạo ra một tập dữ liệu huấn luyện có tính tổng quát Mục tiêu quần thể gồm các tham số, tổng tổng quát hoá tốt và khả năng đại diện cho quần thể dữ liệu ban đầu chính quan hoặc mô hình của quần thể - Đảm bảo mô hình được huấn - Sử dụng các phương pháp thống kê để hiểu rõ hơn và (Goal) (population) dữ liệu ban đầu luyện trên đủ các trường hợp và có tối ưu hóa các thuật toán Machine Learning, thông qua khả năng tổng quát hóa tốt trên dữ việc xác định mẫu, quy tắc, và đặc trưng quan trọng, liệu mới đánh giá và so sánh các mô hình.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Bài viết "Nghiên cứu phát triển kỹ thuật lấy mẫu cho bài toán dự đoán điểm sinh viên đại học" của tác giả Trần Thị Thu Trang, dưới sự hướng dẫn của PGS. Thoại Nam tại Trường Đại Học Bách Khoa - Đại Học Quốc Gia TP.HCM, cung cấp cái nhìn sâu sắc về việc áp dụng các kỹ thuật lấy mẫu trong việc dự đoán điểm số của sinh viên đại học. Nghiên cứu này không chỉ giúp cải thiện khả năng dự đoán kết quả học tập mà còn hỗ trợ trong việc phát triển các phương pháp đánh giá hiệu quả hơn cho sinh viên. Độc giả sẽ tìm thấy giá trị trong việc hiểu rõ hơn về các kỹ thuật thống kê và công nghệ thông tin được sử dụng trong giáo dục.

Để mở rộng thêm kiến thức về các chủ đề liên quan, bạn có thể tham khảo bài viết Phương pháp dự đoán kết quả học tập sinh viên hỗ trợ hệ thống quản lý học vụ, nơi trình bày các phương pháp dự đoán kết quả học tập tương tự. Bài viết này cũng được thực hiện tại Đại Học Bách Khoa và có nhiều điểm tương đồng trong lĩnh vực nghiên cứu.

Ngoài ra, bài viết Phân tích dữ liệu sinh viên ngành CNTT để dự báo tiến độ học tập sẽ cung cấp cho bạn một cái nhìn khác về việc sử dụng dữ liệu để dự đoán kết quả học tập của sinh viên, đặc biệt trong lĩnh vực công nghệ thông tin.

Cuối cùng, bài viết Nghiên cứu phát triển kỹ thuật hỗ trợ phát hiện đạo văn trong văn bản tiếng Việt cũng có liên quan đến việc áp dụng các kỹ thuật phân tích và dự đoán trong giáo dục, mở rộng thêm hiểu biết về ứng dụng công nghệ thông tin trong lĩnh vực học thuật.

Những bài viết này không chỉ giúp bạn có thêm thông tin mà còn mở rộng cái nhìn về các phương pháp và ứng dụng trong giáo dục đại học.