Luận Văn Thạc Sĩ: Tư Vấn Chọn Ngành Học Tại Học Viện CNTT NIIT ICT HN Sử Dụng Phương Pháp Học Máy

Luận văn thạc sĩ phân tích tư vấn chọn ngành học tại học viện cntt niit ict hn sử dụng phương pháp học máy, đánh giá thực trạng, chỉ ra hạn chế, đề xuất giải pháp khả thi cho thực

Trường đại học

Trường Đại học Mở Hà Nội

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

luận văn thạc sĩ

2023

92
0
0

Phí lưu trữ

35 Point

Tóm tắt

I. Giới thiệu về Luận Văn Thạc Sĩ và Tư Vấn Chọn Ngành Học

Luận Văn Thạc Sĩ này tập trung vào việc Tư Vấn Chọn Ngành Học tại Học Viện CNTT NIIT ICT HN bằng Phương Pháp Học Máy. Nghiên cứu nhằm giải quyết vấn đề lựa chọn ngành học phù hợp cho sinh viên, đặc biệt trong lĩnh vực Công Nghệ Thông Tin. Phương Pháp Học Máy được áp dụng để phân tích dữ liệu và đưa ra các gợi ý chính xác, giúp sinh viên đưa ra quyết định sáng suốt.

1.1. Học Viện CNTT NIIT ICT HN và Đào Tạo CNTT

Học Viện CNTT NIIT ICT HN là một trong những cơ sở đào tạo hàng đầu về Công Nghệ Thông Tin tại Việt Nam. Chương trình đào tạo của học viện bao gồm nhiều chuyên ngành đa dạng, từ lập trình đến quản trị hệ thống. Đào Tạo CNTT tại đây không chỉ cung cấp kiến thức chuyên môn mà còn trang bị kỹ năng thực hành, giúp sinh viên sẵn sàng cho thị trường lao động.

1.2. Phương Pháp Học Máy trong Tư Vấn Học Tập

Phương Pháp Học Máy được sử dụng để phân tích dữ liệu sinh viên, bao gồm điểm số, sở thích và năng lực. Các thuật toán như Random ForestC4.5 được áp dụng để phân loại và dự đoán ngành học phù hợp. Phương pháp này không chỉ tăng độ chính xác mà còn tiết kiệm thời gian so với các phương pháp truyền thống.

II. Phương Pháp Phân Lớp Dữ Liệu và Giải Thuật Random Forest

Chương này tập trung vào việc phân tích Phương Pháp Phân Lớp Dữ Liệu và ứng dụng Giải Thuật Random Forest trong việc Tư Vấn Chọn Ngành Học. Random Forest là một thuật toán mạnh mẽ, có khả năng xử lý dữ liệu lớn và đưa ra kết quả chính xác cao. Thuật toán này được sử dụng để phân loại sinh viên dựa trên các đặc điểm cá nhân và học tập.

2.1. Giải Thuật C4.5 và Phân Lớp Dữ Liệu

Giải Thuật C4.5 là một phương pháp phân lớp dữ liệu dựa trên cây quyết định. Thuật toán này được sử dụng để phân tích các đặc điểm của sinh viên và đưa ra quyết định về ngành học phù hợp. Phân Lớp Dữ Liệu giúp xác định các yếu tố quan trọng ảnh hưởng đến quyết định chọn ngành, từ đó cải thiện độ chính xác của hệ thống tư vấn.

2.2. Ưu Điểm và Nhược Điểm của Random Forest

Random Forest có nhiều ưu điểm như khả năng xử lý dữ liệu lớn, giảm thiểu overfitting và dễ dàng triển khai. Tuy nhiên, thuật toán này cũng có nhược điểm như tốn nhiều tài nguyên tính toán và khó giải thích kết quả. Dù vậy, Random Forest vẫn là lựa chọn hàng đầu trong các bài toán phân lớp phức tạp.

III. Ứng Dụng Học Máy trong Tư Vấn Chọn Ngành Học

Chương này trình bày cách Ứng Dụng Học Máy trong việc Tư Vấn Chọn Ngành Học tại Học Viện CNTT NIIT ICT HN. Hệ thống tư vấn được xây dựng dựa trên các thuật toán học máy, giúp sinh viên đưa ra quyết định chính xác và phù hợp với năng lực cá nhân. Học Máy trong Giáo Dục đang trở thành xu hướng quan trọng, mang lại hiệu quả cao trong việc hỗ trợ sinh viên.

3.1. Xây Dựng Mô Hình và Đánh Giá Hiệu Quả

Mô hình tư vấn được xây dựng dựa trên dữ liệu thực tế của sinh viên. Các bước xử lý dữ liệu, phân lớp và đánh giá hiệu quả được thực hiện một cách chi tiết. Xây Dựng Mô Hình giúp đảm bảo tính chính xác và độ tin cậy của hệ thống. Kết quả đánh giá cho thấy mô hình đạt độ chính xác cao, phù hợp với mục tiêu nghiên cứu.

3.2. Kết Quả và Ứng Dụng Thực Tế

Kết quả nghiên cứu cho thấy Học Máy có thể cải thiện đáng kể quá trình Tư Vấn Chọn Ngành Học. Hệ thống tư vấn tự động giúp giảm thiểu sai sót và tăng hiệu quả trong việc hỗ trợ sinh viên. Ứng Dụng Thực Tế của nghiên cứu này có thể mở rộng sang các lĩnh vực giáo dục khác, mang lại lợi ích lớn cho ngành giáo dục.

23/02/2025
Luận văn thạc sĩ tư vấn chọn ngành học tại học viện cntt niit ict hn sử dụng phương pháp học máy

Trích đoạn nội dung tài liệu

chương 1.5 VÀ GIẢI THUẬT RANDOM FOREST 2. Tong quan Giải thuật C4.5 là một giải thuật học máy bằng cây quyết định được phát triên bởi Ross Quinlan.Ross Quinlan đã phát triển giải thuật C4.5 với khoảng 9000 dòng lệnh C. Cây quyết định được tạo ra bởi C4.5 có thê được sử dụng cho bài toán phân lớp [20].5 đã có nhiều cải tiễn so với giải thuật ID3 như: Cho phép xử lý cả các thuộc tính tiếp diễn và rời rạc Xử lý được những thiếu sót trong training data với những giá trị thiếu Hỗ trợ việc xử lý cắt cây (pruning tree) sau khi tao Giải thuật J48 là một bản cài đặt giải thuật C4.5 được sử dụng với công cụ Weka và là một phiên bản được viết bằng Java.5 (wong TÔ: Giải thuật C4.5 là giải thuật phân lớp dữ liệu dựa trên cây quyết định hiệu quả và phổ biến trong những ứng dụng xử lý và thao tác với những tập dữ liệu có kích thước nhỏ.5 phù hợp với những cơ sở dit liệu nhỏ, và có khả năng sắp xếp lại dữ liệu tại mỗi node trong quá trình phát triển cây quyết định.5 chọn thuộc tính phân loại tốt nhất Trong quá trình xây dựng cây quyết định, tác vụ quan trọng nhất là ta cần chọn thuộc tính tốt nhất dé phân hoạch dữ liệu. Trong quá trình xây dựng cây, ta cần tiến hành phân hoạch dữ liệu sao cho.

kết quả thu được cây nhỏ nhất, điều nay sẽ phụ thuộc vào việc chọn thuộc tính sinh ra các nút thuần khiết nhất. Ở đây ta tìm hiểu và sử dụng giải thuật học máy dựa trên cây quyết định tiêu biểu là giải thuật C4. Dưới đây là công thức (2.1) Dưới đây là công thức tính độ đo.2): al 148) = Dy 15) (22) i Độ lợi thông tin (informartion gain) khi chọn thuộc tinh 4 phân hoạch dit liệu Š thành v phần được tinh theo công thức (2.3) [2]: Gs) = /(S)-1,S) (3) Tuy nhiên, khi dữ liệu có thuộc tính có nhiều giá trị hơn các thuộc tính khác, độ lợi thông tin tăng trên các thuộc tính có nhiều giá trị phân hoạch. Giả sử khi sử dụng thuộc tinh A phân hoạch dữ liệu Š thành v phan, thông tin của phân phối dữ liệu được tính như công thức (2.4) & |s| Va tỉ số độ lợi được tính như công thức (2.5) P(S) Phy viện Trường Dai học 2.

Xử lý những giá trị thiểu trong C4.5 Trong quá trình xử lý các tệp dữ liệu, từ những bài toán đơn giản cho đến những bài toán phức tap, không thé tránh khỏi việc có dữ liệu thiếu (missing data) trong tệp dữ liệu. Dữ liệu thiếu là giá trị của thuộc tính không có do lỗi trong quá trình nhập bản ghi vào cơ sở dữ liệu (có thể nhập qua biểu mẫu ứng dụng hoặc nhập trực tiếp vào cơ sở dữ liệu). Khi đó độ đo độ lợi thông tin của test 8 giảm vì chúng ta không phân được lớp nao từ các case trong Sp và được tính theo công thức 2.6) Is] Y nghĩa của các thông số trong công thức trên: #9 là training data B là test data Tập con Sy là tập con các case trong S ma có giá trị thuộc tinh A, không. biét S; biéu diễn các case với đầu ra là b; trong B 12 Từ đó P(S, 8) cũng thay đổi như sau: t P(S,B) =— ISol oa (at )- Isil Dis Isil = 27 BI Uist) ~ 2, BỊ 5% isi a0 2.

Ưu nhược đi m của cây quyết định trong phân lớp dữ liệu 2. Uu điểm của cây quyết định - Cho phép sinh ra các quy tắc dé hiểu: Một trong những điểm mạnh của cây quyết định là khả năng sinh ra các quy tắc, những quy tắc này sau đó có thé dé dàng chuyển đổi được sang dạng tiếng anh, hoặc chuyển thành các câu lệnh SQL. Tir đó sẽ khiến cho quá trình phân lớp trở nên dé hiểu và dé mô tả hơn. - Hỗ trợ khả năng tính toán dễ dàng trong quá phân lóp: Các giải thuật được sử dụng dé tạo ra cây quyết định thường tạo ra những cây với số phân nhánh thấp và các test đơn giản tại từng node.

Điều này trở thành một ưu điểm nỗi trội của cây quyết định, bởi lẽ trong môi trường thương mại, các mô hình dự đoán thường được sử dụng dé phân lớp với số lượng dữ liệu cực lớn, thậm chí lên đến hàng ti bản shi. Thư viện ong Dé 2. Nhược điểm của cây quyết định Mặc dù có nhiều ưu điểm như đã mô tả ở phần trên, cây quyết định vẫn tồn tại một số điểm yếu. Một trong những điểm yếu nhất của cây quyết định là nó không tỏ ra thích hợp khi thực hiện những bài toán với mục tiêu là dự đoán giá trị của thuộc tính liên tục như doanh số, thu nhập, lãi suất V.

- Gặp khó khăn hoặc phát sinh lỗi nếu có quá nhiều lớp. Đối với cây quyết định, nếu có quá nhiều lớp thì có thể xảy ra lỗi. Ngoài ra một số cây quyết định lại chỉ phù hợp khi tiến hành những bài toán phân lớp nhị phân. ~ Tốn kém khi đào tao.

Khi ta quyết định sử dụng cây quyết định, ta sẽ cần phải chấp nhận sẽ tốn kém hay đắt về mặt tính toán, vì tại mỗi node ta cần tính toán một độ đo trên từng thuộc tính. Giải thuật Random Forest 2. Giới thiệu tong quan về giải thuật Random Forest Random Forest là một giải thuật học máy thông dụng thuộc kiểu học có giám sát. Trong đó, thay vì chỉ dựa vào duy nhất một cây quyết định, giải thuật Random Forest sẽ tiến hành dự đoán trên từng cây và dựa trên những dự đoán chiếm ưu thé, nó sẽ dự đoán ra kết quả cuối cùng (final output).

Điều quan trọng: Số lượng cây trong rừng càng nhiều, thì độ chính xác sẽ càng cao, và càng han chế được vấn đề overfiting. Minh họa cơ chế làm việc của giải thuật Random Forest (Nguồn: https://www.javatpoint,com/machine-learning-random-forest-algorithm: 2. Lý do sử dụng Random Forest Có một số lý do giải thích tại sao ta nên sử dụng giải thuật Random Forest: Thời gian để thực hiện training ít hơn so với các giải thuật khác. Giải thuật Random Forest đưa ra dự đoán kết quả với độ chính xác cao, đồng.

thời hiệu quả ngay cả với các tệp dữ liệu lớn. Có độ chính xác cao, thậm chí cho phép duy trì độ chính xác ngay cả khi có một lượng lớn dữ liệu bị thiếu. Giảm thiểu độ rủi ro của vấn đề overfitting 2. Cơ chế làm việc của giải thuật Random Forest Giải thuật Random Forest thực hiện trong hai giai đoạn.

đầu tiên là tạo ra rừng ngẫu nhiên (random forest) bằng cách kết hợp N cây quyết định, giai đoạn thứ hai là đưa ra dự đoán cho từng cây được tạo ra trong giai đoạn đầu. Tiến trình làm việc của giải thuật Random Forest bao gồm các bước như sau: Bước 1: Chon ngẫu nhiên các samples từ tập dữ liệu đào tạo (training set) Bước 2: Xây dựng các cây quyết định được kết hợp với các training data được chọn Bước 3: Tiến hành voting bằng cách chia trung bình Bước 4: Chọn kết quả dự đoán được vote nhiều nhất dé làm kết quả dự đoán cuối cùng. Quá trình kết hợp, của nhiều mô hình1 này còn In VÌ là Ensemble. Ensemble sử dung hai phuong 'pháp sau: g 1 Bagging: Tạo ra một tập con dit liệu dao tạo khác từ tập dữ liệu đào tao với sự thay thế.

Kết quả cuối cùng được dựa trên giá trị voting chủ yếu. Boosting: Kết hợp các weak learners vào các strong learners bằng cách tạo ra các mô hình tuần tự, nhờ đó mô hình cuối cùng có độ chính xác cao nhất. Ví dụ: ADA BOOST, XG BOOST Bagging Boosting th la -—-w——-$ aw’ Parallel Sequential Hình 2. Biểu diễn về hai phương pháp Bagging va Boosting (Nguồn: https:/Avww simplilearn.com/tutorials/machine-learning-tutorial/random-forest-algorithm) Giải thuật Random Forest sử dụng phương pháp Bagging.

Bagging còn được biết đến với tên là Bootstrap Aggregation được sử dụng bởi giải thuật Random Forest. Guá tình này bài dân tới CR HES 19†4i6"Ôiởfr Nội sờ xếp, dụ liệu này sẽ được tô chức thành các samples còn được gọi là Bootstrap Sample. Quá trình này còn được gọi là Bootstraping. Original Data Bootstrapping eee moe Hinh 2.

Biéu dién pink pháp Bagging - Tính lung tung: Mỗi cây có một thuộc tính duy nhất, có các đặc điểm và tính đa dạng liên quan đến các cây khác. i 4 : ThỪ v ten TTỊ ‘ong Đại học Mở Hà Nội - Tính song song: Ta hoàn toàn có thê sử dụng CPU đề xây dựng random forest vì mỗi cây được tạo một cách tự động từ các dữ liệu và tính năng khác nhau. - Phân chia dữ liệu đào tạo-kiểm tra (Train-Test split): Trong giải thuật Random Forest, ta không cần phải phân biệt giữa dữ liệu cho việc đào tạo và đữ liệu cho. test, bởi lẽ cây quyết định sẽ không bao giờ nhìn thay quá 30% dữ liệu.

- Tính ổn định (stability): Kết quả cuối cùng được dựa trên phương pháp Bagging, điều đó có nghĩa là kết quả được dựa trên majority voting hoặc giá trị trung bình. Ứng dụng của giải thuật Random Forest Giải thuật Random Forest có thể được sử dụng trong các lĩnh vực sau: Ngân hàng: Nhận diện rủi ro của các khoản vay. Giúp ngân hàng đưa ra quyết định hoặc phân biệt xem có nên cho khách hàng vay hay không. Ngoài ra giải thuật cũng giúp phát hiện ra những kẻ lừa đảo.

Y dược và chăm sóc sức khỏe: Nhận diện xu hướng dịch bệnh và rủi ro của bệnh. Các chuyên gia y tế có thể sử dụng các hệ thống ứng dụng random forest để 17 giúp chân đoán bệnh nhân. Các bệnh nhân được chan đoán bằng cách xem lại lịch sử điều trị của họ, đề từ đó đưa ra đề xuất sử dụng thuốc cho các bệnh nhân. Chứng khoán: Các chuyên gia tài chính có thể sử dụng giải thuật Random Forest để nhận diện tiềm năng thị trường của các cổ phiếu.

Giải thuật cũng cho phép họ nhớ lại về diễn biến của các cô phiêu trước đó. Thương mại điện tử: Giúp các hãng dự đoán được sở thích của các khách hàng dựa trên hành vi tiêu thụ trong quá khứ của họ. Khi nào không sử dụng Random Forest Giải thuật Random Forest không phù hợp sử dụng trong những tình huống sau: Ngoại suy: Hồi quy Random Forest không lý tưởng đối với dữ liệu ngoại suy. Không giống như hồi quy tuyến tính vốn sử dụng những quan sát đã có sẵn để dự đoán các giá trị vượt ra miền các quan sát [17].

Dữ liệu thưa thớt: Random Forest không cung cấp kết quả tốt khi dữ liệu bị thưa thớt.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Luận Văn Thạc Sĩ: Tư Vấn Chọn Ngành Học Tại Học Viện CNTT NIIT ICT HN Bằng Phương Pháp Học Máy là một nghiên cứu chuyên sâu về việc áp dụng học máy để hỗ trợ sinh viên trong quá trình chọn ngành học phù hợp tại Học viện CNTT NIIT ICT Hà Nội. Tài liệu này không chỉ cung cấp cái nhìn tổng quan về các phương pháp học máy mà còn đề xuất một hệ thống tư vấn thông minh, giúp sinh viên đưa ra quyết định dựa trên dữ liệu và phân tích khoa học. Điều này mang lại lợi ích lớn cho độc giả, đặc biệt là những ai đang tìm kiếm hướng dẫn chọn ngành học một cách chính xác và hiệu quả.

Nếu bạn quan tâm đến ứng dụng của học máy trong lĩnh vực giáo dục và công nghệ thông tin, bạn có thể khám phá thêm Đồ án tốt nghiệp công nghệ thông tin tìm hiểu về nhận dạng hình thái tinh thể sử dụng học máy. Tài liệu này sẽ mở rộng kiến thức của bạn về cách học máy được áp dụng trong các bài toán thực tế, từ đó giúp bạn có cái nhìn toàn diện hơn về tiềm năng của công nghệ này.