Tổng quan nghiên cứu

Trong công tác quản lý giáo dục đào tạo, việc dự báo chính xác số lượng người học có vai trò then chốt đối với việc xây dựng kế hoạch chỉ tiêu đào tạo, bố trí cơ sở vật chất và phân bổ ngân sách. Tuy nhiên, dữ liệu tuyển sinh thực tế thường biến động phi tuyến, phụ thuộc vào nhiều yếu tố kinh tế - xã hội phức tạp và chứa đựng nhiều yếu tố bất định, thông tin mờ không đầy đủ. Nghiên cứu chuỗi thời gian tuyển sinh kéo dài 28 năm từ năm 1990 đến năm 2017 tại Trường Cao đẳng Sư phạm Nam Định và tập dữ liệu chuẩn 22 năm từ năm 1971 đến năm 1992 của Trường Đại học Alabama cho thấy các phương pháp thống kê cổ điển gặp nhiều rào cản khi xử lý các yếu tố biến thiên định tính.

Vấn đề nghiên cứu trọng tâm là khắc phục hạn chế của các mô hình dự báo chuỗi thời gian mờ truyền thống. Mô hình nguyên bản do hai tác giả Song và Chissom công bố năm 1993 đòi hỏi các phép toán hợp thành ma trận phức tạp, trong khi thuật toán rút gọn của Chen công bố năm 1996 tuy đơn giản hóa việc tính toán nhưng việc chia khoảng đều trên không gian nền còn mang tính trực giác, chưa phản ánh trọn vẹn ngữ nghĩa ngôn ngữ tự nhiên.

Mục tiêu cụ thể của luận văn thạc sĩ chuyên ngành Khoa học máy tính, mã số 8 48 01 01 do tác giả Lại Văn Lãm thực hiện dưới sự hướng dẫn khoa học của Tiến sĩ Nguyễn Duy Minh tại Trường Đại học Công nghệ Thông tin và Truyền thông - Đại học Thái Nguyên vào năm 2018 là xây dựng mô hình dự báo chuỗi thời gian mờ cải tiến dựa trên Đại số gia tử và ánh xạ định lượng ngữ nghĩa. Nghiên cứu tập trung vào phạm vi thực nghiệm chuỗi số liệu tuyển sinh 28 năm tại Nam Định và bộ dữ liệu kinh điển 22 năm của Alabama, hướng đến mục tiêu giảm sai số trung bình bình phương xuống dưới mức 3.18% và nâng cao độ tin cậy trong hoạch định tuyển sinh thực tế.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Khung lý thuyết của đề tài được xây dựng trên sự giao thoa giữa lý thuyết tập mờ, logic mờ và cấu trúc Đại số gia tử. Thứ nhất, lý thuyết tập mờ do Lofti A. Zadeh khởi xướng năm 1965 và mở rộng khái niệm biến ngôn ngữ năm 1973 cung cấp nền tảng biểu diễn thông tin không chắc chắn qua hàm thuộc có giá trị trong đoạn từ 0 đến 1. Biến ngôn ngữ cho phép mô hình hóa các trạng thái định tính như ít, trung bình, nhiều hoặc rất nhiều.

Thứ hai, cấu trúc Đại số gia tử tuyến tính đầy đủ do các nhà khoa học phát triển từ những năm 1990 đến 1992 mang lại phương pháp tiếp cận hoàn toàn mới trong việc định lượng ngữ nghĩa ngôn ngữ. Một Đại số gia tử bao gồm tập các phần tử sinh, tập các gia tử âm dương có tính tăng cường hoặc suy giảm ngữ nghĩa và quan hệ thứ tự cảm sinh ngữ nghĩa.

Thứ ba, lý thuyết độ đo tính mờ và ánh xạ định lượng ngữ nghĩa cho phép chuyển đổi chính xác các giá trị ngôn ngữ trừu tượng thành các giá trị số thực trong đoạn đơn vị từ 0 đến 1. Các khái niệm cốt lõi bao gồm: quan hệ logic mờ dạng trạng thái hiện tại suy ra trạng thái tiếp theo, nhóm quan hệ logic mờ cùng vế trái, hàm dấu phân định chiều tác động của gia tử và phép giải mờ định lượng thông qua hệ khoảng mờ liên kết.

Phương pháp nghiên cứu

Nguồn dữ liệu thứ cấp của nghiên cứu bao gồm hai bộ dữ liệu chuỗi thời gian hoàn chỉnh: bộ dữ liệu chuẩn gồm 22 mốc thời gian từ năm 1971 đến năm 1992 về số lượng sinh viên nhập học tại Trường Đại học Alabama với khoảng biến thiên từ 13.055 đến 19.337 sinh viên; và bộ dữ liệu thực tế gồm 28 mốc thời gian từ năm 1990 đến năm 2017 về tuyển sinh của Trường Cao đẳng Sư phạm Nam Định.

Phương pháp chọn mẫu là chọn mẫu toàn bộ theo chuỗi thời gian lịch sử hồi cứu. Cỡ mẫu bao phủ toàn bộ các chu kỳ tuyển sinh liên tục, đảm bảo tính đại diện và phản ánh đầy đủ các pha tăng trưởng, bão hòa và suy giảm của quy mô đào tạo.

Lý do lựa chọn phương pháp phân tích chuỗi thời gian mờ kết hợp Đại số gia tử xuất phát từ việc phương pháp này không đòi hỏi chuỗi dữ liệu phải thỏa mãn các giả định khắt khe về phân phối chuẩn hay tính dừng như các mô hình hồi quy kinh tế lượng. Hơn nữa, thay vì phân chia không gian nền thành 7 khoảng chia đều cứng nhắc có độ dài 1.000 đơn vị như cách tiếp cận của Chen, việc ứng dụng ánh xạ định lượng ngữ nghĩa của Đại số gia tử giúp tự động phân hoạch các khoảng giải nghĩa linh hoạt theo cấu trúc ngữ nghĩa nội tại của dữ liệu. Quy trình thực hiện gồm 6 bước chuẩn hóa: xác định không gian nền vũ trụ, tính toán độ đo tính mờ và khoảng định lượng, mờ hóa chuỗi số liệu lịch sử, thiết lập nhóm quan hệ logic mờ, suy diễn dự báo và giải mờ định lượng.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Thứ nhất, trên tập dữ liệu chuẩn của Đại học Alabama từ năm 1971 đến năm 1992, mô hình dự báo mờ kinh điển của Song và Chissom cho kết quả sai số dao động từ 0.1% đến 8.7% với sai số bình phương trung bình đạt 3.18%. Khi áp dụng mô hình của Chen với 7 khoảng chia từ 13.000 đến 20.000, kết quả dự báo năm 1972 đạt 14.000 sinh viên so với thực tế 13.563 sinh viên, năm 1980 đạt 16.833 sinh viên so với thực tế 16.919 sinh viên, chứng minh tính khả thi của việc nhóm các quan hệ logic mờ không phụ thuộc thời gian.

Thứ hai, việc áp dụng Đại số gia tử và ánh xạ định lượng ngữ nghĩa đã tạo ra bước đột phá về độ chính xác dự báo. Mô hình dựa trên Đại số gia tử đã tính toán các điểm nút giải nghĩa tối ưu, giúp đường dự báo bám sát đường dữ liệu thực tế tại tất cả các bước nhảy vọt như giai đoạn tăng mạnh từ 16.859 sinh viên năm 1987 lên 18.150 sinh viên năm 1988 và đạt đỉnh 19.337 sinh viên năm 1991. Sai số tuyệt đối phần trăm trung bình của mô hình mới giảm đáng kể, phần lớn các năm có độ lệch dưới 1.5%.

Thứ ba, khi thử nghiệm trên bộ dữ liệu 28 năm từ năm 1990 đến năm 2017 của Trường Cao đẳng Sư phạm Nam Định, mô hình Đại số gia tử chứng minh khả năng thích ứng cao với các biến động thực tế phức tạp của hệ thống giáo dục cao đẳng địa phương. Kết quả tính toán giải mờ ngữ nghĩa phản ánh chính xác các chu kỳ tăng giảm tuyển sinh, đạt mức tương thích với thực tế trên 95%.

Thảo luận kết quả

Các kết quả nghiên cứu được biểu diễn trực quan thông qua bảng đối sánh sai số qua từng năm và các biểu đồ đường thể hiện tương quan giữa chuỗi số liệu sinh viên thực tế và chuỗi giá trị dự báo mờ. Trên đồ thị, đường nét đứt dự báo theo Đại số gia tử gần như trùng khít với đường nét liền của dữ liệu thực tế, khắc phục triệt để hiện tượng trễ pha thường gặp trong mô hình của Song và Chissom.

Nguyên nhân chính của sự cải thiện này nằm ở việc Đại số gia tử sử dụng hàm dấu để điều chỉnh các điểm chia khoảng theo bản chất của các gia tử ngôn ngữ. Trong khi phương pháp của Chen chia đều không gian nền thành các đoạn cố định 1.000 sinh viên khiến điểm trung tâm của mỗi khoảng giải mờ bị thô, thì ánh xạ định lượng ngữ nghĩa xác định độ dài mỗi khoảng mờ chính bằng đường kính của tập ngữ nghĩa, tạo ra sự phân hoạch mềm dẻo và chính xác hơn.

So sánh với các nghiên cứu trong nước và quốc tế, việc tích hợp Đại số gia tử vào dự báo chuỗi thời gian mờ là một hướng đi tiên phong, khẳng định tính ưu việt của công cụ toán học do các nhà khoa học Việt Nam phát triển trong việc giải quyết bài toán dự báo xã hội học và giáo dục.

Đề xuất và khuyến nghị

Dựa trên kết quả nghiên cứu thực nghiệm, luận văn đưa ra 4 nhóm giải pháp và khuyến nghị khả thi:

Thứ nhất, tích hợp mô hình dự báo chuỗi thời gian mờ dựa trên Đại số gia tử vào hệ thống phần mềm quản lý điều hành tuyển sinh tại Trường Cao đẳng Sư phạm Nam Định trong thời gian 6 tháng tới. Mục tiêu cụ thể là nâng cao độ chính xác trong việc xác định chỉ tiêu các ngành sư phạm và ngoài sư phạm lên trên 96%, giúp tối ưu hóa kế hoạch phân bổ giảng viên và ngân sách. Chủ thể thực hiện là Ban Giám hiệu phối hợp cùng Trung tâm Công nghệ Thông tin của nhà trường.

Thứ hai, chuẩn hóa quy trình thu thập và làm sạch dữ liệu tuyển sinh định kỳ 12 tháng một lần. Phòng Quản lý Đào tạo và Tuyển sinh cần lưu trữ số liệu lịch sử chi tiết theo từng chuyên ngành, từng phương thức xét tuyển và tổ hợp môn thi để cung cấp chuỗi dữ liệu đầu vào chất lượng cao cho không gian nền vũ trụ của mô hình mờ.

Thứ ba, nâng cấp thuật toán dự báo sang mô hình chuỗi thời gian mờ bậc cao với độ trễ từ 2 năm trở lên kết hợp thuật toán tối ưu hóa bộ tham số độ đo tính mờ trong lộ trình 1 năm. Nhóm nghiên cứu Khoa học máy tính cần tiếp tục thử nghiệm mô hình trên các ngôn ngữ lập trình hiện đại để giảm thời gian xử lý và duy trì sai số dự báo trung hạn dưới 2.0%.

Thứ tư, tổ chức 2 khóa đào tạo và chuyển giao công nghệ ứng dụng tính toán mềm trong dự báo giáo dục cho 100% cán bộ làm công tác kế hoạch tài chính và tuyển sinh tại các cơ sở giáo dục nghề nghiệp và đại học trên địa bàn tỉnh Nam Định trước quý II năm tiếp theo. Chủ thể chủ trì là Sở Giáo dục và Đào tạo phối hợp cùng các chuyên gia công nghệ thông tin.

Đối tượng nên tham khảo luận văn

Công trình nghiên cứu mang giá trị học thuật và ứng dụng thực tiễn cao, đặc biệt hữu ích cho 4 nhóm đối tượng sau:

Nhóm thứ nhất là học viên cao học và nghiên cứu sinh chuyên ngành Khoa học máy tính, Công nghệ thông tin và Hệ thống thông tin. Tài liệu cung cấp cơ sở toán học chi tiết về Đại số gia tử, tập mờ và thuật toán giải mờ, là tài liệu tham khảo đắc lực cho các đề tài nghiên cứu về trí tuệ nhân tạo và tính toán mềm.

Nhóm thứ hai là lãnh đạo và cán bộ quản lý tuyển sinh tại các trường đại học, học viện và cao đẳng sư phạm trên toàn quốc. Luận văn cung cấp công cụ định lượng khoa học giúp xây dựng chiến lược tuyển sinh, dự báo nguồn thu học phí và phân bổ phòng học hiệu quả thay vì chỉ dựa vào kinh nghiệm định tính.

Nhóm thứ ba là các chuyên gia phân tích dữ liệu và kỹ sư học máy trong các lĩnh vực kinh tế, tài chính, chứng khoán và khí tượng. Mô hình dự báo mờ ĐSGT có thể được tùy biến để dự báo chỉ số giá, nhu cầu năng lượng hoặc lưu lượng giao thông với chuỗi dữ liệu phi tuyến.

Nhóm thứ tư là giảng viên giảng dạy các môn học Xử lý thông tin không chắc chắn, Logic mờ và Khai phá dữ liệu. Công trình đóng vai trò là một tình huống nghiên cứu điển hình với đầy đủ dữ liệu thực nghiệm 28 năm tại Việt Nam và 22 năm chuẩn quốc tế.

Câu hỏi thường gặp

Dưới đây là 5 câu hỏi thường gặp về mô hình dự báo chuỗi thời gian mờ dựa trên Đại số gia tử:

Thứ nhất, mô hình chuỗi thời gian mờ khác biệt như thế nào so với các mô hình thống kê ARIMA truyền thống? Chuỗi thời gian mờ không yêu cầu dữ liệu phải thỏa mãn điều kiện dừng hay phân phối chuẩn, có khả năng xử lý xuất sắc các tập dữ liệu ngắn và chứa đựng yếu tố định tính không rõ ràng thông qua các biến ngôn ngữ.

Thứ hai, tại sao Đại số gia tử lại mang lại độ chính xác cao hơn phương pháp mờ truyền thống? Đại số gia tử lượng hóa được cấu trúc ngữ nghĩa tự nhiên của ngôn ngữ nhờ hàm dấu và độ đo tính mờ, giúp phân chia các khoảng giải nghĩa linh hoạt thay vì chia đều cứng nhắc 7 khoảng như phương pháp của Song và Chen.

Thứ ba, sai số dự báo thực tế của mô hình trong luận văn đạt mức nào? Trên chuỗi dữ liệu 22 năm của Đại học Alabama, mô hình giúp kiểm soát sai số trung bình dưới mức 1.5% đến 2.0%, vượt trội hơn mức sai số 3.18% của các mô hình mờ cơ bản.

Thứ tư, phương pháp này có thể áp dụng cho các chuỗi thời gian biến động mạnh không? Hoàn toàn có thể, nghiên cứu thực nghiệm trên chuỗi 28 năm tại Trường Cao đẳng Sư phạm Nam Định từ 1990 đến 2017 cho thấy mô hình thích ứng rất tốt với các giai đoạn tăng giảm đột biến của thị trường giáo dục.

Thứ năm, rào cản lớn nhất khi triển khai mô hình là gì? Thách thức chính là việc xác định các tham số ban đầu của Đại số gia tử như độ đo tính mờ của phần tử sinh và gia tử, đòi hỏi người thực hiện phải có kiến thức nền tảng vững chắc về tính toán mềm.

Kết luận

Luận văn thạc sĩ của tác giả Lại Văn Lãm đã hoàn thành xuất sắc các mục tiêu nghiên cứu với 5 đóng góp học thuật và thực tiễn nổi bật:

  • Hệ thống hóa toàn diện cơ sở lý thuyết về tập mờ, chuỗi thời gian mờ và cấu trúc toán học của Đại số gia tử tuyến tính đầy đủ.
  • Phân tích và so sánh chi tiết ưu nhược điểm của hai mô hình dự báo mờ kinh điển là thuật toán Song & Chissom năm 1993 và thuật toán Chen năm 1996.
  • Xây dựng hoàn chỉnh mô hình tính toán và thuật toán dự báo chuỗi thời gian mờ dựa trên ánh xạ định lượng ngữ nghĩa của Đại số gia tử.
  • Kiểm nghiệm thành công tính ưu việt của mô hình trên tập dữ liệu chuẩn 22 năm từ năm 1971 đến năm 1992 của Đại học Alabama, đạt độ chính xác vượt trội.
  • Ứng dụng thực tế thành công trong bài toán dự báo quy mô tuyển sinh 28 năm từ năm 1990 đến năm 2017 tại Trường Cao đẳng Sư phạm Nam Định với độ tin cậy trên 95%.

Lộ trình phát triển tiếp theo trong 1 đến 2 năm tới là mở rộng mô hình sang chuỗi thời gian mờ đa biến bậc cao và tích hợp các thuật toán tối ưu hóa bầy đàn để tự động hóa việc chọn tham số gia tử. Quý độc giả, các nhà nghiên cứu và nhà quản lý giáo dục quan tâm có thể khai thác toàn văn luận văn để ứng dụng hiệu quả giải pháp tính toán mềm vào công tác quản trị và phân tích dữ liệu thực tiễn.