Tổng quan nghiên cứu

Trong sự phát triển mạnh mẽ của trí tuệ nhân tạo và học sâu, các mô hình toán học ngày càng đối mặt với khối lượng tính toán khổng lồ, trong đó giai đoạn tối ưu hóa hàm mất mát thường chiếm tới hơn 70% tổng thời gian huấn luyện. Thuật toán Gradient Descent truyền thống dựa trên đạo hàm cấp nguyên bậc 1 vốn là nền tảng cốt lõi trong các thư viện tiêu chuẩn. Tuy nhiên, đạo hàm cấp nguyên chỉ phản ánh tính chất vi phân cục bộ tại một điểm tức thời mà hoàn toàn bỏ qua lịch sử biến thiên và tính chất bộ nhớ dài hạn của quá trình tối ưu. Điều này khiến quá trình huấn luyện dễ rơi vào các điểm cực tiểu địa phương, dao động mạnh quanh điểm yên ngựa và làm chậm tốc độ hội tụ trên các không gian tham số phức tạp.

Vấn đề nghiên cứu trọng tâm của luận văn là mở rộng phép vi phân cổ điển sang giải tích cấp phân số nhằm tối ưu hóa thuật toán Gradient Descent trong học máy. Mục tiêu cụ thể là xây dựng khung toán học cho thuật toán Gradient Descent cấp phân số dựa trên định nghĩa Caputo, thiết lập cơ chế lan truyền ngược hỗn hợp cho mạng nơ-ron tích chập LeNet và giải quyết triệt để vấn đề điểm kỳ dị toán học khi cập nhật trọng số.

Nghiên cứu được tác giả Đặng Thu Hiền thực hiện dưới sự hướng dẫn của Tiến sĩ Đàm Thanh Phương tại Trường Đại học Công nghệ Thông tin và Truyền thông – Đại học Thái Nguyên vào năm 2022. Phạm vi thử nghiệm bao gồm các hàm mục tiêu đa biến kiểm thử lên đến 791 chiều và bộ dữ liệu ảnh chữ số viết tay chuẩn MNIST với 70.000 mẫu. Ý nghĩa học thuật và thực tiễn của công trình thể hiện qua việc chứng minh tính hội tụ về điểm cực trị thực sự, rút ngắn số vòng lặp tối ưu từ 20% đến 40%, đồng thời cải thiện độ chính xác phân loại tổng thể so với phương pháp Gradient Descent cấp nguyên truyền thống.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Cơ sở lý thuyết của luận văn được xây dựng trên hai trụ cột chính: Lý thuyết giải tích cấp phân số (Fractional Calculus) có lịch sử từ năm 1695 bởi Leibniz và Lý thuyết tối ưu hóa mô hình học sâu. Khung nghiên cứu tập trung so sánh 3 định nghĩa đạo hàm cấp phân số kinh điển: Riemann-Liouville, Grünwald-Letnikov và Caputo. Trong đó, định nghĩa Caputo bậc alpha (với alpha thuộc khoảng số thực từ 0 đến 2) được lựa chọn làm nền tảng vì đảm bảo đạo hàm của hằng số bằng 0, tạo điều kiện thuận lợi cho việc thiết lập các phương trình vi phân tham số trong học máy.

Mô hình nghiên cứu ứng dụng kiến trúc mạng nơ-ron tích chập chuẩn bao gồm chuỗi các tầng: Tầng tích chập (Convolutional Layer) trích xuất đặc trưng không gian đa chiều, Tầng kích hoạt phi tuyến (ReLU), Tầng tổng hợp (Max Pooling) giảm chiều dữ liệu và Tầng kết nối đầy đủ (Fully Connected Layer) phân phối xác suất qua hàm Softmax.

Bốn khái niệm then chốt được phát triển trong luận văn gồm:

  • Đạo hàm Caputo cấp phân số: Công thức vi phân tích phân cho phép tính toán mức độ biến thiên dựa trên bậc số thực alpha.
  • Tính chất bộ nhớ và di truyền (Memory and Hereditary Property): Khả năng lưu trữ thông tin về độ dốc quá khứ giúp điều hướng quỹ đạo tham số mượt mà hơn.
  • Quy tắc chuỗi hỗn hợp (Hybrid Chain Rule): Cơ chế duy trì đạo hàm cấp nguyên cho các bước chuyển tiếp giữa các tầng mạng nhằm khắc phục sự phức tạp khi tính đạo hàm hàm hợp cấp phân số.
  • Nhân tử chống kỳ dị delta: Đại lượng vô cùng bé dương được đưa vào mẫu số của luật cập nhật nhằm triệt tiêu hiện tượng chia cho 0 khi hai bước lặp liên tiếp có giá trị tham số trùng nhau.

Phương pháp nghiên cứu

Nghiên cứu sử dụng nguồn dữ liệu thực nghiệm gồm 2 nhóm chính. Nhóm 1 là các hàm kiểm thử toán học đa biến nhân tạo dạng lũy thừa bậc 2 với số chiều biến thiên từ 1 đến 791 chiều để đánh giá tính chất hội tụ giải tích. Nhóm 2 là bộ dữ liệu thực tế chuẩn quốc tế MNIST bao gồm 70.000 ảnh xám chữ số viết tay kích thước 28x28 pixels, được chia tách theo phương pháp lấy mẫu phân tầng với 60.000 ảnh cho tập huấn luyện (training set) và 10.000 ảnh cho tập kiểm tra (test set) trên 10 lớp chữ số từ 0 đến 9.

Phương pháp phân tích thực nghiệm được triển khai theo quy trình chia mini-batch với kích thước lô mẫu gồm 64 mẫu mỗi lượt huấn luyện. Lý do lựa chọn phương pháp phân tích lan truyền ngược lai (Hybrid Backpropagation) xuất phát từ rào cản toán học: đạo hàm cấp phân số không tuân theo quy tắc chuỗi thông thường (chain rule) của Leibniz một cách đơn giản. Việc áp dụng đạo hàm cấp 1 cho quá trình lan truyền tín hiệu lỗi giữa các tầng và chỉ áp dụng đạo hàm cấp phân số Caputo cho việc cập nhật trọng số và hệ số điều chỉnh bias tại nội bộ mỗi tầng giúp duy trì tính khả thi tính toán, kiểm soát tài nguyên bộ nhớ và đảm bảo chứng minh giải tích về tính hội tụ về nghiệm cực trị thực sự. Quá trình thực nghiệm được thực hiện và đo lường chi tiết trong vòng 100.000 lượt lặp tối đa.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thử nghiệm và phân tích định lượng trên các mô hình tối ưu đã mang lại những phát hiện quan trọng:

Thứ nhất, trên bài toán tối ưu hàm lồi một biến f(x) = (x - 3)^2 với bước học 0.1 và điểm khởi tạo x0 = 5, thuật toán Gradient Descent cấp phân số với bậc alpha = 0.2 và alpha = 0.4 đạt trạng thái hội tụ về nghiệm tối ưu x* = 3 chỉ sau khoảng 120 đến 180 vòng lặp với sai số dưới 0.0001, trong khi thuật toán cấp nguyên truyền thống (alpha = 1.0) cần hơn 850 vòng lặp để đạt độ chính xác tương đương.

Thứ hai, đối với hàm đa biến phức tạp g(x) gồm 791 tham số độc lập, thuật toán cấp phân số thể hiện khả năng giảm thiểu tích lũy sai số vượt trội. Khi thiết lập bậc alpha = 0.6 và ngưỡng dừng sai số 0.0001, thuật toán đạt mức sai số xấp xỉ 5.42 x 10^-4 với thời gian thực thi giảm khoảng 28% so với phương pháp Gradient Descent tiêu chuẩn. Khi nâng bậc alpha lên 1.3, thuật toán dừng ở số lần lặp tối đa 100.000 do hiện tượng dao động biên độ lớn, xác định khoảng tối ưu của alpha nằm trong vùng từ 0.2 đến 0.8.

Thứ ba, khi huấn luyện mạng nơ-ron tích chập LeNet trên 60.000 mẫu huấn luyện MNIST, mô hình áp dụng Gradient Descent cấp phân số với alpha = 0.6 đạt độ chính xác kiểm tra trung bình 98.42%, cao hơn 0.82% so với mức 97.60% của mạng LeNet sử dụng đạo hàm cấp 1 truyền thống.

Thứ tư, phương sai giá trị hàm mất mát qua các epoch huấn luyện khi sử dụng đạo hàm cấp phân số giảm khoảng 34.5% so với mô hình cơ sở. Hiện tượng mất mát giảm đột ngột và ổn định ngay từ 5 epoch đầu tiên, hạn chế tình trạng trồi sụt thất thường thường thấy ở các phương pháp học sâu cổ điển.

Thảo luận kết quả

Nguyên nhân căn bản giúp Gradient Descent cấp phân số vượt trội nằm ở nhân tử bậc phi nguyên (1 - alpha) kết hợp cùng hàm Gamma trong biểu thức vi phân Caputo. Thành phần này đóng vai trò tương tự như một hệ số quán tính thích nghi (adaptive dynamic momentum), tự động khuếch đại bước nhảy khi tham số ở xa cực trị và thu hẹp bước nhảy khi tiếp cận điểm tối ưu, từ đó vượt qua các vùng yên ngựa (saddle points) mà không bị kẹt lại.

So sánh với các công trình tối ưu hóa kinh điển của Rumelhart và các biến thể SGD hiện đại, phương pháp của luận văn đã giải quyết được nhược điểm hội tụ sai lệch điểm cực trị nhờ công thức hiệu chỉnh tham số chứa số gia delta dương.

Về mặt biểu diễn trực quan, các dữ liệu thực nghiệm được trình bày rõ nét thông qua:

  • Biểu đồ đường biểu diễn sự suy giảm của hàm mất mát theo số lượng epoch với 4 đường tham chiếu tương ứng với các giá trị alpha bằng 0.2, 0.6, 1.0 và 1.3, làm nổi bật đường cong dốc và êm nhất tại alpha = 0.6.
  • Bảng tổng hợp so sánh ma trận phương sai sai số và thời gian xử lý tính bằng mili-giây (ms) trên 791 biến số, minh chứng tính ổn định của giải thuật cấp phân số.

Đề xuất và khuyến nghị

Nhằm phát huy tối đa hiệu quả của đạo hàm cấp phân số trong học máy và tối ưu hóa tính toán, luận văn đưa ra 4 khuyến nghị hành động cụ thể:

Thứ nhất, tích hợp module tối ưu hóa Caputo Fractional Gradient Descent vào các thư viện học máy mã nguồn mở như PyTorch và TensorFlow. Mục tiêu giảm 20% thời gian hội tụ cho các mạng nơ-ron tích chập quy mô vừa, với lộ trình thực hiện 6 tháng do các nhóm kỹ sư phát triển framework AI đảm nhiệm.

Thứ hai, nghiên cứu phát triển cơ chế tự động điều chỉnh bậc đạo hàm alpha theo thời gian thực (Adaptive Fractional Order Tuning) trong suốt quá trình huấn luyện. Mục tiêu kiểm soát phương sai sai số kiểm tra dưới mức 0.005, hoàn thành trong 9 tháng do các chuyên gia nghiên cứu thuật toán tại các viện công nghệ chủ trì.

Thứ ba, mở rộng thử nghiệm giải thuật vi phân phân số trên các kiến trúc học sâu tiên tiến như Residual Networks (ResNet) và Vision Transformers trên các tập dữ liệu ảnh quy mô lớn trên 1.000.000 mẫu như ImageNet. Mục tiêu gia tăng độ chính xác phân loại từ 0.5% đến 1.5%, thời gian thực hiện 12 tháng tại các phòng thí nghiệm thị giác máy tính.

Thứ tư, xây dựng chương trình đào tạo chuyên đề và chuẩn hóa tài liệu giải tích cấp phân số ứng dụng trong khoa học dữ liệu cho ít nhất 500 giảng viên, học viên cao học và nghiên cứu sinh giai đoạn 2023 - 2025 do các trường đại học khối công nghệ thông tin phối hợp tổ chức.

Đối tượng nên tham khảo luận văn

Nội dung và kết quả nghiên cứu của luận văn mang lại giá trị thiết thực cho 4 nhóm đối tượng chính:

  1. Học viên cao học và nghiên cứu sinh ngành Khoa học máy tính, Toán tin ứng dụng: Cung cấp khung lý thuyết toán học chuẩn xác, phương pháp chứng minh giải tích về tính hội tụ nghiệm và hướng dẫn lập trình đạo hàm Caputo trong các bài toán tối ưu phi tuyến.
  2. Kỹ sư phát triển mô hình Machine Learning và Deep Learning: Khai thác thuật toán lan truyền ngược cấp phân số để tối ưu hóa thời gian huấn luyện mạng CNN, nâng cao tỷ lệ chính xác cho các bài toán phân loại hình ảnh và thị giác máy tính thực tế.
  3. Giảng viên và nhà nghiên cứu tại các viện, trường đại học: Sử dụng làm tài liệu tham khảo giảng dạy cho các học phần Tối ưu hóa nâng cao, Mạng nơ-ron nhân tạo và Giải tích số chuyên sâu.
  4. Chuyên gia tối ưu hóa hệ thống AI nhúng và thiết bị biên: Ứng dụng giải pháp cắt giảm số vòng lặp tối ưu để triển khai các mô hình phân loại gọn nhẹ trên phần cứng có tài nguyên bộ nhớ và năng lượng hạn chế.

Câu hỏi thường gặp

Đạo hàm cấp phân số Caputo khác biệt như thế nào so với đạo hàm cấp nguyên trong tối ưu hóa học máy? Đạo hàm cấp nguyên chỉ xác định tốc độ thay đổi tức thời tại một điểm đơn lẻ, trong khi đạo hàm Caputo bậc alpha tích hợp toàn bộ lịch sử biến thiên của hàm mục tiêu từ điểm khởi đầu. Đặc tính bộ nhớ này tạo ra lực quán tính tự nhiên, giúp thuật toán Gradient Descent duy trì phương hướng cập nhật ổn định và giảm hơn 30% số vòng lặp tối ưu trên các bài toán 791 chiều.

Tại sao luận văn lại kết hợp cả đạo hàm cấp nguyên và đạo hàm cấp phân số trong mạng CNN? Do đạo hàm cấp phân số không thỏa mãn quy tắc chuỗi Leibniz thông thường cho hàm hợp, việc áp dụng thuần túy cấp phân số qua nhiều tầng mạng sẽ dẫn đến bùng nổ khối lượng tính toán. Luận văn sử dụng giải pháp lai: dùng đạo hàm cấp 1 cho lan truyền tín hiệu giữa các tầng và đạo hàm Caputo cho cập nhật tham số nội bộ, vừa giữ vững tính khả thi vừa đảm bảo hội tụ chính xác.

Bậc đạo hàm alpha nào đem lại hiệu quả tối ưu nhất trong các thực nghiệm của luận văn? Qua các khảo sát thực nghiệm trên cả hàm kiểm thử đa biến và mạng LeNet với tập dữ liệu 70.000 mẫu MNIST, khoảng giá trị alpha từ 0.4 đến 0.8 mang lại tốc độ hội tụ nhanh nhất và sai số thấp nhất. Cụ thể, tại alpha = 0.6, mô hình đạt độ chính xác kiểm tra cao nhất 98.42% và phương sai suy giảm ổn định nhất.

Thuật toán có gặp hiện tượng chia cho 0 khi tham số ở hai bước lặp liên tiếp bằng nhau không? Hiện tượng kỳ dị này đã được luận văn giải quyết triệt để bằng cách bổ sung một số gia dương delta vô cùng bé vào biểu thức hiệu số giữa hai bước lặp kế tiếp. Nhờ đó, thuật toán loại bỏ hoàn toàn nguy cơ gián đoạn tính toán tại các vùng tham số phẳng mà vẫn bảo toàn tính hội tụ nghiêm ngặt về cực trị thực sự.

Thuật toán Gradient Descent cấp phân số có thể áp dụng cho các thuật toán học máy khác ngoài CNN không? Hoàn toàn có thể. Về mặt bản chất giải tích, thuật toán tối ưu cấp phân số có thể thay thế trực tiếp cho mọi thuật toán sử dụng Gradient Descent tiêu chuẩn như Hồi quy tuyến tính (Linear Regression), Hồi quy Logistic, Máy vector hỗ trợ (SVM cấp phân số) và Mạng nơ-ron nhiều tầng (MLP), giúp cải thiện tốc độ học từ 15% đến 30% trên nhiều dạng dữ liệu khác nhau.

Kết luận

  • Luận văn đã hệ thống hóa và làm sáng tỏ cơ sở toán học của giải tích cấp phân số, đặc biệt là định nghĩa đạo hàm Caputo trong bài toán tối ưu hóa.
  • Đề xuất thành công thuật toán Gradient Descent cấp phân số cải tiến với nhân tử ổn định delta, giải quyết triệt để điểm kỳ dị và chứng minh toán học tính hội tụ về nghiệm thực.
  • Thiết kế hoàn chỉnh quy trình lan truyền ngược lai (Hybrid Backpropagation) cho mạng nơ-ron tích chập LeNet, khắc phục hạn chế của quy tắc chuỗi vi phân phân số.
  • Đánh giá thực nghiệm toàn diện trên bài toán đa biến 791 chiều và tập dữ liệu MNIST với 70.000 mẫu, đạt độ chính xác 98.42% và giảm 34.5% phương sai hàm mất mát.
  • Khẳng định tính ưu việt của việc ứng dụng công cụ toán học phi nguyên để nâng cao năng lực tính toán và hiệu năng của các mô hình học sâu hiện đại.

Đóng góp lớn nhất của luận văn là mở ra hướng tiếp cận kết hợp chặt chẽ giữa giải tích hiện đại và trí tuệ nhân tạo, mang lại giải pháp tối ưu hóa hiệu quả cao cho các bài toán phân lớp dữ liệu phức tạp. Lộ trình phát triển tiếp theo trong 12 đến 24 tháng tới là mở rộng thuật toán sang các mô hình Transformer và học tăng cường. Các nhà nghiên cứu và kỹ sư công nghệ hãy cùng khám phá, ứng dụng và hoàn thiện mã nguồn giải thuật tối ưu cấp phân số nhằm thúc đẩy bước tiến mới trong công nghệ học máy.