Luận án tiến sĩ toán học lựa chọn biến số thành phần và ước lượng tham số bằng phương pháp vb cho các mô hình glmm và mrde mn

Luận án tiến sĩ toán học nghiên cứu lựa chọn biến số thành phần và ước lượng tham số bằng phương pháp VB cho mô hình GLMM và MRDE MN.

Trường đại học

Đại học Quốc gia Hà Nội

Người đăng

Ẩn danh

Thể loại

luận án tiến sĩ

2020

115
2
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

1. CHƯƠNG 1: KIẾN THỨC CHUẨN BỊ

1.1. Một số phân phối thường gặp

1.2. Họ mũ và Mô hình hồi quy tuyến tính tổng quát

1.3. Phương pháp Bayes biến phân

1.3.1. Cơ sở toán học

1.3.2. Trường hợp MFVB

1.3.3. Trường hợp FEFEVH

1.4. Một số thuật toán tối ưu sử dụng trong luận án

1.4.1. Thuật toán Newton - Raphson

1.4.2. Thuật toán xấp xỉ ngẫu nhiên cho FFVB

1.4.3. Thuật toán đạo hàm theo hướng

2. CHƯƠNG 2: LỰA CHỌN BIẾN VÀ ƯỚC LƯỢNG THAM SỐ BẰNG PHƯƠNG PHÁP VB CHO MÔ HÌNH GLMM

2.1. Giới thiệu chung

2.2. Phương pháp VB ước lượng mô hình hậu nghiệm

2.3. Phương pháp VB để chọn biến và ước lượng tham số cho GLMM

2.3.1. Phân phối hậu nghiệm tối ưu VB cho đ

2.3.2. Phân phối hậu nghiệm tối ưu VB cho b

2.3.3. Phân phối hậu nghiệm tối ưu VB cho Q_

2.3.4. Phân phối hậu nghiệm tối ưu VB cho À

2.3.5. Phân phối hậu nghiệm tối ưu VB cho @

2.3.6. Lựa chọn các siêu tham số

2.4. Nghiên cứu mô phỏng

2.5. Ứng dụng trên dữ liệu thực

3. CHƯƠNG 3: LỰA CHỌN BIẾN, SỐ THÀNH PHẦN VÀ ƯỚC LƯỢNG THAM SỐ BẰNG PHƯƠNG PHÁP VB CHO MÔ HÌNH MRDE-MN

3.1. Giới thiệu chung

3.2. Mô hình MRDE-MN

3.2.1. Phân phối hậu nghiệm tối ưu VB cho B

3.2.2. Phân phối hậu nghiệm tối ưu VB cho T7y

3.2.3. Phân phối hậu nghiệm tối ưu VB cho g„

3.2.4. Phân phối hậu nghiệm tối ưu VB của +y

3.2.6. Thuật toán VB cho mô hình MRDE-MN

3.3. Lựa chọn số thành phần

3.4. Lựa chọn biến

3.4.1. Mô hình tiên nghiệm

3.4.2. Lựa chọn biến cho mean model

3.4.3. Lựa chọn biến cho gating model

3.4.4. Thuật toán đầy đủ

3.5. Nghiên cứu mô phỏng

3.6. Ứng dụng trên dữ liệu thực HILDA

MỞ ĐẦU

KẾT LUẬN VÀ KIẾN NGHỊ

4.1. Kết luận

4.2. Kiến nghị về những nghiên cứu tiếp theo

DANH MỤC CÔNG TRÌNH KHOA HỌC CỦA TÁC GIẢ LIÊN QUAN ĐẾN LUẬN ÁN

DANH SÁCH HÌNH VẼ

DANH SÁCH BẢNG

BẢNG KÝ HIỆU VÀ VIẾT TẮT

Tóm tắt

I. Tổng quan về phương pháp VB ước lượng tham số trong GLMM

Phương pháp VB (Variational Bayes) đã trở thành một công cụ quan trọng trong việc ước lượng tham số cho các mô hình GLMM (Generalized Linear Mixed Models). Phương pháp này cho phép ước lượng các tham số một cách hiệu quả, đặc biệt trong các tình huống mà các phương pháp truyền thống gặp khó khăn. Việc áp dụng phương pháp VB giúp cải thiện độ chính xác và tính khả thi của các mô hình thống kê phức tạp.

1.1. Giới thiệu về mô hình GLMM và ứng dụng

Mô hình GLMM được sử dụng rộng rãi trong phân tích dữ liệu có cấu trúc phức tạp. Chúng cho phép kết hợp các yếu tố cố định và ngẫu nhiên, giúp mô hình hóa các mối quan hệ phức tạp trong dữ liệu. Việc hiểu rõ về mô hình này là cần thiết để áp dụng phương pháp VB một cách hiệu quả.

1.2. Lợi ích của phương pháp VB trong ước lượng tham số

Phương pháp VB cung cấp một cách tiếp cận linh hoạt và hiệu quả để ước lượng tham số trong GLMM. Nó cho phép xử lý các mô hình lớn với nhiều biến mà không gặp phải các vấn đề tính toán phức tạp như trong các phương pháp truyền thống.

II. Thách thức trong lựa chọn biến số thành phần cho mô hình MRDE MN

Lựa chọn biến số thành phần trong mô hình MRDE MN (Multivariate Regression Density Estimation with Mixtures of Normals) là một nhiệm vụ khó khăn. Các thách thức này bao gồm việc xác định số lượng biến cần thiết và đảm bảo rằng các biến được chọn có ảnh hưởng đáng kể đến kết quả mô hình. Việc lựa chọn không chính xác có thể dẫn đến kết quả sai lệch và giảm độ tin cậy của mô hình.

2.1. Các vấn đề thường gặp trong lựa chọn biến

Một số vấn đề phổ biến trong lựa chọn biến bao gồm việc xác định các biến không cần thiết và các biến có tương quan cao. Điều này có thể dẫn đến hiện tượng đa cộng tuyến, làm giảm độ chính xác của mô hình.

2.2. Giải pháp cho vấn đề lựa chọn biến trong MRDE MN

Sử dụng các tiêu chuẩn như AIC và BIC có thể giúp xác định số lượng biến cần thiết cho mô hình. Ngoài ra, các phương pháp như phương pháp Bayes biến phân cũng có thể được áp dụng để cải thiện quá trình lựa chọn biến.

III. Phương pháp VB trong lựa chọn biến cho mô hình GLMM

Phương pháp VB không chỉ được sử dụng để ước lượng tham số mà còn có thể áp dụng trong việc lựa chọn biến cho mô hình GLMM. Việc sử dụng phương pháp này giúp tối ưu hóa quá trình lựa chọn biến, đảm bảo rằng các biến được chọn có ảnh hưởng lớn nhất đến mô hình.

3.1. Cách thức hoạt động của phương pháp VB trong lựa chọn biến

Phương pháp VB sử dụng các phân phối hậu nghiệm để xác định các biến quan trọng. Điều này cho phép nhà nghiên cứu có cái nhìn rõ ràng hơn về ảnh hưởng của từng biến đến kết quả mô hình.

3.2. Kết quả nghiên cứu từ ứng dụng phương pháp VB

Nghiên cứu cho thấy rằng việc áp dụng phương pháp VB trong lựa chọn biến cho mô hình GLMM đã mang lại kết quả khả quan, giúp cải thiện độ chính xác và tính khả thi của mô hình.

IV. Ứng dụng thực tiễn của phương pháp VB trong phân tích dữ liệu

Phương pháp VB đã được áp dụng thành công trong nhiều lĩnh vực khác nhau, từ y tế đến kinh tế. Việc sử dụng phương pháp này giúp các nhà nghiên cứu có thể xử lý các tập dữ liệu lớn và phức tạp một cách hiệu quả.

4.1. Ví dụ ứng dụng trong lĩnh vực y tế

Trong lĩnh vực y tế, phương pháp VB đã được sử dụng để phân tích dữ liệu bệnh nhân, giúp xác định các yếu tố ảnh hưởng đến sức khỏe và điều trị hiệu quả hơn.

4.2. Ứng dụng trong nghiên cứu kinh tế

Phương pháp VB cũng đã được áp dụng trong nghiên cứu kinh tế để phân tích các yếu tố ảnh hưởng đến tăng trưởng kinh tế, từ đó đưa ra các chính sách phù hợp.

V. Kết luận và triển vọng tương lai của phương pháp VB

Phương pháp VB đã chứng minh được giá trị của mình trong việc ước lượng tham số và lựa chọn biến cho các mô hình phức tạp. Tương lai của phương pháp này hứa hẹn sẽ còn nhiều tiềm năng phát triển, đặc biệt trong bối cảnh dữ liệu ngày càng lớn và phức tạp.

5.1. Tương lai của phương pháp VB trong nghiên cứu

Với sự phát triển không ngừng của công nghệ và khoa học dữ liệu, phương pháp VB sẽ tiếp tục được cải tiến và mở rộng ứng dụng trong nhiều lĩnh vực khác nhau.

5.2. Những thách thức cần vượt qua

Mặc dù phương pháp VB đã đạt được nhiều thành công, nhưng vẫn còn nhiều thách thức cần phải giải quyết, đặc biệt là trong việc tối ưu hóa các thuật toán và cải thiện độ chính xác của các ước lượng.

21/02/2025
Luận án tiến sĩ toán học lựa chọn biến số thành phần và ước lượng tham số bằng phương pháp vb cho các mô hình glmm và mrde mn

Trích đoạn nội dung tài liệu

MỞ ĐẦU Lựa chọn mô hình là một bài toán cơ bản trong thống kê cũng như trong nhiều lĩnh vực khoa học khác. Fisher, có ba khía cạnh của một bài toán tổng quát về suy luận thống kê và dự báo: (1) mô tả và xây dựng mô hình, (2) ước lượng các tham số mô hình, và (3) ước tính độ chính xác. Về cơ bản, bài toán lựa chọn mô hình liên quan đến yếu tố (1) và (3) ở trên. Mục tiêu quan trọng trong phân tích dữ liệu là hiểu cấu trúc cơ bản trong dữ liệu.

Giả sử rằng chúng ta được cho một tập hợp các mô hình phan ánh một loạt các cấu trúc tiềm năng trong dữ liệu và nhiệm vụ là chọn trong số đó một mô hình giải thích tốt nhất hoặc phù hợp nhất với dữ liệu. Giả sử tập dữ liệu D = {(a1, 1), (22, 9a),., (an, Yn)} được rút ra từ một mối quan hệ hàm U= firue (x) + nhiéu van đề là ta không biết biểu thức toán học của ham fire, nó như một hộp den, biến đổi x thành y và có sự tác động của nhiễu. Tìm hiểu về firye chính là tìm hiểu về cơ chế sinh ra dit liệu y khi có x. Thông thường, ta không thể xác định được chính xác ƒ„„¿ mà cần chon trong một lớp hàm F, nào đó một hàm f, phan ánh tốt nhất mối quan hệ của theo x hay giải thích được y nhiều nhất theo một tiêu chuẩn nào đó.

Lớp hàm để chọn f, được hiểu là một lớp mô hình. Chỉ số "c" trong ký hiệu Z, ngụ ý tính phức tạp của lớp ham (c viết tắt của chữ "complexity"). Việc chọn hàm f, như vay là lựa chọn mô hình, bao gồm các van đề lựa chọn biến, ước lượng tham số của mô hình và đánh giá f, là tốt nhất A 2 ` Z theo tiêu chuẩn nào đó. Trước khi nhà phân tích dit liệu tiến hành lựa chọn một mô hình, ho cần phải biết tiêu chuẩn thế nào là một mô hình tốt.

Noi cách khác, mục tiêu của bài toán lựa chọn mô hình cần phải được xác định rõ ràng. Các mục tiêu khác nhau có thể dan đến các mô hình khác nhau. Các dạng mô hình F, cũng cần được xác định trước, với c thuộc một tập hợp C nào đó. Lua chon mô hình sẽ là lựa chọn một chỉ số e € C tốt nhất.

Với e được lựa chọn đó, ký hiệu ƒÿ € F là hàm hồi quy tốt nhất xấp xỉ ƒ¡„„¿. Có rất nhiều phương pháp lựa chọn mô hình nổi tiếng như phương pháp hợp lý cực đại phạt, phương pháp Bayes, phương pháp thực nghiệm. Để ước lượng tham số của mô hình có thể sử dụng phương pháp bình phương tối thiểu (Least Squares: LS) hoặc phương pháp hợp lý cực dai (Maximum Likelihood: ML). Giả sử D có phân phối mẫu là P(D|ƒ) thường gọi là hàm hợp ly.

Dé ước lượng tham số của mô hình, phương pháp ML sẽ chọn fe = arg max Ip ax P(D|f). (D\f) Chang hạn xét mô hình hồi quy tuyến tính thong thường y = 6X +e, khi đó F, là lớp hàm tuyến tính hay mô hình hồi quy tuyến tính của X với e biến độc lập. Khi đó fs = ƒ°(8) trong đó ô là ước lượng hợp lý cực đại của đ. Đối với việc chọn mô hình thì phương pháp hợp lý cực đại phạt (Penalized Maximum Likelihood: PML) chon ê = arg min{—logP(D|f%) + pen(Z.

l6 Đại lượng —logP(D|fS) + pen(Z¿) được xem là tiêu chuẩn để chọn lựa mô hình, số hạng phạt pen(F,) phụ thuộc vào cách tiếp cận được dùng. Trong tiêu chuẩn AIC thì pen(Z,) = e, hoặc tiêu chuẩn BIC thì pen(F,) = c®8" trong đó e là số tham số tự do của mô hình. Trong thực hành, hai tiêu chuẩn AIC và BIC là các tiêu chuẩn thông dụng nhất được sử dụng để lựa chọn mô hình. Trong nhiều trường hợp, chúng dễ dàng sử dụng và mang lại kết quả tốt.

Một số phiên bản mở rộng của AIC cũng đã được đề xuất trong [6]. Lóp phương pháp lựa chọn mô hình thứ hai là các phương phấp lựa chon mô hình Bayes (Bayesian Model Selection: BMS), các phương pháp này tổ ra rất hiệu quả và ngày càng được sử dụng nhiều. Thông thường, BMS bao gồm việc xây dựng một công thức Bayes phân cấp và sử dụng phương pháp MCMC hoặc một số thuật toán tính toán khác để ước lượng xác suất hậu nghiệm của mô hình. Mô hình có xác suất hậu nghiệm cao nhất sẽ được chọn.

Với một lớp mô hình M, giả sử chúng ta có niềm tin nào đó về phân phối tiên nghiệm p(M), trong trường hợp không có thông tin gì thì có thể chọn p(M) có phân phối đều. Theo quy tắc Bayes, ta có p(DỊM)p(M) p(M|D) = PT mô hình được chọn là mô hình có xác suất hậu nghiệm cao nhất, nghĩa là Mup = arg max p(M|D). Su mở rong BMS được giới thiệu trong [22], [29] va [34]. BMS đã được mở rộng bằng cách xây dựng mô hình Bayes phân cấp với các biến tiềm an được sử dụng để xác định việc chọn tập con các biến.

Bằng cách này, sẽ tránh được việc tính xác suất hậu nghiệm của 2? tập con, trong đó p là số lượng tất cả các biến độc lập có thể đưa vào mô hình hồi quy. Một lớp các phương pháp lựa chọn mô hình khác được ứng dụng rộng rãi trong thực tế là các phương pháp thực nghiệm như bootstrap của Efron và Tibshirani [14], kiểm tra chéo (cross-validation) và các biến thể của nó trong [1], [LO], [16] và [37]: Các phương pháp này thường dựa trên một bộ dữ liệu kiểm tra 7“ được sử dụng để chọn c sao cho ƒÿ có sai số nhỏ nhất trên D’. Thông thường 7 được cắt ra hoặc lấy lại từ 2. Nghia là họ sử dụng D để ước lượng các tham số cho 3 từng mô hình sau đó sẽ chọn mô hình nào có sai số nhỏ nhất trên D’.

Các tiêu chuẩn thực nghiệm dễ hiểu và dễ sử dụng, nhưng độ chính xác sẽ giảm khi kích thước mẫu giảm, có thể là một van đề nghiêm trọng nếu cỡ mẫu ø nhỏ. Ngoài ra, chúng đôi khi tốn thời gian, đặc biệt là trong các trường hợp nhiều biến và phức tạp. Cùng với sự phát triển của khoa học và công nghệ, nhu cầu thực hiện các bài toán lớn và phức tạp ngày càng được nâng cao, đòi hỏi cần phải phát triển những thuật toán nhanh phù hợp với các bài toán đó. Phương pháp Bayes biến phân ra đời nhằm giải quyết nhu cầu thiết yếu đó.

Phương pháp ước lượng hợp lý cực đại là một trong những phương pháp phổ biến được sử dụng để xử lý các bài toán thống kê hiện đại. Thuật toán tối đa hóa kỳ vọng (Expectation Maximization: EM), là một thuật toán lặp đệ quy để ước lượng ML, có một số lợi thế và đã trở thành một phương pháp tiêu chuẩn để giải quyết các van đề xử lý thống kê. Tuy nhiên, thuật toán EM chứa đựng những yêu cầu làm hạn chế khả năng ứng dụng của nó trong những bài toán phức tạp. Gần đây, phương pháp Bayes biến phân (Variational Bayes: VB) đã xuất hiện giải quyết một số yêu cầu hạn chế của thuật toán EM và đang được phát triển và ứng dụng rộng rãi từ giữa những năm 1990.

Hơn nữa, người ta đã chỉ ra rằng thuật toán EM là một trường hợp đặc biệt của thuật toán VB. Trong nhiều trường hợp ta đã biết dạng mô hình hoặc đã xác định được cấu trúc của mô hình. Khi đó vấn đề cần quan tâm là chọn biến cho mô hình. Lựa chọn biến là bài toán cơ bản nhất trong thống kê và các lĩnh vực liên quan như học máy và kinh tế lượng.

Nó là trường hợp đặc biệt (nhưng thông dụng nhất) của bài toán lựa chon mô hình. Giả sử Y là biến được quan tâm và X\, Xa,., Xp là tập các biến độc lập có thể giải thích hay dự đoán Y. Vấn đề đặt ra là cần chọn lựa các biến quan trọng, tức là lựa chọn một tập con từ p biến đó, có ảnh hưởng nhất đến Y để đưa ra mô hình biểu diễn tốt nhất mối quan hệ giữa Y và các biến được chọn. Bài toán lựa chọn biến là bài toán quen thuộc trong ngữ cảnh hồi quy tuyến tính thông thường.

Ký hiệu + là vector các chỉ số các tập con của p biến Xy, Xa,., Xp tức là + = (ñ,í2,.,í„) trong đó i; = 1 nếu biến X; được chọn, i; = 0 nếu ngược lại. Ký hiệu q, là số các biến được chon trong tập con +, tức là d;=33;—¡¡;- Ta cần chọn tập con phù hợp nhất với mô hình có dạng Y= X,B8,+€ trong đó X, là ma trận cỡ n x qy có các cột là các biến được chọn ứng với các thành phần có giá trị bằng 1 của vector 7, 3, là vector hệ số hồi quy q,-chiéu và c~ W„(0;ø?]). Khi hàm mật độ có điều kiện p(/|+) không có phân phối chuẩn nhưng vẫn thuộc họ phân phối mũ (chẳng hạn như phân phối nhị thức, Possion) thì khi đó mô hình hồi quy tuyến tính thông thường được mở rộng thành mô hình hồi quy tuyến tính tổng quát (Generalized Linear Models: GLMs). Một mô hình GLM sẽ bao gồm ba thành phần như sau: 1.

Hàm mật độ có điều kiện p(z|z) thuộc họ phân phối mũ có dạng ƒ(w|8) = exp Ñ — +4 ci) ; 2. Thanh phan dự báo tuyến tính ạ= Xổ. Hàm liên kết ø(-) sao cho Ey=p=g~1(n). Trong thực tế có nhiều tình huống không phù hợp với mô hình hồi quy tuyến tính thông thường mà phải sử dụng mô hình khác tổng quát hơn.

Chẳng hạn, khi nghiên cứu trên ø bệnh nhân ung thư, bệnh nhân thứ i được theo dõi khảo sát n¡ lần tại các thời điểm khác nhau. Trong trường hợp này, các bệnh nhân là độc lập với nhau còn các kết quả khảo sát được trên mỗi bệnh nhân lại phụ thuộc nhau. Vì vậy không thể sử dụng mô hình hồi quy tuyến tính thông thường được mà cần sử dụng các mô hình hồi quy tuyến tính hỗn hợp tổng quát (Generalized b Linear Mixed Model: GUMM), còn gọi là mô hình hồi quy tuyến tính hỗn hợp tổng quát với yếu tố ảnh hưởng ngẫu nhiên hoặc mô hình dữ liệu theo dõi lặp lại. Mô hình hồi quy tuyến tính hỗn hợp tổng quát cũng là một mở rộng từ mô hình tuyến tính tổng quát, trong đó thành phần dự báo tuyến tính chứa các ảnh hưởng ngẫu nhiên (hay ảnh hưởng mang tính cá thể) ngoài các ảnh hưởng cố định thông thường (hay ảnh hưởng mang tính tổng thể).

Nghĩa là 7 = X + Zb trong đó b = (bị,.,bạ)“ là vector yếu tố ảnh hưởng ngẫu nhiên, đối tượng thứ i được đặc trưng bởi b; với i = 1,.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Phương Pháp VB Ước Lượng Tham Số và Lựa Chọn Biến Số Thành Phần Trong Mô Hình GLMM và MRDE MN là một tài liệu chuyên sâu tập trung vào việc ước lượng tham số và lựa chọn biến số trong các mô hình GLMM (Generalized Linear Mixed Models) và MRDE MN (Multivariate Random Effects Models). Tài liệu này cung cấp các phương pháp tiên tiến, giúp người đọc hiểu rõ cách tối ưu hóa mô hình thống kê, cải thiện độ chính xác trong dự đoán và phân tích dữ liệu. Đặc biệt, nó nhấn mạnh vào việc sử dụng phương pháp VB (Variational Bayes) để đơn giản hóa quá trình tính toán phức tạp, mang lại hiệu quả cao trong các nghiên cứu ứng dụng.

Để mở rộng kiến thức về các phương pháp toán học và ứng dụng thống kê, bạn có thể tham khảo thêm Luận văn thạc sĩ toán ứng dụng nghiên cứu phương pháp lặp để tính giá trị của toán tử không bị chặn, nơi trình bày chi tiết về các kỹ thuật lặp trong toán học. Ngoài ra, Luận văn thạc sĩ khoa học hệ động lực ngẫu nhiên trên thang thời gian cung cấp cái nhìn sâu sắc về các mô hình động lực ngẫu nhiên, một chủ đề liên quan chặt chẽ đến GLMM. Cuối cùng, Luận văn thạc sĩ xây dựng không gian lp cho đại số toán tử sẽ giúp bạn hiểu rõ hơn về cấu trúc không gian toán tử, một yếu tố quan trọng trong phân tích thống kê.