Giáo trình phân tích hồi quy ứng dụng và mô hình tuyến tính tổng quát - John Fox

Phân tích hồi quy và mô hình tuyến tính tổng quát. Tìm hiểu ứng dụng thực tiễn, phương pháp tính toán, và cách sử dụng trong phân tích dữ liệu hiện đại.

Trường đại học

McMaster University

Chuyên ngành

Thống kê

Tác giả

Ẩn danh

Người đăng

Ẩn danh

Thể loại

Sách giáo khoa

2016

817
1
0

Phí lưu trữ

135 Point

Mục lục chi tiết

Lời nói đầu

Về tác giả

1. Chương 1: Mô hình thống kê và khoa học xã hội

1.1. Mô hình thống kê và thực tế xã hội

1.2. Quan sát và thực nghiệm

1.3. Tổng thể và mẫu

1.4. Bài tập

1.5. Tóm tắt

1.6. Tài liệu đọc thêm đề xuất

2. Chương 2: Phân tích hồi quy là gì?

2.1. Hồi quy phi tham số ngây thơ

2.2. Lấy trung bình cục bộ

2.3. Bài tập

2.4. Tóm tắt

3. Chương 3: Khảo sát và biểu diễn đồ thị dữ liệu

3.1. Ước lượng mật độ phi tham số

3.2. Đồ thị so sánh phân vị

3.3. Biểu diễn đồ thị dữ liệu hai biến

3.4. Biểu diễn đồ thị dữ liệu đa biến

3.4.1. Biểu đồ phân tán ba chiều

3.4.2. Đồ thị điều kiện

3.5. Bài tập

3.6. Tóm tắt

3.7. Tài liệu đọc thêm đề xuất

4. Chương 4: Biến đổi dữ liệu

4.1. Họ hàm lũy thừa và căn bậc

4.2. Biến đổi độ phân tán không đồng nhất

4.3. Ước lượng các phép biến đổi dưới dạng tham số*

4.4. Bài tập

4.5. Tóm tắt

4.6. Tài liệu đọc thêm đề xuất

5. Chương 5: Hồi quy bình phương tối thiểu tuyến tính

5.1. Khớp mô hình bình phương tối thiểu

5.1.1. Hai biến giải thích

5.1.2. Nhiều biến giải thích

5.2. Hệ số hồi quy chuẩn hóa

5.3. Bài tập

5.4. Tóm tắt

6. Chương 6: Suy luận thống kê cho hồi quy

6.1. Mô hình hồi quy đơn

6.1.1. Tính chất của ước lượng bình phương tối thiểu

6.1.2. Khoảng tin cậy và kiểm định giả thuyết

6.2. Mô hình hồi quy bội

6.2.1. Khoảng tin cậy và kiểm định giả thuyết

6.2.2. Mối quan hệ thực nghiệm và cấu trúc

6.2.3. Sai số đo lường trong các biến giải thích*

6.3. Bài tập

6.4. Tóm tắt

7. Chương 7: Hồi quy với biến giả

7.1. Chuẩn phương sai của hệ số*

7.2. Xây dựng các biến tương tác

7.2.1. Nguyên lý biên

7.2.2. Tương tác với các yếu tố nhiều mức

7.2.3. Giải thích mô hình hồi quy biến giả có tương tác

7.2.4. Kiểm định giả thuyết cho tác động chính và tương tác

7.3. Lưu ý liên quan đến các hệ số chuẩn hóa

7.4. Bài tập

7.5. Tóm tắt

8. Chương 8: Phân tích phương sai

8.1. Phân tích phương sai một yếu tố

8.1.1. Ví dụ: Dữ liệu Duncan về uy tín nghề nghiệp

8.1.2. Mô hình ANOVA một yếu tố

8.2. Phân tích phương sai hai yếu tố

8.2.1. Dạng giá trị trung bình trong phân loại hai yếu tố

8.2.2. ANOVA hai yếu tố bằng hồi quy biến giả

8.2.3. Mô hình ANOVA hai yếu tố

8.2.4. Khớp mô hình ANOVA hai yếu tố vào dữ liệu

8.2.5. Kiểm định giả thuyết trong ANOVA hai yếu tố

8.2.6. Tần số ô bằng nhau

8.2.7. Một số lưu ý cảnh báo

8.3. Phân tích phương sai nhiều yếu tố bậc cao

8.3.1. Phân loại ba yếu tố

8.3.2. Các phân loại bậc cao hơn

8.3.3. Các ô rỗng trong ANOVA

8.4. Phân tích hiệp phương sai

8.5. Tương phản tuyến tính của các giá trị trung bình

8.6. Bài tập

8.7. Tóm tắt

9. Chương 9: Lý thuyết thống kê cho các mô hình tuyến tính*

9.1. Mô hình tuyến tính dưới dạng ma trận

9.1.1. Hồi quy biến giả và phân tích phương sai

9.2. Khớp bình phương tối thiểu

9.2.1. Tham số hóa hạng thiếu của mô hình tuyến tính

9.3. Tính chất của ước lượng bình phương tối thiểu

9.3.1. Phân phối của ước lượng bình phương tối thiểu

9.3.2. Định lý Gauss-Markov

9.3.3. Ước lượng hợp lý cực đại

9.4. Suy luận thống kê cho các mô hình tuyến tính

9.4.1. Suy luận cho các hệ số riêng lẻ

9.4.2. Suy luận cho nhiều hệ số

9.4.3. Giả thuyết tuyến tính tổng quát

9.4.4. Vùng tin cậy đồng thời

9.5. Mô hình tuyến tính đa biến

9.6. Biến công cụ và bình phương tối thiểu hai giai đoạn

9.6.1. Ước lượng biến công cụ trong hồi quy đơn

9.6.2. Ước lượng biến công cụ trong hồi quy bội

9.6.3. Bình phương tối thiểu hai giai đoạn

9.7. Bài tập

9.8. Tóm tắt

9.9. Tài liệu đọc thêm đề xuất

10. Chương 10: Hình học vector của các mô hình tuyến tính*

10.1. Các biến ở dạng độ lệch trung bình

10.2. Bậc tự do

10.3. Ước lượng phương sai sai số

10.4. Các mô hình phân tích phương sai

10.5. Bài tập

10.6. Tóm tắt

10.7. Tài liệu đọc thêm đề xuất

11. Chương 11: Dữ liệu bất thường và có ảnh hưởng lớn

11.1. Điểm ngoại lai, đòn bẩy và ảnh hưởng

11.2. Đánh giá đòn bẩy: Giá trị Hat

11.3. Phát hiện điểm ngoại lai: Phần dư chuẩn hóa Student

11.3.1. Kiểm định điểm ngoại lai trong mô hình tuyến tính

11.3.2. Phép loại suy bảo hiểm của Anscombe

11.4. Ảnh hưởng đến sai số chuẩn

11.4.1. Ảnh hưởng đến hiện tượng cộng tuyến

11.5. Các ngưỡng số cho thống kê chẩn đoán

11.6. Các thước đo ảnh hưởng

11.6.1. Đồ thị biến bổ sung

11.7. Có nên loại bỏ dữ liệu bất thường không?

11.8. Một số chi tiết thống kê*

11.8.1. Giá trị Hat và ma trận Hat

11.8.2. Phân phối của các phần dư bình phương tối thiểu

11.8.3. Đồ thị biến bổ sung và đồ thị đòn bẩy

11.9. Bài tập

11.10. Tóm tắt

11.11. Tài liệu đọc thêm đề xuất

12. Chương 12: Chẩn đoán tính không chuẩn, phương sai sai số không đồng nhất và tính phi tuyến

12.1. Sai số không tuân theo phân phối chuẩn

12.1.1. Bao tin cậy bằng phương pháp lấy mẫu mô phỏng*

12.2. Phương sai sai số không đồng nhất

12.2.1. Ước lượng bình phương tối thiểu có trọng số*

12.2.2. Hiệu chỉnh sai số chuẩn OLS cho phương sai không đồng nhất*

12.2.3. Phương sai sai số không đồng nhất ảnh hưởng thế nào đến ước lượng OLS*

12.3. Đồ thị thành phần cộng phần dư

12.3.1. Đồ thị thành phần cộng phần dư cho các mô hình có tương tác

12.3.2. Khi nào đồ thị thành phần cộng phần dư hoạt động hiệu quả?

12.4. Kiểm định tính phi tuyến ("Thiếu độ khớp")

12.4.1. Kiểm định phương sai sai số không đồng nhất

12.5. Các phương pháp hợp lý cực đại*

12.5.1. Biến đổi Box-Cox cho biến Y

12.5.2. Biến đổi Box-Tidwell cho các biến X

12.5.3. Xem lại phương sai sai số không đồng nhất

12.6. Chiều cấu trúc

12.7. Bài tập

12.8. Tóm tắt

12.9. Tài liệu đọc thêm đề xuất

13. Chương 13: Đa cộng tuyến và các biện pháp khắc phục được đề xuất

13.1. Hệ số phóng đại phương sai tổng quát*

13.2. Đối phó với cộng tuyến: Không có giải pháp nhanh chóng

13.3. Thông tin tiên nghiệm về các hệ số hồi quy

13.4. Một số so sánh

13.5. Bài tập

13.6. Tóm tắt

14. Chương 14: Mô hình Logit và Probit cho biến phản hồi phân loại

14.1. Mô hình cho dữ liệu nhị phân

14.1.1. Mô hình xác suất tuyến tính

14.1.2. Các phép biến đổi của p: Mô hình Logit và Probit

14.1.3. Công thức biến tiềm ẩn

14.1.4. Mô hình Logit và Probit cho hồi quy bội

14.1.5. Ước lượng mô hình Logit tuyến tính*

14.2. Mô hình cho dữ liệu nhiều mức

14.2.1. Mô hình Logit nhiều mức

14.2.2. Mô hình Logit và Probit thứ bậc

14.2.3. So sánh ba cách tiếp cận

14.3. Các biến giải thích rời rạc và bảng chéo

14.3.1. Mô hình Logit nhị thức*

14.4. Bài tập

14.5. Tóm tắt

14.6. Tài liệu đọc thêm đề xuất

15. Chương 15: Các mô hình tuyến tính tổng quát

15.1. Cấu trúc của các mô hình tuyến tính tổng quát

15.1.1. Ước lượng và kiểm định GLM

15.2. Mô hình tuyến tính tổng quát cho dữ liệu đếm

15.2.1. Mô hình cho dữ liệu đếm quá phân tán

15.2.2. Mô hình log-tuyến tính cho bảng chéo

15.3. Lý thuyết thống kê cho các mô hình tuyến tính tổng quát*

15.3.1. Ước lượng hợp lý cực đại của mô hình tuyến tính tổng quát

15.4. Chẩn đoán cho các mô hình tuyến tính tổng quát

15.4.1. Chẩn đoán điểm ngoại lai, đòn bẩy và ảnh hưởng

15.5. Phân tích dữ liệu từ các cuộc điều tra mẫu phức tạp

15.6. Bài tập

15.7. Tóm tắt

15.8. Tài liệu đọc thêm đề xuất

16. Chương 16: Hồi quy chuỗi thời gian và bình phương tối thiểu tổng quát*

16.1. Ước lượng bình phương tối thiểu tổng quát

16.2. Sai số tự tương quan theo chuỗi

16.2.1. Quá trình tự hồi quy bậc nhất

16.2.2. Các quá trình tự hồi quy bậc cao hơn

16.2.3. Quá trình trung bình trượt và tự hồi quy trung bình trượt

16.3. Ước lượng GLS với các sai số tự tương quan

16.3.1. Ước lượng GLS thực nghiệm

16.3.2. Ước lượng hợp lý cực đại

16.4. Hiệu chỉnh suy luận OLS cho sai số tự tương quan

16.5. Chẩn đoán các sai số tự tương quan theo chuỗi

16.6. Lời kết

16.7. Bài tập

16.8. Tóm tắt

16.9. Tài liệu đọc thêm đề xuất

17. Chương 17: Hồi quy phi tuyến và đường cong hồi quy

17.1. Xem xét kỹ hơn về các mặt bậc hai*

17.2. Đa thức từng đoạn và spline hồi quy

17.3. Bình phương tối thiểu phi tuyến*

17.3.1. Tối thiểu hóa tổng bình phương phần dư

17.3.2. Tăng trưởng dân số

17.4. Bài tập

17.5. Tóm tắt

17.6. Tài liệu đọc thêm đề xuất

18. Chương 18: Hồi quy phi tham số

18.1. Hồi quy phi tham số đơn: Làm mịn biểu đồ phân tán

18.1.1. Hồi quy đa thức cục bộ

18.2. Hồi quy phi tham số bội

18.2.1. Hồi quy bội đa thức cục bộ

18.2.2. Mô hình hồi quy cộng tính

18.3. Hồi quy phi tham số tổng quát

18.3.1. Ước lượng hợp lý cục bộ*

18.3.2. Mô hình cộng tính tổng quát

18.4. Bài tập

18.5. Tóm tắt

18.6. Tài liệu đọc thêm đề xuất

19. Chương 19: Hồi quy vững

19.1. Ước lượng M trong hồi quy

19.2. Hồi quy ảnh hưởng bị chặn

19.3. Ước lượng vững của các mô hình tuyến tính tổng quát

19.4. Lời kết

19.5. Bài tập

19.6. Tóm tắt

19.7. Tài liệu đọc thêm đề xuất

20. Chương 20: Dữ liệu khuyết thiếu trong các mô hình hồi quy

20.1. Các khái niệm cơ bản về dữ liệu khuyết thiếu

20.2. Các cách tiếp cận truyền thống đối với dữ liệu khuyết thiếu

20.3. Ước lượng hợp lý cực đại cho dữ liệu khuyết ngẫu nhiên*

20.3.1. Thuật toán EM

20.4. Gán giá trị đa biến Bayes

20.4.1. Suy luận cho các hệ số riêng lẻ

20.4.2. Suy luận cho nhiều hệ số*

20.4.3. Ví dụ: Mô hình hồi quy cho tỷ lệ tử vong ở trẻ sơ sinh

20.5. Sai lệch chọn mẫu và kiểm duyệt dữ liệu

20.5.1. Phân phối chuẩn bị cắt cụt và bị kiểm duyệt

20.5.2. Mô hình hồi quy chọn lọc Heckman

20.5.3. Các mô hình hồi quy kiểm duyệt

20.6. Bài tập

20.7. Tóm tắt

20.8. Tài liệu đọc thêm đề xuất

21. Chương 21: Phương pháp Bootstrap cho các mô hình hồi quy

21.1. Khoảng tin cậy Bootstrap

21.1.1. Khoảng theo lý thuyết phân phối chuẩn

21.1.2. Khoảng tin cậy Bootstrap cải tiến

21.2. Áp dụng Bootstrap cho các mô hình hồi quy

21.3. Kiểm định giả thuyết bằng Bootstrap*

21.4. Bootstrap cho thiết kế lấy mẫu phức tạp

21.5. Lời kết

21.6. Bài tập

21.7. Tóm tắt

21.8. Tài liệu đọc thêm đề xuất

22. Chương 22: Lựa chọn mô hình, tính trung bình mô hình và kiểm định mô hình

22.1. Tiêu chí lựa chọn mô hình

22.1.1. Minh họa: Lương cầu thủ bóng chày

22.1.2. Bình luận về lựa chọn mô hình

22.2. Tính trung bình mô hình

22.2.1. Áp dụng vào dữ liệu lương bóng chày

22.2.2. Bình luận về tính trung bình mô hình

22.3. Kiểm định giá trị mô hình

22.3.1. Minh họa: Đơn kháng cáo của người tị nạn

22.3.2. Bình luận về kiểm định giá trị mô hình

22.4. Bài tập

22.5. Tóm tắt

22.6. Tài liệu đọc thêm đề xuất

23. Chương 23: Mô hình hiệu ứng hỗn hợp tuyến tính cho dữ liệu phân cấp và dữ liệu theo thời gian

23.1. Dữ liệu phân cấp và dữ liệu theo thời gian

23.2. Mô hình hiệu ứng hỗn hợp tuyến tính

23.3. Mô hình hóa dữ liệu phân cấp

23.3.1. Thiết lập mô hình hỗn hợp

23.3.2. Phân tích phương sai một yếu tố với hiệu ứng ngẫu nhiên

23.3.3. Mô hình hồi quy với các hệ số ngẫu nhiên

23.3.4. Mô hình xem hệ số là biến kết quả

23.4. Mô hình hóa dữ liệu theo thời gian

23.5. Kiểm định Wald cho các hiệu ứng cố định

23.6. Kiểm định tỷ số hợp lý cho các thành phần phương sai và hiệp phương sai

23.7. Định tâm các biến giải thích, hiệu ứng ngữ cảnh và mô hình hiệu ứng cố định

23.7.1. So sánh hiệu ứng cố định và hiệu ứng ngẫu nhiên

23.7.2. Mô hình Laird-Ware dưới dạng ma trận

23.7.3. Xem lại kiểm định Wald

23.8. Bài tập

23.9. Tóm tắt

23.10. Tài liệu đọc thêm đề xuất

24. Chương 24: Mô hình hiệu ứng hỗn hợp phi tuyến và tuyến tính tổng quát

24.1. Mô hình hỗn hợp tuyến tính tổng quát

24.1.1. Ví dụ: Đau nửa đầu

24.2. Mô hình hỗn hợp phi tuyến*

24.2.1. Ví dụ: Hồi phục sau hôn mê

24.2.2. Ước lượng mô hình hỗn hợp phi tuyến

24.3. Bài tập

24.4. Tóm tắt

24.5. Tài liệu đọc thêm đề xuất

Phụ lục A

Tài liệu tham khảo

Chỉ mục tác giả

Chỉ mục chủ đề

Chỉ mục tập dữ liệu

Tóm tắt

I. Tổng quan về phân tích hồi quy áp dụng và mô hình tuyến tính tổng quát

Phân tích hồi quy áp dụng và mô hình tuyến tính tổng quát là hai trụ cột của thống kê hiện đại. Phương pháp này cung cấp công cụ mạnh mẽ để mô tả mối quan hệ giữa biến phụ thuộc và biến độc lập. Hồi quy tuyến tính cổ điển sử dụng bình phương tối thiểu để ước lượng tham số. Mô hình tuyến tính tổng quát mở rộng framework này cho nhiều loại dữ liệu hơn. GLM bao gồm hồi quy logistic, Poisson và nhiều biến thể khác. Các phương pháp này áp dụng rộng rãi trong khoa học xã hội, y học và kinh tế. John Fox đã trình bày hệ thống toàn diện về lý thuyết và ứng dụng. Cuốn sách nhấn mạnh tầm quan trọng của mô tả chính xác dữ liệu. Việc hiểu rõ giả định và giới hạn của mô hình là yếu tố then chốt. Phân tích hồi quy không chỉ đơn thuần là kỹ thuật tính toán. Đây là cách tiếp cận có hệ thống để hiểu dữ liệu thực tế. Người nghiên cứu cần kết hợp lý thuyết thống kê với kiến thức chuyên môn.

1.1. Định nghĩa và nguồn gốc phương pháp hồi quy

Hồi quy là phương pháp thống kê mô tả mối quan hệ giữa các biến số. Thuật ngữ này xuất phát từ nghiên cứu của Francis Galton về di truyền học. Galton quan sát hiện tượng con cái có chiều cao trung bình gần với trung bình quần thể hơn cha mẹ. Đây gọi là hồi quy về trung bình. Ngày nay, hồi quy được mở rộng thành công cụ phân tích dữ liệu đa năng. Phương pháp này giúp dự đoán giá trị biến phụ dựa trên biến độc lập. Hồi quy cũng cho phép kiểm định giả thuyết về mối quan hệ nhân quả. Ứng dụng trải rộng từ kinh tế lượng đến dịch tễ học.

1.2. Vai trò của mô hình tuyến tính tổng quát trong thống kê

Mô hình tuyến tính tổng quát mở rộng hồi quy tuyến tính cổ điển. GLM cho phép biến đáp ứng tuân theo phân phối thuộc họ phân phối mũ. Điều này bao gồm phân phối chuẩn, nhị thức, Poisson và gamma. Hàm liên kết kết nối giá trị kỳ vọng của biến đáp ứng với biến giải thích. Mô hình logit xử lý biến nhị phân trong nghiên cứu y khoa. Mô hình Poisson phân tích dữ liệu đếm trong dịch tễ học. GLM cung cấp framework thống nhất cho nhiều loại phân tích. Phương pháp này trở thành công cụ không thể thiếu trong nghiên cứu khoa học hiện đại.

II. Các vấn đề thường gặp trong phân tích hồi quy áp dụng

Phân tích hồi quy áp dụng đối mặt nhiều thách thức thực tế. Một vấn đề phổ biến là giả định sai về hình thức mối quan hệ. Nhiều nhà nghiên cứu mặc định mối quan hệ giữa biến số là tuyến tính. Thực tế, mối quan hệ giữa thu nhập và trình độ học vấn thường không tuyến tính. Giá trị ngoại lai ảnh hưởng lớn đến kết quả hồi quy. Các quan sát bất thường có thể kéo đường hồi quy đi lệch. Đa cộng tuyến xảy ra khi các biến giải thích tương quan cao với nhau. Hiện tượng này làm sai lệch ước lượng tham số và tăng phương sai. Vi phạm giả định phân phối chuẩn của sai số gây vấn đề cho kiểm định. Phương sai không ổn định ảnh hưởng đến độ tin cậy của kết quả. Dữ liệu thiếu cũng là thách thức lớn trong phân tích thực tế. Mỗi vấn đề đòi hỏi phương pháp phát hiện và xử lý riêng biệt.

2.1. Dữ liệu bất thường và ảnh hưởng đến mô hình hồi quy

Dữ liệu bất thường bao gồm điểm ngoại lai và điểm có ảnh hưởng cao. Điểm ngoại lai có giá trị Y khác biệt đáng kể so với mô hình dự đoán. Điểm có ảnh hưởng cao tác động lớn đến hệ số hồi quy khi bị loại bỏ. Cook's distance là chỉ số phổ biến để phát hiện điểm ảnh hưởng. DFITS và DFBETAS cũng cung cấp thông tin hữu ích. Việc xử lý dữ liệu bất thường cần cân nhắc kỹ lưỡng. Không nên tự động loại bỏ mà cần hiểu nguyên nhân. Đôi khi điểm bất thường phản ánh hiện tượng thực tế quan trọng.

2.2. Vi phạm giả định tuyến tính và phương sai không đổi

Giả định tuyến tính đòi hỏi mối quan hệ giữa biến số dạng đường thẳng. Khi vi phạm, mô hình cho kết quả sai lệch và dự đoán kém chính xác. Biểu đồ phần dư so với giá trị fitted giúp phát hiện phi tuyến tính. Phương sai không đổi nghĩa là độ phân tán sai số đồng nhất. Heteroscedasticity xảy ra khi phương sai thay đổi theo mức biến giải thích. Breusch-Pagan test kiểm tra chính thức giả định phương sai hằng. Biến đổi dữ liệu như logarit có thể khắc phục vấn đề này. Hồi quy phi tham số như lowess cung cấp cách tiếp cận linh hoạt hơn.

III. Phương pháp và giải pháp trong phân tích hồi quy áp dụng

Nhiều phương pháp đã được phát triển để giải quyết vấn đề trong hồi quy. Biến đổi dữ liệu là kỹ thuật đơn giản nhưng hiệu quả. Hàm logarit xử lý dữ liệu có phân phối lệch và phương sai không ổn định. Box-Coff transformation tìm biến đổi tối ưu cho dữ liệu. Hồi quy phi tham số không giả định hình thức mối quan hệ cụ thể. Lowess tạo đường cong mượt mà dựa trên dữ liệu địa phương. Phương pháp này giảm thiểu thiên kiến biên và xử lý điểm ngoại lai tốt. Bootstrap cung cấp ước lượng khoảng tin cậy không dựa vào giả định phân phối. Cross-validation đánh giá khả năng dự đoán của mô hình trên dữ liệu mới. Lựa chọn mô hình cân nhắc giữa độ phù hợp và độ phức tạp. AIC và BIC là tiêu chí phổ biến cho mục đích này. Mô hình hỗn hợp xử lý dữ liệu phân cấp và dữ liệu dọc. Kết hợp nhiều phương pháp thường cho kết quả đáng tin cậy nhất.

3.1. Kỹ thuật biến đổi dữ liệu và hồi quy phi tham số

Biến đổi dữ liệu thay đổi thang đo để phù hợp giả định mô hình. Hàm logarit biến đổi dữ liệu lệch phải thành phân phối gần chuẩn hơn. Căn bậc hai phù hợp cho dữ liệu đếm có giá trị nhỏ. Biến đổi Box-Cox tìm lũy thừa tối ưu một cách hệ thống. Hồi quy phi tham số như lowess dựa trên trung bình địa phương có trọng số. Lowess cho kết quả mượt hơn so với trung bình địa phương đơn giản. Băng thông của lowess kiểm soát mức độ mượt mà của đường cong. Kỹ thuật này đặc biệt hữu ích khi khám phá hình dạng mối quan hệ.

3.2. Phương pháp bootstrap và lựa chọn mô hình

Bootstrap tạo mẫu có hoàn lại từ dữ liệu gốc để ước tính phân phối lấy mẫu. Phương pháp này không yêu cầu giả định về phân phối quần thể. Bootstrap hữu ích khi kích thước mẫu nhỏ hoặc phân phối phức tạp. Lựa chọn mô hình cân nhắc giữa giải thích và dự đoán. Stepwise selection thêm hoặc loại biến dựa trên tiêu chí thống kê. AIC ưu tiên mô hình có khả năng dự đoán tốt. BIC ưa thích mô hình đơn giản hơn với ít tham số. Cross-validation chia dữ liệu thành tập huấn luyện và kiểm tra để đánh giá.

IV. Ứng dụng thực tế và tương lai của phân tích hồi quy áp dụng

Phân tích hồi quy áp dụng có ứng dụng rộng rãi trong nhiều lĩnh vực. Trong khoa học xã hội, phương pháp này phân tích mối quan hệ thu nhập và giáo dục. Nghiên cứu y tế sử dụng GLM để dự báo kết quả điều trị bệnh nhân. Kinh tế lượng áp dụng hồi quy để phân tích tác động của chính sách. Marketing sử dụng mô hình dự đoán hành vi tiêu dùng. Kỹ thuật áp dụng hồi quy cho kiểm soát chất lượng và dự báo. Phần mềm thống kê hiện đại giúp triển khai phương pháp dễ dàng hơn. R, Python và SAS cung cấp thư viện phong phú cho phân tích hồi quy. Tương lai của lĩnh vực này liên quan đến học máy và dữ liệu lớn. Tuy nhiên, nền tảng lý thuyết từ Fox vẫn giữ vai trò quan trọng. Hiểu nguyên tắc cơ bản giúp áp dụng công cụ mới hiệu quả hơn. Phân tích hồi quy tiếp tục là kỹ năng cốt lõi của nhà nghiên cứu.

4.1. Ứng dụng trong khoa học xã hội và nghiên cứu y tế

Khoa học xã hội sử dụng hồi quy để kiểm tra lý thuyết về hành vi con người. Mô hình logit phân tích yếu tố ảnh hưởng đến quyết định lựa chọn nghề nghiệp. Hồi quy đa biến kiểm soát nhiều biến số đồng thời trong nghiên cứu quan sát. Dịch tễ học áp dụng GLM để phân tích yếu tố nguy cơ bệnh tật. Mô hình Cox mở rộng hồi quy cho dữ liệu sinh tồn. Nghiên cứu lâm sàng sử dụng hồi quy logistic để dự báo đáp ứng điều trị. Phương pháp này giúp đưa ra quyết định dựa trên bằng chứng khoa học.

4.2. Xu hướng phát triển và tích hợp công nghệ mới

Học máy mở rộng phương pháp hồi quy truyền thống với thuật toán phức tạp hơn. Regularization như LASSO và Ridge xử lý tốt vấn đề đa cộng tuyến. Dữ liệu lớn đòi hỏi phương pháp tính toán hiệu quả hơn. Mạng nơ-ron tổng quát hóa ý tưởng hàm liên kết trong GLM. Tuy nhiên, mô hình phức tạp không thay thế hiểu biết lý thuyết cơ bản. Giải thích kết quả vẫn quan trọng trong nghiên cứu khoa học. Sự kết hợp giữa phương pháp truyền thống và công nghệ mới tạo tiềm năng lớn. Các nguyên tắc từ Fox tiếp tục hướng dẫn nghiên cứu trong tương lai.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI. Nếu bạn thấy nội dung không chính xác hoặc có vấn đề, vui lòng Báo lỗi nội dung.

21/04/2026

Trích đoạn nội dung tài liệu

THIRD EDITION APPLIED REGRESSION ANALYSIS and GENERALIZED LINEAR MODELS For Bonnie and Jesse (yet again) THIRD EDITION APPLIED REGRESSION ANALYSIS and GENERALIZED LINEAR MODELS John Fox McMaster University FOR INFORMATION: Copyright © 2016 by SAGE Publications, Inc. SAGE Publications, Inc. All rights reserved. No part of this book may be 2455 Teller Road reproduced or utilized in any form or by any means, Thousand Oaks, California 91320 electronic or mechanical, including photocopying, recording, or by any information storage and retrieval E-mail: order@sagepub.com system, without permission in writing from the publisher.

SAGE Publications Ltd. 1 Oliver’s Yard 55 City Road London EC1Y 1SP United Kingdom Cataloging-in-Publication Data is available for this SAGE Publications India Pvt. title from the Library of Congress. B 1/I 1 Mohan Cooperative Industrial Area Mathura Road, New Delhi 110 044 ISBN 978-1-4522-0566-3 India SAGE Publications Asia-Pacific Pte.

3 Church Street #10–04 Samsung Hub Singapore 049483 Printed in the United States of America Acquisitions Editor: Vicki Knight Associate Digital Content Editor: Katie Bierach Editorial Assistant: Yvonne McDuffee Production Editor: Kelly DeRosa Copy Editor: Gillian Dickens Typesetter: C&M Digitals (P) Ltd. Proofreader: Jennifer Grubba Cover Designer: Anupama Krishnan Marketing Manager: Nicole Elliott 15 16 17 18 19 10 9 8 7 6 5 4 3 2 1 Brief Contents _____________ Preface xv About the Author xxiv 1. Statistical Models and Social Science 1 I. What Is Regression Analysis? 13 3.

Transforming Data 55 II. LINEAR MODELS AND LEAST SQUARES 81 5. Linear Least-Squares Regression 82 6. Statistical Inference for Regression 106 7.

Dummy-Variable Regression 128 8. Analysis of Variance 153 9. Statistical Theory for Linear Models* 202 10. The Vector Geometry of Linear Models* 245 III.

LINEAR-MODEL DIAGNOSTICS 265 11. Unusual and Influential Data 266 12. Diagnosing Non-Normality, Nonconstant Error Variance, and Nonlinearity 296 13. Collinearity and Its Purported Remedies 341 IV.

GENERALIZED LINEAR MODELS 369 14. Logit and Probit Models for Categorical Response Variables 370 15. Generalized Linear Models 418 V. EXTENDING LINEAR AND GENERALIZED LINEAR MODELS 473 16.

Time-Series Regression and Generalized Least Squares* 474 17. Missing Data in Regression Models 605 21. Bootstrapping Regression Models 647 22. Model Selection, Averaging, and Validation 669 VI.

MIXED-EFFECTS MODELS 699 23. Linear Mixed-Effects Models for Hierarchical and Longitudinal Data 700 24. Generalized Linear and Nonlinear Mixed-Effects Models 743 Appendix A 759 References 762 Author Index 773 Subject Index 777 Data Set Index 791 Contents _________________ Preface xv About the Author xxiv 1. Statistical Models and Social Science 1 1.1 Statistical Models and Social Reality 1 1.2 Observation and Experiment 4 1.3 Populations and Samples 8 Exercise 10 Summary 10 Recommended Reading 11 I.

What Is Regression Analysis? 13 2.2 Naive Nonparametric Regression 18 2.3 Local Averaging 22 Exercise 25 Summary 26 3.2 Nonparametric Density Estimation 33 3.3 Quantile-Comparison Plots 37 3.2 Plotting Bivariate Data 44 3.3 Plotting Multivariate Data 47 3.3 Three-Dimensional Scatterplots 50 3.4 Conditioning Plots 51 Exercises 53 Summary 53 Recommended Reading 54 4.1 The Family of Powers and Roots 55 4.4 Transforming Nonconstant Spread 70 4.6 Estimating Transformations as Parameters* 76 Exercises 78 Summary 79 Recommended Reading 80 II. LINEAR MODELS AND LEAST SQUARES 81 5. Linear Least-Squares Regression 82 5.1 Least-Squares Fit 83 5.1 Two Explanatory Variables 92 5.2 Several Explanatory Variables 96 5.4 Standardized Regression Coefficients 100 Exercises 102 Summary 105 6. Statistical Inference for Regression 106 6.1 The Simple-Regression Model 106 6.2 Properties of the Least-Squares Estimator 109 6.3 Confidence Intervals and Hypothesis Tests 111 6.1 The Multiple-Regression Model 112 6.2 Confidence Intervals and Hypothesis Tests 113 6.3 Empirical Versus Structural Relations 117 6.4 Measurement Error in Explanatory Variables* 120 Exercises 123 Summary 126 7.

Dummy-Variable Regression 128 7.1 Coefficient Quasi-Variances* 138 7.1 Constructing Interaction Regressors 141 7.2 The Principle of Marginality 144 7.3 Interactions With Polytomous Factors 145 7.4 Interpreting Dummy-Regression Models With Interactions 145 7.5 Hypothesis Tests for Main Effects and Interactions 146 7.4 A Caution Concerning Standardized Coefficients 149 Exercises 150 Summary 151 8. Analysis of Variance 153 8.1 One-Way Analysis of Variance 153 8.1 Example: Duncan’s Data on Occupational Prestige 155 8.2 The One-Way ANOVA Model 156 8.2 Two-Way Analysis of Variance 159 8.1 Patterns of Means in the Two-Way Classification 160 8.2 Two-Way ANOVA by Dummy Regression 166 8.3 The Two-Way ANOVA Model 168 8.4 Fitting the Two-Way ANOVA Model to Data 170 8.5 Testing Hypotheses in Two-Way ANOVA 172 8.6 Equal Cell Frequencies 174 8.7 Some Cautionary Remarks 175 8.3 Higher-Way Analysis of Variance 177 8.1 The Three-Way Classification 177 8.2 Higher-Order Classifications 180 8.3 Empty Cells in ANOVA 186 8.4 Analysis of Covariance 187 8.5 Linear Contrasts of Means 190 Exercises 194 Summary 200 9. Statistical Theory for Linear Models* 202 9.1 Linear Models in Matrix Form 202 9.1 Dummy Regression and Analysis of Variance 203 9.2 Least-Squares Fit 208 9.1 Deficient-Rank Parametrization of Linear Models 210 9.3 Properties of the Least-Squares Estimator 211 9.1 The Distribution of the Least-Squares Estimator 211 9.2 The Gauss-Markov Theorem 212 9.3 Maximum-Likelihood Estimation 214 9.4 Statistical Inference for Linear Models 215 9.1 Inference for Individual Coefficients 215 9.2 Inference for Several Coefficients 216 9.3 General Linear Hypotheses 219 9.4 Joint Confidence Regions 220 9.5 Multivariate Linear Models 225 9.8 Instrumental Variables and Two-Stage Least Squares 231 9.1 Instrumental-Variables Estimation in Simple Regression 231 9.2 Instrumental-Variables Estimation in Multiple Regression 232 9.3 Two-Stage Least Squares 234 Exercises 236 Summary 241 Recommended Reading 243 10. The Vector Geometry of Linear Models* 245 10.1 Variables in Mean Deviation Form 247 10.2 Degrees of Freedom 250 10.3 Estimating the Error Variance 256 10.4 Analysis-of-Variance Models 258 Exercises 260 Summary 262 Recommended Reading 264 III.

LINEAR-MODEL DIAGNOSTICS 265 11. Unusual and Influential Data 266 11.1 Outliers, Leverage, and Influence 266 11.2 Assessing Leverage: Hat-Values 270 11.3 Detecting Outliers: Studentized Residuals 272 11.1 Testing for Outliers in Linear Models 273 11.2 Anscombe’s Insurance Analogy 274 11.1 Influence on Standard Errors 277 11.2 Influence on Collinearity 280 11.5 Numerical Cutoffs for Diagnostic Statistics 280 11.3 Measures of Influence 281 11.1 Added-Variable Plots 282 11.7 Should Unusual Data Be Discarded? 288 11.8 Some Statistical Details* 289 11.1 Hat-Values and the Hat-Matrix 289 11.2 The Distribution of the Least-Squares Residuals 290 11.4 Added-Variable Plots and Leverage Plots 291 Exercises 293 Summary 294 Recommended Reading 294 12. Diagnosing Non-Normality, Nonconstant Error Variance, and Nonlinearity 296 12.1 Non-Normally Distributed Errors 297 12.1 Confidence Envelopes by Simulated Sampling* 300 12.2 Nonconstant Error Variance 301 12.2 Weighted-Least-Squares Estimation* 304 12.3 Correcting OLS Standard Errors for Nonconstant Variance* 305 12.4 How Nonconstant Error Variance Affects the OLS Estimator* 306 12.1 Component-Plus-Residual Plots 308 12.2 Component-Plus-Residual Plots for Models With Interactions 313 12.3 When Do Component-Plus-Residual Plots Work? 314 12.1 Testing for Nonlinearity (“Lack of Fit”) 318 12.2 Testing for Nonconstant Error Variance 322 12.5 Maximum-Likelihood Methods* 323 12.1 Box-Cox Transformation of Y 324 12.2 Box-Tidwell Transformation of the Xs 326 12.3 Nonconstant Error Variance Revisited 329 12.6 Structural Dimension 331 Exercises 334 Summary 338 Recommended Reading 339 13. Collinearity and Its Purported Remedies 341 13.2 Generalized Variance Inflation* 357 13.2 Coping With Collinearity: No Quick Fix 358 13.4 Prior Information About the Regression Coefficients 364 13.5 Some Comparisons 365 Exercises 366 Summary 368 IV.

GENERALIZED LINEAR MODELS 369 14. Logit and Probit Models for Categorical Response Variables 370 14.1 Models for Dichotomous Data 370 14.1 The Linear-Probability Model 372 14.2 Transformations of p: Logit and Probit Models 375 14.3 An Unobserved-Variable Formulation 379 14.4 Logit and Probit Models for Multiple Regression 380 14.5 Estimating the Linear Logit Model* 389 14.2 Models for Polytomous Data 392 14.1 The Polytomous Logit Model 392 14.3 Ordered Logit and Probit Models 400 14.4 Comparison of the Three Approaches 407 14.3 Discrete Explanatory Variables and Contingency Tables 408 14.1 The Binomial Logit Model* 411 Exercises 413 Summary 415 Recommended Reading 416 15. Generalized Linear Models 418 15.1 The Structure of Generalized Linear Models 418 15.1 Estimating and Testing GLMs 425 15.2 Generalized Linear Models for Counts 427 15.1 Models for Overdispersed Count Data 431 15.2 Loglinear Models for Contingency Tables 434 15.3 Statistical Theory for Generalized Linear Models* 443 15.2 Maximum-Likelihood Estimation of Generalized Linear Models 445 15.4 Diagnostics for Generalized Linear Models 453 15.1 Outlier, Leverage, and Influence Diagnostics 454 15.5 Analyzing Data From Complex Sample Surveys 460 Exercises 464 Summary 468 Recommended Reading 471 V. EXTENDING LINEAR AND GENERALIZED LINEAR MODELS 473 16.

Time-Series Regression and Generalized Least Squares* 474 16.1 Generalized Least-Squares Estimation 475 16.2 Serially Correlated Errors 476 16.1 The First-Order Autoregressive Process 477 16.2 Higher-Order Autoregressive Processes 481 16.3 Moving-Average and Autoregressive-Moving-Average Processes 482 16.3 GLS Estimation With Autocorrelated Errors 485 16.1 Empirical GLS Estimation 487 16.2 Maximum-Likelihood Estimation 487 16.4 Correcting OLS Inference for Autocorrelated Errors 488 16.5 Diagnosing Serially Correlated Errors 489 16.6 Concluding Remarks 494 Exercises 496 Summary 499 Recommended Reading 500 17.1 A Closer Look at Quadratic Surfaces* 506 17.2 Piece-wise Polynomials and Regression Splines 507 17.4 Nonlinear Least Squares* 515 17.1 Minimizing the Residual Sum of Squares 516 17. Population Growth 519 Exercises 521 Summary 526 Recommended Reading 527 18.1 Nonparametric Simple Regression: Scatterplot Smoothing 528 18.2 Local-Polynomial Regression 532 18.2 Nonparametric Multiple Regression 550 18.1 Local-Polynomial Multiple Regression 550 18.2 Additive Regression Models 563 18.3 Generalized Nonparametric Regression 572 18.1 Local Likelihood Estimation* 572 18.2 Generalized Additive Models 575 Exercises 578 Summary 580 Recommended Reading 585 19.2 M Estimation in Regression 592 19.2 Bounded-Influence Regression 595 19.4 Robust Estimation of Generalized Linear Models 600 19.5 Concluding Remarks 601 Exercises 601 Summary 603 Recommended Reading 604 20. Missing Data in Regression Models 605 20.1 Missing Data Basics 606 20.2 Traditional Approaches to Missing Data 609 20.3 Maximum-Likelihood Estimation for Data Missing at Random* 613 20.1 The EM Algorithm 616 20.4 Bayesian Multiple Imputation 619 20.1 Inference for Individual Coefficients 621 20.2 Inference for Several Coefficients* 624 20.4 Example: A Regression Model for Infant Mortality 626 20.5 Selection Bias and Censoring 629 20.1 Truncated- and Censored-Normal Distributions 629 20.2 Heckman’s Selection-Regression Model 632 20.3 Censored-Regression Models 637 Exercises 639 Summary 643 Recommended Reading 646 21. Bootstrapping Regression Models 647 21.2 Bootstrap Confidence Intervals 655 21.1 Normal-Theory Intervals 655 21.3 Improved Bootstrap Intervals 656 21.3 Bootstrapping Regression Models 658 21.4 Bootstrap Hypothesis Tests* 660 21.5 Bootstrapping Complex Sampling Designs 662 21.6 Concluding Remarks 663 Exercises 664 Summary 667 Recommended Reading 668 22.

Model Selection, Averaging, and Validation 669 22.1 Model Selection Criteria 671 22.2 An Illustration: Baseball Salaries 681 22.3 Comments on Model Selection 683 22.1 Application to the Baseball Salary Data 687 22.2 Comments on Model Averaging 687 22.1 An Illustration: Refugee Appeals 691 22.2 Comments on Model Validation 693 Exercises 694 Summary 696 Recommended Reading 698 VI. MIXED-EFFECTS MODELS 699 23. Linear Mixed-Effects Models for Hierarchical and Longitudinal Data 700 23.1 Hierarchical and Longitudinal Data 701 23.2 The Linear Mixed-Effects Model 702 23.3 Modeling Hierarchical Data 704 23.1 Formulating a Mixed Model 708 23.2 Random-Effects One-Way Analysis of Variance 710 23.3 Random-Coefficients Regression Model 712 23.4 Coefficients-as-Outcomes Model 714 23.4 Modeling Longitudinal Data 717 23.5 Wald Tests for Fixed Effects 724 23.6 Likelihood-Ratio Tests of Variance and Covariance Components 726 23.7 Centering Explanatory Variables, Contextual Effects, and Fixed-Effects Models 727 23.1 Fixed Versus Random Effects 730 23.1 The Laird-Ware Model in Matrix Form 734 23.2 Wald Tests Revisited 737 Exercises 738 Summary 740 Recommended Reading 741 24. Generalized Linear and Nonlinear Mixed-Effects Models 743 24.1 Generalized Linear Mixed Models 743 24.1 Example: Migraine Headaches 745 24.2 Nonlinear Mixed Models* 749 24.1 Example: Recovery From Coma 751 24.2 Estimating Nonlinear Mixed Models 755 Exercises 757 Summary 757 Recommended Reading 758 Appendix A 759 References 762 Author Index 773 Subject Index 777 Data Set Index 791 Preface ___________________ L inear models, their variants, and extensions—the most important of which are general- ized linear models—are among the most useful and widely used statistical tools for social research.

This book aims to provide an accessible, in-depth, modern treatment of regression analysis, linear models, generalized linear models, and closely related methods.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ