Bối cảnh và vấn đề nghiên cứu
Xác định giá trị bất động sản là bài toán phức tạp do giá cả nhà đất phản ánh đồng thời quan hệ cung cầu của thị trường và giá trị nội tại của bất động sản. Giá trị này được cấu thành từ hai yếu tố: giá trị hữu hình (chất lượng tự nhiên, chi phí đầu tư xây dựng) và giá trị vô hình (vị thế xã hội, yếu tố con người, văn hóa, kinh tế, chính trị). Trên thực tế, các quy định pháp luật yêu cầu việc xác định giá nhà đất phải sát với giá thị trường. Tuy nhiên, các phương pháp thẩm định giá hiện hành chủ yếu dựa trên so sánh cặp cục bộ giữa các bất động sản tương đồng mà chưa áp dụng rộng rãi các mô hình toán học thống kê trên quy mô mẫu lớn theo các tiêu chuẩn định lượng.
Mặc dù tư duy toán học đã bước đầu được ứng dụng để xác định hệ số điều chỉnh giá, việc xây dựng phương trình định giá tổng thể phụ thuộc vào các đặc tính đa chiều của nhà đất vẫn đối mặt với nhiều thách thức:
- Xác định dạng phương trình toán học phù hợp để mô hình hóa mối quan hệ giữa giá nhà và các biến số độc lập.
- Nhận diện và phân tách mức độ tác động của các biến số phản ánh đặc điểm hữu hình và vô hình.
- Lựa chọn phương pháp ước lượng tham số tối ưu (giữa hồi quy tuyến tính cổ điển và các mô hình học máy như cây quyết định).
Xuất phát từ bối cảnh đó, đồ án "Hồi quy tuyến tính và ứng dụng trong dự báo giá nhà" do sinh viên Đỗ Văn Hùng thực hiện (chuyên ngành Hệ thống thông tin quản lý, chuyên sâu Toán ứng dụng, Viện Toán ứng dụng và Tin học – Đại học Bách Khoa Hà Nội, dưới sự hướng dẫn của TS. Ngô Thị Hiền, hoàn thành tháng 7/2023) tập trung vào các mục tiêu và nhiệm vụ nghiên cứu sau:
- Nhiệm vụ 1: Tổng quan cơ sở lý thuyết về học máy (Machine Learning) và phương pháp hồi quy tuyến tính (đơn biến và đa biến).
- Nhiệm vụ 2: Thiết lập quy trình phân tích, xây dựng và tối ưu hóa mô hình hồi quy tuyến tính đa biến sử dụng ngôn ngữ R và môi trường RStudio.
- Nhiệm vụ 3: Ứng dụng mô hình trên tập dữ liệu thực nghiệm để dự báo giá bán nhà ở và kiểm định các giả thiết thống kê liên quan.
Đối tượng nghiên cứu của đề tài là mô hình hồi quy tuyến tính đa biến và bài toán dự báo giá bán nhà ở. Phạm vi dữ liệu thực nghiệm gồm 14.000 quan sát (được chia thành bộ mẫu xây dựng 10.000 quan sát và bộ mẫu kiểm định 4.000 quan sát) với 16 biến đặc trưng phản ánh cấu trúc, diện tích, chất lượng và vị trí của bất động sản.
Cơ sở lý thuyết và phương pháp
Khung lý thuyết và mô hình toán học
Nghiên cứu đặt trên nền tảng của kỹ thuật học có giám sát (Supervised Learning) trong Học máy, cụ thể là mô hình hồi quy tuyến tính (Linear Regression Model - LRM). Phương trình hồi quy tuyến tính tổng quát dạng tổng thể có cấu trúc:
$$Y_i = \beta_0 + \beta_1 X_{1i} + \beta_2 X_{2i} + \dots + \beta_k X_{ki} + \epsilon_i$$
Trong đó:
- $Y_i$: Biến phụ thuộc (biến kết cục/regressand) biểu thị giá nhà.
- $X_{ji}$: Các biến độc lập (biến giải thích/predictors/regressors) biểu thị các đặc trưng bất động sản.
- $\beta_0$: Hệ số tự do (hệ số chặn).
- $\beta_j$: Hệ số hồi quy của biến độc lập thứ $j$.
- $\epsilon_i$: Sai số ngẫu nhiên (hạng nhiễu ngẫu nhiên) tại quan sát thứ $i$.
Để mô hình hồi quy đạt độ tin cậy thống kê, tác giả dựa trên 4 giả định toán học cốt lõi:
- Mối quan hệ tuyến tính: Tồn tại quan hệ tuyến tính giữa các biến giải thích và biến phụ thuộc.
- Phần dư độc lập: Sai số ngẫu nhiên giữa các quan sát không có tương quan chuỗi hay phụ thuộc lẫn nhau.
- Tính chuẩn của sai số: Phần dư $\epsilon$ tuân theo phân phối chuẩn với kỳ vọng $E(\epsilon) = 0$.
- Phương sai không đổi (Homoscedasticity): Phương sai của phần dư là hằng số cố định đối với mọi giá trị của biến độc lập.
Phương pháp nghiên cứu và công cụ xử lý dữ liệu
Tác giả sử dụng phương pháp bình phương cực tiểu (Ordinary Least Squares - OLS) để ước lượng các hệ số hồi quy $\hat{\beta}_j$ thông qua việc cực tiểu hóa tổng bình phương phần dư ($RSS = \sum e_i^2$).
Quy trình phân tích định lượng bao gồm:
- Phân tích tương quan: Sử dụng hệ số tương quan Pearson ($r$) và ma trận tương quan để đánh giá sơ bộ liên hệ tuyến tính giữa từng biến độc lập với biến phụ thuộc cũng như giữa các biến độc lập với nhau.
- Lựa chọn biến và tối ưu mô hình: Sử dụng tiêu chuẩn thông tin Akaike ($AIC = 2k + n \ln(RSS/n)$) thông qua thuật toán Stepwise regression để loại bỏ các biến không đóng góp giá trị dự báo; kết hợp phân tích hệ số xác định ($R^2$), sai số chuẩn của hồi quy ($RSE = \sqrt{RSS / (n - p - 1)}$) và kiểm định giả thuyết tổng thể qua thống kê $F$.
- Kiểm định chẩn đoán mô hình (Regression Diagnostics): Sử dụng hệ thống 4 đồ thị phần dư (Residuals vs Fitted, Normal Q-Q, Scale-Location, Residuals vs Leverage với khoảng cách Cook) để kiểm tra các vi phạm về tính tuyến tính, phân phối chuẩn, phương sai thay đổi và điểm ngoại lai có ảnh hưởng lớn (influential observations).
- Đánh giá khả năng tổng quát hóa: So sánh hệ số $R^2$ giữa bộ mẫu xây dựng (training set) và bộ mẫu kiểm định (testing set) để kiểm tra hiện tượng quá khớp (overfitting).
Toàn bộ quá trình tính toán, huấn luyện mô hình, kiểm định giả thiết và trực quan hóa dữ liệu được thực hiện trên ngôn ngữ R (phiên bản tích hợp gói stats, hàm lm(), step(), summary(), plot()) và môi trường RStudio.
Nguồn và cấu trúc dữ liệu
Dữ liệu đầu vào bao gồm 16 biến số đã được làm sạch và chuẩn hóa:
| STT |
Tên biến |
Ý nghĩa |
Đơn vị đo |
| 1 |
price |
Giá bán nhà (Biến phụ thuộc) |
Nghìn Đồng/Căn |
| 2 |
number of rooms |
Số phòng ngủ |
Đơn vị đếm |
| 3 |
number of bathrooms |
Số phòng tắm |
Đơn vị đếm |
| 4 |
living area |
Diện tích khu vực sống |
$\text{m}^2$ |
| 5 |
lot area |
Diện tích lô đất |
$\text{m}^2$ |
| 6 |
number of floors |
Số tầng |
Đơn vị đếm |
| 7 |
number of views |
Số mặt tiền |
Đơn vị đếm |
| 8 |
condition of the house |
Tình trạng ngôi nhà |
Thang điểm 1 - 5 |
| 9 |
grade of the house |
Chất lượng xây dựng ngôi nhà |
Thang điểm 1 - 10 |
| 10 |
area of the house (excluding basement) |
Diện tích nhà không tính tầng hầm |
$\text{m}^2$ |
| 11 |
area of basement |
Diện tích tầng hầm |
$\text{m}^2$ |
| 12 |
built year |
Năm xây dựng |
Năm |
| 13 |
living_area_renov |
Diện tích nhà sau cải tạo |
$\text{m}^2$ |
| 14 |
lot_area_renov |
Diện tích lô đất sau cải tạo |
$\text{m}^2$ |
| 15 |
number of schools nearby |
Số trường học lân cận |
Đơn vị đếm |
| 16 |
distant from the airport |
Khoảng cách đến sân bay |
km |
Nội dung chính theo từng chương
1. Kiến thức cơ sở
Chương này trình bày tổng quan về học máy và vị trí của hồi quy tuyến tính trong bức tranh trí tuệ nhân tạo:
- Phân loại Machine Learning: Tác giả phân định hai nhánh chính gồm học có giám sát (Supervised Learning - sử dụng dữ liệu gán nhãn để mô hình hóa quan hệ và dự báo biến liên tục/phân loại) và học không giám sát (Unsupervised Learning - khám phá cấu trúc tiềm ẩn và phân cụm dữ liệu).
- Yêu cầu dữ liệu và vai trò con người: Nhấn mạnh tính sạch, tính đại diện của dữ liệu lớn (Big Data) và vai trò của chuyên gia trong việc lựa chọn kỹ thuật phân tích phù hợp.
- Bản chất của hồi quy tuyến tính trong học máy: Giải thích cơ chế thuật toán phân tích tập dữ liệu lớn để tính toán phương trình dự đoán, đồng thời phân tích chi tiết 4 giả định thống kê (tuyến tính, phần dư độc lập, phân phối chuẩn của phần dư, phương sai không đổi) kèm các giải pháp khắc phục khi giả định bị vi phạm (biến đổi phi tuyến logarit/căn bậc hai, chuẩn hóa thang đo, loại bỏ ngoại lai).
2. Hồi quy tuyến tính
Chương 2 đi sâu vào cấu trúc toán học của các mô hình hồi quy và cơ chế suy diễn thống kê:
- Mô hình hồi quy đơn biến và đa biến: Trình bày công thức ước lượng OLS cho hệ số $\beta_0, \beta_1$ trong hồi quy đơn biến và mở rộng sang hồi quy bội $k$ biến.
- Phạm vi ứng dụng thực tiễn: Liệt kê và phân tích các ứng dụng điển hình trong 7 lĩnh vực: bất động sản (dự báo giá nhà đất), giáo dục (dự báo điểm chuẩn), kinh tế - tài chính (phân tích GDP, chứng khoán, lạm phát), kinh doanh (dự báo doanh thu, lợi nhuận), y tế (nghiên cứu dịch tễ, sức khỏe), xã hội học (phân tích thu nhập, giáo dục), và khoa học kỹ thuật (đánh giá chi phí sản xuất, sai số kỹ thuật).
- Vấn đề tương quan và biến gây nhiễu: Minh họa sự khác biệt giữa hồi quy đơn biến và đa biến qua ví dụ thực nghiệm: trong hồi quy đơn biến, số phòng ngủ có tương quan thuận với giá nhà; nhưng trong hồi quy đa biến có mặt diện tích và số tầng, tác động riêng lẻ của số phòng ngủ có thể biến mất do tương quan giữa số tầng và số phòng ngủ ($r = 0{,}49$). Tác giả đưa ra phản ví dụ trực quan về mối liên hệ giả giữa số vụ cá mập tấn công và doanh số bán kem để khẳng định sự cần thiết phải kiểm soát biến thứ ba (nhiệt độ).
- Kiểm định giả thuyết và lựa chọn mô hình: Phân tích kiểm định $F$ cho giả thuyết vô hiệu $H_0: \beta_1 = \beta_2 = \dots = \beta_p = 0$; so sánh các tiêu chí đánh giá mô hình như $R^2$, $RSE$, $AIC$, $BIC$, $C_p$ của Mallows. Tác giả chỉ rõ đặc tính của $R^2$ luôn tăng khi bổ sung biến mới (dù biến đó có tương quan thấp) và lý giải nguy cơ overfitting nếu chỉ dựa vào $R^2$.
- Phân rã sai số dự báo: Phân tách độ không chắc chắn của dự báo thành sai số có thể rút gọn (sai số ước lượng tham số, sai số do xấp xỉ dạng mô hình) và sai số không thể rút gọn ($\epsilon$).
- Hạ tầng phần mềm: Giới thiệu ngôn ngữ R và giao diện RStudio cùng các gói lệnh hỗ trợ phân tích hồi quy (
stats, lmtest, car, ggplot2, tidyverse).
3. Ứng dụng của hồi quy tuyến tính trong dự báo giá nhà
Chương 3 là phần thực nghiệm trọng tâm, triển khai quy trình xây dựng mô hình dự báo giá nhà trên tập dữ liệu cụ thể:
- Khảo sát ma trận tương quan: Biến
price có tương quan tuyến tính mạnh nhất với living area ($r = 0{,}71$) và number of bathrooms ($r = 0{,}53$). Ngược lại, distant from the airport ($r = 0{,}0053$) và number of schools nearby ($r = 0{,}0156$) thể hiện mức tương quan tuyến tính gần như bằng 0. Mặt khác, biến area of the house (excluding basement) có tương quan rất cao với living area ($r = 0{,}87$), tiềm ẩn hiện tượng đa cộng tuyến.
- Lựa chọn biến bằng Stepwise AIC: Qua 3 bước lặp tối ưu hóa AIC, 3 biến bị loại bỏ khỏi mô hình ban đầu gồm:
area of the house (excluding basement), area of basement và distant from the airport. Mô hình thu được (Mô hình 1) đạt $RSE = 215.600$, $R^2 = 0{,}656$.
- Tinh gọn mô hình lần 2: Tiếp tục loại bỏ 3 biến có mức ý nghĩa thống kê thấp (
lot area, living_area_renov, number of schools nearby), thu được Mô hình 2 tối ưu gồm 9 biến độc lập. Kết quả so sánh giữa 2 mô hình:
| Tiêu chí |
Mô hình 1 (12 biến sau AIC) |
Mô hình 2 (9 biến tối ưu) |
| Số lượng biến độc lập |
12 |
9 |
| Sai số chuẩn phần dư ($RSE$) |
215.600 |
217.600 |
| Hệ số xác định ($R^2$) |
0,656 |
0,6501 |
Tác giả chấp nhận mức giảm không đáng kể của $R^2$ (giảm khoảng 0,006) và mức tăng nhẹ của $RSE$ để đổi lấy mô hình tinh gọn, giúp tiết kiệm chi phí thu thập dữ liệu và giảm tải tính toán.
- Kiểm định các giả thiết hồi quy trên Mô hình 2:
- Đồ thị Residuals vs Fitted: Đường xu hướng màu đỏ có dạng hơi cong nhẹ, phản ánh tính tuyến tính bị vi phạm ở mức độ thấp, nhưng giả thiết kỳ vọng phần dư bằng 0 vẫn cơ bản được bảo đảm.
- Đồ thị Normal Q-Q: Các điểm phần dư bám sát đường chéo trung tâm, xác nhận giả thiết sai số tuân theo phân phối chuẩn được thỏa mãn.
- Đồ thị Scale-Location: Các điểm thặng dư phân tán tương đối đồng đều xung quanh đường nằm ngang, xác nhận phương sai của phần dư không đổi.
- Đồ thị Residuals vs Leverage: Đường khoảng cách Cook (Cook's distance) xuất hiện ở góc đồ thị; nhận diện các quan sát số 2425, 3533 và 9172 là các điểm có đòn bẩy/ảnh hưởng cao (influential observations).
- Đánh giá hiệu suất và kiểm tra quá khớp:
| Bộ dữ liệu |
Giá trị $R^2$ |
| Bộ mẫu xây dựng (Training - 10.000 mẫu) |
0,6500522 |
| Bộ mẫu kiểm định (Testing - 4.000 mẫu) |
0,648 (tương đương) |
Sự tương đồng chặt chẽ giữa $R^2$ trên hai tập dữ liệu khẳng định mô hình không xảy ra hiện tượng overfitting và có khả năng tổng quát hóa tốt.
- Phương trình hồi quy thực nghiệm cuối cùng:
$$\text{price} = 5.844.000 - 35.770 \times (\text{number of rooms}) + 34.444 \times (\text{number of bathrooms}) + 174{,}6 \times (\text{living area}) + \dots$$
Mô hình giải thích được 65,01% sự biến thiên của giá nhà trong khu vực nghiên cứu.
- Thực nghiệm dự báo cá thể: Áp dụng phương trình cho Căn nhà số 1 với các thuộc tính cụ thể, mô hình đưa ra mức giá dự báo là 524.461,3 nghìn Đồng (tương đương khoảng 524,461 triệu Đồng).
Kết quả và đóng góp
Kết quả định lượng chính
- Xây dựng thành công phương trình hồi quy tuyến tính đa biến dự báo giá nhà gồm 9 biến độc lập tối ưu:
number of rooms, number of bathrooms, living area, number of floors, number of views, condition of the house, grade of the house, built year, và lot_area_renov.
- Mô hình đạt hệ số xác định $R^2 = 0{,}6501$ (giải thích 65,01% phương sai giá nhà) và sai số chuẩn $RSE = 217.600$ nghìn Đồng.
- Kiểm chứng thực nghiệm trên 4.000 mẫu kiểm định độc lập cho thấy chỉ số $R^2$ đạt xấp xỉ 0,648–0,650, chứng minh mô hình duy trì độ ổn định cao, không bị quá khớp.
- Xác định và định vị chính xác 3 quan sát ngoại lai có ảnh hưởng lớn (mẫu số 2425, 3533, 9172) thông qua đồ thị đòn bẩy Residuals vs Leverage.
- Dự báo thực nghiệm thành công giá trị thị trường cho căn nhà mẫu số 1 với kết quả 524.461,3 nghìn Đồng.
Đề xuất và giải pháp của tác giả
Dựa trên kết quả xây dựng mô hình, tác giả đề xuất 5 nhóm khuyến nghị kỹ thuật nhằm nâng cao độ chính xác trong định giá bất động sản:
- Tối ưu hóa chất lượng dữ liệu: Đảm bảo quy trình thu thập dữ liệu đầu vào chuẩn xác, đầy đủ và phản ánh trung thực biến động thị trường.
- Mở rộng quy mô và tính đa dạng của mẫu: Thu thập tập dữ liệu lớn hơn với các căn nhà phân bố ở nhiều vị trí và phân khúc khác nhau để bao quát toàn diện thị trường.
- Tích hợp thêm các yếu tố ngoại sinh: Bổ sung các biến số về môi trường xung quanh, tiện ích công cộng, hạ tầng giao thông, yếu tố pháp lý và chu kỳ thị trường bất động sản.
- Kiểm tra và hiệu chỉnh định kỳ: Thường xuyên đánh giá lại các hệ số ước lượng, kiểm tra mức độ phù hợp giữa giá dự báo và giá giao dịch thực tế để kịp thời phát hiện suy giảm hiệu năng mô hình.
- Kết hợp mô hình lai (Hybrid Models): Phối hợp hồi quy tuyến tính với các kỹ thuật hồi quy phi tuyến hoặc các thuật toán học máy nâng cao (như cây quyết định, rừng ngẫu nhiên) để cải thiện năng lực dự báo.
Đóng góp về mặt học thuật và thực tiễn
- Hệ thống hóa phương pháp luận áp dụng hồi quy thống kê thay thế cho các phương pháp so sánh cặp định tính truyền thống trong định giá nhà đất.
- Minh chứng rõ ràng cơ chế hoạt động của thuật toán Stepwise AIC kết hợp sàng lọc thống kê để tối ưu hóa số lượng biến, giải quyết mâu thuẫn giữa việc tối đa hóa $R^2$ và sự tinh gọn của mô hình.
- Cung cấp kịch bản thực thi hoàn chỉnh trên ngôn ngữ R/RStudio (từ nhập liệu, làm sạch, tối ưu biến, chẩn đoán phần dư 4 bước đến dự báo trên dữ liệu mới).
Hạn chế và hướng nghiên cứu tiếp
Hạn chế
- Dữ liệu thực nghiệm sử dụng trong đồ án là bộ dữ liệu mẫu mô phỏng, chưa phải là nguồn dữ liệu khảo sát sơ cấp trực tiếp từ một địa bàn hành chính cụ thể tại Việt Nam.
- Năng lực giải thích của mô hình dừng lại ở mức trung bình khá ($R^2 \approx 65{,}01%$), còn 34,99% sự biến động giá nhà thuộc về các yếu tố chưa được đưa vào mô hình.
- Tồn tại một số biến độc lập có ý nghĩa về mặt thống kê toán học ($p$-value nhỏ) nhưng giá trị giải thích thực tế đối với quyết định mua bán nhà chưa thật sự rõ nét.
- Giả thiết về tính tuyến tính hoàn hảo của dữ liệu bị vi phạm nhẹ (thể hiện qua đường cong trên đồ thị Residuals vs Fitted).
Hướng nghiên cứu tiếp
- Mở rộng phạm vi thu thập dữ liệu thực địa sơ cấp tại địa phương sinh sống hoặc các thị trường bất động sản cụ thể.
- Xử lý các khuyết điểm về tính giải thích thực tế của các biến số, tinh chỉnh thang đo của các thuộc tính định tính.
- Nghiên cứu và thử nghiệm các mô hình học máy phi tuyến (hồi quy cây quyết định, Random Forest, Gradient Boosting) để nâng cao độ chính xác dự báo khi mối quan hệ giữa các đặc trưng và giá nhà không hoàn toàn tuyến tính.
Giá trị tham khảo
Đồ án này là tài liệu tham khảo có giá trị chuyên môn đối với:
- Sinh viên ngành Hệ thống thông tin quản lý, Toán ứng dụng, Khoa học dữ liệu: Cung cấp ví dụ thực hành hoàn chỉnh về việc áp dụng lý thuyết kinh tế lượng và học máy vào bài toán kinh doanh cụ thể.
- Sinh viên và nhà nghiên cứu ngành Kinh tế, Thẩm định giá, Quản lý đất đai: Tham khảo phương pháp lượng hóa các đặc trưng bất động sản và cách xây dựng hàm định giá tự động (Automated Valuation Model - AVM) thay thế phương pháp so sánh cặp truyền thống.
- Các nội dung đáng tham khảo nhất trong đồ án:
- Quy trình 3 bước sử dụng thuật toán Stepwise kết hợp tiêu chuẩn AIC trên phần mềm R để loại biến đa cộng tuyến.
- Phương pháp đọc và diễn giải bộ 4 đồ thị chẩn đoán phần dư (Residual plots) để kiểm chứng các giả thiết hồi quy OLS.
- Cách xử lý mâu thuẫn hiện tượng "nghịch lý" tương quan giữa hồi quy đơn biến và hồi quy đa biến (ví dụ biến số phòng ngủ và số tầng).
Câu hỏi thường gặp
1. Tại sao các biến diện tích tầng hầm, diện tích không tính tầng hầm và khoảng cách đến sân bay bị loại khỏi mô hình?
Trong quá trình lựa chọn mô hình bằng thuật toán Stepwise dựa trên tiêu chí thông tin Akaike (AIC), ba biến area of the house (excluding basement), area of basement và distant from the airport bị loại bỏ vì chúng không làm giảm chỉ số AIC của mô hình tổng thể. Cụ thể, distant from the airport có hệ số tương quan tuyến tính rất thấp với giá nhà ($r = 0{,}0053$), trong khi area of the house (excluding basement) có tương quan quá cao với living area ($r = 0{,}87$), gây dư thừa thông tin và đa cộng tuyến.
2. Vì sao trong hồi quy đơn biến số phòng ngủ có tương quan thuận với giá nhà nhưng trong hồi quy đa biến lại có hệ số âm?
Hiện tượng này xảy ra do sự tương quan giữa các biến độc lập với nhau. Trong dữ liệu nghiên cứu, số phòng ngủ có mối tương quan dương ($r = 0{,}49$) với số tầng. Khi chạy hồi quy đơn biến, số phòng ngủ đóng vai trò đại diện gián tiếp cho quy mô căn nhà (số tầng/diện tích). Tuy nhiên, khi đưa cả số tầng, diện tích và số phòng ngủ vào mô hình hồi quy đa biến, tác động riêng biệt của số tầng và diện tích đã được kiểm soát; việc tăng thêm phòng ngủ trên cùng một diện tích/số tầng cố định có thể làm giảm không gian sinh hoạt chung, dẫn đến việc hệ số hồi quy của số phòng ngủ mang dấu âm ($-35.770$).
3. Tác giả kiểm tra hiện tượng quá khớp (overfitting) của mô hình bằng cách nào?
Tác giả kiểm tra overfitting bằng phương pháp kiểm định chéo trên tập dữ liệu độc lập: huấn luyện mô hình trên bộ mẫu xây dựng gồm 10.000 quan sát và đánh giá lại trên bộ mẫu kiểm định gồm 4.000 quan sát. Kết quả cho thấy hệ số xác định $R^2$ trên tập huấn luyện đạt $0{,}6500522$ và trên tập kiểm định đạt xấp xỉ $0{,}648$ (gần như tương đương), khẳng định mô hình không bị quá khớp và có khả năng tổng quát hóa tốt trên dữ liệu mới.
4. Bốn đồ thị phần dư (Residual Plots) trong đồ án phản ánh những khuyết tật gì của mô hình?
Kết quả từ 4 đồ thị chẩn đoán cho thấy:
- Residuals vs Fitted: Đường xu hướng màu đỏ có độ cong nhẹ, cho thấy giả thiết quan hệ tuyến tính hoàn hảo giữa các biến bị vi phạm ở mức độ thấp (dữ liệu có tính phi tuyến nhẹ).
- Normal Q-Q: Phần dư phân bố bám sát đường chuẩn, thỏa mãn tốt giả thiết phân phối chuẩn.
- Scale-Location: Đám mây điểm phân tán đều dọc đường nằm ngang, thỏa mãn giả thiết phương sai sai số không đổi.
- Residuals vs Leverage: Nhận diện được 3 quan sát có giá trị đòn bẩy vượt trội (mẫu số 2425, 3533, 9172), là những điểm ngoại lai có khả năng tác động mạnh đến việc ước lượng hệ số hồi quy.
5. Kết quả dự báo giá cụ thể cho căn nhà số 1 trong thực nghiệm là bao nhiêu?
Khi áp dụng phương trình hồi quy 9 biến độc lập cho dữ liệu khảo sát của Căn nhà số 1, mô hình đã tính toán và đưa ra mức giá dự báo là 524.461,3 nghìn Đồng (tương đương khoảng 524,461 triệu Đồng).
Kết luận
Đồ án "Hồi quy tuyến tính và ứng dụng trong dự báo giá nhà" của tác giả Đỗ Văn Hùng đã hệ thống hóa đầy đủ cơ sở toán học của mô hình hồi quy tuyến tính OLS và triển khai thành công quy trình phân tích dữ liệu thực nghiệm trên môi trường R/RStudio. Thông qua kỹ thuật chọn biến Stepwise AIC và kiểm định chẩn đoán 4 đồ thị phần dư, nghiên cứu đã xây dựng phương trình hồi quy 9 biến đạt hệ số giải thích $R^2 = 65{,}01%$, kiểm soát tốt hiện tượng quá khớp trên 4.000 mẫu thử nghiệm. Công trình là tài liệu tham khảo có giá trị ứng dụng cao cho sinh viên các ngành Toán ứng dụng, Hệ thống thông tin và Thẩm định giá bất động sản trong việc chuyển đổi từ các phương pháp định giá thủ công sang mô hình định lượng tự động.