Tổng quan nghiên cứu

Thị trường bất động sản tại Thành phố Hồ Chí Minh luôn giữ vai trò đầu tàu kinh tế nhưng thường xuyên đối mặt với sự biến động giá phức tạp và tình trạng bất cân xứng thông tin. Trong giai đoạn quý 3 và quý 4 năm 2021, làn sóng đô thị hóa mạnh mẽ cùng sự thành lập của thành phố mới đã thúc đẩy giá đất tăng vọt, kéo theo nguy cơ đầu cơ và gian lận thương mại. Trước thực trạng đó, việc xây dựng các mô hình định giá khoa học nhằm cung cấp công cụ dự báo minh bạch, chính xác là yêu cầu cấp thiết. Đề tài tập trung nghiên cứu ứng dụng các thuật toán học máy tiên tiến để dự đoán giá trị nhà đất dựa trên tập dữ liệu thực nghiệm gồm 2.214 bản ghi thô thu thập từ cổng thông tin bất động sản chuyên ngành.

Mục tiêu trọng tâm của nghiên cứu là đánh giá mức độ tương quan của 18 biến số thuộc tính đến giá bán thực tế, đồng thời so sánh hiệu năng dự báo giữa các mô hình hồi quy tuyến tính, cây quyết định và thuật toán tăng cường độ dốc. Phạm vi không gian nghiên cứu bao quát 4 địa bàn trọng điểm đại diện cho các phân khúc đô thị đặc thù tại Thành phố Hồ Chí Minh, bao gồm Quận 1 (trung tâm hành chính - thương mại), Thành phố Thủ Đức (khu đô thị sáng tạo đang phát triển), Quận Tân Bình (khu vực dân cư và logistics ổn định) và Huyện Hóc Môn (vùng ven đô thị có tiềm năng quỹ đất lớn). Kết quả nghiên cứu mang ý nghĩa thực tiễn sâu sắc khi giảm thiểu độ lệch định giá xuống dưới mức 10% đối với các phân khúc phổ biến từ 1 đến 10 tỷ đồng, hỗ trợ các nhà đầu tư cá nhân, tổ chức tín dụng và cơ quan quản lý đưa ra quyết định giao dịch an toàn và hiệu quả.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng dựa trên nền tảng của Lý thuyết Định giá hưởng thụ kết hợp với Lý thuyết Học máy có giám sát. Các mô hình thuật toán chủ đạo được đưa vào thử nghiệm và đối chuẩn bao gồm:

  • Mô hình hồi quy tuyến tính tối ưu hóa ngẫu nhiên (SDCA - Stochastic Dual Coordinate Ascent): Phương pháp tối ưu hóa đối ngẫu tọa độ giải quyết bài toán hồi quy quy mô lớn với tốc độ hội tụ nhanh và tối thiểu hóa hàm mất mát lồi.
  • Mô hình rừng cây quyết định nhanh (Fast Forest Regression): Một triển khai ngẫu nhiên của kỹ thuật quần thể cây quyết định, tổng hợp các phân phối chuẩn Gaussian từ từng cây riêng lẻ để đưa ra giá trị dự đoán trung bình chuẩn xác.
  • Mô hình tăng cường độ dốc (LightGBM và Fast Tree Regression): Khung học máy dựa trên cấu trúc cây phân nhánh theo chiều dọc, tối ưu hóa bộ nhớ và tăng tốc độ xử lý dữ liệu lớn.

Hệ thống biến số quan sát gồm 18 thuộc tính ban đầu được chuẩn hóa và phân loại thành 3 nhóm nhân tố cốt lõi: nhân tố đặc tính tài sản (loại hình bất động sản, diện tích sử dụng, hướng nhà, số tầng, số phòng ngủ, số phòng vệ sinh, tình trạng giấy tờ pháp lý); nhân tố vị trí địa lý (quận huyện, phường xã, tên đường cụ thể); và nhân tố môi trường - tiện ích xung quanh (vị trí nhà mặt tiền phố, khoảng cách tiếp cận trung tâm thương mại và trường học, tính trung tâm quận huyện, độ rộng hẻm cho phương tiện ô tô lưu thông).

Phương pháp nghiên cứu

Nghiên cứu sử dụng phương pháp chọn mẫu phân tầng kết hợp với kỹ thuật thu thập dữ liệu tự động từ nền tảng trực tuyến trong nửa cuối năm 2021. Tổng dung lượng mẫu khảo sát ban đầu đạt 2.214 bản ghi, sau quá trình làm sạch dữ liệu, xử lý giá trị khuyết thiếu và loại bỏ các điểm dị biệt ngoại lai (như diện tích khai báo bất thường trên 18.000 m² tại khu vực trung tâm), tập dữ liệu chuẩn hóa còn lại 2.010 quan sát hoàn chỉnh.

Quy trình phân tích được thực hiện thông qua công cụ tự động hóa học máy ML.NET Model Builder tích hợp trong môi trường phát triển Visual Studio, phân chia ngẫu nhiên dữ liệu theo tỷ lệ chuẩn 80% cho tập huấn luyện và 20% cho tập kiểm thử độc lập. Phương pháp phân tích hồi quy phi tuyến và tăng cường độ dốc được lựa chọn vì tính ưu việt trong việc xử lý các mối liên hệ phức tạp, đa chiều giữa thuộc tính không gian và giá bán. Độ tin cậy và tính quy chuẩn của dữ liệu được đối chiếu trực tiếp với khung giá đất nhà nước ban hành theo Quyết định số 02/2020/QĐ-UBND của Ủy ban Nhân dân Thành phố Hồ Chí Minh giai đoạn 2020-2024 kết hợp với cơ sở dữ liệu khảo sát từ hơn 2.000.000 tin đăng thị trường trên Mogi.vn.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

  • Đặc điểm phân phối giá bất động sản: Dữ liệu phân tích thể hiện sự phân bổ lệch phải rõ rệt, trong đó hơn 65% giao dịch tập trung ở phân khúc giá trị từ 1 đến 10 tỷ đồng. Phân khúc nhà ở riêng lẻ ghi nhận mức giá bình quân cao nhất đạt 13,31 tỷ đồng, vượt trội đáng kể so với phân khúc đất nền và căn hộ chung cư.
  • Tác động của quy mô mẫu và đặc trưng dữ liệu đến hiệu năng mô hình: Trong thử nghiệm đầu tiên với 330 bản ghi tại Quận Tân Bình cùng 10 thuộc tính cơ bản, mô hình LightGBM cho hệ số xác định $R^2$ chỉ đạt 0,22. Khi mở rộng quy mô dữ liệu trong thử nghiệm thứ hai lên 850 bản ghi (bổ sung khu vực Thành phố Thủ Đức) và tăng thêm 5 thuộc tính chi tiết về kết cấu kiến trúc, chỉ số $R^2$ của mô hình Fast Forest đã cải thiện vượt bậc lên mức xấp xỉ 0,56 đến 0,58.
  • Mức độ chính xác theo loại hình và diện tích: Mô hình đạt độ chuẩn xác cao nhất đối với các bất động sản có diện tích phổ biến dao động từ 84 m² đến 100 m² và loại hình đất nền, với sai số tuyệt đối ghi nhận chỉ khoảng 9,5%. Ngược lại, các bất động sản thiếu hụt thông tin pháp lý hoặc không có tiện ích kinh doanh mặt phố ghi nhận tỷ lệ sai số cao hơn đáng kể.

Thảo luận kết quả

Khi biểu diễn các kết quả thực nghiệm thông qua biểu đồ phân tán (Scatterplot) và biểu đồ phân phối tần suất giá bán (SellPrice Distribution), mối quan hệ giữa vị trí địa lý và giá trị tài sản được thể hiện rất rõ: khoảng cách càng tiến gần về khu vực lõi trung tâm Quận 1 thì đơn giá trên mỗi mét vuông càng tăng cao đột biến. So sánh với các công trình nghiên cứu tiền nhiệm tại Melbourne (Australia) hay Ames (Hoa Kỳ), việc áp dụng các biến đổi phi tuyến tính và thuật toán cây quyết định cải tiến Fast Forest cho thấy ưu thế vượt trội về tốc độ huấn luyện trên cấu hình phần cứng tiêu chuẩn mà vẫn duy trì khả năng kiểm soát sai số MAE và RMSE ở mức thấp.

Để minh chứng tính ứng dụng thực tế của thuật toán, toàn bộ mô hình dự báo tối ưu đã được đóng gói và tích hợp vào một hệ thống phần mềm hoàn chỉnh, sử dụng nền tảng backend .NET Core 3.1 kết hợp giao diện web frontend Angular 11. Hệ thống cho phép người dùng lọc thuộc tính trực quan và kiểm chứng giá dự báo với sai số sát thực tế so với dữ liệu niêm yết trên thị trường.

Đề xuất và khuyến nghị

  • Chuẩn hóa và mở rộng hệ thống dữ liệu định giá tự động: Đội ngũ kỹ sư dữ liệu và chuyên viên phân tích thị trường cần thiết lập cơ chế cập nhật tự động định kỳ hàng tuần, mở rộng quy mô kho dữ liệu lên tối thiểu 10.000 bản ghi trên toàn bộ 22 quận huyện và Thành phố Thủ Đức. Mục tiêu đạt chỉ số $R^2$ trên 0,75 và hạ sai số tuyệt đối bình quân xuống dưới 8% trong vòng 6 tháng tới.
  • Tích hợp công cụ định giá AI vào các nền tảng công nghệ bất động sản: Các doanh nghiệp PropTech và sàn giao dịch địa ốc cần nhanh chóng triển khai hệ thống giao diện lập trình ứng dụng (API) dựa trên kiến trúc .NET Core và Angular 11, đảm bảo tốc độ phản hồi truy vấn định giá dưới 500 mili-giây, phục vụ tối thiểu 100.000 lượt tra cứu mỗi quý nhằm minh bạch hóa thị trường.
  • Tăng cường liên kết và số hóa dữ liệu quy hoạch pháp lý: Các cơ quan quản lý nhà nước về tài nguyên - môi trường và xây dựng đô thị cần đẩy mạnh số hóa 100% hồ sơ địa chính, tích hợp bảng giá đất theo Quyết định số 02/2020/QĐ-UBND cùng dữ liệu lộ giới hẻm vào hệ sinh thái dữ liệu mở trong lộ trình 12 tháng, tạo cơ sở pháp lý chuẩn mực cho các mô hình học máy.
  • Đào tạo kỹ năng ứng dụng trí tuệ nhân tạo cho chuyên viên thẩm định: Các hiệp hội bất động sản phối hợp cùng viện nghiên cứu tổ chức định kỳ 12 khóa tập huấn chuyên sâu mỗi năm cho hơn 500 thẩm định viên tại các ngân hàng thương mại, giúp chuẩn hóa quy trình sử dụng mô hình học máy để rút ngắn thời gian thẩm định tài sản bảo đảm.

Đối tượng nên tham khảo luận văn

  • Học viên cao học và nhà nghiên cứu ngành Khoa học Dữ liệu, Hệ thống Thông tin: Cung cấp tài liệu tham khảo chi tiết về quy trình kỹ thuật đặc trưng (feature engineering), ứng dụng ML.NET AutoML và phương pháp so chuẩn hiệu năng giữa các thuật toán SDCA, Fast Forest, LightGBM trên bộ dữ liệu thực nghiệm hơn 2.000 mẫu.
  • Chuyên viên thẩm định giá và quản trị rủi ro tín dụng tại các ngân hàng thương mại: Cung cấp phương pháp luận ứng dụng mô hình học máy để tự động hóa khâu định giá tài sản thế chấp, giúp cắt giảm thời gian phê duyệt hồ sơ vay vốn từ 3 ngày làm việc xuống dưới 15 phút mà vẫn bảo đảm độ tin cậy cao.
  • Nhà đầu tư cá nhân và tổ chức kinh doanh bất động sản: Hỗ trợ công cụ sàng lọc và định giá khoa học dựa trên 15 thuộc tính cấu thành, giúp hạn chế rủi ro mua vượt giá thị trường từ 50% đến 200% tại các khu vực đang biến động mạnh như Thành phố Thủ Đức hay Quận Tân Bình.
  • Kỹ sư công nghệ phần mềm và kiến trúc sư hệ thống: Cung cấp bản thiết kế hoàn chỉnh về việc tích hợp mô hình máy học đã huấn luyện vào hệ thống ứng dụng Web hiện đại, kết hợp đồng bộ giữa .NET Core 3.1 ở tầng máy chủ và Angular 11 ở tầng giao diện người dùng.

Câu hỏi thường gặp

  • Thuật toán học máy nào mang lại độ chính xác cao nhất trong nghiên cứu này? Mô hình rừng cây quyết định nhanh Fast Forest đạt hiệu năng tối ưu nhất với hệ số xác định $R^2$ ghi nhận từ 0,56 đến 0,58 trong thử nghiệm mở rộng 850 mẫu. Thuật toán này vượt trội hơn mô hình hồi quy tuyến tính SDCA nhờ năng lực xử lý hiệu quả các mối quan hệ phi tuyến và hạn chế hiện tượng quá khớp dữ liệu.
  • Quy mô dữ liệu và số lượng biến số ảnh hưởng ra sao đến độ chính xác của mô hình? Khi nâng quy mô từ 330 bản ghi với 10 thuộc tính lên 2.010 bản ghi với 15 thuộc tính, chỉ số $R^2$ được cải thiện rõ rệt từ mức 0,22 lên trên 0,56. Việc bổ sung các đặc trưng cấu trúc như số phòng, số tầng và tình trạng pháp lý giúp giảm độ lệch dự báo xuống chỉ còn 9,5% ở phân khúc đất nền.
  • Phân khúc bất động sản nào chiếm tỷ trọng giao dịch lớn nhất tại Thành phố Hồ Chí Minh? Kết quả phân tích 2.010 quan sát thực tế chỉ ra rằng hơn 65% bất động sản được chào bán nằm trong khoảng giá từ 1 đến 10 tỷ đồng. Trong đó, loại hình nhà ở riêng lẻ ghi nhận mức giá bán trung bình cao nhất đạt 13,31 tỷ đồng, phản ánh nhu cầu sở hữu nhà liền thổ chiếm ưu thế tuyệt đối.
  • Hệ thống công nghệ nào được sử dụng để hiện thực hóa mô hình dự báo lên ứng dụng web? Nghiên cứu ứng dụng công cụ ML.NET Model Builder để tự động hóa quy trình huấn luyện học máy, sau đó nhúng mô hình vào dịch vụ Web API xây dựng trên .NET Core 3.1 và phát triển giao diện người dùng bằng Angular 11. Hệ thống vận hành mượt mà với thời gian phản hồi định giá chưa tới 1 giây.
  • Độ tin cậy của tập dữ liệu khảo sát được kiểm chứng qua những nguồn căn cứ nào? Dữ liệu được đối chuẩn chặt chẽ với bảng giá đất của Ủy ban Nhân dân Thành phố Hồ Chí Minh theo Quyết định số 02/2020/QĐ-UBND giai đoạn 2020-2024. Đồng thời, các thuộc tính giá và vị trí được kiểm tra chéo với hơn 2.000.000 tin đăng thực tế từ hệ thống dữ liệu Mogi.vn và Muaban.net.

Kết luận

  • Hoàn thành thu thập, tiền xử lý và chuẩn hóa thành công 2.010 bản ghi dữ liệu bất động sản thực tế tại 4 khu vực trọng điểm của Thành phố Hồ Chí Minh.
  • Chứng minh mô hình học máy Fast Forest và LightGBM mang lại hiệu năng dự báo vượt trội với hệ số $R^2$ đạt từ 0,56 đến 0,58, vượt xa mô hình hồi quy tuyến tính cổ điển.
  • Xác định rõ ràng 15 biến số có tác động mạnh nhất đến giá trị tài sản, đặc biệt là diện tích, vị trí hành chính, khả năng tiếp cận mặt phố và tính minh bạch pháp lý.
  • Xây dựng hoàn chỉnh giải pháp ứng dụng Web tích hợp mô hình định giá thời gian thực trên kiến trúc công nghệ hiện đại .NET Core 3.1 và Angular 11.
  • Đóng góp công cụ định lượng khoa học giúp giải quyết bài toán bất cân xứng thông tin và hạn chế rủi ro định giá sai lệch trên thị trường nhà đất đô thị.

Trong lộ trình 12 tháng tiếp theo, nghiên cứu hướng đến việc mở rộng tập dữ liệu lên hơn 50.000 quan sát phủ khắp 22 quận huyện, tích hợp thêm các chỉ số kinh tế vĩ mô và mạng nơ-ron học sâu để nâng cao độ chính xác. Quý bạn đọc và các nhà nghiên cứu quan tâm hãy tham khảo toàn văn luận văn để ứng dụng hiệu quả giải pháp định giá bất động sản bằng trí tuệ nhân tạo vào thực tiễn công việc.