Báo cáo đồ án môn học về dự đoán giá nhà California bằng Machine Learning - Trường Đại học Thủy Lợi

Báo cáo đồ án môn học dự đoán giá nhà California. Nghiên cứu và phân tích các yếu tố ảnh hưởng, mô hình dự đoán giá nhà hiệu quả. Xem ngay!

Trường đại học

Trường Đại học Thủy Lợi

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

Báo cáo đồ án môn học

2023

46
1
0

Phí lưu trữ

30 Point

Tóm tắt

I. Tổng quan dự án dự đoán giá nhà California bằng học máy

Dự án dự đoán giá nhà California là một bài toán kinh điển trong lĩnh vực học máy, giúp giải quyết nhu cầu thực tiễn của thị trường bất động sản. Việc xây dựng một mô hình dự báo chính xác không chỉ hỗ trợ các nhà đầu tư và người mua nhà đưa ra quyết định sáng suốt mà còn là cơ hội để áp dụng các kỹ thuật phân tích dữ liệu phức tạp. Đồ án này tập trung vào việc sử dụng bộ dữ liệu California Housing Prices nổi tiếng từ Kaggle để huấn luyện và đánh giá các mô hình hồi quy. Quá trình thực hiện bao gồm các giai đoạn cốt lõi: thu thập và tiền xử lý dữ liệu, khám phá và trực quan hóa thông tin, xây dựng mô hình với các thuật toán khác nhau, và cuối cùng là đánh giá hiệu suất để tìm ra giải pháp tối ưu nhất. Bài toán này không chỉ đòi hỏi kiến thức về thuật toán mà còn yêu cầu kỹ năng xử lý các vấn đề thực tế như dữ liệu thiếu, nhiễu và các biến không tương quan. Mục tiêu cuối cùng là tạo ra một sản phẩm có khả năng dự báo giá trị nhà ở (Median House Value) với độ chính xác cao, dựa trên các thuộc tính đầu vào như vị trí địa lý, thu nhập trung bình, tuổi đời của ngôi nhà và nhiều yếu tố khác. Báo cáo này sẽ trình bày chi tiết từng bước, từ lý do chọn đề tài đến kết quả cuối cùng và những hướng phát triển tiềm năng trong tương lai, mang lại cái nhìn toàn diện và sâu sắc về ứng dụng của học máy trong ngành bất động sản.

1.1. Mục tiêu cốt lõi của đề tài dự đoán giá nhà

Mục tiêu chính của đề tài là xây dựng một mô hình dự đoán giá nhà tại California với độ chính xác cao. Để đạt được điều này, dự án tập trung vào việc áp dụng các thuật toán học máy phổ biến như Linear Regression, Decision Tree, và Random Forest. Một mục tiêu quan trọng khác là trau dồi và phát triển kỹ năng phân tích, tiền xử lý dữ liệu và xây dựng mô hình từ dữ liệu thực tế. Phạm vi của dự án bao gồm toàn bộ quy trình khoa học dữ liệu: từ việc làm sạch, xử lý các giá trị thiếu, mã hóa biến, đến việc huấn luyện mô hình, tinh chỉnh siêu tham số và đánh giá hiệu suất. Kết quả của dự án không chỉ dừng lại ở việc tìm ra mô hình tốt nhất mà còn cung cấp những phân tích sâu sắc về các yếu tố ảnh hưởng lớn nhất đến giá nhà, qua đó mang lại giá trị thực tiễn cho các quyết định đầu tư bất động sản.

1.2. Giới thiệu bộ dữ liệu California Housing Prices

Bộ dữ liệu California Housing Prices là một nguồn tài nguyên tiêu chuẩn được lấy từ nền tảng Kaggle. Tập dữ liệu này chứa thông tin chi tiết về các khu vực dân cư khác nhau tại California. Các thuộc tính chính bao gồm Median Income (thu nhập trung bình), Housing Median Age (tuổi trung bình của nhà), Total Rooms (tổng số phòng), Population (dân số), và Median House Value (giá trị nhà trung bình), là biến mục tiêu cần dự đoán. Ngoài ra, các thuộc tính quan trọng khác là Longitude (kinh độ), Latitude (vĩ độ) và Ocean Proximity (mức độ gần biển). Biến Ocean Proximity là một biến phân loại (categorical), thể hiện vị trí của khu nhà so với đại dương, đây là một yếu tố có ảnh hưởng đáng kể đến giá trị bất động sản và cần được xử lý đặc biệt trong giai đoạn tiền xử lý.

II. Phân tích thách thức trong bài toán dự đoán giá nhà

Bài toán dự đoán giá nhà California đặt ra nhiều thách thức đáng kể, phản ánh sự phức tạp của thị trường bất động sản trong thực tế. Giá nhà không phụ thuộc vào một yếu tố duy nhất mà là kết quả của sự tương tác phức tạp giữa nhiều biến số kinh tế, xã hội và địa lý. Một trong những thách thức lớn nhất là chất lượng của dữ liệu đầu vào. Bộ dữ liệu có thể chứa các giá trị bị thiếu (missing data), các điểm dữ liệu ngoại lai (outliers) do sai sót trong quá trình thu thập, hoặc các biến có độ tương quan cao gây nhiễu cho mô hình. Việc xử lý hiệu quả những vấn đề này đòi hỏi các kỹ thuật tiền xử lý dữ liệu chuyên sâu để đảm bảo mô hình học được từ những thông tin chính xác và đáng tin cậy. Hơn nữa, việc lựa chọn và xây dựng các đặc trưng (feature engineering) phù hợp cũng là một thử thách. Ví dụ, việc kết hợp các biến có sẵn để tạo ra các đặc trưng mới như tỷ lệ phòng ngủ trên tổng số phòng có thể giúp cải thiện độ chính xác của mô hình. Cuối cùng, việc chọn đúng thuật toán và tinh chỉnh siêu tham số để mô hình có khả năng tổng quát hóa tốt trên dữ liệu mới là yếu tố quyết định sự thành công của dự án. Một mô hình quá khớp (overfitting) sẽ hoạt động tốt trên tập huấn luyện nhưng lại dự đoán kém trên thực tế.

2.1. Tầm quan trọng của việc dự báo giá bất động sản

Dự báo giá bất động sản có ý nghĩa thực tiễn to lớn, hỗ trợ các bên liên quan từ người mua, người bán đến các nhà đầu tư và nhà hoạch định chính sách. Một mô hình dự đoán giá nhà chính xác giúp người mua và bán xác định được mức giá hợp lý, tránh các quyết định cảm tính. Đối với các nhà đầu tư, mô hình này là công cụ phân tích rủi ro và tiềm năng sinh lời, giúp tối ưu hóa danh mục đầu tư. Việc hiểu rõ các yếu tố ảnh hưởng đến giá nhà cũng giúp các cơ quan chính phủ đưa ra các chiến lược quy hoạch đô thị và phát triển cơ sở hạ tầng hiệu quả hơn. Do đó, việc giải quyết bài toán dự đoán giá nhà California không chỉ là một bài tập học thuật mà còn mang lại giá trị ứng dụng cao.

2.2. Các yếu tố phức tạp ảnh hưởng đến giá nhà ở California

Giá nhà tại California chịu ảnh hưởng bởi một tập hợp đa dạng các yếu tố. Dữ liệu cho thấy các yếu tố kinh tế như Median Income có tương quan mạnh với giá nhà. Các đặc điểm của bất động sản như Housing Median Age hay số lượng phòng cũng đóng vai trò quan trọng. Tuy nhiên, yếu tố địa lý lại có tác động đặc biệt lớn. Theo phân tích trực quan hóa dữ liệu trong đồ án, những khu vực gần biển (Ocean Proximity = 'NEAR OCEAN' hoặc 'ISLAND') có mức giá trung bình cao hơn đáng kể so với những khu vực trong đất liền (INLAND). Các tọa độ địa lý LongitudeLatitude cũng là những chỉ báo quan trọng, phản ánh sự khác biệt về giá giữa các thành phố lớn và các vùng nông thôn. Sự kết hợp của những yếu tố này tạo ra một bức tranh phức tạp, đòi hỏi các mô hình học máy đủ mạnh để nắm bắt các mối quan hệ phi tuyến tính này.

III. Hướng dẫn tiền xử lý dữ liệu giá nhà California hiệu quả

Chất lượng của một mô hình học máy phụ thuộc rất lớn vào chất lượng dữ liệu đầu vào. Do đó, tiền xử lý dữ liệu là một giai đoạn không thể thiếu và mang tính quyết định trong dự án dự đoán giá nhà California. Quy trình này bao gồm một chuỗi các bước được thiết kế để làm sạch, chuẩn hóa và biến đổi dữ liệu thô thành một định dạng phù hợp cho việc huấn luyện mô hình. Bắt đầu bằng việc kiểm tra và xử lý các giá trị bị thiếu (missing data) và các giá trị trùng lặp, đảm bảo tính toàn vẹn của tập dữ liệu. Tiếp theo, các giá trị ngoại lai (outliers) cần được xác định và xử lý cẩn thận để chúng không làm sai lệch kết quả học của mô hình. Một bước quan trọng khác là xử lý các biến phân loại, chẳng hạn như thuộc tính Ocean Proximity. Vì các thuật toán học máy chủ yếu làm việc với dữ liệu số, các biến này cần được mã hóa thành các giá trị số học. Cuối cùng, việc trực quan hóa dữ liệu thông qua các biểu đồ phân tán, biểu đồ hộp giúp khám phá các mối quan hệ ẩn, xác định các đặc trưng quan trọng và cung cấp định hướng cho việc xây dựng mô hình. Toàn bộ quy trình này đảm bảo rằng dữ liệu được đưa vào mô hình là sạch, có cấu trúc và giàu thông tin nhất có thể.

3.1. Quy trình làm sạch và xử lý giá trị thiếu missing data

Trong bộ dữ liệu California Housing Prices, việc đầu tiên là kiểm tra sự tồn tại của các giá trị rỗng (NaN) hoặc thiếu. Tài liệu gốc đã chỉ ra rằng việc kiểm tra và xóa các hàng chứa dữ liệu thiếu là một bước cần thiết để đảm bảo mô hình không bị ảnh hưởng bởi thông tin không đầy đủ. Tương tự, các hàng dữ liệu bị trùng lặp cũng được loại bỏ để tránh việc mô hình bị thiên vị. Sau khi làm sạch, dữ liệu sẽ trở nên nhất quán và đáng tin cậy hơn, sẵn sàng cho các bước phân tích và mô hình hóa tiếp theo.

3.2. Kỹ thuật mã hóa biến phân loại Categorical Encoding

Thuộc tính Ocean Proximity là một biến phân loại với các giá trị như '<1H OCEAN', 'INLAND', 'NEAR OCEAN', 'NEAR BAY', 'ISLAND'. Các mô hình học máy không thể xử lý trực tiếp dữ liệu dạng chuỗi này. Do đó, kỹ thuật mã hóa được áp dụng. Trong đồ án này, LabelEncoder từ thư viện Scikit-learn được sử dụng để chuyển đổi năm giá trị chuỗi này thành các số nguyên từ 0 đến 4. Bước chuyển đổi này cho phép thuật toán hồi quy xử lý Ocean Proximity như một đặc trưng số học, qua đó nắm bắt được ảnh hưởng của vị trí địa lý đến việc dự đoán giá nhà.

3.3. Trực quan hóa dữ liệu để khám phá thông tin chi tiết

Trực quan hóa là một công cụ mạnh mẽ để hiểu sâu hơn về dữ liệu. Bằng cách sử dụng các thư viện như matplotlibseaborn trong Python, đồ án đã tạo ra một biểu đồ phân tán (scatter plot) thể hiện sự phân bổ dân số và giá nhà trên bản đồ California. Biểu đồ này cho thấy một xu hướng rõ ràng: giá nhà có xu hướng tăng mạnh ở những khu vực ven biển Đại Tây Dương. Phát hiện này khẳng định tầm quan trọng của các biến địa lý như Longitude, Latitude, và đặc biệt là Ocean Proximity trong việc dự đoán giá nhà, cung cấp một cơ sở vững chắc cho việc lựa chọn đặc trưng sau này.

IV. Top 3 mô hình học máy dự đoán giá nhà California tối ưu

Việc lựa chọn thuật toán phù hợp là yếu tố then chốt để xây dựng một mô hình dự đoán giá nhà chính xác và hiệu quả. Dựa trên tính chất của bài toán hồi quy (dự đoán một giá trị liên tục), đồ án đã triển khai và so sánh ba mô hình học máy phổ biến và mạnh mẽ. Bắt đầu với Linear Regression (Hồi quy tuyến tính) như một mô hình cơ sở để thiết lập một đường chuẩn hiệu suất. Đây là một phương pháp đơn giản nhưng hiệu quả để nắm bắt các mối quan hệ tuyến tính giữa các đặc trưng và biến mục tiêu. Tiếp theo, Decision Tree Regressor (Cây quyết định hồi quy) được sử dụng. Mô hình này có khả năng học các mối quan hệ phi tuyến tính phức tạp bằng cách chia dữ liệu thành các tập con nhỏ hơn. Cuối cùng, Random Forest Regressor (Rừng ngẫu nhiên hồi quy), một thuật toán học tập tập thể (ensemble learning), được triển khai. Bằng cách kết hợp dự đoán từ nhiều cây quyết định, Random Forest thường mang lại độ chính xác cao hơn và khả năng chống nhiễu tốt hơn. Mỗi mô hình được huấn luyện trên cùng một tập dữ liệu đã qua tiền xử lý và sau đó được đánh giá bằng các chỉ số đo lường hiệu suất thống nhất để có sự so sánh khách quan nhất.

4.1. Áp dụng mô hình Hồi quy tuyến tính Linear Regression

Linear Regression là thuật toán giả định rằng có một mối quan hệ tuyến tính giữa các biến đầu vào và biến mục tiêu. Trong dự án, mô hình này được triển khai bằng lớp LinearRegression() của thư viện Scikit-learn. Mặc dù dễ triển khai và diễn giải, kết quả từ đồ án cho thấy Linear Regression dự đoán giá nhà có phần thấp hơn và chưa thực sự chính xác so với dữ liệu thực tế. Mô hình này đóng vai trò là một điểm tham chiếu quan trọng để đánh giá sự cải thiện của các thuật toán phức tạp hơn.

4.2. Xây dựng mô hình Cây quyết định Decision Tree

Decision Tree Regressor hoạt động bằng cách xây dựng một cấu trúc cây, trong đó mỗi nút đại diện cho một quyết định dựa trên một đặc trưng. Mô hình này có khả năng nắm bắt các mối quan hệ phi tuyến tính mà Linear Regression bỏ lỡ. Kết quả thực nghiệm trong báo cáo cho thấy mô hình cây quyết định cho kết quả khả quan hơn, các giá trị dự đoán bám sát hơn so với giá trị thực. Tuy nhiên, một nhược điểm của cây quyết định đơn lẻ là dễ bị quá khớp (overfitting), do đó cần các kỹ thuật tối ưu hóa như Cross-Validation.

4.3. Tối ưu với mô hình Rừng ngẫu nhiên Random Forest

Random Forest là một trong những thuật toán hiệu quả nhất cho cả bài toán phân loại và hồi quy. Nó xây dựng một "khu rừng" gồm nhiều cây quyết định và lấy giá trị trung bình của các dự đoán từ tất cả các cây để đưa ra kết quả cuối cùng. Cách tiếp cận này giúp giảm phương sai và hạn chế overfitting. Trong dự án dự đoán giá nhà California, Random Forest đã chứng tỏ hiệu suất vượt trội. Các chỉ số đánh giá lỗi như MSERMSE đều thấp hơn đáng kể so với hai mô hình còn lại, khẳng định đây là mô hình tốt nhất trong ba thuật toán được thử nghiệm.

V. Cách đánh giá và so sánh hiệu suất các mô hình dự đoán

Xây dựng mô hình chỉ là một phần của quá trình; đánh giá mô hình là bước thiết yếu để xác định mức độ hiệu quả và độ tin cậy của nó. Để đánh giá các mô hình dự đoán giá nhà California, một bộ các chỉ số đo lường (metrics) tiêu chuẩn cho bài toán hồi quy đã được sử dụng. Các chỉ số này giúp lượng hóa sai số giữa giá trị dự đoán và giá trị thực tế, cho phép so sánh khách quan hiệu suất giữa các thuật toán khác nhau. Cụ thể, các chỉ số như Sai số bình phương trung bình (Mean Squared Error - MSE), Căn bậc hai của sai số bình phương trung bình (Root Mean Squared Error - RMSE) và Sai số tuyệt đối trung bình (Mean Absolute Error - MAE) đã được tính toán trên tập dữ liệu kiểm thử (test set). Ngoài ra, để đảm bảo mô hình có khả năng tổng quát hóa tốt và không chỉ hoạt động hiệu quả trên một tập dữ liệu cụ thể, kỹ thuật Cross-Validation (Kiểm định chéo) đã được áp dụng. Kỹ thuật này giúp tinh chỉnh các siêu tham số (hyperparameters) của mô hình, chẳng hạn như độ sâu tối đa của cây, để tìm ra cấu hình tối ưu nhất. Cuối cùng, một bảng so sánh tổng hợp các chỉ số hiệu suất của cả ba mô hình được tạo ra, cung cấp một cái nhìn rõ ràng về thuật toán nào là lựa chọn tốt nhất cho bài toán.

5.1. Các chỉ số đo lường MSE RMSE và MAE

Để đo lường sai số dự đoán, ba chỉ số chính đã được sử dụng. MSE tính trung bình của bình phương các sai số, có xu hướng khuếch đại các lỗi lớn. RMSE là căn bậc hai của MSE, đưa đơn vị đo lường về cùng đơn vị với biến mục tiêu (giá nhà), giúp dễ diễn giải hơn. MAE tính trung bình của giá trị tuyệt đối các sai số, ít nhạy cảm với các giá trị ngoại lai hơn MSE. Việc sử dụng đồng thời cả ba chỉ số này cung cấp một cái nhìn toàn diện về hiệu suất của từng mô hình dự đoán giá nhà.

5.2. Kỹ thuật Cross Validation để tăng độ tin cậy mô hình

Cross-Validation là một phương pháp được sử dụng để đánh giá hiệu suất của mô hình trên dữ liệu mà nó chưa từng thấy. Trong đồ án, các lớp GridSearchCVRandomizedSearchCV của Scikit-learn đã được dùng để thực hiện kiểm định chéo. Quá trình này không chỉ giúp đánh giá mô hình một cách đáng tin cậy hơn mà còn tìm ra bộ siêu tham số tốt nhất (ví dụ: max_depth, min_samples_split) cho các mô hình Decision TreeRandom Forest. Kết quả cho thấy, sau khi tinh chỉnh qua Cross-Validation, hiệu suất của mô hình đã được cải thiện, thể hiện qua việc giảm các chỉ số lỗi trên tập kiểm thử.

5.3. So sánh kết quả dự đoán trên tập dữ liệu thử nghiệm

Sau khi huấn luyện và tối ưu, cả ba mô hình được đánh giá trên một tập dữ liệu thử nghiệm cuối cùng. Một DataFrame so sánh đã được tạo ra để đối chiếu các chỉ số MSE, RMSE, và MAE của Linear Regression, Decision Tree, và Random Forest. Kết quả phân tích cuối cùng đã khẳng định một cách rõ ràng: thuật toán Random Forest cho kết quả dự đoán tốt nhất với các chỉ số lỗi thấp nhất, tiếp theo là Decision Tree, và cuối cùng là Linear Regression. Điều này phù hợp với lý thuyết rằng các mô hình học tập tập thể thường có hiệu suất vượt trội trong các bài toán phức tạp.

VI. Kết luận Hướng phát triển cho dự đoán giá nhà tương lai

Dự án dự đoán giá nhà California đã hoàn thành các mục tiêu đề ra, từ việc xử lý một bộ dữ liệu thực tế đến việc xây dựng và so sánh các mô hình học máy khác nhau. Quá trình này đã mang lại nhiều kết quả quan trọng và những bài học kinh nghiệm sâu sắc. Báo cáo đã chứng minh rằng thông qua các bước tiền xử lý dữ liệu cẩn thận và lựa chọn thuật toán phù hợp, có thể xây dựng được một mô hình dự báo với độ chính xác cao. Cụ thể, mô hình Random Forest đã thể hiện hiệu suất vượt trội, cho thấy sức mạnh của các phương pháp học tập tập thể trong việc giải quyết các bài toán hồi quy phức tạp. Các kết quả này không chỉ có giá trị học thuật mà còn có tiềm năng ứng dụng lớn trong ngành bất động sản, hỗ trợ việc ra quyết định dựa trên dữ liệu. Tuy nhiên, luôn có những không gian để cải tiến và phát triển thêm. Với nền tảng kiến thức và kỹ năng hiện có, dự án có thể được mở rộng theo nhiều hướng khác nhau để tăng cường độ chính xác và tính thực tiễn. Tương lai của lĩnh vực này hứa hẹn sẽ tích hợp các công nghệ tiên tiến hơn, dữ liệu đa dạng hơn để tạo ra những công cụ dự báo ngày càng thông minh và đáng tin cậy.

6.1. Tổng kết những kết quả chính của dự án

Kết luận chính rút ra từ báo cáo là việc ứng dụng thành công các thuật toán học máy để dự đoán giá nhà California. Dự án đã thực hiện đầy đủ các bước từ thu thập, tiền xử lý dữ liệu đến xây dựng và đánh giá mô hình. Kết quả so sánh cho thấy Random Forest là mô hình hiệu quả nhất, với các chỉ số sai số MSERMSE thấp nhất. Điều này khẳng định rằng các mô hình phức tạp hơn, có khả năng nắm bắt các mối quan hệ phi tuyến tính, sẽ hoạt động tốt hơn trên bộ dữ liệu này so với mô hình tuyến tính đơn giản.

6.2. Triển vọng và tiềm năng ứng dụng trong thực tế

Về hướng phát triển trong tương lai, đồ án đề xuất một số cải tiến tiềm năng. Thứ nhất, có thể mở rộng bộ dữ liệu bằng cách tích hợp thêm các biến kinh tế vĩ mô như lãi suất, tỷ lệ lạm phát, hoặc các biến động thị trường. Thứ hai, có thể thử nghiệm các mô hình học máy mạnh mẽ hơn như Gradient Boosting hoặc các mô hình Deep Learning. Ngoài ra, việc tích hợp dữ liệu hình ảnh về ngôi nhà cũng là một hướng đi hứa hẹn. Về mặt ứng dụng, mô hình có thể được triển khai thành một giao diện người dùng thân thiện, cho phép người dùng nhập thông tin và nhận được ước tính giá nhà một cách nhanh chóng, phục vụ trực tiếp cho nhu cầu của thị trường bất động sản.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

15/09/2025
Báo cáo đồ án môn học đề tài canifornia housing prices prediction

Trích đoạn nội dung tài liệu

BỘ NÔNG NGHIỆP VÀ PHÁT TRIỂN NÔNG THÔN PHÂN HIỆU TRƯỜNG ĐẠI HỌC THỦY LỢI BỘ MÔN CÔNG NGHỆ THÔNG TIN ---------- BÁO CÁO ĐỒ ÁN MÔN HỌC Đề tài Canifornia Housing Prices Prediction BỘ NÔNG Giảng viên hướng dẫn: ThS. Vũ Thị Hạnh Sinh viên thực hiện: Đinh Hồng Anh Nguyễn Thị Thanh Mai Hàng Đức Phú Võ Lê Hậu NGHIỆP VÀ PHÁT TRIỂN NÔNG THÔN PHÂN HIỆU TRƯỜNG ĐẠI HỌC THỦY LỢI HỌ VÀ TÊN Đinh Hồng Anh Nguyễn Thị Thanh Mai Hàng Đức Phú Võ Lê Hậu California Housing Prices Prediction Ngành: CÔNG NGHỆ THÔNG TIN NGƯỜI HƯỚNG DẪN: ThS. Vũ Thị Hạnh HỒ CHÍ MINH, NĂM 2023 LỜI CAM ĐOAN Nhóm 3 xin cam đoan đây là Đồ án môn học của nhóm chúng em. Các kết quả trong Đồ án môn học này là trung thực, và không sao chép từ bất kỳ một nguồn nào và dưới bất kỳ hình thức nào.

Việc tham khảo các nguồn tài liệu (nếu có) đã được thực hiện trích dẫn và ghi nguồn tài liệu tham khảo đúng quy định. LỜI CÁM ƠN Nhóm 3 xin trân trọng cám ThS. Vũ Thị Hạnh và các bạn đóng góp ý kiến cho việc soạn thảo tài liệu trình bày Đồ án môn học này. Nhóm sinh viên thực hiện Ni dung LỜI CAM ĐOAN.4 PHẦN 1 : TỔNG QUAN VỀ ĐỀ TÀI.1 Lý do chọn đề tài :.2 Giới thiệu về bộ dữ liệu California Housing Price.3 Mục tiêu và phạm vi của đề tài.2 Tại sao cần học Học máy?.3 Máy học có bao nhiêu phương pháp?.4 Các chức năng của học máy?.5 Vậy học máy có những ứng dụng gì?.

Xây dựng và đánh giá mô hình dự đoán.1 Tiền xử lý dữ liệu.11 - Đọc dữ liệu từ file csv.12 - Xem dữ liệu:.13 - Kiểm tra shape của dữ liệu:.14 - Kiểm tra và xóa missing data.15 - Kiểm tra và xóa những giá trị trùng lặp:.16 - Handle outlier values:.2 Understanding and Visualize.22 Visualize cách phân bổ dân số và giá nhà dọc theo bản đồ California:.24 Phân phối giá trị trung bình:.3 Phân chia dữ liệu huấn luyện.4 Mô hình dự đoán giá nhà Linear Regression, Decision Regression Tree và Random Forest.2 Decision Regression Tree.5 Đánh giá trên dữ liệu thử nghiệm.5 Kết luận dự án.44 PH ẦN 1 : T ỔNG QUAN VỀ ĐỀ TÀI 1.1 Lý do chọ n đề tài : Sau một thời gian tham khảo về các đề tài về dự đoán và nhận dạng trên Kaggle cũng như các nền tảng khác, chúng em đã quyết định lựa chọn một đề tài về bài toán dự đoán giá nhà tại California vì những lý do sau: - Bộ dữ liệu California Housing Prices chứa nhiều thông tin về giá nhà tại nhiều khu vực khác nhau ở California. Chúng em sẽ có cơ hội thực hiện phân tích và dự đoán giá nhà dựa trên nhiều yếu tố như độ tuổi trung bình của nhà, thu nhập trung bình, số phòng ngủ,. - Dự đoán giá nhà là một thách thức thực tế và có ứng dụng rộng rãi trong thị trường bất động sản. Kỹ thuật dự đoán giá nhà có thể được ứng dụng trong các dự đoán thực tế như hỗ trợ việc quyết định mua bán nhà, đầu tư bất động sản,.

- Thực hiện dự đoán giá nhà bằng dữ liệu thực tế giúp sinh viên chúng em trau dồi, phát triển kỹ năng phân tích dữ liệu, xử lý dữ liệu và xây dựng mô hình dự đoán. Sẽ có cơ hội được làm việc nhiều với các thuật toán của machine learning như hồi quy,. - Và cuối cùng, đa số các nhóm khác đều chọn đề tài về nhận dạng nên chúng em quyết định sẽ chọn một bài toán khác là dự đoán để làm đa dạng hơn về các đề tài trong bài báo cáo môn học. Chúng em hy vọng rằng kết quả của đề tài sẽ không chỉ là thành tựu cá nhân mà còn mang lại giá trị và ý nghĩa cho cộng đồng và ngành công nghiệp mà chúng em hướng đến.

Điều này là nguồn động viên lớn, giúp chúng em không ngừng nỗ lực để đạt được những kết quả tích cực và bổ ích nhất từ đề tài này.2ớ Gi ệi thi ều vộ bữ dệ li u California Housing Price Bộ dữ liệu California Housing Price là một tập dữ liệu chi tiết về giá nhà ở California, Hoa Kỳ. Đây là một nguồn dữ liệu quan trọng trong lĩnh vực dự đoán giá nhà và phân tích thị trường bất động sản. Dữ liệu này được cung cấp trên Kaggle, một nền tảng chuyên về kho dữ liệu trong lĩnh vực khoa học dữ liệu. Thông tin cơ bản: - Nguồn dữ liệu: Kaggle - Link đến Dataset: https://www.com/datasets/camnugent/california- housing-prices Cấu trúc dữ liệu: Bộ dữ liệu này một tập hợp các thuộc tính khác nhau, chủ yếu là các yếu tố ảnh hưởng đến giá nhà.

Dưới đây là một số thuộc tính chính: - Median Income (Mức thu nhập trung bình): Thu nhập trung bình của các hộ gia đình trong khu vực nhất định. - Housing Median Age (Độ tuổi trung bình nhà ở): Độ tuổi trung bình của các ngôi nhà trong khu vực. - Total Room (Tổng số phòng): Tổng số phòng trong một một khu vực. - Total Bedroom (Tổng số phòng ngủ): Tổng số phòng ngủ trong một khu vực.

- Population (Số dân): Tổng số người cư trú trong một khu vực. - Household (Hộ gia đình): Tổng số hộ gia đình cư trú trong một khu vực. - Median House Value (Giá nhà trung bình): Giá trị nhà trung bình của các hộ gia đình trong một khu vực nhất định (Tính bằng Dollar). - Ocean Proximity (Gần đại dương): Vị trí của căn nhà có gần đại dương/ biển hay không.

- Longitude (Kinh độ): Là giá trị tọa độ địa lý theo hướng đông sang tây. - Latitude (Vỹ độ): Là giá trị xác định vị trí của một điểm nào đó trên bề mặt Trái Đất.3 ụM c tiêu và ph ạ m viủc a ềđ tài Mục tiêu chính của bài tập là xây dựng một mô hình dự đoán giá nhà tại California bằng những thuộc tính trên như mức thu nhập trung bình, tổng số phòng, vị trí gần biển,. Mô hình này sẽ học từ những dự liệu và áp dụng để dự đoán giá nhà tại California hoặc tất cả các quận khác ở Hoa Kỳ dựa trên những thuộc tính đã cung cấp. Phạm vi của dự án bao gồm việc tiền xử lý dữ liệu, xây dựng mô hình học máy, dự đoán bằng dataset testing và đánh giá mô hình đã xây dựng.1ọ H c máy (Machine Learning) là gì? - Học Máy (Machine Learning - ML) là một lĩnh vực của trí tuệ nhân tạo (AI) tập trung vào việc phát triển và nghiên cứu các phương pháp và mô hình máy học có khả năng tự động học từ dữ liệu.

Trong khi các hệ thống máy học truyền thống thường yêu cầu sự can thiệp của con người để định rõ các quy tắc và quy luật, Học Máy giúp máy tính "học" từ kinh nghiệm và dữ liệu mà không cần sự lập trình cụ thể. - Ba khái niệm chính trong Học Máy : o Huấn luyện (Training): Quá trình huấn luyện máy tính bao gồm cung cấp cho nó một tập dữ liệu huấn luyện, trong đó mỗi mẫu dữ liệu được gán nhãn (label) hoặc có giá trị đầu ra mong muốn. Máy tính sẽ sử dụng các thuật toán học máy để tìm hiểu các mẫu và xây dựng một mô hình dự đoán. o Mô hình (Model): Mô hình học máy là một biểu diễn toán học hoặc thuật toán mà máy tính sử dụng để dự đoán hoặc phân loại dữ liệu mới dựa trên thông tin đã học từ quá trình huấn luyện.

Mô hình có thể là một cây quyết định, một mạng neural, một phương trình toán học, hoặc một thuật toán khác. o Dự đoán (Prediction): Sau khi máy tính đã được huấn luyện, nó có thể sử dụng mô hình đã xây dựng để dự đoán hoặc phân loại dữ liệu mới mà nó chưa từng thấy trước đó. Quá trình này gọi là dự đoán hoặc gán nhãn (labeling) dữ liệu - Trong học máy, một hệ thống máy tính được huấn luyện thông qua việc xem xét các dữ liệu đầu vào và tìm hiểu các mẫu, quy tắc hoặc cấu trúc ẩn trong dữ liệu đó. Máy tính sử dụng thông tin đã học được để tự động dự đoán hoặc đưa ra quyết định cho các dữ liệu mới mà nó chưa từng thấy trước đó.2 ạT i sao ầc n họ c Họ c máy? Học Máy đóng vai trò quan trọng trong việc giải quyết những thách thức phức tạp và khám phá những tri thức ẩn sau dữ liệu lớn mà con người không thể xử lý một cách hiệu quả bằng các phương pháp truyền thống.

Một trong những đặc điểm quan trọng của Học Máy là khả năng tự học và cải thiện theo thời gian mà không cần phải lập trình cụ thể cho từng tác vụ. Học Máy đã và đang thay đổi cách chúng ta làm việc và tư duy về dữ liệu. Trong lĩnh vực y tế, Học Máy có thể giúp dự đoán và chẩn đoán bệnh, tìm kiếm phác đồ điều trị tối ưu, và phát hiện sớm các nguy cơ sức khỏe. Trong ngành công nghiệp, Học Máy hỗ trợ quá trình tự động hóa, tối ưu hóa chuỗi cung ứng, và dự báo nhu cầu thị trường.

Trong tài chính, nó giúp phân tích rủi ro, dự đoán xu hướng thị trường, và tối ưu hóa quyết định đầu tư. Học Máy còn đóng vai trò lớn trong các ứng dụng hàng ngày như trích xuất thông tin từ văn bản, nhận diện giọng nói, và thậm chí là trong xe tự lái. Khả năng "học" từ dữ liệu và áp dụng kiến thức đã học để đưa ra dự đoán hoặc quyết định làm cho Học Máy trở thành một công cụ mạnh mẽ và linh hoạt.3 Máy ọ h c có bao nhiêu phươ ng pháp? Các mô hình học máy được chia thành ba loại chính: Máy học có giám sát: Học máy có giám sát được hiểu là cách sử dụng các tập dữ liệu được gán nhãn để huấn luyện thuật phân loại hoặc dự đoán một kết quả chính xác. Học tập có giám sát giúp các tổ chức giải quyết được nhiều vấn đề trong thực tế trên quy mô lớn.

Một số phương pháp được sử dụng trong học có giám sát bao gồm mạng nơron, mô hình phân lớp (Naive Bayes), hồi quy tuyến tính, hồi quy logistic, rừng ngẫu nhiên (Random forest) và máy hỗ trợ (SVM-support vector machine). Như trong dự án, chúng em sử dụng phương pháp học có giảm sát. Trong trường hợp của bài đồ án môn học dự đoán giá nhà, đầu vào (features) là các thuộc tính như độ tuổi trung bình nhà, số phòng ngủ,. Đầu ra (Label): sẽ là giá nhà, vì giá nhà là biến cần được dự đoán.

Học máy không giám sát: Học không giám sát, còn được gọi là học máy không giám sát, sử dụng các thuật toán học máy để phân tích và phân cụm các tập dữ liệu không được gán nhãn.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ