CHƯƠNG 1: TỔNG QUAN VỀ HỌC MÁY 1.1 Giới thiệu về học máy (Machine Learning) 1.1 Khái niệm Học máy (Machine Learning) thường được viết tắt là ML, nó là một tập con của trí tuệ nhân tạo (AI) cho phép máy tính học từ dữ liệu và đưa ra dự đoán hay quyết định. Nó triển khai các thuật toán nhằm tạo điều kiện thuận lợi cho dự đoán và quyết định này. Các thuật toán được thiết kế với mục đích cải thiện hiệu suất đã trở nên ngày càng chính xác và hiệu quả hơn theo thời gian, đặc biệt khi chúng phải xử lý lượng dữ liệu lớn hơn. [1] Hình 1-1 Minh hoạ AI, học máy và học sâu 1.2 Nguyên tắc hoạt động Cách hoạt động của máy học bao gồm việc đi sâu vào quy trình từng bước để chuyển đổi dữ liệu thô thành những hiểu biết có giá trị.
Quy trình này bao gồm một số bước chính sau: Bước 1: Thu thập dữ liệu − Chất lượng và số lượng của dữ liệu có thể ảnh hưởng trực tiếp đến hiệu suất mô hình. Dữ liệu được thu thập từ nhiều nguồn khác nhau như cơ sở dữ liệu, tập tin văn bản, hình ảnh, tập tin âm thanh hoặc trang web… Trần Hải Thành _ CT2401C 9 − Dữ liệu cần được chuẩn bị theo định dạng phù hợp như là tập CSV, cơ sở dữ liệu và đảm bảo dữ liệu có liên quan đến vấn đề đang giải quyết. Bước 2: Tiền xử lý dữ liệu − Tiền xử lý dữ liệu là một bước quan trọng nó xử lý dữ liệu (loại bỏ trùng lặp, sửa lỗi), xử lý dữ liệu bị thiếu (xóa hoặc điền vào) và chuẩn hóa dữ liệu. − Quá trình tiền xử lý cải thiện chất lượng dữ liệu đảm bảo mô hình học máy có thể diễn giải dữ liệu đó một cách chính xác, cải thiện đáng kể độ chính xác của mô hình.
Bước 3: Chọn mô hình phù hợp − Sau khi dữ liệu được chuẩn bị tiếp theo sẽ chọn mô hình. Có nhiều loại mô hình để lựa chọn, bao gồm hồi quy tuyến tính, cây quyết định và mạng lưới thần kinh. Lựa chọn mô hình tùy thuộc vào bản chất của dữ liệu và vấn đề đang giải quyết. − Các yếu tố cần xem xét bao gồm kích thước và loại dữ liệu, độ phức tạp của vấn đề và tài nguyên sẵn có.
Bước 4: Huấn luyện mô hình − Quá trình huấn luyện mô hình bao gồm đưa dữ liệu vào mô hình và cho phép mô hình điều chỉnh các tham số bên trong để dự đoán kết quả đầu ra tốt hơn. − Trong quá trình huấn luyện, điều quan trọng là tránh bị trang bị quá mức (mô hình hoạt động tốt trên dữ liệu huấn luyện nhưng kém trên dữ liệu mới) và trang bị thiếu (mô hình hoạt động kém trên cả dữ liệu huấn luyện và dữ liệu mới). Trần Hải Thành _ CT2401C 10 Bước 5: Đánh giá mô hình − Thử nghiệm mô hình trên dữ liệu mới mà nó chưa thấy trong quá trình đào tạo. Các số liệu phổ biến để đánh giá hiệu suất của mô hình bao gồm độ chính xác (đối với các vấn đề phân loại), độ chính xác và thu hồi (đối với các vấn đề phân loại nhị phân) và sai số bình phương trung bình (đối với các vấn đề hồi quy).
Bước 6: Điều chỉnh và tối ưu hóa siêu tham số − Điều chỉnh các siêu tham số của nó để cải thiện hiệu suất của nó. Sự tiến bộ này được gọi là điều chỉnh tham số hoặc tối ưu hoa siêu tham số. Các kỹ thuật điều chỉnh siêu tham số bao gồm tìm kiếm dạng lưới (thử các kết hợp tham số khác nhau) và xác thực chéo (thử chia dữ liệu của mình thành các tập hợp con và huấn luyện mô hình của mình trên từng tập hợp con để đảm bảo nó hoạt động tốt trên các dữ liệu khác nhau). Bước 7: Dự đoán và triển khai − Sau khi mô hình được đào tạo và tối ưu hóa, nó sẵn sàng đưa ra dự đoán về dữ liệu mới.
Quá trình này bao gồm việc cung cấp dữ liệu mới vào mô hình và sử dụng kết quả đầu ra của mô hình để đưa ra quyết định hoặc phân tích sâu hơn. Việc triển khai mô hình bao gồm việc tích hợp mô hình vào môi trường sản xuất nơi mô hình có thể xử lý dữ liệu trong thế giới thực và cung cấp thông tin chi tiết theo thời gian thực.3 Ứng dụng của học máy trong thực tế Machine Learning (ML) đang được áp dụng rộng rãi trong nhiều lĩnh vực khác nhau trong thực tế. Dưới đây là một số lĩnh vực phổ biến mà ML đang được sử dụng: 1. Công nghệ thông tin và Internet: • Công nghệ tìm kiếm: Google, Bing và các công cụ tìm kiếm khác sử dụng ML để cải thiện kết quả tìm kiếm.
Trần Hải Thành _ CT2401C 11 • Dịch thuật tự động: Các dịch vụ như Google Translate sử dụng ML để cải thiện hiệu suất dịch. • Phân loại email: Các hộp thư đến tự động phân loại email vào các danh mục phù hợp bằng ML. Tài chính: • Phân tích rủi ro và giao dịch: Ngân hàng và tổ chức tài chính sử dụng ML để phát hiện gian lận và phân tích rủi ro trong giao dịch tài chính. • Dự báo thị trường: Công ty đầu tư sử dụng ML để dự đoán xu hướng thị trường và đánh giá rủi ro.
Y tế: • Chẩn đoán y học: ML được sử dụng để phát hiện các bệnh từ hình ảnh y khoa, như X-quang và MRI. • Dự đoán bệnh: Các mô hình ML có thể được sử dụng để dự đoán nguy cơ mắc các bệnh lý dựa trên dữ liệu bệnh lý và di truyền. Ô tô tự hành và IoT (Internet vạn vật): • Xe tự lái: Các hãng ô tô như Tesla và Waymo sử dụng ML để phát triển công nghệ xe tự lái. • Cảm biến thông minh và quản lý năng lượng: ML được sử dụng trong các hệ thống quản lý năng lượng thông minh và cảm biến IoT.
Bán lẻ và Thương mại điện tử: • Tiếp thị cá nhân hóa: Các công ty bán lẻ sử dụng ML để tùy chỉnh trải nghiệm mua sắm cho từng khách hàng. • Dự đoán nhu cầu và tồn kho: ML giúp dự đoán nhu cầu và quản lý tồn kho một cách hiệu quả. Trần Hải Thành _ CT2401C 12 6. Giáo dục: • Học tập cá nhân hóa: Nền tảng giáo dục sử dụng ML để cá nhân hóa trải nghiệm học tập cho từng học viên.
• Đánh giá và phân loại học sinh: ML có thể giúp tự động đánh giá và phân loại bài làm của học sinh. Quản lý chuỗi cung ứng: • Dự đoán nhu cầu: ML được sử dụng để dự đoán nhu cầu sản phẩm và tối ưu hóa chuỗi cung ứng. • Quản lý lưu trữ và vận chuyển: ML giúp cải thiện quy trình quản lý lưu trữ và vận chuyển hàng hóa. Giải trí: • Gợi ý nội dung: Các dịch vụ phát trực tuyến sử dụng ML để gợi ý nội dung dựa trên lịch sử xem phim hoặc âm nhạc của người dùng.
• Xử lý ngôn ngữ tự nhiên: ML được sử dụng để phát triển trí tuệ nhân tạo trong trò chơi video và các ứng dụng giải trí khác. Đây chỉ là một số ví dụ, ML đang được áp dụng rộng rãi trong hầu hết các lĩnh vực của đời sống hàng ngày và còn nhiều ứng dụng khác đang được phát triển.4 Ưu điểm và nhược điểm của học máy Machine Learning (ML) có những ưu điểm và nhược điểm sau: Ưu điểm: 1. Khả năng học từ dữ liệu: ML có khả năng tự học từ dữ liệu một cách tự động, giúp cải thiện hiệu suất và chính xác của các mô hình dự đoán và phân loại. Trần Hải Thành _ CT2401C 13 2.
Khả năng xử lý dữ liệu lớn: ML có thể xử lý và phân tích lượng dữ liệu lớn một cách hiệu quả, giúp trích xuất thông tin quan trọng từ dữ liệu phức tạp. Tính tự động hóa: ML có thể tự động hóa nhiều nhiệm vụ phức tạp mà trước đây cần sự can thiệp của con người, từ việc phân loại dữ liệu đến việc ra quyết định. Tính linh hoạt và linh động: Các mô hình ML có thể được điều chỉnh và tinh chỉnh để phù hợp với yêu cầu cụ thể của mỗi ứng dụng, từ việc chọn lựa thuật toán đến việc điều chỉnh siêu tham số. Áp dụng rộng rãi: ML có thể được áp dụng trong nhiều lĩnh vực khác nhau, từ công nghệ thông tin, y tế, tài chính đến giáo dục, sản xuất và nhiều lĩnh vực khác.
Nhược điểm: 1. Yêu cầu lượng dữ liệu lớn: Đa số các thuật toán ML đòi hỏi lượng dữ liệu lớn để huấn luyện mô hình một cách hiệu quả và đảm bảo tính chính xác. Nguy cơ overfitting: Mô hình ML có thể mắc phải tình trạng overfitting, nghĩa là mô hình quá tinh chỉnh cho dữ liệu huấn luyện cụ thể mà không tổng quát hóa được cho dữ liệu mới. Khả năng diễn giải kém: Một số mô hình ML phức tạp có thể khó hiểu và khó giải thích cách chúng ra quyết định, làm giảm tính minh bạch và tin cậy của mô hình.
Yêu cầu kiến thức chuyên sâu: Xây dựng và triển khai các mô hình ML đòi hỏi kiến thức vững về toán học, thống kê và lập trình, điều này có thể là một rào cản đối với người mới bắt đầu. Trần Hải Thành _ CT2401C 14 5. Nguy cơ quyền riêng tư và bảo mật: Một số ứng dụng ML có thể đối mặt với nguy cơ về quyền riêng tư và bảo mật khi sử dụng dữ liệu cá nhân hoặc nhạy cảm.2 Các phương pháp học máy Học máy là một phần của trí tuệ nhân tạo (AI) tập trung vào việc xây dựng các hệ thống có khả năng học và cải thiện từ dữ liệu một cách tự động, mà không cần phải được lập trình cụ thể cho mỗi nhiệm vụ. Thay vào đó, các thuật toán học máy sử dụng dữ liệu để phát hiện các mẫu, quy luật và hiểu biết từ kinh nghiệm, từ đó tạo ra các dự đoán hoặc hành động có ý nghĩa.
[2] Tóm lại, học máy cho phép máy tính học hỏi từ dữ liệu và trải nghiệm, từ đó tự động cải thiện hiệu suất của chúng trong các nhiệm vụ như nhận dạng ảnh, dự đoán, phân loại, gợi ý, và nhiều ứng dụng khác. Cơ sở của Machine Learning nằm ở việc xử lý dữ liệu và tìm kiếm các mẫu và quy luật ẩn trong dữ liệu đó. Các phương pháp ML có thể được chia thành các loại chính bao gồm: − Học có giám sát (Supervised Learning): Mô hình được huấn luyện trên một tập dữ liệu có nhãn, trong đó mỗi mẫu dữ liệu đã được gán một nhãn đích.