Chương 1: TONG QUAN DE TAI VA TINH HÌNH NGHIÊN CỨU * Chương 2: CƠ SỞ LY THUYET * Chương 3: PHƯƠNG PHAP THUC HIỆN * Chương 4: HIỆN THUC, ĐÁNH GIÁ VÀ THẢO LUẬN * Chương 5: KET LUẬN VÀ HƯỚNG PHÁT TRIÊN CHƯƠNG 2. Hoc tăng cường 2. Tổng quan về mô hình học tăng cường Học tăng cường (RL) là một lĩnh vực quan trọng, có tiềm năng ứng dụng cao của trí tuệ nhân tạo, tập trung vào việc xây dựng và nghiên cứu các thuật toán ma một tác nhân tự động học cách ra quyết định hành động trong một môi trường dé nham tối đa hóa phần thưởng nhận được, từ đó đạt được mục tiêu huấn luyện. Trong RL, tác tử tương tác với môi trường bằng cách đưa ra quyết định hoặc thực hiện các hành động và nhận được phản hồi từ môi trường dưới dạng phần thưởng đại diện cho kết quả tử quyết định hoặc hành động mà tác tử đưa ra.
Mục tiêu của RL là tối ưu việc đưa ra các quyết định hoặc hành động mà tác nhân có thể thực hiện nhằm tối đa hóa phần thưởng mà nó thu được trong quá trình tương tác với môi trường. Các thành phần chính Action A a | a) State S Hình 2. Kiến trúc chung của học tăng cường. Các thành phần cơ bản trong RL (Hình 2.1) bao gồm: - Agent (Tác nhân): Là thực thé hoặc chương trình máy tính có khả năng thực hiện các hành động đã đề ra sẵn trong môi trường.
Nó có mục tiêu là tối đa hóa tổng phần thưởng mà nó nhận được thông qua quá trình tương tác với môi trường. - Environment (Môi trường): là hệ thống bên ngoài mà tác nhân tương tác. Nó có thé là bất kỳ hình thức nào, từ trò chơi máy tính đến robot thực tế hoặc các hệ thống tự động. - State (Trang thái): là biểu diễn của môi trường tại một thời điểm cụ thể.
Sau khi tác nhân đã thực hiện hành động cụ thể, trạng thái sẽ cung cấp thông tin về tình hình hiện tại của môi trường mà tác nhân sử dụng để ra quyết định hành động đã làm. - Action (Hành động): là các hành động mà tác nhân có thé thực hiện trong môi trường. Hành động này thường được lựa chọn từ một tập hợp các hành động có thể thực hiện tại mỗi trạng thái. - Reward (Phần thưởng): là phản hồi từ môi trường cho mỗi hành động của tác nhân và hướng dẫn tác nhân học từ kinh nghiệm.
Nếu tác nhân có những hành động đúng và hiệu quả thì sẽ được thưởng, ngược lại nếu tác nhân có những hành động xau thì sẽ bi phạt. - Policy (Chính sách): các tác nhân trong môi trường phải tuân theo chính sách là chuỗi những quy tắc được đặt ra dé chọn ra hành động phù hợp tại mỗi trạng thái. Chính sách có thé được biéu diễn dưới dang một bảng quyết định hoặc một hàm giá tri. Cac action có thé thực hiện trên file PE Trong ngữ cảnh của việc sử dung RL dé xử lý van đề tránh bi phát hiện do ảnh hưởng của các phần mềm độc hại, có một số hành động có thể thực hiện trên file PE [6] như Hình 2.
10 ARBE Code View Information COFF Symbols COFF Line Numbers reloc ARS-RELOCATION ARS-IDATA data S ections ARS-TEXT ARS 4a ARS-RESOURCE tls ARS-TLS ARS-UNKNOWN Section Table(Array of IMAGE_ Section_HEADERs) Export Table ee Import Table —— Z2 IMAGE_OPTIONAL_HEADER Resource Table IMAGE_NT_HEADERs Exception Table IMAGE_FILE_HEADER Certificate_Table “PE\O\0" PE signature Offset 0 MS-DOS Header Hình 2.Cau trúc file PE và những hành động dùng dé biến đổi nội dung cua file. - ARBE : Thêm các byte ngẫu nhiên vào cuối của tệp PE. Việc này có thé làm thay đổi kích thước của tệp một cách ngẫu nhiên mà không ảnh hưởng đến chức năng của nó. - ARI : Thêm một thư viện mới với tên và tên hàm ngẫu nhiên vao bảng địa chỉ nhập của tệp PE, có thể làm cho tệp trở nên phức tạp hơn và khó phát hiện hơn.
- ARS : Thêm một phần mới với tên ngẫu nhiên vào bảng phần của tệp PE. Phân này có thê chứa dữ liệu không mong muôn hoặc mã độc hại. - RS : Loại bỏ chữ ký số từ bảng chứng chỉ của tệp PE, từ đó có thé gây ra thay đổi trong dữ liệu chứng chi va làm cho tệp trở nên khó phát hiện hơn. Ứng dụng RL được áp dụng rộng rãi trong ứng dụng khoa học và công nghệ trong dời sông hiện nay như: - Phát triển hệ thống tự động lái xe, từ xe tự lái trong công nghiệp ô tô đến các phương tiện tự lái như xe buýt và xe điện tự lái.
RL giúp hệ thống lái xe tự động học từ môi trường xung quanh và tự điều chỉnh hành vi lái xe với mục đích đảm bảo an toàn và hiệu quả. - Robotics và Automation: áp dụng trong nhiều ứng dụng robot như robot dọn dẹp nhà cửa, robot giao hàng, robot y tế và robot sản xuất. RL giúp robot học và tự lựa chọn và điêu chỉnh hành vi của mình dựa trên môi trường va mục tiêu cụ thê. - Chăm sóc sức khỏe: RL được áp dụng trong nhiều mặt của lĩnh vực y học cũng như về chăm sóc sức khỏe dé tối ưu hóa quy trình chuẩn đoán và điều trị bệnh, lập lịch hóa các cuộc hẹn bác sĩ và dự đoán các kết quả của bệnh lý.
Tổng quan về mô hình học máy Mô hình học máy là một lĩnh vực thuộc trí tuệ nhân tạo (AT) nơi mọi thành phần của kiến trúc hệ thống được xây dựng theo mục đích riêng nên có thể học một cách tự động các dữ liệu và cải thiện hiệu suất mà không cần phải được theo dõi một cách thủ công từ con người. Mục tiêu chính của việc sử dụng học máy là phát triển khả năng dự đoán hoặc phân loại dữ liệu mới dựa vào kinh nghiệm đã học từ bộ huấn luyện. Các thành phần chính Một số khái niệm/thành phần cơ bản liên quan tới học máy: — Dữ liệu Huấn Luyện: là dit liệu mà mô hình sử dụng dé học. Nó thường bao gồm các dữ liệu (dạng ảnh, văn bản, video.) và nhãn phân loại tương ứng.
12 Model: Một mô hình là một biểu diễn toán học của quy luật mà mô hình cố gắng học từ dữ liệu. Mô hình có thể là một tập hợp các tham số được điều chỉnh trong quá trình huấn luyện. Training: còn gọi là huấn luyện, là quá trình tinh chỉnh các tham số của mô hình để mô hình có khả năng dự đoán đầu ra mong muốn từ đầu vào. Quá trình này thường bao gồm việc tối ưu hóa một hàm mất mát (loss function) nhằm cải thiện độ chính xác của mô hình.
Dự Đoán: áp dụng mô hình đã huấn luyện dé dự đoán kết quả với dit liệu mới mà nó chưa từng thấy. Hàm Mat Mat (Loss Function): Đây là một phép đo độ chệch giữa đầu ra dự đoán của mô hình và giá trị thực tế mong muốn. Mục tiêu là giảm thiểu giá trị của ham mat mát trong quá trình huấn luyện. Thuật Toán Học Máy: Là các phương pháp và kỹ thuật được sử dụng dé xây dựng và huấn luyện mô hình.
Các thuật toán phố biến bao gồm học giám sat (supervised learning), học không giám sát (unsupervised learning), va học tăng cường (reinforcement learning). Overfitting xảy ra khi mô hình học quá mức các đặc trưng và nhiễu của dit liệu huấn luyện, làm cho mô hình trở nên quá phù hợp với dữ liệu này mà không thé áp dung tôt cho dữ liệu mới. Khi một mô hình bi overfitting, nó thể hiện hiệu suất rất cao trên tập huấn luyện nhưng lại kém trên tập kiểm tra hoặc tập xác thực. Điều này xảy ra do mô hình đã học thuộc lòng các mẫu cụ thể của đữ liệu huấn luyện, bao gồm cả nhiễu, thay vì học các đặc trưng chung có thể áp dụng cho dữ liệu mới.
Một số nguyên nhân chính của overfitting bao gồm việc sử dụng một mô hình quá phức tạp với quá nhiều tham số, thời gian huấn luyện quá dài, hoặc dữ liệu huấn luyện không đủ đa dạng. Underfitting xảy ra khi mô hình thiết kế quá đơn giản và không thé học được cấu trúc phức tap của dữ liệu. Khi bị underfitting, hiệu suất của mô hình sẽ thấp trên cả trên tập huấn luyện và tập kiểm tra. Underfitting thường xảy ra 13 khi mô hình có quá ít tham số, sử dụng các kỹ thuật regularization quá mạnh, hoặc thời gian huấn luyện không đủ.
Giới thiệu mô hình Convolutional Neural Network(CNN) 2. Mạng nơ ron tích chập (CNN) Mạng nơ ron tích chập (CNN) là một trong những mô hình học sâu hiện đại và thường được ưu tiên sử dụng cho các bải toán nhận diện đối tượng trong hình ảnh. Convolutional Convolutional có thé hiểu là một loại cửa số dạng trượt di chuyền trên một ma trận đầu vào và chứa các parameter (tham số) có khả năng tự điều chỉnh dé trích xuất được những thông tin chính xác nhất mà không cần chọn đặc trưng. Các thành phan cơ bản của CNN e Convolutional Layer Lớp này là thành phan quan trọng nhất cua CNN, nó đảm nhiệm việc thực hiện các phép tính cần thiết để trích xuất đặc trưng từ dữ liệu.
Các phép tính như stride, padding, filter map, feature map đều được thực hiện trong lớp này. Những yếu tô này đóng vai trò thiết yêu cho việc tối ưu hoá khả năng nhận diện và phân loại cua CNN. Trong đó: e Filter map: là các ma trận ba chiều chứa các tham số, được sử dụng dé ap (nhân) vào từng vùng cu thé của ảnh. e_ Stride: sự dịch chuyền filter map từ trái sang phải (theo pixel).
e Padding: là các giá tri 0 được thêm vào lớp input hay còn gọi là ma trận của hình ảnh, mục dich là dé tăng kích thước của ảnh nhằm phù hợp với filter map mà không làm giảm chi tiết ảnh cũng như hiệu suất của mô hình. e_ Feature map: kết quả thu được sau mỗi lần các filter map quét vào từng vùng ảnh. 14 e Relu Layer (Rectified Linear Unit) Còn có tên gọi khác là hàm kích hoạt, hàm này dong vai trò tăng tốc cho quá trình training và làm nỗi bật các đặc trưng sau khi filter map. Công thức của hàm Relu: Kêt quả của công thức là x nêu x > 0 và 0 nêu ngược lại, tức là làm cho các điểm ảnh trên ma trận luôn không âm, từ đó tăng tốc cho quá trình training.
e Pooling Layer Thuong dung xen giữa các convolution layer, mục dich là làm giảm kích thước input hay ma trận hình ảnh, đồng thời vẫn giữ được các đặc trưng quan trọng (Hình 2. max pooling 12 | 20 30| 0 8 |12} 2/0 average pooling Hinh 2.