Chương 1- Trình bảy lý thuyết tổng quan về phương pháp học ting cường, mô hình bải toán quyết định Markov, bên cạnh đó cũng giới thiệu sơ lược về sự ra đời, cũng như lịch sử phát triển của phương pháp học lăng cường, các lĩnh vực ng dụng trong thực tiễn. Chương 2: Trình bày chỉ tiết về đặc điểm, cáo bước thực hiện của từng loại giải thuật học tăng cường đã và đang dược sử dụng hiển nay Chương 3: Trinh bày về bài toán lựa chọn thử nghiệm, giới thiệu lại sơ qua về loại thuật Luán học tăng cường lựa chọn án dụng trong bải loàn thứ nghiệm. Các kich bản thử nghiệm va các kết quả thu được. yên cư sở dỏ, kết luận đánh giá vả đưa ra giải pháp cải tiến.
DANH MỤC CÁC KY HIEU, CHU VIET TAT Thuật ngữ Viet tat Hoc tang cudng (Reinforcement Learning) RL Phương pháp lập trinh dng (Dynamic Programming) | DP Phuong phap Monte Carlo Mc Phuong phap Temporal Difference TD DANH MỤC CÁC KY HIEU, CHU VIET TAT Thuật ngữ Viet tat Hoc tang cudng (Reinforcement Learning) RL Phương pháp lập trinh dng (Dynamic Programming) | DP Phuong phap Monte Carlo Mc Phuong phap Temporal Difference TD Với mô hình bài toán quyết định Markov như trên, chúng ta có thể xem xéL qua một số vỉ dụ quen thuộc. Vi dy 1: Máy bán hàng tự động -_ Trạng thải: cấu hình các khe -_ Ilảnh động: thời gian dừng lại. -_ Mụo tiêu: kiếm được nhiều tiền. - Bai toan: tim m:§—>A sao cho R lớn nhất Vi dy 2: Tic-Tac-Toe Đây là một trẻ chơi quen thuộc của giới trẻ.
Hai người chơi thực hiện chơi trên một bảng kích thước 3x3. Một người ghi kí hiệu X và một người ghi kí hiệu O, đến tận khi có người thing nhờ ghi 3 dấu trên cùng một hảng dọc hoặc hàng, ngang hoặc hảng chéo, như người ghi dấu X trong hình vẽ: -xiolo 9 xịx x Nếu bảng bi lip đầy mà không người chơi nào ghi được 3 dấu trong cùng một hàng thì trận dấu sẽ hoà. Bài Loán lic-tac-toc dược tiếp cận sử dụng RT. như sau - Trang thai: bing 3x3 - Tianh động: phép đi chuyển tiếp theo -_ Mục tiểu: 1 nêu thẳng, -] nếu thua, 0 néu hoa - Bai toán: tìm m:8—>A sao cho R lớn nhất Vi du 3:Robat di déng - Trang thai: vi trí của Robot và của người.
-_ IIảnh động: sự đi chuyển. -_ Mục tiểu: số các hước đối mặt thành công, DANH MỤC CÁC KY HIEU, CHU VIET TAT Thuật ngữ Viet tat Hoc tang cudng (Reinforcement Learning) RL Phương pháp lập trinh dng (Dynamic Programming) | DP Phuong phap Monte Carlo Mc Phuong phap Temporal Difference TD Với mô hình bài toán quyết định Markov như trên, chúng ta có thể xem xéL qua một số vỉ dụ quen thuộc. Vi dy 1: Máy bán hàng tự động -_ Trạng thải: cấu hình các khe -_ Ilảnh động: thời gian dừng lại. -_ Mụo tiêu: kiếm được nhiều tiền.
- Bai toan: tim m:§—>A sao cho R lớn nhất Vi dy 2: Tic-Tac-Toe Đây là một trẻ chơi quen thuộc của giới trẻ. Hai người chơi thực hiện chơi trên một bảng kích thước 3x3. Một người ghi kí hiệu X và một người ghi kí hiệu O, đến tận khi có người thing nhờ ghi 3 dấu trên cùng một hảng dọc hoặc hàng, ngang hoặc hảng chéo, như người ghi dấu X trong hình vẽ: -xiolo 9 xịx x Nếu bảng bi lip đầy mà không người chơi nào ghi được 3 dấu trong cùng một hàng thì trận dấu sẽ hoà. Bài Loán lic-tac-toc dược tiếp cận sử dụng RT.
như sau - Trang thai: bing 3x3 - Tianh động: phép đi chuyển tiếp theo -_ Mục tiểu: 1 nêu thẳng, -] nếu thua, 0 néu hoa - Bai toán: tìm m:8—>A sao cho R lớn nhất Vi du 3:Robat di déng - Trang thai: vi trí của Robot và của người. -_ IIảnh động: sự đi chuyển. -_ Mục tiểu: số các hước đối mặt thành công, Chương! BAI TOAN QUYET DINH MARKOV VA PHƯƠNG PHIÁP HỌC TĂNG CƯỜNG Phương pháp học tăng cường là một phương pháp phễ biển để giải các bài toán quyết định Markov. Dải Loán quyết dinh Markov có rất nhiều ứng dụng trong các lĩnh vực kỹ thuật như lý thuyết quyết đỉnh, quy hoạch toán học, điều khiển tổi ưu,.
Trong phần này, chúng la sẽ trình bay về quá Irình quyết định Markov trong đó lập trung vào các khái niệm của quá trình Markov có số bước vô hạn và có số bước hữu hạn. 11 PHÁT BIẾU BẢITOÁN Bài toán quyết định Mlarkov là bài toán học từ các tác động đề đạt được mục địch. Người học va người ra quyết đmh được gọi là tác tử. Tất cã những gì mả chúng tương tác với, bao gồm mọi thứ bên ngoài tác tử được gọi là môi trường.
Các tác động thực hiện một cách liên tục, tác tử lựa chọn các hành động, môi trường đáp ứng lại các hành động dó và chuyển từ trạng thải hiện thời sang trạng, thái mới. MIôi trường cũng đem lại các mục tiêu, các giá trị băng số mà tác tứ cố gắng cực đại hoá qua thời gian. Một dic 14 hoàn thiện về môi trường được coi là một “nhiệm vụ”, một thực thể của bài toán quyết định Miarkov. 'Tóm lại, bài toán quyết định Markov liên quan đến lớp bài toán trong đó một tác tử rúL ra kết luận trong khi phân tích một chuỗi các hành déng cua né cing với tín hiệu võ hướng được đưa ra bởi môi trường.
Trong khái niệm chưng này có thể thấy hai đặc tỉnh quan trọng » Tác tử tương tác với môi trường và cặp “Tác tử ! Môi trường” tạo thành một hệ thống déng Chương! BAI TOAN QUYET DINH MARKOV VA PHƯƠNG PHIÁP HỌC TĂNG CƯỜNG Phương pháp học tăng cường là một phương pháp phễ biển để giải các bài toán quyết định Markov. Dải Loán quyết dinh Markov có rất nhiều ứng dụng trong các lĩnh vực kỹ thuật như lý thuyết quyết đỉnh, quy hoạch toán học, điều khiển tổi ưu,. Trong phần này, chúng la sẽ trình bay về quá Irình quyết định Markov trong đó lập trung vào các khái niệm của quá trình Markov có số bước vô hạn và có số bước hữu hạn. 11 PHÁT BIẾU BẢITOÁN Bài toán quyết định Mlarkov là bài toán học từ các tác động đề đạt được mục địch.
Người học va người ra quyết đmh được gọi là tác tử. Tất cã những gì mả chúng tương tác với, bao gồm mọi thứ bên ngoài tác tử được gọi là môi trường. Các tác động thực hiện một cách liên tục, tác tử lựa chọn các hành động, môi trường đáp ứng lại các hành động dó và chuyển từ trạng thải hiện thời sang trạng, thái mới. MIôi trường cũng đem lại các mục tiêu, các giá trị băng số mà tác tứ cố gắng cực đại hoá qua thời gian.
Một dic 14 hoàn thiện về môi trường được coi là một “nhiệm vụ”, một thực thể của bài toán quyết định Miarkov. 'Tóm lại, bài toán quyết định Markov liên quan đến lớp bài toán trong đó một tác tử rúL ra kết luận trong khi phân tích một chuỗi các hành déng cua né cing với tín hiệu võ hướng được đưa ra bởi môi trường. Trong khái niệm chưng này có thể thấy hai đặc tỉnh quan trọng » Tác tử tương tác với môi trường và cặp “Tác tử ! Môi trường” tạo thành một hệ thống déng MO DAU = Tinh cAp thiết của dé tai Xã hôi ngày cảng hiện đại, sáo kỹ thuật công nghệ ngày cảng phát triển, đi cùng với nó là các nghiền cứu phát triển không ngừng về lĩnh vực trí tuệ nhân tạo và học máy, cho ra đời các hệ thỗng máy móc thông minh ứng dụng rộng rãi trong hầu hết các lĩnh vực dời sống như may truy tìm dữ Hệu, chẩn đoán y khoa, phát hiện thẻ tín đụng giá, phân tích thị trường chứng khoán, phân loại chuỗi TNA, nhận dạng tiổng nói và chữ viết,. đặc biết lá trong lĩnh vực diều khiển Các phương pháp tự đào tạo (học) đã được đưa ra từ rất lâu để chỉ khả năng các hệ thống théng minh trong quá trình hoạt động tự tích hwy, phân tích các thông tin thu được tử đó tự nâng cao khả năng của bản thân, đây chính là mục đích quan trọng trong lỹ thuyết quyết định cũng như trong các bài toán tự động hoá và điều khiển tối ưu Chúng ta có nhiều loại thuật toán học như học có giám sát, học không có giám sát, học tăng oường, mỗi loại thuật toán thích ứng với Lừng loại bài toán cụ thể.
Trang phạm vi dễ tải này, chúng ta sẽ nghiên cửu vả tìm hiểu các vẫn dễ liên quan đến phương pháp học tăng cường. Đây là một thuật toán học có khả năng giải quyết dược những bài toán thực tế khá phức tạp trong đỏ có sự tương tác piữ hệ thống và môi trường. Với những tình huống môi trường không chỉ đứng yên, cố định mà thay đổi phức tạp thì các phương pháp học truyền thống không còn đáp ứng được mà phải sử dựng phương pháp học tăng cường. Những bải toán với môi trường thay đối trong thực tế là không nhỏ và ứng đụng nhiễu trong các lĩnh vực quan trọng, " Mục đích Qua quá trình lắm luận văn sẽ tổng hợp và nắm vững các kiến thức về phương pháp học tăng cường nói chung.
Hiểu rõ ý tưởng, cơ chế hoạt động các thuật toán học tăng cường và ứng đụng trong các bài toán điển hinh cụ thể. Đồng thời cũng thực hiện mô phỏng bải toán thử nghiêm, do dạc thống kẻ vả dánh giả kết quả thử nghiệm về các thuật toán RL. "_ Giới hạn vẫn đề 1o những hạn chế về điều kiên và thời gian thực hiện, đề tài nghiên cửu mới chỉ ở mức lý thuyết và cài đặt thử nghiệm, chưa được ứng dụng vào thực tiễn. " Hưửng phát triển Trong thời gian tới, sẽ cố găng ứng dụng các kiến thức về phương pháp học tăng cường, xây đựng bải Loán thực tiễn cụ thể vá ứng dụng rộng rất "_ Hỗ cục của luận văn Luận văn gồm 3 chương với những nội đung chính như sau: Chương 1- Trình bảy lý thuyết tổng quan về phương pháp học ting cường, mô hình bải toán quyết định Markov, bên cạnh đó cũng giới thiệu sơ lược về sự ra đời, cũng như lịch sử phát triển của phương pháp học lăng cường, các lĩnh vực ng dụng trong thực tiễn.
Chương 2: Trình bày chỉ tiết về đặc điểm, cáo bước thực hiện của từng loại giải thuật học tăng cường đã và đang dược sử dụng hiển nay Chương 3: Trinh bày về bài toán lựa chọn thử nghiệm, giới thiệu lại sơ qua về loại thuật Luán học tăng cường lựa chọn án dụng trong bải loàn thứ nghiệm. Các kich bản thử nghiệm va các kết quả thu được. yên cư sở dỏ, kết luận đánh giá vả đưa ra giải pháp cải tiến.