CHƯƠNG 1: TONG QUAN VỀ DE TÀI 2. Tinh hình nghiên cứu ngoài nước © Dự báo chất lượng không khí tại Mỹ: AIRNOW (http://airnow.gov ) do Cục Bảo vệ Môi trường và Cục Khí tượng và Đại dương Quốc gia (NOAA), các bang và các cơ quan liên quan của Mỹ xây dựng dé cộng đồng dé dang truy cập được các thông tin CLKK của quốc gia. © Dự báo chất lượng không khí tại Anh: http://airquality.uk/ © Dự báo chất lượng không khí tại Úc: AAQFS đưa ra bản tin dự báo CLKK. (24 đến 36 gid) hai lần trong ngày: 9 giờ sáng và 3 giờ chiều; Dự báo NOx, Ozon, SOa, benzen, formaldehyde, và bụi PM10, PMas © Một số hệ thống dự báo chất lượng không khí của Trung Quốc, Đài Loan, Bắc Mỹ, liên minh châu Au,.
Những tồn tại cần giải quyết Nhiều hệ thống dự báo chất lượng không khí trên thế giới có quy mô và chất lượng tốt, là nguồn tham khảo khoa học để xây dựng hệ thống dự báo chất lượng không khí cho các đô thị tại Việt Nam. Do hạn chế về mặt công nghệ và yêu cầu kiến thức liên ngành khá phức tạp của ngành CNTT và Môi trường nên hiện ở Việt Nam chưa có hệ thông dự báo chất lượng không khí đáp ứng đủ nhu cầu của xã hội. CHƯƠNG 2: KIÊN THỨC NEN TANG CHƯƠNG 2: KIÊN THUC NEN TANG Chương 2 sẽ trình bày những kiến thức nên tảng về máy học, AI và các mô hình dự báo theo chuỗi thời gian. Qua đó, luận văn sẽ sử dụng kiến thức nên tang nay dé ứng dụng thực hiện đề tài dự báo chất lượng không khí đô thị.
Tổng quan về trí tuệ nhân tạo và máy học Ngày nay, khi ta nhắc đến các thiết bị máy móc điện tử, chúng cũng đều được kỳ vọng rằng liệu trí tuệ nhân tạo liệu có được tích hợp trên thiết bị đó. Vì thế, việc nghiên cứu và tích hợp công nghệ thông tin cũng như kỹ thuật máy học cũng được ap dụng rộng rãi, phổ biến trong nhiều lĩnh vực khác nhau. Máy học cũng được áp dung và xuất hiện rất nhiều trong những ngành khoa học/công nghiệp sản xuất với nguồn dữ liệu lớn có sẵn, các ứng dụng điển hình dé giải quyết các bài toán thực tiễn như: e Bài toán phân tích, dự báo: phân tích dữ liệu và dự báo thời tiết, khí tượng, thiên văn, thị trường bán lẻ, dự báo ùn tắc giao théng,. e Xử lý ngôn ngữ tự nhiên (Natural Language Processing): xử lý văn ban, phát hiện ngôn từ đả kích, phát ngôn tục tĩu trên mạng xã hdi.
e Các bài toán nhận dạng (Pattern Recognition): nhận dang khuôn mặt, vân tay, giọng nói, văn bản trong hình ảnh. © Hệ thống tìm kiếm (Search Engine): tìm kiếm thông tin, tìm kiếm hình ảnh,. © Chan đoán trong y tế: phân tích ảnh X-quang, các hệ chân đoán tự động. e Trong Sinh học: phân loại chuỗi gen, quá trình hình thành gen/prô-tê-in,.
e Trong Vật lý: phân tích ảnh thiên văn, tác động giữa các hạt e Các hoạt động trong trò chơi điện tử: tự động choi bài, chơi cờ, hành động của các nhân vật ảo, thiết lập NPC. Qua đó, việc ứng dụng máy học ngày càng phát triển mang đến nhiều bức phá lớn cho nhân loại. Điền hình là sự bùng nổ của máy học đã mang lại nhiều thành tựu trong lĩnh vực phát triển Rô bốt. Ngày nay, Rô bốt còn được phát triển thêm về mặt cảm xúc, giọng nói tốt hơn - những thứ mà trước đây chúng ta chỉ thường thấy trên phim ảnh khoa học viễn tưởng.
Có thé nói việc áp dụng may học dang là một bước tiền công nghệ mới dé phát triển kinh tế, xã hội trong các lĩnh vực: phân tích và dự báo khí tượng, hỗ trợ chan 14 CHƯƠNG 2: KIÊN THỨC NEN TANG đoán bệnh lý, dự báo nguồn cung của thị trường bán lẻ, tự động hóa quy trình sản xuất., giúp tiết kiệm được thời gian, chi phí và công sức. Tại Việt Nam, các nghiên cứu ứng dụng của trí tuệ nhân tạo đê hỗ trợ con người trong các lĩnh vực nêu trên còn khá mới mẻ, tuy rằng việc áp dụng công nghệ hiện dai dé phát triển nền công nghiệp. của nước ta chưa hoàn chỉnh, nhưng đây là một bước tiến mới trong việc phát triển xã hội hiện đại và cũng đang từng bước được cải thiện tốt hơn từng ngày. Theo Mitchell [1], máy học được định nghĩa như sau: “Một chương trình may tính được gọi là học từ kinh nghiệm E để hoàn thành nhiệm vụ 7, với hiệu quả được đo bằng phép đánh giá P, nếu hiệu quả của nó khi thực hiện nhiệm vụ 7, khi được đánh giá bởi P, cải thiện theo kinh nghiệm E”.
Như định nghĩa trên, máy học có thể được hiểu đơn giản như sau: Máy học là sự tự động hóa của quá trình học tập và việc học tập tương đương với việc xây dựng các quy tắc dựa trên việc quan sát các trạng thái trên bộ dữ liệu và các phép biến đổi của chúng. Máy học là một lĩnh vực rộng lớn không chỉ bao gồm học theo mẫu mà còn học tăng cường, học với “thay”,. Máy học kiểm tra những vi dụ trước đó và đồng thời cũng kiểm tra cả những kết quả của chúng khi xuất kết quả và mục tiêu là học để làm sao tái tạo lại được những kết quả ấy, tạo ra những trường hợp tổng quát hóa cho những trường hợp mới. Có hai phương pháp chính của máy học: Phương pháp quy nạp: Máy học (hay phân biệt) những khái niệm dựa trên dữ liệu đã thu thập được từ trước.
Phương pháp này cho phép tận dụng được nguồn dữ liệu sẵn có và cũng rất nhiều. Phương pháp suy diễn: Máy học (hay phân biệt) các khái niệm dựa vào các luật. Phương pháp này cho phép tận dung được các kiến thức chuyên ngành dé hỗ trợ cho máy tính. Hiện nay, các thuật toán máy học vẫn đang và cố gắng tận dụng, phát triển những ưu điểm của hai phương pháp này.
Máy học sử dụng một tập hữu hạn dữ liệu được gọi là tập huấn luyện (bộ dữ liệu huấn luyện). Tập này chứa những mẫu dữ liệu mà nó được viết bằng mã theo một quy luật nào đó để máy tính có thé đọc và hiểu được. Tập huấn luyện bao giờ cũng hữu hạn do đó không phải lúc nào toàn bộ dữ liệu sẽ được học một cách chính xác. 15 CHƯƠNG 2: KIÊN THỨC NEN TANG Một tiến trình máy học gồm hai giai đoạn: © Giai đoạn học (learning): hệ thống phân tích dữ liệu và nhận ra sự mối quan hệ (có thể là phi tuyến tính hoặc tuyến tính) giữa các đối tượng dữ liệu.
Kết quả của việc học có thể | : nhóm các đối tượng vào trong các lớp, tạo ra các luật, tiên đoán lớp cho các đối tượng mới. Giai đoạn kiểm thử (testing): Mối quan hệ (các luật, lớp.) được tạo ra phải được kiểm nghiệm lại bằng một số hàm tính toán thực thi trên một phan của tập dữ liệu huấn luyện hoặc trên một tập dữ liệu lớn. Phân loại các nhóm thuật toán học máy: Các loại máy học Học có giám sát Học không giám sát Hoe bán giám sát Học củng cố Continuous | | Categorical : s Categorical Target Target Target Target ý not Categorical Target Target erste Variable Variable vz lena Variable | |not available Regression [isssification Clustering | Association | Classification | Clustering | Classificatior Control + + + + + + + + Dự báo Hình ảnh Phân khúc | [Market basket| | Phânloại | |Timđườngđi| | Tốiưuhóa | | Xe không thời thiết y khoa khách hàng. trên DL GPS makerting người lái Hình 3: Sơ đồ phân loại máy học Dựa vào phương thức học trong quá trình học máy, các thuật toán máy học được chia làm 04 nhóm: Học có giám sát (Supervised learning), Họ không giám sát (Unsupervised learning), Học bán giám sát (Semi-supervised learning) và Học củng cố (Reinforcement learning).
Học có giám sát Học có giám sát là thuật toán dự đoán đầu ra (outcome) của một dit liệu đầu vào mới (new input) dựa trên các cặp (input, outcome) đã biết từ trước. Cặp dữ liệu nay còn được gọi là (data, label) hay (di liệu, nhãn). Trong quá trình học, máy tính duyệt qua các mẫu gồm đầu vào (input) và dau ra (outcome) tương ứng. Sau khi học 16 CHƯƠNG 2: KIÊN THỨC NEN TANG xong các mẫu này, máy tính quan sát một đầu vào mới và cho ra kết quả.
Học có giám sát là nhóm thuật toán phổ biến nhất trong máy học. Trong toán học, Học có giám sát là khi chúng ra có một tập hợp các dữ liệu đầu vào X = { XI, X2, ., XN } và một tập hợp nhãn tương ứng Y = { yi, Y2; ., yn}, trong đó xi, yi gọi là các vector. Các cặp dữ liệu biết trước (xi, yi) € X X Y được gọi là tập dữ liệu huấn luyện (training data). Từ tap dữ liệu huấn luyện này, chúng ta cần tạo ra một hàm số ánh xa mỗi phan tử từ tập X sang một phan tử (có thé xắp xi) tương ứng của tập Y : yi® £(xi), Vị= 1,2,.N Mục tiêu là tim một ham xấp xi f tốt nhất để khi có một dữ liệu x mới, chúng ta có thé tính được nhãn tương ứng của nó y = f (x).
Ví dụ: Trong vấn đề dự đoán điều kiện thời tiết ở một địa điểm cụ thể. Để đưa ra dự đoán chính xác về thời tiết, chúng ta cần tính đến các thông số khác nhau, bao gồm đữ liệu lịch sử nhiệt độ, lượng mưa, gió, độ âm, chất lượng không khí,. Vấn dé này có thể sẽ mang đến nhiều thử thách dé đáp ứng được việc phát triển các mô hình máy học có giám sát bao gồm nhiều nhiệm vụ phức tạp. Dự đoán nhiệt độ ngày hôm nay là một bài toán hồi quy, trong đó nhãn đầu ra là các biến liên tục.
Ngược lại, dự đoán liệu ngày mai có mưa hay không là một bài toán phân loại nhị phân. Học không giám sát Trong thuật toán Học không giám sát, ta không biết được dự đoán đầu ra (outcome) hay nhãn (label) mà chỉ có dữ liệu đầu vào. Thuật toán Học không giám sát sẽ dựa vào cấu trúc của dữ liệu đề thực hiện một công việc nào đó, ví dụ như phân nhóm (clustering) hoặc giảm số chiều của dữ liệu (dimension reduction) dé hỗ trợ tốt hơn trong việc tính toán và lưu trữ. Trong toán học, Học không giám sát là khi chúng ta chỉ có đữ liệu vào là X mà không biết nhãn Y tương ứng.
Không giống như Học có giám sát, chúng ta không. biết câu trả lời chính xác cho mỗi dữ liệu đầu vào. Giống như khi ta học, giáo viên sẽ không cho ta biết trước đó là con gà hay con vịt.