CHƯƠNG I: GIỚI THIỆU TONG QUAN.1 Lí Do Chọn Đề Tài. 5 S111 E1 E1 221212121 tru re 8 IV): 8:-14)‹{4)4))):00“.1 Mục Tiêu Nghiên Cứu.2 Đối Tượng Nghiên Cứu 10 1.3 Phương Pháp Thực Hiện 11 1.1 Phân Lớp Dữ Liệu Là Gì? 12 1.1 Khái Niệm Phân Lớp Dữ Liệu.2 Quy Trình Phân Lớp Dữ Liệu.2 Khái Niệm Và Phân Loại Sonar 14 1.1 Khái Niệm Và Phân Loại Sonar.3 Ứng Dụng Của Hệ Thống SOHAF.3 Các Phương Pháp Phân Lớp Dữ Liệu 17 1.1 Một Số Phương Pháp Phân Lớp Dữ Liệu Sử Dụng Trong Bài EdCc OL | 17 1.4 Chỉ số đánh giá 25 CHƯƠNG 2: VẤN ĐẺ NGHIÊN CỨU.1 Định Nghĩa Vấn ĐỀ.2 Phân Tích Khám Phá Dữ Liệu (EDA)).1 Thống kê mô tả .2 Visualize Data we Jl 2.3 Cac chién urge Pre-Processing 0. cecetecenseeeetssesesseseesensntaeeees 33 CHUONG 3: THI NGHIEM VÀ THÁO LUẬN.1 Môi trường nghiên cứu.3 Tiến hành nghiên cứu. - S221 SE1 111 112112712112111 1111 71T12 re rre 38 3.1 Đánh Giá Thuật Toán: Cơ Sở 38 3.2 Đánh Giá Thuật Toán: Chuẩn Hóa Dữ Liệu 39 3.3 Đánh Giá Dựa Trên Các Chỉ Số Phố Biến Trong Bài Toán Phân Loai.5 Kết luận mô hình.
52 2E 11112111111111711 71111121111 11112111 rrre 44 CHƯƠNG 4: KÉT LUẬN VÀ HƯỚNG PHÁT TRIỂN. 5-2 22s 2E rre 45 TÀI LIỆU THAM KHẢO. - 5-51 21 S212E121121122271 1111712221111 46 DANH MỤC HÌNH ẢNH Hình 1.1 Nguyên lý của SONAR.2 Xây dựng mô hình phân lớp.3 Đánh giá mô hình phân lớp.4 Phân lớp dữ liệu m ới.-- ii cece 2232232111151 151411111111151111 11111111 11 81111 XÐg 14 Hình 1.5 Mô hình của hệ thống SONAR chủ động.-- 5-2 S12 SE SE5E221212112 x52 l5 Hình 1.6 Nguyên lý SONAR thụ động.7 Minh họa mô hình cây quyết định.8 Minh họa thuật toán phân lớp Support Vector Machine (SVM)).9 Các biến thể của SVM.10 Minh họa thuật toán phân lớp hồi quy Logistic.11 Minh họa thuật toán K-Nearest Neighbor (KNN).12 Ví dụ Sơ đồ của mô hình AdaBoosting.13 Minh họa thuật toán Linear DIscriminant Analysis (LDA).14 Ví dụ thuat toan Linear Discriminant Analysis (LDA) su dung ng6n ngtr Lap trink Python.1 Số xuất hiện cdc Class.2 Biểu đồ Histogram của các Thuộc tính từ Tập dữ liệu.3 Biêu đồ Box and Whisker của Các Thuộc tính từ Tập đữ liệu.4 Biêu đồ Mật độ của Các Thuộc tính từ Tập đữ liệu.5 Biểu đồ Tương quan giữa Các Thuộc tính từ Tập dữ liệu.6 Kết quả lam tron đữ liệu bang Simple Moving Average.7 Kết quả làm trơn đữ liệu băng Multi-level Moving Average ở mức (3,5,7) 35 Hình 2.8 Kết quả làm trơn đữ liệu băng Multi-level Moving Average ở mức 5 2 .9 Kết quả làm trơn đữ liệu băng Multi-level Moving Average ở mức (7,14,21) c1111111111111 1111111111 1111111 111111111111 1111111 111111111111 11 1111111111111 1111111 111111111111 11 11111111110 T0 10111 10 36 Hình 2.10 Kết quả MSE.- ST T1 E2 2112111121121112111111211 HH Ha 37 DANH MỤC BẢNG BIẾU Bảng 2.1 Các thuộc tính thống kê cơ bản của đữ liệu.2 Kiểm tra tính toàn vẹn đữ liệu. 2-2 SH T111 1111111 1512121211155 1115 sg 29 Bảng 3.1 Đánh giá hiệu suất của một số mô hình máy học khác nhau trên tập dữ liệu 0 .2 Đánh giá các chỉ số của 10 phương pháp phân lớp.3 Đánh giá 2 mô hình qua các phương pháp phô biến.4 Đánh giá mô hình (RF và MLP) sử dụng ENSEMBLE.5 Danh giá 8 mô hình sử dụng ENSEMBLE.
02c 2 S22 2ey 44 DANH MỤC TỪ VIET TAT TT Từ viết tắt Từ đầy đủ Y nghia Một tập hợp các phương pháp học có giám sát liên quan đến SVM Support Vector Machine nhau đề phân loại và phân tích hồi quy. Một kĩ thuật học có giám sát dùng đề phân loại quan sát mới KNN K-Nearest Neighbor bằng cách tìm điểm tương đồng giữa quan sát mới này với dữ liệu sẵn có. Một loại kết hợp tuyến tính, một quá trình toán học sử dụng Linear Discriminant các mục dữ liệu khác nhau và LDA Analysis chức năng áp đụng đề thiết lập đó đề riêng phân tích nhiều lớp của đối tượng. Chỉ số được tính toán dựa trên đường cong ROC nhằm đánh Area Under the Curve AUC giá khả năng phân loại của mô hình tốt như thê nảo.
Một lĩnh vực của trí tuệ nhân tạo liên quan đến việc nghiên Machine Learning (May cứu và xây dựng các kĩ thuật ML hoc) cho phép các hệ thống "học" tự động từ đữ liệu để giải quyết những van dé cu thé. Một thuật toán học máy có giam sat (Machine Learning) MLP Multilayer Perceptron thuộc lớp Mạng nơ-ron nhân tạo. Qua trình khám phá và phân tích dữ liệu ban đầu nhằm hiểu rõ hơn về dữ liệu.EDA giúp EDA Exploration Data Analysis làm sạch, hiểu rõ về đữ liệu, từ đó xây dựng được mô hình phù hợp với bài toán. Thuật toán học có giám sát (supervised learning).
No có thé Random Forest được sử dụng cho cả phan lớp và hồi quy. LỜI CÁM ƠN Nhóm chúng em xin gửi lời cảm ơn chân thành nhất đến thầy Đỗ Như Tài đã tận tình hướng dẫn, giúp đỡ nhóm chúng em hoàn thành dự án môn Khoa học dữ liệu nâng cao. Trong suốt quá trình học, thầy đã dành rất nhiều thời gian chỉ bảo, gợi ý cho chúng em và các bạn về cách tiếp cận đề tài, cách bố cục nội dung và cách trình bày kết quả nghiên cứu một cách khoa học, thầy luôn sẵn lòng chia sẻ những kiến thức mới nhất và những kinh nghiệm thực tế mà thầy đã tích lũy được. Thầy đã mang đến cho chúng em nhiều góc nhìn mới mẻ về các nghiên cứu sâu chuyên sâu cùng những bài học, mô hình mới mà nhóm nghiên cứu được tiếp cận.
Và qua môn học, nhóm nghiên cứu đã có trải nghiệm tuyệt vời khi tích lũy được những kiến thức mới từ các bài tập và bài học trên lớp cũng như các buổi online thầy dành thời gian dạy chúng em. Và qua dự án nghiên cứu này chúng em cũng mong góp phần nào đó để là bước đệm cho bài nghiên cứu khoa học ở trường. Từ những kiến thức thầy truyền đạt chúng em đã tích lũy đề thực hiện dự án “Nghiên cứu ứng dụng mô hình máy học trong phân loại tín hiệu Sonar’’. Trong quá trình thực hiện dự án chắc chắn khó tránh khỏi những thiếu sót.
Do đó, chúng em kính mong nhận được những lời góp ý của thầy để dự án của chúng em ngày càng hoàn thiện hơn. Cuối cùng, chúng em xin kính chúc thầy sức khỏe đồi dào, hạnh phúc và luôn thành công trong công việc giảng dạy và nghiên cứu của minh. CHUONG 1: GIOI THIEU TONG QUAN 1.1 Li Do Chon Dé Tai Bồi cảnh hiện nay của thế giới đang chứng kiến sự tiến bộ nhanh chóng của công nghệ, đặc biệt là trong lĩnh vực trí tuệ nhân tạo (AT) va may hoc (Machine Learning). Đối diện với những thách thức đa dạng và phức tạp, sự kết hợp giữa nghiên cứu khoa học và ứng dụng thực tế trở nên quan trọng hơn bao giờ hết.
Trong tầm quan trọng đó, nhóm chúng tôi quyết định chọn đề tài "Nghiên cứu ứng dụng mô hình máy học trong phân loại tín hiệu Sonar" không chỉ xuất phát từ sự nhận thức vẻ tính ứng dụng rộng rãi mà còn từ những con số và dẫn chứng cụ thê, làm nổi bật lý đo đây là lựa chọn hay hơn. Một trong những con số nổi bật là khối lượng dữ liệu lớn được tạo ra từ hệ thống sonar trên toàn thể giới. Tô chức Hải đương Quốc tế (IOOS) đã thống kê rằng hệ thống này tạo ra khoảng 5 petabyte dữ liệu mỗi năm. Đây vừa là con số ấn tượng về quy mô, vừa là một thách thức lớn, đặt ra yêu cầu cao về khả năng xử lý và phân loại dữ liệu.
Sự đa dạng và phức tạp của tín hiệu sonar đòi hỏi sự chính xác và linh hoạt trong việc áp dụng các mô hình máy học. Tình hình an ninh biến ngày càng trở nên nhạy cảm và phức tạp. Các đối tượng như tàu ngầm và mìn biến đe dọa sự an toàn của không gian biến, và khả năng phân loại chính xác tín hiệu sonar trở thành một yếu tô chính trong. việc đối phó với những thách thức này.
Theo Thông tin An ninh Quốc gia Mỹ, vấn để này đặt ra những yêu cầu ngày càng cao đối với công nghệ phân loại, và sự kết hợp giữa may hoc va tin hiệu sonar trở thành một hướng nghiên cứu hứa hẹn. Hình II Nguyên lý cua SONAR Mô hình máy học, đặc biệt là Convolutional Neural Networks (CNN) và Recurrent Neural Networks (RNN), đã chứng minh khả năng lớn trong việc xử lý dữ liệu phức tạp và tự động hóa quá trình phân loại. Sự tiến bộ này đã đem đến hiệu suất cao và mở ra những khả năng mới trong việc hiếu biết sâu sắc về cầu trúc và biểu hiện của tín hiệu sonar. Các mô hình này không chỉ giúp giải quyết những thách thức hiện nay mà còn mở ra những triển vọng hứa hẹn cho tương lai.
Tổng cộng, lựa chọn “Nghiên cứu về ứng dụng mô hình máy học trong phân loại tín hiệu Sonar” là một phản ánh của xu hướng tiên tiến trong công nghệ và là sự đáp ứng linh hoạt và hiệu quả đối với những thách thức đương đại. Đây sẽ là một bước tiến quan trọng trong việc tối ưu hóa sức mạnh của tín hiệu sonar, đóng góp vào sự an toàn và bảo vệ của không gian biên toàn cầu.1 Mục Tiêu Nghiên Cứu Muc tiéu chung: © Muc tiéu chung ctia dé tai là áp đụng và phát triển các mô hình máy học hiện đại nhằm nâng cao khả năng phân loại tín hiệu Sonar. Thông qua việc này, nhóm nghiên cứu đặt ra mục tiêu xây dựng một hệ thống phân loại mạnh mẽ vả chính xác, tạo ra công cụ hỗ trợ hiệu quả trong việc giám sát không gian biến. Mục tiêu này sẽ góp phần đáng kế vào nâng cao hiệu suất của các hoạt động an ninh và quốc phòng.
Mục tiêu cụ thể: © Nghiên cứu và xử lý dữ liệu Sonar: - Tiến hành phân tích đặc điểm và câu trúc của đữ liệu Sonar, đảm bảo hiểu rõ về đặc điểm đặc trưng của tín hiệu. - Phát triển các phương pháp xử lý đữ liệu để chuẩn hóa, giảm nhiễu, và tối ưu hóa cho quá trình huấn luyện mô hình. © - Điều chính mô hình phù hợp với đữ liệu - Quan trọng trong quá trình phát triển mô hình máy học để đảm bảo rằng nó hoạt động hiệu quả với dữ liệu cụ thé. - Tối ưu hóa mô hình đề đạt được hiệu suất cao và đáng tin cậy trong việc phân loại tín hiệu sonar, đồng thời đảm bảo khả năng chịu đựng và áp dụng trong môi trường thực tế.
® Đánh giá và hiệu chính: - Thực hiện các bài kiểm tra và đánh giá chi tiết về hiệu suất của mô hình trên các tập dữ liệu kiểm thử và thực tế.