BỘ GIÁO DỤC VÀ ĐÀO TẠO ĐẠI HỌC KINH TẾ THÀNH PHỐ HỒ CHÍ MINH KHOA CÔNG NGHỆ THÔNG TIN KINH DOANH KHOA HỌC DỮ LIỆU ĐỀ TÀI: Xây Dựng Mô Hình Dự Đoán Bệnh Tiểu Đường Ở Bệnh Nhân Dựa Trên Tiền Sử Bệnh Và Thông Tin Nhân Khẩu Học. (Nhóm 8) Giảng viên hướng dẫn: Thầy Võ Thành Đức. Mã lớp học phần: 23C1INF50905962. Buổi - phòng học: Chiều thứ 3 – Phòng B2.
Hồ Chí Minh, ngày 9 tháng 12 năm 2023. STT Họ và tên MSSV Chi tiết Tỷ lệ công việc % hoàn thành 1 Nguyễn Thị Kim 31221024809 Nghiên cứu 100% Hòa phần giới thiệu về phương pháp sử dụng, làm slide và đóng góp xây dựng các phần còn lại của bài. 2 Nguyễn Thị 31221022777 Nghiên cứu 100% Ngọc Hà phần kết quả thực nghiệm và kết luận, làm slide, đóng góp xây dựng các phần còn lại của bài. 3 Lưu Thị Trúc Hà 31221023668 Nghiên cứu 100% phần kết quả thực nghiệm, thuyết trình và đóng góp xây dựng các phần còn lại của bài.
4 Hứa Thị Xuân 31221023850 Nghiên cứu 100% Nhi phần kết quả thực nghiệm, thuyết trình và đóng góp xây dựng các phần còn lại của bài. 5 Võ Nguyễn 31221023715 Nghiên cứu 100% Thùy Linh phần lời nói đầu và tổng quan, chỉnh word, đóng góp xây dựng các phần còn lại của bài. ĐIỂM: …………… NHẬN XÉT CỦA GIẢNG VIÊN: …………………………………………………………………………………………. MỤC LỤC LỜI NÓI ĐẦU.
Giới thiệu về đề tài. Mục tiêu của đề tài. Phương pháp thực hiện. Giới thiệu về phương pháp sử dụng.
Tiền xử lý dữ liệu. Mô hình phân lớp dữ liệu. Một số phương pháp phân lớp dữ liệu .3 Các phương pháp đánh giá mô hình phân lớp. Kết quả thực nghiệm.
Giới Thiệu Bộ dữ liệu. Khám phá dữ liệu. Liệu có mối liên hệ nào giữa tuổi tác và khả năng mắc bệnh tiểu đường không?. Giới tính có ảnh hưởng đến xác suất mắc bệnh tiểu đường không?.
Mức BMI có liên quan đến nguy cơ mắc bệnh tiểu đường không?. Tăng huyết áp có phản ánh về nguy cơ mắc bệnh tiểu đường không?. Có mối liên hệ nào giữa bệnh tim và bệnh tiểu đường không?. Tiền sử hút thuốc có ảnh hưởng đến nguy cơ mắc bệnh tiểu đường không?.
Mức HbA1c có liên quan đến nguy cơ mắc bệnh tiểu đường không?. Mức đường huyết có ảnh hưởng đến khả năng phát triển bệnh tiểu đường không?. Xây dựng mô hình và đánh giá kết quả. Xây dựng mô hình phân lớp.
Đánh giá kết quả: .Kết quả đạt được. Ý nghĩa mô hình. Hướng phát triển mô hình. 20 TÀI LIỆU THAM KHẢO.
22 Khoa Học Dữ Liệu Giảng viên: TS. Võ Thành Đức LỜI NÓI ĐẦU Hiện nay, sự bùng nổ của cuộc cách mạng công nghệ - thông tin khiến kho dữ liệu của các hệ thống thông tin quản lý tăng lên một cách không kiểm soát được. Luồng thông tin chuyển tải trên thế giới được ước tính tăng không ngừng nghỉ. Các tổ chức hiện đại chìm ngập trong dữ liệu và hiện có vô vàn thiết bị có thể tự động thu thập và lưu trữ dữ liệu.
Các hệ thống và cổng thanh toán trực tuyến đang dần thu thập nhiều dữ liệu hơn trong những lĩnh vực thương mại điện tử, y tế, tài chính cũng như mọi khía cạnh khác của đời sống con người. Phân tích dữ liệu là quá trình kiểm tra thông tin những hoạt động đã diễn ra trong quá khứ và giúp đưa ra các quyết định cũng như kết luận cuối cùng cho tương lai. Dữ liệu cần được xử lý một cách nhanh chóng, chính xác thông qua các phần mềm để đạt được mục tiêu, năng suất đề ra. Nhu cầu trong ngành đã tạo ra một hệ sinh thái các khóa học, bằng cấp và vị trí việc làm trong lĩnh vực khoa học dữ liệu.
Do đòi hỏi trình độ chuyên môn và bộ kỹ năng đa ngành nghề, lĩnh vực khoa học dữ liệu cho thấy sự phát triển mạnh mẽ được dự kiến trong những thập niên tới. Trong những năm gần đây, số bệnh nhân đái tháo đường đang có xu hướng gia tăng nhanh với nhiều biến chứng nặng nề như biến chứng tim mạch, thận, mắt, thần kinh… trở thành nỗi lo ngại hàng đầu của toàn xã hội. Việc trang bị những hiểu biết về triệu chứng bệnh tiểu đường sẽ giúp phát hiện sớm, điều trị hiệu quả bệnh ngay từ giai đoạn đầu. Trong bài tiểu luận này, nhóm chúng em cùng nhau tìm hiểu và trình bày “mô hình dự đoán bệnh tiểu đường ở bệnh nhân dựa trên tiền sử bệnh và thông tin nhân khẩu học của họ” bằng khoa học dữ liệu.
Điều này có thể hữu ích cho các chuyên gia chăm sóc sức khỏe trong việc xác định những bệnh nhân có nguy cơ mắc bệnh tiểu đường và phát triển các kế hoạch điều trị cá nhân hóa. Diabetes prediction dataset - Nhóm 8 !1 Khoa Học Dữ Liệu Giảng viên: TS. Giới thiệu về đề tài Đái tháo đường hay còn gọi là tiểu đường, là bệnh rối loạn chuyển hóa đặc trưng với biểu hiện lượng đường ở trong máu luôn ở mức cao hơn so với bình thường do cơ thể thiếu hụt về tiết insulin hoặc đề kháng với insulin hoặc cả 2, dẫn đến rối loạn quan trọng về chuyển hóa đường, đạm, mỡ, chất khoáng. Hiệp hội Đái tháo đường Thế giới (IDF) cũng đưa ra những con số thống kê đáng chú ý về thực trạng bệnh tiểu đường trên toàn thế giới như sau: • Mỗi năm thế giới có khoảng 132.600 trẻ em được chẩn đoán mắc bệnh tiểu đường tuýp 1, chỉ tính riêng số trẻ em bị bệnh tiểu đường tuýp 1 trong độ tuổi 0 – 19 tuổi là hơn 1 triệu.
• Hơn 21 triệu phụ nữ đang mang thai bị tăng đường huyết và dung nạp đường kém, chiếm tỷ lệ 1/6 tổng số phụ nữ mang thai. • Khoảng 2/3 số bệnh nhân tiểu đường là người cao tuổi, tuy nhiên, số bệnh nhân tiểu đường trẻ tuổi cũng không ngừng gia tăng. • Cứ 6 giây trôi qua sẽ có 1 người tử vong vì các biến chứng nguy hiểm của tiểu đường. Năm 2017, số bệnh nhân tử vong do tiểu đường là 4 triệu người.
Chi phí điều trị bệnh tiểu đường toàn thế giới là 727 tỷ đô la, trở thành gánh nặng của toàn thế giới. Qua đó, có thể thấy được đái tháo đường là một căn bệnh vô cùng nghiêm trọng, bệnh nhân mắc bệnh ngày càng nhiều và đang có xu hướng trẻ hóa. Chính vì thế, việc đưa ra cảnh báo khả năng mắc bệnh tiểu đường một cách kịp thời và chính xác là rất cần thiết, giúp bệnh nhân điều chỉnh lại lượng đường cung cấp vào cơ thể, nhận được điều trị kịp thời để có được một sức khỏe tốt hơn, tránh được các biến chứng nguy hiểm. Vì vậy, chúng em quyết định thực hiện dự án nghiên cứu “Xây dựng mô hình dự báo khả năng bị đái tháo đường” để dự đoán khả năng bị mắc bệnh đái tháo đường ở các bệnh nhân dựa trên tiền sử bệnh và thông tin nhân khẩu học của họ.
Mục tiêu của đề tài Với đề tài này, khi nghiên cứu nhóm chúng em mong muốn có thể hỗ trợ các bệnh nhân đang có nguy cơ mắc bệnh tiểu đường có thể kịp thời phát hiện được bệnh, nhằm nhận được sự chăm sóc về y tế, cũng như đảm bảo được sức khỏe, tránh khỏi các biến chứng nguy hiểm, và đóng góp một phần nhỏ vào y khoa trong việc thăm khám điều trị cho các bệnh nhân thông qua bộ dữ liệu có sẵn. Diabetes prediction dataset - Nhóm 8 !2 Khoa Học Dữ Liệu Giảng viên: TS. Phương pháp thực hiện • Phương pháp thu thập dữ liệu: Nhóm chúng em đã thu thập dữ liệu từ nguồn kaggle.com, một nguồn dữ liệu đáng tin cậy. Dữ liệu gốc được xử lý bằng phần mềm Excel và trực quan hóa qua các biểu đồ.
• Phương pháp nghiên cứu lý luận: Tiến hành tìm hiểu, thu thập, chắt lọc và phân tích các dữ liệu, thông tin thông qua đọc sách báo, tài liệu. Bao gồm các phương pháp sau: Phương pháp phân tích – tổng hợp lý thuyết: đọc và tổng hợp các tài liệu để rút ra nội dung cần thiết. Phương pháp mô hình hóa: xây dựng mô hình nghiên cứu dựa trên lý thuyết và kiểm định tính chính xác của mô hình. • Phương pháp nghiên cứu thực tiễn: Từ cơ sở lý luận, tiến hành nghiên cứu thực tiễn bằng các thuật toán trong KPDL và phần mềm Orange.
Xây dựng các mô hình dự báo dựa trên bộ dữ liệu huấn luyện có sẵn và so sánh kết quả để lựa chọn mô hình phù hợp nhất. Từ đó, xây dựng các mô hình dự báo dựa vào bộ dữ liệu huấn luyện có sẵn và so sánh các kết quả rút ra được với nhau nhằm lựa mô hình phù hợp nhất nhằm giúp các siêu thị đưa ra được các biện pháp thu hút và giữ chân khách hàng một cách kịp thời thông qua các chương trình ưu đãi. Giới thiệu về phương pháp sử dụng 1. Tiền xử lý dữ liệu Tiền xử lý dữ liệu là một bước rất quan trong trong việc giải quyết bất kỳ vấn đề nào trước khi xử lý dữ liệu.
Hầu hết các bộ dữ liệu được sử dụng đều cần phải xử lý, làm sạch hay biến đổi trước khi các thuật toán huấn luyện trên những bộ dữ liệu này. Quy trình kỹ thuật tiền xử lí dữ liệu gồm: Làm sạch dữ liệu (Data cleaning), Tích hợp dữ liệu (Data integration), chuyển đổi dữ liệu (Data transformation) và rút gọn dữ liệu (Data reduction). * Làm sạch dữ liệu (Data cleaning): Làm sạch dữ liệu là quá trình chuẩn bị dữ liệu bằng cách thêm dữ liệu thiếu, sửa chữa hay loại bỏ những dữ liệu không quan trọng ra khỏi bộ dữ liệu để tránh những yếu tố dẫn đến quyết định sai lầm. Quá trình làm sạch dữ liệu gồm có 3 phần: Tóm tắt dữ liệu, xử lý dữ liệu bị thiếu (missing data) và xử lý dữ liệu bị nhiễu (noisy data) • Tóm tắt dữ liệu là xác định các thuộc tính tiêu biểu của dữ liệu như các xu hướng chính hay sự phân tán,…Từ đó cung cấp cái nhìn cụ thể hơn về dữ liệu.
Diabetes prediction dataset - Nhóm 8 !3 Khoa Học Dữ Liệu Giảng viên: TS. Võ Thành Đức • Xử lý dữ liệu bị thiếu (missing data) bằng cách sử dụng giá trị thay thế hay tự động hoặc không tự động. Bên cạnh đó, có thể bỏ qua những bộ bị thiếu dữ liệu hoặc phải đảm bảo tốt CSDL và các thủ tục nhập liệu. • Xử lý dữ liệu bị nhiểu (noisy data) có 2 cách là giảm thiểu nhiễu (phân giỏi, hồi quy, phân tích cụm) và nhận diện phần tử biên (phân bố thống kê, khoảng cách, mật độ, độ lệch).