DAI HOC QUOC GIA THANH PHO HO CHI MINH TRUONG DAI HOC BACH KHOA KHOA KHOA HOC & KY THUAT MAY TINH BK TP.HCM CAU TRUC ROT RAC CHO KHMT (CO1007) Thống kê khảo sát kết quả Covid-19 môn Cấu trúc rởi rạc GVHD : Huỳnh Tương Nguyên Nguyễn Ngọc LỄ SV thực hiện : Nguyễn Hoài Khang - 2111453 Hà Văn Châu - 2110054 Vũ Ngọc Thuận - 2112394 Đỗ Nguyễn An Huy - 2110193 Dương Trọng Khôi - 2113786 Tp. H 6Chi Minh, Thang 04/2022 Muc luc 1 Động cơ nghiên cứu 2 Mục tiêu 3 Cơ sở lý thuyết 3.1 Trung bình cộng (giá trị kì vọng) .Ặ Q Q HQ HH gà kg kg ky ky ky 3. Cách thức xác định.3 Phương sai - Độ lệch chuẩn.4 Khoảng tứ phân vị.41 Định nghĩa 342 Ý nghĩa. v gà xxx xxx xxx xxx xà 3.1 Định nghĩa 352 Ý nghĩa.
QQ Q Q Q Q TQ ng. v gà xxx xxx xxx xxx xà 3.6 Biểu đôhộp (Box Plo0 3.7 Tần số tích lũy - Biểu đ ồ tích lũy.2 Thiết lập bảng tần số tích lũy. Truong Dai Hoc Bach Khoa Tp.H% Chi Minh Khoa Khoa Học & Kỹ Thuật Máy Tính EcNhg. Đường trung bình động 3.
Tính toán giá trị trung bình động đơn giản.Q QQ Q Q Q Q Quà xxx xxx xxx xxx xà 8 3. Hệ số tương quan .1 Hệ số tương quan Pearson .2 H@ quy tuyến tính, phương pháp bình phương cực tiểu 9 4 Phân tích dữ liệu 11 4.1 Tập dữ liệu mẫu 42 Tifsxuli .1 Cài đặt các packages (gói) va sourc file chứa các hàm tính toán cần thiết .2 Đọc dữ liệu từ file vào dataframe (khung dữ liệu).23 Kiém tra cấu trúc của tập dữ liệu mẫu. Chuẩn hóa dữ liệu 4.1 Chuẩn hóa kiểu dữ liệu của thuộc tính date (ngày-giở) .2 Xử lí các giá tri 4m trong new_cases va new_deaths .3 Lọc ra những dữ liệu không phải là quốc gia 13 44 Dữ liệu được phân công riêng .5 Kết quả phân tích 5_ Kết luận 82 Tài liệu 82 Bài tập lớn môn Cấu trúc Rời rạc cho KHMT (COI007) - Niên khóa 2021-2022 Trang 2/83 Truong Dai Hoc Bach Khoa Tp.H% Chi Minh Khoa Khoa Học & Kỹ Thuật Máy Tính 1 Động cơ nghiên cứu Bénh Corona do virus gây ra còn gọi là COVID-19 đã tạo ra những tác động tiêu cực đến nềầi đời sống của cư dân trên thề giới. Các đợt bùng phát của COVIDI9 hay những biến thể virus đã mang đến những thách thức chưa từng có và được dự báo sẽ có tác động đáng kể đến sự phát triển kinh tế.
Nhiềi thông tin, tin tức về tình hình dịch bệnh cũng như dữ liệu về COVID-19 được phổ biến rộng rải trong đời sống hay trên internet để giúp cho mọi người quan sát, phân tích, nghiên cứu đươc cập nhật hàng ngày. Phân tích & thống kê dữ liệu về COVID19 giúp cho ta thấy được số ca nhiễm bệnh, tử vong của một quốc gia, so sánh tình trạng của các quốc gia trong khu vực hay diễn biến dịch trên thế giới. Từ số liệu được báo cáo mơi chúng ta muốn biết các ca nhiễm bệnh có xu hướng tăng lên hay giảm xuống quy mô các đợt bùng phát ở mỗi quốc gia. Dữ liệu dùng cho bài tập lớn có tham khào từ: https://github.com/owid/covid- 19-data/blob/master/public/data/README.
2_ Mục tiêu Trong bài tập lớn này, chúng ta sẽ bắt đầi với các bài toán thống kê đơn giản từ những dữ liệu được cung cấp. Qua đó, tìm ra những con số thú vị, có ý nghĩa đối với các dữ liệu thực tế từ tình hình dịch corona. Những kết quả tìm ra sẽ là bước khởi đầi cho việc khai phá nguồn dữ liệu của hệ thống sau này, nhằm đạt tới mục tiêu nâng cao kỹ năng lập trình, kỹ năng giải quyết vấn đề cho người học, kỹ năng làm việc nhóm cũng như hướng tới mục tiêu cao hơn là đam mê trong làm việc, học tập và nghiên cứu. 3 Cơ sở lý thuyết Trong thống kê, dữ liệu mà ta làm việc cùng là vô cùng lớn và nếu chổ nhìn vào dữ liệu nói chung thì rất khó để có thể rút ra được ý nghĩa tử những con số đó.
Vì vậy, người ta thường tính toán một số giá trị để có thể khái quát được dữ liệu. Ta sẽ cùng tìm hiểu một vài giá trị có ý nghĩa đối với thống kê.1 Trung bình cộng (giá trị kì vọng) 3.12 Ý nghĩa Trung bình cộng (hay giá trị trung bình, giá trị * Trong phân tích dữ liệu: giúp ta hình dùng được kì vọng) là một khái niệm vô cùng gần gũi đối với khoa điểm trung tâm của tập giá trị. học và đời sống hàng ngày. Giả sử ta có một tập D gần ¬ `.
¬ k oid trị _ ở, s Trong phân tích tình hình dịch Covid: giá trị giá trị XỊ, X¿,. Khí đó, ` anes Sat a x ` A » `. kì vọng có thể được xem là đại diện cho số lượng trung bình cộng của D là:. Ạ ca nhiễm hoặc tử vong của một quốc gia trong một khoảng thời gian cụ thể Từ đó đánh giá mức độ * nghiêm trọng, tình hình của dịch Covid, cũng như oO 5 (1) so sánh khách quan tình hình dịch giữa các quốc Mean(D)= a gia, các châu lục.
Bài tập lớn môn Cấu trúc Rời rạc cho KHMT (COI007) - Niên khóa 2021-2022 Trang 3/83 Truong Dai Hoc Bách Khoa Tp.H% Chi Minh Khoa Khoa Hoc & Kỹ Thuật Máy Tính 3.2 Tứ phân vị 3.23 Ý nghĩa Trong thống kê mô tả, tứ phân vị là một loại tập * Trong tính toán thống kê: ba tứ phân vị trên lượng tử chia số lượng điểm dữ liệu thành bốn phần có chia một tập hợp dữ liệu (đã sấp xếp theo trật tự kích thước bằng nhau hoặc nhỏ hơn. Dữ liệu phải được từ bé đến lớn) thành bốn phần có số lượng quan sấp xếp theo thứ tự tử nhỏ nhất đến lớn nhất để tính sit d@& bang nhau. Nó cung cấp thông tin về cả toán tứ phân vị. trung tâm và sự phân tán của dữ liệu.
Tứ phân vị thứ nhất và thứ ba cung cấp thông tỉn về mức độ chênh lệch lớn như thế nào và liệu tập dữ liệu có 3.2 Phân loại bị lệch v`ê một phía hay không. » Trong phân tích tình hình dịch Covid: tứ Có 3 tứ phân vị chính, đó là: phân vị thứ hai (Q; hay trung vị) có thể được sử dụng để thay cho giá trị kì vọng thành trung tâm *° Tứ phân vị thứ nhất (Q¡): là số chính giữa giữa của tập dữ liệu, trong trưởng hợp số liệu được báo số nhỏ nhất (minimun) và số trung vi (median) cáo có sự phân tán cao (độ lệch chuẩn lớn) để đánh của tập dữ liệu Nó còn được gọi là phần tư thực giá trình hình dịch bệnh. nghiệm thấp hơn hoặc thứ 25, vì 25% dữ liệu nằm dưới điểm này. *° Tứ phân vị thứ hai (Q;): là giá trị trung vị của một tập dữ liệu; do đó 50% dữ liệu nằm dưới điểm này.
*° Tứ phân vi tht ba (Q;): là giá trị giữa giữa giá trị trung vị (median) và số lớn nhất (maximun) của tập dữ liệu. Nó được gọi là phần tư thực nghiệm QI Y Q3 trên hoặc thứ 75, vì 75% dữ liệu nằm dưới điển Me này. Tứ phân vi 3.4 Cách thức xác định Có nhi quy chuẩn, phương thức để tính các tứ phân vị, mỗi phương thức có thể cho ra kết quả rất khác nhau, nhưng chúng đồi được công nhận là đúng. Một trong những cách thức tính toán tứ phân vị như sau: giả sử có một tap D gm k gid tri di duo sắp xếp: D = {x), x2, very Xk } ¢ Tinh tứ phân vi thứ hai: 3 Néu klé thì: Q;(D) = Median(D) = xe: 3 Nếu k chẵn thì: Q.(D) = Median(D) = 5% +X) s Tính tứ phân vị thứ nhất và thứ ba: 1.
Tìm trung vị (tứ phân vị thứ hai Qo) 3 Nếu k lẻ thì loại bỏ trung vị ra khoải tập dữ liệu. Chia tập dữ liệu còn lại ra hai phần bằng nhau. 3 Nếu k chẵn thì chia tập dữ liệu gốc ra hai phầi bằng nhau 2. Tứ phân vị thứ nhất Q; là trung vị của phần dữ liệu có giá trị thấp hơn.
Tứ phân vị thu ba Q; la trung vị của phần dữ liệu có giá trị cao hơn. Sử dụng kí hiệu toán học, ta có thể viết: Q;(D)=Mcdian({xIlx < Median(D)}) (2) Q3(D)=M edian({xlx > Median(D)}) (3) Bài tập lớn môn Cấu trúc Rời rạc cho KHMT (COI007) - Niên khóa 2021-2022 Trang 4/83 Truong Dai Hoc Bach Khoa Tp.H% Chi Minh Khoa Khoa Học & Kỹ Thuật Máy Tính Ví dụ 1: Cho một tập đã được sap xếp 6, 7, 15, 36, Ví dụ 2: Cho một tập đã được sấp xếp 7, 15, 36, 39, 39, 40, 41, 42, 43, 47, 49; có k = II. * Tính tứ phân vị thứ 2: Q; =xe= 40. « Tính tứ phân vị thứ 2: Q;y=-#‡*+ = 37.
* Chia tap dữ liệu ra hai phần bằng nhau sau khi đã loại trung vị » Chia tập dữ liệu ra hai phần bằng nhau: +Dị ={6,7,15,36. +Dị ={7,15,36} và Qị = 15.3 Phuong sai - Độ lệch chuẩn 3.1 Định nghĩa Salary Distribution Giá trị trung bình cộng cho ta biết được các giá trị Mean. trong tập dữ liệu phân bố quanh một điểm trung tâm nào, nhưng phương sai và độ lệch chuẩn cho ta biết được các giá trị đó phân bố như thế nào quanh điểm trung tâm. 7” Ễ Phương sai được định nghĩa là trung bình của bình — A8 phương khoảng cách của mỗi điểm dữ liệu tới điểm trung bình (giá trị kỳ vọng- trung bình cộng).
sọ i=k H_(¡~ Mean(Ð))? P PP PSS V(D) = o— salary Hình 3. Tập dữ liệu có phương sai nhỏ, các các điển Độ lệh chuẩn được định nghĩa là căn bậc hai cla ty lê, phan bố gần giá trị kì vọng (mean) nên dùng giá phương sai — trị kì vọng để mô tả (đại diện) cho trung tâm tập dữ liệu. Std(D) = O, (D) Salary Distribution Median Mean ' ' 300 ' 1 343.2 Ý nghĩa * Trong tính toán thống kê : phương sai càng lớn thì các giá trị có xu hướng phân bố càng xa quanh điểm kì vọng, giá trị kì vọng càng mô tả kém chính xác về điểm trung tâm. Ngược lai, phương sai càng h — nhỏ thì các điểm dữ liệu càng phân bố gần điểm ng kì vọng, giá trị kì vọng càng mô tả chính xác điển : : " Salary na.
trung tâm của tập dữ liệu. Tập dữ liệu có phương sai lớn, các các điển Trong phân tích tinh hinh dich bệnh: khi dữ liệu phân bố xa giá trị kì vọng nên dùng trung vị phương sai lớn, nên dùng trung vị (Q;) để làn(median) để mô tả (đại diện) cho trung tâm tập dữ liệu.