CHƯƠNG 1. GIỚI THIỆU VỀ PHÂN TÍCH DỮ LIỆU 1.1 Giới thiệu Theo công ty Amazon, phân tích dữ liệu là quá trình thu thập, lưu trữ, xử lý, làm sạch, phân tích dữ liệu thô để trở thành các thông tin hữu ích, kết luận và hỗ trợ việc quyết định cho các tổ chức, doanh nghiệp. Phân tích dữ liệu có nhiều khía cạnh và hướng tiếp cận khác nhau bao gồm nhiều phương thức phân tích khác nhau trong các lĩnh vực như kinh tế, khoa học và xã hội học [2].2 Vai trò Phân tích dữ liệu đóng vai trò quan trọng vì nó có thể định hình các quy trình kinh doanh và cải thiện khả năng ra quyết định của doanh nghiệp. Lý do mà việc phân tích dữ liệu có thể làm được như vậy là vì nó có thể giúp cho doanh nghiệp nhìn rõ hơn và hiểu sâu hơn về quá trình và dịch vụ của họ bằng cách thu thập thông tin chuyên sâu chi tiết về trải nghiệm và các vấn đề của khách hàng để rồi phân tích, xây dựng và tạo ra những trải nghiệm khách hàng đã được cá nhân hóa, xây dựng các sản phẩm kỷ thuật số liên quan, tối ưu hoạt động và năng xuất của nhân viên [2].3 Dữ liệu lớn Việc lượng dữ liệu được sinh ra ngày nay ngày càng lớn lên đến 2.5 tỷ gigabytes mỗi ngày là quá lớn để để có thể xử lý 1 bằng các phương pháp thông thường như xử lý 1 dạng dữ liệu thường mà thay vào đó chúng sẽ được xem là dữ liệu lớn (big data).
Dữ liệu lớn (big data) là cách gọi các tệp dữ liệu lớn đa dạng cấu trúc (structured),bán cấu trúc (semi structured) và không cấu trúc (unstructured ) được tạo ra liên tục với tốc độ cao và khối lượng lớn. Big data thường được đo bằng terabyte hoặc petabyte. 1 terabyte tương đương 1. Việc phân tích dữ liệu lớn là quá trình tìm các mẫu, xu hướng và các mỗi quan hệ trong những tập dữ liệu khổng lồ.Việc này đòi hỏi các công cụ, công cụ cụ thể, năng lực điện toán và kho lưu trữ dữ liệu hỗ trợ theo quy mô của dữ liệu.4 Quy trình phân tích dữ liệu Quy trình phân tích dữ liệu thô sang các thông tin có lợi cho doanh nghiệp, tổ chức,… bao gồm các bước sau [2]: - Xác định mục tiêu - Thu thập dữ liệu - Tiền xử lý dữ liệu - Xử lý dữ liệu - Phân tích dữ liệu 16 - Diễn giải dữ liệu và đưa ra kết luận 1.1 Xác định mục tiêu Đây là bước mà các nhà phân tích dữ liệu phải phát thảo một số mục tiêu rõ ràng.
Tìm ra các câu hỏi mà doanh nghiệp, tổ chức, cá nhân,… cần trả lời bằng dữ liệu. VD: Liệu đặt kệ khăn giấy gần quầy thuốc tây có tăng doanh thu của khăn giấy lên không ? Đây cũng là bước mà các nhà phân tích dữ liệu xác định rõ loại dữ liệu, định dạng của dữ liệu mà họ muốn phân tích.2 Thu thập dữ liệu Bước này bao gồm việc xác định nguồn dữ liệu và thu thập dữ liệu từ nguồn này. Việc thu thập cần tuân theo một trong hai quá trình là ELT hoặc ETL [2]. - ELT – (Extract, Load, Transform) Trích xuất, tải, chuyển đổi: Trong ELT,trước tiên dữ liệu sau khi được trích xuất từ nguồn sẽ được tải vào kho lưu trữ và sau đó được chuyển đổi thành định dạng yêu cầu - ETL – (Extract, Transform, Load) Trích xuất, chuyển đổi, tải: Trong ETL, trước tiên dữ liệu sau khi được trích xuất từ nguồn sẽ được chuyển đổi thành định dạng yêu cầu sau đó được tải và kho lưu trữ.
Sau khi thu thập, dữ liệu cần phải được lưu trữ ở dịch vụ lưu trữ đặc biệt do dữ liệu thu về thường có dung lượng rất lớn.Trong số các dịch vụ lưu trữ dữ liệu: Data warehouse và datalake là 2 dịch vụ phổ biến và hiệu quả nhất.1 Các phương pháp thu thập dữ liệu Các phương pháp để thu thập dữ liệu bao gồm [3]: - Phương pháp quan sát (observation) - Phương pháp phỏng vấn bằng thư (mail interview) - Phương pháp phỏng vấn bằng điện thoại (telephone interview) - Phương pháp phỏng vấn cá nhân trực tiếp (personal interview) - Phương pháp điều tra nhóm cố định (panels) - Phương pháp điều tra nhóm chuyên đề (focus groups) 1.2 Lưu trữ dữ liệu Dựa vào các loại và độ phức tạp khác nhau mà dữ liệu được lưu trữ ở kho dữ liệu (data warehouse) hoặc hồ dữ liệu (data lake). Đây là các công nghệ giúp cho doanh nghiệp quản lý và tận dụng tiềm năng rộng lớn của Big data.1 Data warehouse Là cơ sở dữ liệu được tối ưu hóa cho phân tích dữ liệu quan hệ đến từ hệ thống giao dịch và ứng dụng kinh doanh. Cấu trúc dữ liệu và lược đồ được xác định trước để tối ưu hóa việc tìm kiếm và báo cáo nhanh. Dữ liệu được đưa vào kho dữ liệu đã được dọn dẹp và biến đổi để đóng vai trò là “nguồn thông tin “ đáng tin cậy mà người dùng có thể tin tưởng.
Đa số dữ liệu được lưu trữ trong kho dữ liệu đều là các dữ liệu có cấu trúc hoặc bán cấu trúc.2 Data lake Data lake thì khác vì có thể lữu trữ cả dữ liệu có cấu trúc và phi cấu trúc mà không cần xử lý thêm. Cấu trúc dữ liệu hoặc lược đồ không cần được xác định khi thu thập, tức là có thể lưu mọi dữ liệu mà không cần cẩn trọng thiết kế, điều này hữu ích khi chưa xác định mục đích sử dụng dữ liệu trong tương lai. Các ví dụ về dữ liệu bao gồm: nội dung truyền thông xã hội, dữ liệu Iot,… 1.3 Sự khác biệt của data lake và data warehouse So sánh giữa data lake và data warehouse [4]: Data lake Data warehouse Loại dữ liệu Chỉ lưu trữ các dữ liệu trích Tất cả các loại dữ liệu từ hệ thống đếu được lưu trữ kể cả dữ liệu bị xuất từ hệ thống giao dịch và từ chối lưu trữ trong data warecác số liệu định lượng để hỗ house. trợ quá trình phân tích hiệu Các loại dữ liệu này chưa được suất và tình trạng kinh doanh.
Dữ liệu trong data warehouse Có thể lưu cả dữ liệu hiện tại là các dữ liệu có cấu trúc rõ không sử dụng. Hình thức Data lake sử dụng phương pháp Data warehouse áp dụng schema “Schema on Read”.Nghĩa là khi phương pháp “Schema on có nhu cầu xử dụng dữ liệu để Write”. Nghĩa là mô hình này giải quyết các vấn đề kinh doanh được thiết kế với mục đích là thì chỉ có các dữ liệu liên quan cung cấp báo cáo thông qua đến được chọn và phân tích. quá trình dài phân tích dữ liệu, Dữ liệu được giữ ở trạng thái thấu hiểu quy trình nghiệp vụ, nguyên bản.
và hình thành một hệ thống xác định để phân tích dữ liệu. Tiết kiệm chi phí và thời gian Dữ liệu được biến đổi theo cấu trúc. 18 Hình thành hệ thống phân tích chi tiết. Tính linh hoạt Linh hoạt trong việc tái cấu trúc Khó khăn và tốn kém trong do dữ liệu được lưu trữ trong data việc tái cấu trúc do dữ liệu lake đều là những dữ liệu phi cấu được lưu trữ trong data trúc.
warehouse thường là những dữ liệu có cấu trúc nên dẫn đến việc đòi hỏi thêm các quy trình xử lý phức tạp và tốn kém Người dùng Phù hợp với những người có nhu Phù hợp với doanh nghiệp và cầu phân tích chuyên sâu như người dùng. những data scientists. Dễ dàng sử dụng và chủ yếu Đa dạng các loại dữ liệu để các được dùng để trả lời các câu nhà phân tích có thể kết hợp và truy vấn do dữ liệu được quản đưa ra các câu hỏi mới để giải lý với cấu trúc chặt chẽ. Bảng 1-1 Bảng so sánh giữa data lake và data warehouse 1.3 Tiền xử lý dữ liệu Theo tác giả của IBM developer, tiền xử lý dữ liệu (pre data processing) bao gồm các bước làm sạch dữ liệu (data cleaning), chuyển đổi dữ liệu (data transformation), rút gọn dữ liệu (data reduction) [5].1 Data cleaning Làm sạch dữ liệu là quá trình loại bỏ hoặc chỉnh sửa các tệp dữ liệu không phù hợp, sai định dạng hoặc bị thiếu thông tin trong tập dữ liệu.
Khi kết hợp các tệp dữ liệu lại với nhau có khả năng dữ liệu bị trùng lặp hoặc sai [6]. Việc đảm bảo dữ liệu được chính xác và toàn vẹn trước khi được đưa vào xử lý là vô cùng quan trọng nhằm đảm bảo kết quả và thuật toán được chính xác. Làm sạch dữ liệu bao gồm các bước: - Loại bỏ các dữ liệu bị trùng lặp hoặc không phù hợp Các dữ liệu bị trùng lặp thường do trong quá trình thu thập dữ liệu và kết hợp các dữ liệu. Khi kết hợp dữ liệu từ nhiều nguồn, đối tượng khác nhau sẽ dễ dẫn đến trùng lặp dữ liệu.
Để xử lý dữ liệu bị trùng lặp trước hết cần quan sát 19 và liệt kê các dữ liệu bị trùng lặp sau đó tiến hành xoá đi các hàng dữ liệu trùng lặp [6]. Các dữ liệu không phù hợp là các dữ liệu không liên quan hoặc không phù hợp với vấn đề đang cần phân tích [6]. VD: Nếu muốn phân tích các hoạt động, sở thích của genz nhưng các tập dữ liệu lại có cả thông tin của những thế hệ lớn hơn thì có thể xoá đi những tập tin của các thế hệ đấy. Điều này góp phần giảm thiểu sự phân tâm và tăng cường hiệu suất trong việc phân tích.
- Sữa lỗi cấu trúc Lỗi cấu trúc thường xảy ra khi nhà phân tích di chuyển tập dữ liệu hoặc khi đo lường thì dữ liệu thường bị thay đổi như quy ước tên lạ, lỗi chính tả, sai kiểu ký tự, viết hoa sai,… Những điều không nhất quán có thể gây ra sai sót trong phân loại danh mục.VD: Tập dữ liệu đếu xuất hiện đồng thời N/A và NAN,nhưng đáng lý thì chúng phải đều ở cùng 1 phân loại. - Lọc dữ liệu ngoại lai Đôi khi trong lúc quan sát tập dữ liệu sẽ xuất hiện các tập dữ liệu không phù hợp với dữ liệu mà nhà phân tích đang phân tích. Nếu dữ liệu khác biệt với các dữ liệu còn lại do sai sót trong lúc nhập liệu thì nhà phân tích hoàn toàn có thể xoá giá trị ngoại lai này đi để tăng chất lượng dữ liệu mà nhà phân tích đang phân tích. Ngược lại nếu dữ liệu đó tồn tại để chứng minh cho lý thuyết mà nhà phân tích đang phân tích thì nhà phân tích nên giữ lại [6].