Tổng quan nghiên cứu

Trong kỷ nguyên bùng nổ của các dịch vụ giá trị gia tăng trên nền tảng di động, sự ổn định của hệ thống viễn thông đóng vai trò sống còn đối với doanh nghiệp. Một sự cố gián đoạn dịch vụ dù chỉ kéo dài từ 5 đến 10 phút cũng có thể gây thất thoát hàng trăm triệu đồng doanh thu và làm suy giảm 15% đến 20% chỉ số hài lòng của khách hàng. Vấn đề cốt lõi mà các doanh nghiệp viễn thông phải đối mặt là sự hạn chế của các giải pháp giám sát truyền thống. Hầu hết các công cụ hiện hành chỉ tập trung đo lường trạng thái vật lý của hạ tầng mạng như switch, router hoặc tải máy chủ, mà bỏ qua hoàn toàn tầng ứng dụng và tiến trình nghiệp vụ. Thực tế ghi nhận nhiều trường hợp kết nối mạng vẫn thông suốt 100%, nhưng các tiến trình xử lý tin nhắn bị treo hoặc lỗi kết nối cơ sở dữ liệu khiến dịch vụ ngưng trệ hoàn toàn.

Luận văn tập trung nghiên cứu và xây dựng hệ thống giám sát, cảnh báo chủ động toàn diện cho cả hạ tầng phần cứng lẫn các ứng dụng, dịch vụ đang vận hành tại Công ty Cổ phần Dịch vụ Gia tăng MobiFone. Đề tài được triển khai thực nghiệm từ tháng 01/2015 đến tháng 06/2015 trên hệ thống máy chủ IBM, HP và thiết bị mạng Cisco. Phạm vi nghiên cứu bao phủ hơn 10 dịch vụ trọng điểm của công ty như hệ thống đầu số nhắn tin 7x89, cổng thanh toán trực tuyến, SMS Brand Name, dịch vụ ngân hàng Fastbank và các tiến trình xử lý cước CDR. Mục tiêu trọng tâm là rút ngắn thời gian phát hiện lỗi từ 30 phút xuống dưới 60 giây, đồng thời đạt độ chính xác 100% trong việc định danh các sự cố phát sinh từ mã nguồn và tiến trình phần mềm.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu xây dựng trên nền tảng tích hợp giữa lý thuyết mạng truyền thông và kiến trúc hệ thống phân tán thông qua hai nhóm công nghệ chính:

Thứ nhất là hệ thống giao thức quản trị và truyền thông tiêu chuẩn. Nghiên cứu khai thác giao thức Syslog theo chuẩn RFC 5424 hoạt động qua giao thức TCP cổng 514 tích hợp mã hóa TLS nhằm bảo đảm tính toàn vẹn của dữ liệu nhật ký. Bên cạnh đó, các giao thức truy cập từ xa Telnet theo chuẩn RFC 854 và SSH được ứng dụng để khởi tạo kết nối an toàn với máy chủ. Tại tầng ứng dụng, giao thức HTTP và giao thức SOAP 1.2 trên nền tảng XML đóng vai trò chuẩn hóa thông điệp trao đổi giữa các webservice phân tán.

Thứ hai là mô hình thu thập dữ liệu hệ thống thông qua thư viện mã nguồn mở Hyperic Sigar API kết hợp kỹ thuật bắt ngoại lệ Exception trong Java. Khung lý thuyết bao gồm 4 khái niệm cốt lõi: thu thập tài nguyên phần cứng theo thời gian thực, giám sát trạng thái tiến trình nền, kiểm tra tính khả dụng của dịch vụ thông qua cơ chế gửi yêu cầu HTTP GET/POST kết hợp truy vấn cơ sở dữ liệu MySQL, và mô hình phân cấp cảnh báo 5 cấp độ phục vụ việc ra quyết định xử lý sự cố.

Phương pháp nghiên cứu

Phương pháp nghiên cứu kết hợp giữa thu thập dữ liệu thực nghiệm và phân tích định lượng dựa trên việc so sánh ngưỡng chỉ số. Nguồn dữ liệu sơ cấp được trích xuất trực tiếp từ 14 câu lệnh giám sát chuyên biệt gồm: cpu, mem, dsk, ps, sql, wget, wpost, countfile, dirsize, filesize, grep, ping, telnet và ver. Dữ liệu thứ cấp được tổng hợp từ máy chủ Syslog Server và các bảng ghi cước CDR.

Cỡ mẫu thực nghiệm bao gồm 20 máy chủ vật lý và máy chủ ảo hóa vận hành trên hệ điều hành Linux, kết nối trực tiếp với hệ thống mạng Core và Gateway của MobiFone Plus. Phương pháp chọn mẫu là chọn mẫu có chủ đích toàn diện trên 100% các phân hệ dịch vụ đang chạy thực tế trên môi trường sản xuất. Lý do lựa chọn phương pháp này là nhằm đảm bảo tính xác thực tuyệt đối của dữ liệu kiểm thử, đo lường chính xác các tác động của tải giao dịch thực tế lên đến hàng triệu tin nhắn mỗi ngày. Cơ chế quét dữ liệu được thiết kế không đồng bộ, giữ cho mức tiêu thụ tài nguyên của ứng dụng giám sát luôn ở mức dưới 2% tải CPU máy chủ và độ trễ phân tích log dưới 1 giây. Timeline nghiên cứu được thực hiện nghiêm ngặt từ ngày 19/01/2015 đến ngày 14/06/2015 trước khi hoàn thiện và bảo vệ thành công vào tháng 01/2016.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình triển khai thực tế hệ thống giám sát và cảnh báo tại MobiFone Plus đã mang lại 4 phát hiện quan trọng:

Thứ nhất, việc thiết lập 3 ngưỡng cảnh báo tài nguyên máy chủ mang lại hiệu quả kiểm soát vượt trội. Khi dung lượng ổ cứng hoặc bộ nhớ RAM đạt ngưỡng 80%, hệ thống tự động gắn nhãn WARNING để theo dõi. Khi mức sử dụng chạm 90%, trạng thái ERROR được kích hoạt, và khi vượt ngưỡng 95%, mức báo động cao nhất CRITICAL sẽ phát lệnh gửi tin nhắn SMS và Email đến người quản trị trong vòng 30 giây.

Thứ hai, nghiên cứu phát hiện và tự động hóa thành công quy trình xử lý lỗi hàng đợi tin nhắn. Cụ thể tại phân hệ dịch vụ Sub7989, cảm biến sử dụng lệnh SQL kiểm tra định kỳ bảng dữ liệu, phát hiện ngay lập tức các tin nhắn MO bị tồn đọng trong hàng đợi. Kịch bản Bash shell tự động can thiệp cập nhật cơ sở dữ liệu và khởi động lại tiến trình chỉ trong vòng 2 giây, giúp triệt tiêu 99% rủi ro mất mát giao dịch của khách hàng.

Thứ ba, hệ thống chứng minh khả năng phát hiện 100% các lỗi tiến trình ứng dụng Java bị dừng đột ngột mà các công cụ hạ tầng mạng không thể nhận diện. Việc kiểm tra định kỳ chuỗi tiến trình bằng lệnh ps và kiểm tra website bằng lệnh wget giúp phát hiện tức thì các hiện tượng thay đổi nội dung trang web hoặc treo luồng gửi tin MT.

Thứ tư, cơ chế truyền thông tin cảnh báo đa kênh đạt tỷ lệ thành công 99.8%. Việc kết hợp đồng thời giữa giao diện Web Dashboard phát âm thanh, tin nhắn SMS Brand Name, thư điện tử Email và thông báo qua ứng dụng PushBullet giúp giảm thời gian phản ứng trung bình của nhân viên trực vận hành từ 20 phút xuống dưới 3 phút.

Thảo luận kết quả

Nguyên nhân chính dẫn đến các sự cố gián đoạn dịch vụ viễn thông bắt nguồn từ việc phân mảnh dữ liệu, rò rỉ bộ nhớ của các ứng dụng chạy nền và lỗi kết nối webservice từ phía đối tác cung cấp nội dung, chứ không đơn thuần do đứt gãy đường truyền vật lý.

So với các công trình nghiên cứu trước đây như đề tài giám sát mạng ISP của tác giả Nguyễn Trung Thông, đề tài giám sát IPTV của tác giả Phan Văn Vinh, hay giải pháp SNMP/ICMP của tác giả Võ Thanh Dũng, hệ thống này tạo ra bước đột phá khi can thiệp sâu vào tầng logic nghiệp vụ. Hệ thống không chỉ kiểm tra tính sống còn của thiết bị mà còn giám sát chi tiết từng bảng dữ liệu MySQL và bắt các ngoại lệ Java Exception phát sinh trong quá trình vận hành.

Về mặt trực quan hóa, toàn bộ dữ liệu giám sát có thể được biểu diễn một cách khoa học thông qua bảng ma trận trạng thái máy chủ hiển thị theo 5 gam màu quy chuẩn: xanh lá cây cho trạng thái OK, vàng cho WARNING, cam cho ERROR, đỏ cho CRITICAL và xám cho UNKNOWN. Đồng thời, dữ liệu biến động sản lượng tin nhắn MO/MT được trực quan hóa qua biểu đồ đường theo các khung thời gian thực từ 15 đến 30 phút, giúp kỹ sư vận hành nhận diện ngay độ lệch chuẩn bất thường so với cùng thời điểm của ngày hôm trước.

Đề xuất và khuyến nghị

Dựa trên kết quả nghiên cứu và thực nghiệm tại doanh nghiệp, 4 nhóm giải pháp kỹ thuật cụ thể được khuyến nghị triển khai:

Một là, tối ưu hóa chu kỳ quét cảm biến Sensor trên toàn bộ máy chủ. Cấu hình chu kỳ quét linh hoạt theo 2 mức độ ưu tiên: 30 giây một lần đối với các dịch vụ xử lý giao dịch trực tiếp như cổng thanh toán và đầu số SMS, và 300 giây một lần đối với các tác vụ kiểm tra dung lượng ổ đĩa hay kích thước file nhật ký. Mục tiêu giữ mức chiếm dụng bộ nhớ của Sensor dưới 256MB RAM. Chủ thể thực hiện là Đội ngũ Kỹ sư Quản trị Hệ thống, hoàn thành trong Quý 1.

Hai là, mở rộng tự động hóa kịch bản tự phục hồi lỗi cho toàn bộ các hệ sinh thái dịch vụ. Lập trình bổ sung 15 kịch bản tự động xử lý hàng đợi và khởi động lại tiến trình tương tự mô hình Sub7989 cho các dịch vụ Fastbank, Mfun và cổng VAS 7089, hướng tới mục tiêu tự động khắc phục thành công 85% các sự cố phần mềm phổ biến mà không cần con người can thiệp thủ công. Chủ thể thực hiện là Bộ phận Phát triển Phần mềm kết hợp DevOps, triển khai trong 6 tháng.

Ba là, nâng cấp hạ tầng lưu trữ cơ sở dữ liệu Syslog tập trung sang mô hình dữ liệu lớn. Thiết lập cụm máy chủ lưu trữ chuyên biệt có khả năng tiếp nhận và phân loại trên 50GB dữ liệu nhật ký mỗi ngày, tích hợp cơ chế đánh chỉ mục nâng cao nhằm rút ngắn thời gian truy vấn grep log từ 10 giây xuống dưới 1 giây. Chủ thể thực hiện là Bộ phận Quản trị Hạ tầng Mạng, hoàn thiện vào Quý 3.

Bốn là, chuẩn hóa quy trình phản ứng sự cố 24/7 của Trung tâm Điều hành. Ban hành quy chế phối hợp 4 bước: tiếp nhận cảnh báo âm thanh từ Web Dashboard, xác thực nhanh bằng lệnh telnet/ping, kích hoạt kịch bản khắc phục, và lưu vết báo cáo CDR. Mục tiêu duy trì chỉ số thời gian trung bình khắc phục sự cố dưới 10 phút. Chủ thể thực hiện là Ban Lãnh đạo Trung tâm Vận hành, áp dụng ngay trong tháng đầu tiên.

Đối tượng nên tham khảo luận văn

Công trình nghiên cứu mang giá trị ứng dụng thực tiễn cao, đặc biệt hữu ích cho 4 nhóm đối tượng chuyên môn:

Nhóm thứ nhất là Kỹ sư Quản trị Hệ thống và DevOps. Tài liệu cung cấp hướng dẫn chi tiết về cách thức nhúng thư viện Sigar API và cấu hình 14 lệnh kiểm thử chuyên sâu trên hệ điều hành Linux, giúp quản trị hiệu quả hơn 50 cụm máy chủ với mức tiêu hao tài nguyên tối thiểu.

Nhóm thứ hai là Lập trình viên và Kỹ sư Phát triển Dịch vụ Viễn thông. Đối tượng này có thể tham khảo phương pháp xử lý ngoại lệ Java Exception, kỹ thuật giám sát hàng đợi tin nhắn MO/MT trên MySQL và phương pháp viết script Bash shell tự động khởi động lại dịch vụ trong 2 giây khi xảy ra sự cố.

Nhóm thứ ba là Trưởng bộ phận Giám sát Mạng và Điều hành NOC. Luận văn cung cấp mô hình phân cấp 5 mức độ cảnh báo khoa học và giải pháp xây dựng Dashboard điều hành tập trung phát âm thanh, giúp tối ưu hóa 100% năng suất làm việc của đội ngũ trực ca 24/7.

Nhóm thứ tư là Học viên Cao học và Nghiên cứu sinh chuyên ngành Kỹ thuật Điện tử, Viễn thông và Công nghệ Thông tin. Đề tài là tài liệu tham khảo giá trị về phương pháp nghiên cứu thực nghiệm kéo dài từ ngày 19/01/2015 đến 14/06/2015, kết hợp nhuần nhuyễn giữa cơ sở lý thuyết mạng viễn thông và bài toán kinh doanh thực tế tại doanh nghiệp quy mô lớn.

Câu hỏi thường gặp

Hệ thống giám sát này có điểm gì vượt trội so với các phần mềm Nagios và Cacti truyền thống?

Nagios và Cacti chủ yếu tập trung giám sát hạ tầng phần cứng và lưu lượng mạng thông qua giao thức SNMP hoặc ICMP. Hệ thống trong luận văn tích hợp thêm thư viện Sigar API và các lệnh kiểm tra mức ứng dụng như sql, wget và ps, cho phép kiểm tra trực tiếp hàng đợi cơ sở dữ liệu MySQL và nội dung website, phát hiện 100% các lỗi treo tiến trình phần mềm mà mạng vẫn thông.

Thư viện Sigar API đóng vai trò gì trong kiến trúc giám sát và hỗ trợ các nền tảng nào?

Sigar API là thư viện mã nguồn mở chuyên dụng giúp thu thập toàn diện các thông số tài nguyên máy chủ từ CPU, RAM, dung lượng đĩa cứng đến bảng định tuyến mạng TCP/UDP. Thư viện này hỗ trợ đa nền tảng gồm Linux, Windows, Mac OS, Solaris và tương thích với nhiều ngôn ngữ như Java, C#, PHP, giúp tối ưu hóa hiệu suất thu thập dữ liệu với mức tải dưới 2% CPU.

Cơ chế tự động xử lý khi phát hiện nghẽn hàng đợi tin nhắn MO/MT hoạt động ra sao?

Khi cảm biến phát hiện số lượng bản tin MO trong bảng dữ liệu vượt mức 0, kịch bản Bash shell sẽ tự động cập nhật lại trường thông tin retry trong MySQL, tạm dừng 2 giây để tiến hành chạy lại các file stop.sh và start.sh nhằm tái khởi động tiến trình. Toàn bộ thông tin xử lý được gửi qua API PushBullet và SMS đến điện thoại quản trị viên chỉ trong 5 giây.

Hệ thống phân chia các cấp độ cảnh báo như thế nào để tối ưu hóa việc xử lý sự cố?

Hệ thống thiết lập 5 cấp độ cảnh báo rõ ràng gồm: OK khi hệ thống ổn định, WARNING khi tài nguyên đạt ngưỡng 80%, ERROR khi chạm 90%, CRITICAL khi vượt 95% hoặc tiến trình dừng, và UNKNOWN cho lỗi cấu hình. Phân cấp này giúp nhân viên NOC phân loại ưu tiên, xử lý các sự cố khẩn cấp trong vòng 3 phút mà không bị quá tải bởi các thông báo thông thường.

Tại sao hệ thống cần tích hợp đồng thời nhiều kênh cảnh báo như SMS, Email, Web UI và PushBullet?

Mỗi kênh phục vụ một mục đích chuyên biệt: giao diện Web UI phát âm thanh báo động tại phòng trực 24/7; Email cung cấp chi tiết file nhật ký dài để phân tích kỹ thuật; SMS và PushBullet gửi thông báo tức thì đến thiết bị di động của kỹ sư trong vòng 30 giây khi không có mặt tại văn phòng, bảo đảm tỷ lệ tiếp nhận thông tin sự cố đạt 100%.

Kết luận

  • Xây dựng thành công hệ thống giám sát và cảnh báo toàn diện, giải quyết triệt để bài toán phát hiện lỗi ở tầng ứng dụng và tiến trình dịch vụ viễn thông mà các phần mềm truyền thống bỏ sót.
  • Ứng dụng xuất sắc thư viện Sigar API kết hợp bộ 14 câu lệnh kiểm tra chuyên sâu, tối ưu hóa mức tiêu thụ tài nguyên máy chủ luôn dưới 2% tải CPU.
  • Thiết lập thành công cơ chế tự động hóa khắc phục lỗi hàng đợi tin nhắn MO/MT với thời gian tự phục hồi dịch vụ chỉ trong 2 giây.
  • Chuẩn hóa mô hình cảnh báo đa kênh 5 cấp độ qua Web Dashboard âm thanh, tin nhắn SMS, Email và PushBullet với độ chính xác đạt 99.8%.
  • Triển khai ứng dụng thực tế thành công tại Công ty Cổ phần Dịch vụ Gia tăng MobiFone, bảo vệ doanh thu ổn định cho hơn 10 dịch vụ giá trị gia tăng trọng điểm.
  • Hướng nghiên cứu tiếp theo trong 12 tháng tới tập trung vào việc hoàn thiện cơ sở dữ liệu phân tán cho hệ thống Syslog và ứng dụng thuật toán học máy nhằm dự báo nguy cơ sự cố trước 15 phút.
  • Quý độc giả, kỹ sư và các nhà nghiên cứu quan tâm có thể tiếp cận toàn văn công trình luận văn thạc sĩ để khai thác chi tiết các mã nguồn kịch bản và tài liệu cấu hình hệ thống thực tế.