CHƯƠNG 1. Bối cảnh và động lực Hệ thống giao thông công cộng là một thành phần quan trọng của cơ sở hạ tầng đô thị hiện đại, cung cấp khả năng di chuyển hiệu quả cho nhiều người mỗi ngày. Đặc biệt, xe buýt là phương tiện giao thông công cộng phổ biến do tính linh hoạt và khả năng tiếp cận của chúng. Do đó, việc cải thiện hiệu quả hoạt động của hệ thống xe buýt là một việc thiết thực, chẳng hạn như cải thiện độ tin cậy trong lịch trình di chuyển của xe buýt.
Độ tin cậy của các dịch vụ xe buýt có thể bị ảnh hưởng bởi nhiều yếu tố, bao gồm tắc nghẽn giao thông, điều kiện thời tiết và sự chậm trễ không mong muốn. Một trong những thách thức quan trọng nhất mà hệ thống xe buýt phải đối mặt là dự đoán chính xác thời gian đến của xe buýt tại các trạm dừng được chỉ định. Dự đoán chính xác thời gian đến của xe buýt là điều cần thiết để hệ thống giao thông công cộng hoạt động hiệu quả và đáng tin cậy. Hành khách cần biết khi nào xe buýt của họ sẽ đến để lên kế hoạch cho chuyến đi của mình và tránh những chậm trễ không cần thiết.
Các cơ quan giao thông công cộng cũng yêu cầu dự đoán chính xác để tối ưu hóa các tuyến xe buýt, lịch trình và điều phối, điều này có thể cải thiện độ tin cậy của dịch vụ và giảm chi phí vận hành. Đối với các nước có hệ thống giao thông ổn định hoặc có quy hoạch tuyến đường riêng cho xe buýt thì việc dự đoán không còn nhiều thách thức.Với phần lớn còn lại, hoạt động xe buýt chịu ảnh hưởng lớn từ hệ thống giao thông chung nhiều biến động, do đó việc dự đoán chính xác thời gian đến của xe buýt còn nhiều thách thức. Các phương pháp dự đoán thời gian đến của xe buýt truyền thống, chẳng hạn như lập lịch trình cố định hoặc điều phối thủ công, có thể không tính đến hoặc không thể tính đến các yếu tố khách quan ảnh hưởng đến thời gian đến của xe buýt, chẳng hạn như tình trạng giao thông, thời tiết… Do đó, các phương pháp này có thể không đáng tin cậy. Ngày nay có nhiều phương pháp được nghiên cứu để giải quyết bài 1 toán này, có thể kể đến các mô hình học máy sử dụng dữ liệu lịch sử để huấn luyện các mô hình, đưa vào các yếu tố khách quan để đưa ra các dự đoán chính xác hơn.
Mục tiêu Mục tiêu của luận văn là phát triển một giải pháp dự đoán thời gian đến trạm dừng của xe buýt, có thể đưa ra những dự đoán chính xác và đáng tin cậy, bằng cách sử dụng các kỹ thuật hiện đại và tiến bộ gần đây trong lĩnh vực học máy. Cụ thể hơn, mục tiêu của luận văn là phát triển mô hình dự đoán thời gian đến trạm dừng của xe buýt, dữ liệu lịch sử di chuyển của xe buýt huấn luyện cho mô hình mạng nơron truy hồi (RNN). Phạm vi và giới hạn của đề tài Phạm vi luận văn này sẽ tập trung vào việc dự đoán thời gian đến của xe buýt cho một nhóm tuyến xe buýt cụ thể trong một thành phố cụ thể, với dữ liệu là: 1. Dữ liệu lịch sử hành trình của xe buýt chứa các thông tin như: thời gian, vị trí xe buýt, tên tuyến tương ứng… từ đây gọi là dữ liệu GPS (Global Positioning System).
Dữ liệu tĩnh chứa thông tin của hệ thống xe buýt như tuyến đường, vị trí trạm dừng… từ đây gọi là dữ liệu GTFS (General Transit Feed Specification). Hai tập dữ liệu trên được dùng để huấn luyện mô hình dự đoán, đồng thời dùng để so sánh với các mô hình dự đoán khác. Do tính đặc thù của từng hệ thống xe buýt mà cấu trúc dữ liệu sẽ khác nhau, mặc khác về tính riêng tư mà dữ liệu xe buýt thường không được chia sẻ công khai. Đây là hai thách thức nổi bậc về dữ liệu đối với bài toán dự đoán thời gian của xe buýt.
Luận văn sử dụng hai tập dữ liệu được chia sẻ công khai: - Dữ liệu GPS tháng 1 năm 2013 của thành phố Dublin - Ireland [10] - Dữ liệu GFTS tháng 12 năm 2016 của thành phố Dublin - Ireland [11] 2 Chi tiết về các tập dữ liệu này sẽ được mô tả ở Chương 5. Với tập dữ liệu trong một khoảng thời gian ngắn, do đó không khai thác được các ảnh hưởng có tính chu kỳ trong năm như các mùa, các kỳ nghỉ. Mặc khác, mô hình dự đoán dùng dữ liệu làm cơ sở, nên chỉ đúng đắn với các tuyến đường đã được huấn luyện. Quá trình xử lý dữ liệu cũng sẽ phát triển theo hướng không phụ thuộc quá nhiều vào cấu trúc dữ liệu, trích xuất những thông tin cơ bản của hệ thống buýt, với mục đích là dễ dàng áp dụng cho những hệ thống buýt khác có cấu trúc dữ liệu khác nhau.
TỔNG QUAN BÀI TOÁN DỰ ĐOÁN THỜI GIAN ĐẾN TRẠM DỪNG CỦA XE BUÝT 2. Bài toán dự đoán Dự đoán khi nào xe buýt sẽ đến trạm dừng là nhiệm vụ khó khăn do có nhiều biến ngẫu nhiên liên quan và mối quan hệ phức tạp của chúng, chẳng hạn như: thời tiết, cường độ giao thông, tai nạn, giao lộ và số lượng hành khách… là các yếu tố có thể ảnh hưởng đến thời gian di chuyển của xe buýt. Có thể xem thời gian đến trạm dừng là đầu ra từ một hàm với đầu vào là các biến ảnh hưởng. Có nhiều phương pháp tiếp cận để giải quyết bài toán dự đoán thời gian đến của xe buýt, chẳng hạn như: phương pháp lập lịch, phương pháp thống kê, phương pháp tìm lân cận, phương pháp học máy.
Khảo sát các phương pháp cho bài đoán dự đoán 2. Phương pháp lập lịch Các phương pháp dựa trên lịch trình xe buýt được xác định trước và sử dụng chúng làm cơ sở để dự đoán thời gian đến. Các phương pháp này giả định rằng xe buýt tuân thủ lịch trình đã công bố và tính toán thời gian đến dự kiến dựa trên thời gian khởi hành theo lịch trình. Tuy nhiên, các phương pháp dựa trên lịch trình có thể không chính xác do các yếu tố không thể đoán trước như điều kiện giao thông, thời tiết và thời gian lên xuống của hành khách.
Phương pháp thống kê Các phương pháp thống kê nhằm mô hình hóa và dự đoán thời gian đến của xe buýt dựa trên dữ liệu lịch sử và kỹ thuật thống kê. Các phương pháp này phân tích thời gian đến của xe buýt trước đây, cùng với các yếu tố ảnh hưởng khác nhau như thời gian trong ngày, ngày trong tuần, điều kiện thời tiết và mô hình giao thông. Các mô hình thống kê như phân tích hồi quy, phân tích chuỗi thời gian như: ARIMA [12] sử dụng để nắm bắt mối quan hệ giữa các yếu tố này và thời gian đến của xe 4 buýt. Các mô hình này có thể đưa ra các dự đoán hợp lý dựa trên các mẫu lịch sử nhưng có thể gặp khó khăn trong việc nắm bắt các biến thể động và theo thời gian thực.
Phương pháp này hoạt động tốt với những hệ thống giao thông ổn định, tuy nhiên dễ bị ảnh hưởng bởi tắt nghẽn. Phương pháp tìm kiếm Ý tưởng của phương pháp này là tìm các phiên bản dữ liệu gần nhất trong lịch sử của dữ liệu đang xét, chẳng hạn như: số xe, số tuyến, thời gian trong tuần, khung giờ…và dùng chúng để đưa ra dự đoán bằng cách tính trung bình chẳng hạn. Có thể kể đến các kỹ thuật như k-NN [13], KR [14] (Kernel Regression). Phương pháp này hoạt động khá tốt, tuy nhiên thời gian tính toán dự đoán sẽ cao và dễ bị ảnh hưởng bởi dữ liệu xấu.
Phương pháp học máy Các phương pháp học máy dựa trên dữ liệu để huấn luyện mô hình dự đoán. Các phương pháp này sử dụng dữ liệu lịch sử, bao gồm dữ liệu GPS của xe buýt, tốc độ xe, số lượng hành khách, tình trạng giao thông, tình trạng thời tiết… để huấn luyện mô hình dự đoán. Chẳng hạn như kỹ thuật SVM (Support Vector Machine) được sử dụng trong bài báo [15] để dự đoán thời gian đến của xe buýt ở Hồng Kông vào năm 2011, các tác giả đã sử dụng thời gian di chuyển cùng với dữ liệu thời tiết làm cơ sở cho mô hình của họ. Một công trình khai thác dữ liệu lớn (Big data) của mạng lưới giao thông ở Việt Nam [7], bằng cách sử dụng dữ liệu được tạo từ các thiết bị IoT được trang bị hệ thống định vị toàn cầu (GPS) được gắn trên các phương tiện di chuyển trên mạng lưới đường thành phố để trích xuất trạng thái giao thông hiện tại, tức là các luồng giao thông trên đường… dữ liệu trạng trạng thái giao thông thời gian thực có nhiều 5 ứng dụng như: dự đoán thời gian đến của xe buýt tại các điểm dừng xe buýt, dự đoán thời gian đến và định tuyến cho taxi, điều hướng hành khách để tránh tắc đường, dự báo tắc đường… Các phương pháp dùng dữ liệu trạng thái thời tiết, trạng thái luồng giao thông sẽ hiệu quả với bài toán dự đoán thời gian di chuyển do có thông tin trạng thái của đoạn đường sẽ đi đến.
Tuy nhiên, cách tiếp cận này cần một hệ thống thu thập rộng lớn để có thể bao phủ một mạng lưới giao thông. Một cách tiếp cận khác là dùng chính dữ liệu mà hệ thống xe buýt thu thập được, chẳng hạn như dữ liệu hành trình của xe buýt. Cách mô hình mạng nơron nhân tạo thường được dùng để khai thác mối quan hệ của dữ liệu, chẳng hạn như mô hình mạng đa tầng (Multilayer perceptron - MLP) từ bài báo [16], hoặc dùng mạng nơron truy hồi (Recurrent Neural Networks - RNN) ở bài báo [1] được sử dụng để khai thác các phụ thuộc dài hạn giữa các điểm dữ liệu. Phương pháp tiếp cận bài toán Luận văn sẽ tiếp cận bài toán theo hướng bài toán hồi quy, bài toán dự đoán một giá trị dựa vào một tập hợp các đầu vào (chi tiết hơn về dạng bài toán này sẽ được trình bày ở phần 3.
Về dữ liệu sẽ sử dụng dữ liệu lịch sử của chính hệ thống xe buýt để huấn luyện mô hình. Với khả năng biểu diễn tốt dữ liệu, các mạng nơron nhân tạo ưu tiên được lựa chọn. Mặc khác, nếu xem thời gian đến trạm của xe buýt là một chuỗi các giá trị tuần tự, thì có thể xem đây là bài toán dự đoán giá trị tương lai của một chuỗi dữ liệu tuần tự.