Tổng quan nghiên cứu

Thị trường tài chính phi tập trung và công nghệ chuỗi khối ghi nhận bước phát triển nhảy vọt với quy mô vốn hóa của Bitcoin từng đạt 902 tỷ USD vào tháng 3 năm 2022. Cùng với sự bùng nổ của mạng lưới vạn vật kết nối và hệ thống giao thông thông minh, lưu lượng dữ liệu trao đổi giữa các phương tiện đạt ngưỡng hơn 1.000 thông điệp mỗi giây trên mỗi nút mạng. Yêu cầu cấp thiết đặt ra là phải đảm bảo tính xác thực, toàn vẹn và chống chối bỏ cho mọi giao dịch kỹ thuật số. Tuy nhiên, các giải thuật mã hóa khóa công khai truyền thống như RSA bộc lộ hạn chế lớn về độ dài khóa và tốc độ xử lý, trong khi việc thực thi thuật toán chữ ký số đường cong Elliptic trên CPU phần mềm thuần túy tạo nên điểm nghẽn hiệu năng nghiêm trọng.

Trước bối cảnh định luật Moore dần chạm ngưỡng giới hạn vật lý, việc nghiên cứu các giải pháp tăng tốc phần cứng chuyên biệt trở thành xu hướng tất yếu. Luận văn thạc sĩ chuyên ngành Khoa học máy tính của tác giả Phạm Lê Song Ngân thực hiện tại Trường Đại học Bách Khoa – Đại học Quốc gia TP. Hồ Chí Minh trong giai đoạn từ ngày 06/02/2023 đến ngày 10/12/2023 tập trung giải quyết bài toán tối ưu hóa hệ thống tăng tốc phần cứng cho giải thuật chữ ký số ECDSA trên đường cong secp256k1 256-bit. Mục tiêu trọng tâm của đề tài là xây dựng kiến trúc phần cứng tối ưu trên nền tảng tính toán tái cấu hình FPGA Xilinx Kria KV260 Vision AI, khai thác tối đa khả năng xử lý song song để giảm thiểu số chu kỳ xung nhịp thực thi xuống dưới 100.000 chu kỳ, nâng thông lượng xử lý lên hơn 2.700 phép xác thực mỗi giây và tiết kiệm trên 50% tài nguyên bộ nhớ tạm thời so với các phương pháp truyền thống.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu xây dựng trên nền tảng hệ mật mã đường cong Elliptic do Victor Miller và Neal Koblitz đề xuất độc lập từ năm 1991, kết hợp với lý thuyết số học trường hữu hạn Galois. Mô hình nghiên cứu triển khai giải thuật chữ ký số ECDSA dựa trên đường cong chuẩn secp256k1 có phương trình Weierstrass dạng y^2 = x^3 + 7 xác định trên trường số nguyên tố 256-bit p = 2^256 - 2^32 - 2^9 - 2^8 - 2^7 - 2^6 - 2^4 - 1. Hệ thống tích hợp hàm băm an toàn SHA-256 theo tiêu chuẩn FIPS 180-4 của Viện Tiêu chuẩn và Công nghệ Quốc gia Hoa Kỳ để tạo bản tóm lược thông điệp 256-bit trước khi ký số.

Bốn khái niệm kỹ thuật cốt lõi được vận dụng bao gồm:

  1. Độ an toàn dựa trên bài toán logarit rời rạc đường cong Elliptic, trong đó khóa ECC kích thước 256-bit cung cấp mức bảo mật tương đương khóa RSA kích thước từ 3072-bit đến 3248-bit nhưng chiếm ít tài nguyên lưu trữ hơn đáng kể.
  2. Hệ tọa độ chiếu Jacobian nhằm biểu diễn điểm hình học dưới dạng bộ ba tọa độ phân số, giúp loại bỏ hoàn toàn các phép chia nghịch đảo modular tốn kém thời gian trong quá trình thực hiện các phép cộng điểm và nhân đôi điểm liên tiếp.
  3. Thuật toán nhân Karatsuba và phép nhân Montgomery hỗ trợ phân rã và xử lý song song các toán hạng lớn trên trường hữu hạn.
  4. Kiến trúc tính toán tái cấu hình trên FPGA với các khối logic khả trình, bảng tra cứu LUT và các lát cắt xử lý tín hiệu số DSP chuyên dụng.

Phương pháp nghiên cứu

Tác giả áp dụng phương pháp đồng thiết kế phần cứng và phần mềm trên bộ công cụ Vivado ML của Xilinx. Nguồn dữ liệu thực nghiệm bao gồm 500 bộ vector kiểm thử chuẩn do Viện Tiêu chuẩn và Công nghệ Quốc gia Hoa Kỳ công bố cho thuật toán SHA-256 cùng 1.000 mẫu thông điệp ngẫu nhiên trên hệ thống giao dịch chuỗi khối. Phương pháp chọn mẫu có chủ đích được áp dụng nhằm bao phủ toàn diện các trường hợp biên của phép toán modulo 256-bit và kiểm tra độ chính xác tuyệt đối của chữ ký số được tạo ra.

Lý do lựa chọn phương pháp phân tích đồng thiết kế là nhằm phân tách tối ưu khối lượng công việc: hệ thống vi xử lý ARM đảm nhiệm khởi tạo tham số, phân tích gói tin và điều khiển luồng, trong khi khối logic lập trình FPGA thực thi song song các phép toán nhân vô hướng điểm, rút gọn modular và chuyển đổi tọa độ. Toàn bộ quá trình giao tiếp dữ liệu được chuẩn hóa qua giao thức AXI có độ trễ cực thấp. Nghiên cứu khai thác trực tiếp 256K ô logic hệ thống và 1.200 lát cắt DSP trên kit phần cứng Kria KV260 trong suốt lộ trình 10 tháng thực hiện đề tài.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thực nghiệm và kiểm thử trên phần cứng thực tế đã mang lại bốn kết quả nổi bật:

  • Phát hiện thứ nhất: Việc ứng dụng hệ tọa độ chiếu Jacobian kết hợp kỹ thuật chia tầng toán hạng đã loại bỏ hoàn toàn các phép chia lặp, giúp giảm 57% dung lượng ô nhớ tạm thời và rút ngắn thời gian tính toán nhân điểm xuống còn khoảng 19,33 micro-giây cho mỗi phép toán trường hữu hạn.
  • Phát hiện thứ hai: Khối tiền tính toán sử dụng dạng biểu diễn NAF cố định với cơ số w = 4 giúp giảm thiểu số lượng phép cộng điểm, đưa tổng số chu kỳ thực thi của công cụ xác thực ECDSA xuống mức 92.000 chu kỳ xung nhịp ở tần số 250 MHz. Kết quả này mang lại thông lượng đạt 2.717 phép xác thực mỗi giây, nhanh hơn gấp 2,5 lần (tăng 150%) so với các thiết kế FPGA truyền thống.
  • Phát hiện thứ ba: Khi tích hợp vào mạng chuỗi khối doanh nghiệp Hyperledger Fabric, hệ thống tăng tốc phần cứng giúp nâng thông lượng giao dịch từ 3.650 TPS lên mức 7.520 TPS trên cụm 10 nút máy chủ, tương ứng mức tăng trưởng hiệu năng vượt mức 106%.
  • Phát hiện thứ tư: Mức tiêu thụ tài nguyên phần cứng trên bo mạch Kria KV260 được tối ưu hóa xuất sắc với chỉ 21.759 LUTs, 5.625 Flip-Flops, 137 DSPs và 15 khối BRAM, duy trì công suất tiêu thụ toàn mạch dưới 5W và nhiệt độ hoạt động ổn định dưới 45 độ C.

Thảo luận kết quả

Nguyên nhân cốt lõi tạo nên sự vượt trội về tốc độ xử lý là sự kết hợp đồng bộ giữa kiến trúc xử lý song song word-wise và việc tối ưu hóa giao thức bắt tay dữ liệu AXI giữa hệ thống xử lý PS và logic lập trình PL. Thay vì để CPU xử lý tuần tự từng vòng lặp của hàm băm SHA-256 và thuật toán nhân vô hướng điểm, các đường ống dữ liệu trên FPGA cho phép tính toán đồng thời nhiều phép toán rút gọn modular reduction.

Khi so sánh với các công trình nghiên cứu trên dòng chip Virtex-6 trước đây vốn đạt thời gian nhân điểm 19,5 micro-giây tại tần số 135 MHz, thiết kế của luận văn đạt tần số hoạt động cao hơn rõ rệt (250 MHz) và độ trễ thấp hơn hẳn các mô hình chạy trên vi xử lý nhúng MicroBlaze (vốn mất tới 9,145 mili-giây cho khóa 521-bit). Dù các mạch tích hợp chuyên dụng ASIC 65nm có thể chạm mốc 27.000 phép xác thực mỗi giây, nền tảng FPGA Kria KV260 lại chiếm ưu thế vượt trội về chi phí nghiên cứu phát triển thấp hơn 80% cùng khả năng tái lập trình linh hoạt. Trong các báo cáo kỹ thuật, dữ liệu thực nghiệm được trực quan hóa sinh động qua các bảng thống kê tài nguyên logic và biểu đồ cột so sánh thông lượng TPS tương quan với số lượng nút mạng, khẳng định tính hiệu quả và độ tin cậy cao của kiến trúc đề xuất.

Đề xuất và khuyến nghị

Nhằm chuyển giao và ứng dụng hiệu quả kết quả nghiên cứu vào thực tiễn, luận văn đưa ra bốn nhóm giải pháp cụ thể:

  1. Thương mại hóa lõi IP tăng tốc ECDSA: Các doanh nghiệp công nghệ vi mạch và giải pháp bảo mật cần tích hợp ngay kiến trúc RTL vào các thiết bị xác thực phần cứng, cổng thanh toán tài chính và thiết bị biên IoT. Mục tiêu đạt thông lượng xử lý tối thiểu 5.000 giao dịch mỗi giây với mức tiêu thụ điện năng dưới 3,5W trong thời gian 6 đến 12 tháng tới.
  2. Mở rộng kiến trúc hỗ trợ đa đường cong mật mã: Nhóm nghiên cứu tại các trường đại học và viện công nghệ cần nâng cấp hệ thống để hỗ trợ linh hoạt các đường cong secp256r1, secp384r1 và Ed25519 thông qua kỹ thuật tái cấu hình từng phần (Partial Reconfiguration). Đặt mục tiêu rút ngắn thời gian chuyển đổi cấu hình phần cứng xuống dưới 5 mili-giây trong lộ trình 18 tháng.
  3. Tích hợp cơ chế phòng chống tấn công kênh kề: Các kỹ sư an toàn thông tin cần bổ sung các kỹ thuật che giấu toán hạng ngẫu nhiên và cân bằng tiêu thụ năng lượng nhằm ngăn chặn triệt để các cuộc tấn công phân tích công suất vi sai. Đảm bảo tỷ lệ kháng lỗi vật lý đạt 99,9% cho các thiết bị xác thực thông minh giai đoạn 2024 - 2026.
  4. Thử nghiệm diện rộng trên hạ tầng giao thông thông minh và ngân hàng số: Các cơ quan quản lý giao thông đô thị và tổ chức tài chính cần phối hợp triển khai thử nghiệm giải pháp tăng tốc phần cứng trên các trạm giao tiếp V2X và máy chủ xác thực giao dịch, hướng tới mục tiêu giảm độ trễ phản hồi chữ ký số xuống dưới 1 mili-giây cho 100% các gói tin dữ liệu.

Đối tượng nên tham khảo luận văn

Công trình nghiên cứu mang lại giá trị học thuật và ứng dụng thực tiễn sâu sắc cho bốn nhóm đối tượng:

  • Kỹ sư thiết kế vi mạch và lập trình phần cứng FPGA/ASIC: Tìm thấy tài liệu hướng dẫn chi tiết về phương pháp thiết kế RTL cho các khối số học modular 256-bit, kỹ thuật tối ưu hóa đường truyền dữ liệu AXI và phương án phân bổ tài nguyên bộ nhớ BRAM, lát cắt DSP tối ưu trên nền tảng Xilinx.
  • Lập trình viên và kiến trúc sư hệ thống Blockchain / Fintech: Nắm vững giải pháp tăng tốc độ xác thực giao dịch trên đường cong secp256k1, giúp nâng thông lượng mạng lưới chuỗi khối từ 1.290 lên 2.717 TPS cho các nút xác thực dữ liệu.
  • Chuyên gia an toàn thông tin và kỹ sư hệ thống nhúng bảo mật: Tiếp cận phương pháp hiện thực hóa chuẩn chữ ký số bảo mật cao với khóa 256-bit thay thế chuẩn RSA 3072-bit cồng kềnh, giải quyết bài toán xử lý kịp thời hơn 1.000 thông điệp mỗi giây trên các thiết bị biên IoT và ô tô tự hành.
  • Giảng viên, nghiên cứu sinh và học viên cao học chuyên ngành Công nghệ thông tin: Sử dụng làm tài liệu tham khảo chuẩn mực về lý thuyết mật mã đường cong Elliptic, phương pháp đồng thiết kế phần cứng - phần mềm và quy trình đánh giá thực nghiệm trên công cụ Vivado ML.

Câu hỏi thường gặp

  1. Tại sao nghiên cứu lại lựa chọn đường cong secp256k1 thay vì các đường cong khác? Đường cong secp256k1 thuộc chuẩn Koblitz với các hệ số đặc thù a = 0 và b = 7, cho phép tối ưu hóa tốc độ tính toán các phép nhân điểm và tiết kiệm tài nguyên logic trên phần cứng. Hơn nữa, đây là tiêu chuẩn mật mã cốt lõi của mạng lưới Bitcoin với kích thước khóa 256-bit, cung cấp độ an toàn tương đương khóa RSA 3072-bit trong khi kích thước lưu trữ nhỏ gọn hơn nhiều lần.

  2. Nền tảng FPGA Kria KV260 Vision AI mang lại những lợi thế gì cho việc tăng tốc giải thuật? Kit Kria KV260 tích hợp chip Zynq UltraScale+ MPSoC với 256K ô logic hệ thống, 1.200 lát cắt DSP và giao diện AXI băng thông rộng. Nền tảng này cho phép kết hợp hoàn hảo giữa vi xử lý ARM 64-bit và mạch logic chuyên dụng, giúp giảm 80% chi phí và thời gian phát triển so với chip ASIC thương mại mà vẫn đạt hiệu năng vượt trội.

  3. Việc chuyển đổi từ hệ tọa độ Affine sang hệ tọa độ Jacobian có ý nghĩa kỹ thuật gì? Trong hệ tọa độ Affine, mỗi phép cộng điểm đều đòi hỏi phép chia nghịch đảo modular cực kỳ tốn kém thời gian. Việc chuyển sang tọa độ Jacobian giúp thay thế phép chia bằng các chuỗi phép nhân và bình phương nhanh chóng, chỉ cần thực hiện đúng một phép nghịch đảo duy nhất ở bước cuối cùng, giúp tiết kiệm 57% ô nhớ và tăng tốc độ tính toán gấp nhiều lần.

  4. Hệ thống đạt được các chỉ số hiệu năng cụ thể nào khi kiểm thử thực tế? Kiến trúc phần cứng đề xuất đạt tần số vận hành tối đa 250 MHz, hoàn thành một chu trình xác thực chữ ký số chỉ trong 92.000 chu kỳ xung nhịp, tương đương thông lượng 2.717 phép xác thực mỗi giây. Khi triển khai trên mạng Hyperledger Fabric quy mô 10 nút, hệ thống đạt tốc độ xử lý 7.520 TPS, vượt trội 106% so với hệ thống chạy phần mềm thông thường.

  5. Giải pháp tăng tốc phần cứng này có khả năng thích ứng với các thuật toán mã hóa hậu lượng tử không? Nhờ tính năng tái cấu hình linh hoạt của FPGA, các khối xử lý số học modular và đường dẫn dữ liệu AXI có thể dễ dàng được nâng cấp, mở rộng để thực thi các thuật toán mã hóa dựa trên lưới hoặc hàm băm thế hệ mới mà không cần thiết kế lại toàn bộ bo mạch phần cứng vật lý.

Kết luận

  • Hoàn thành thiết kế và hiện thực thành công kiến trúc tăng tốc phần cứng cho giải thuật chữ ký số ECDSA trên đường cong secp256k1 bằng bộ công cụ Vivado ML trên nền tảng FPGA Kria KV260.
  • Ứng dụng xuất sắc hệ tọa độ chiếu Jacobian để triệt tiêu các phép chia modular lặp, cắt giảm 57% tài nguyên bộ nhớ tạm và tối ưu hóa đường truyền dữ liệu AXI.
  • Đạt tần số vận hành 250 MHz với thời gian thực thi chỉ 92.000 chu kỳ xung nhịp, mang lại thông lượng 2.717 phép xác thực mỗi giây, nhanh gấp 2,5 lần so với các kiến trúc FPGA hiện hành.
  • Gia tăng thông lượng giao dịch cho mạng chuỗi khối Hyperledger Fabric lên mức 7.520 TPS trên 10 nút máy chủ, tạo mức tăng trưởng hiệu năng hơn 106%.
  • Đảm bảo tính khả thi cao cho các hệ thống nhúng thời gian thực với mức tiêu thụ điện năng toàn mạch dưới 5W và nhiệt độ vận hành luôn duy trì an toàn dưới 45 độ C.

Đóng góp lớn nhất của luận văn là cung cấp một giải pháp tăng tốc phần cứng toàn diện, hiệu năng cao và tiết kiệm năng lượng cho hệ mật mã đường cong Elliptic, giải quyết triệt để bài toán thắt nút cổ chai trong bảo mật dữ liệu tốc độ cao. Lộ trình phát triển tiếp theo sẽ tập trung vào kỹ thuật tái cấu hình từng phần trong 12 tháng tới và tích hợp thử nghiệm vào hệ thống điều hành giao thông thông minh V2X trước năm 2025. Các tổ chức tài chính, doanh nghiệp công nghệ và nhà phát triển hệ thống nhúng hãy chủ động ứng dụng kiến trúc lõi này vào các nền tảng số để nâng cao toàn diện năng lực bảo mật và tối ưu hóa hiệu suất giao dịch.