Tổng quan nghiên cứu

Trong kỷ nguyên phát triển mạnh mẽ của công nghệ vi mạch tích hợp quy mô siêu lớn (VLSI), các khối xử lý số học trong chip hệ thống trên bo mạch (SoC) chiếm tới khoảng 40% đến 60% tổng năng lượng tiêu thụ trên các thiết bị cầm tay. Trong đó, bộ nhân kỹ thuật số là thành phần cốt lõi của các đơn vị tính toán số học logic (ALU) và bộ xử lý tín hiệu số (DSP), thường gây ra độ trễ chiếm hơn 30% chu kỳ xung nhịp của toàn hệ thống. Vấn đề nghẽn cổ chai về tốc độ và sự gia tăng tiêu thụ công suất đòi hỏi các giải pháp kiến trúc đột phá nhằm thay thế các bộ nhân truyền thống như Booth hay mảng cộng thông thường.

Nghiên cứu này tập trung vào mục tiêu thiết kế và tối ưu hóa bộ nhân Vedic 16x16 bit hiệu năng cao, công suất thấp trên quy trình công nghệ CMOS TSMC 45nm với điện áp nguồn danh định 1.0 V. Đề tài kết hợp giải thuật nhân Vedic cổ đại với các bộ cộng tiền tố song song tiên tiến như Modified Kogge-Stone (MKS) và Square Root Brent-Kung Carry Select Adder (Regular SQRT BK CSA). Đồng thời, cấu trúc cổng New XOR-XNOR và Full Adder 22 transistor (22T) được triển khai nhằm giảm thiểu dòng ngắn mạch và điện dung ký sinh.

Nghiên cứu được hoàn thành tại Trường Đại học Bách Khoa – Đại học Quốc gia Thành phố Hồ Chí Minh vào tháng 6 năm 2019. Kết quả nghiên cứu mang ý nghĩa khoa học và thực tiễn sâu sắc khi cung cấp giải pháp tối ưu hóa toàn diện chỉ số Power-Delay Product (PDP), cải thiện tốc độ xử lý hơn 45% ở tần số vận hành 0.5 GHz, mở ra tiềm năng ứng dụng rộng rãi trong các thiết bị vi điện tử di động và hệ thống nhúng thông minh.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng trên nền tảng kết hợp giữa toán học thuật toán và lý thuyết thiết kế mạch tích hợp số:

Khung lý thuyết thứ nhất là thuật toán nhân Vedic dựa trên Sutra Urdhva-Tiryakbhyam, mang ý nghĩa nguyên lý nhân "theo chiều dọc và chiều ngang". Thuật toán cho phép tạo ra tất cả các tích từng phần (partial products) đồng thời và độc lập, loại bỏ sự phụ thuộc tuần tự giữa các bước tính. Để mở rộng quy mô từ khối 2x2 bit lên 4x4 bit, 8x8 bit và 16x16 bit, lý thuyết phân chia và chinh phục Karatsuba-Ofman được áp dụng triệt để, giúp giảm độ phức tạp của phép nhân nhiều chữ số xuống cấu trúc đệ quy mô-đun.

Khung lý thuyết thứ hai là lý thuyết cộng tiền tố song song (Parallel Prefix Adder Theory). Nghiên cứu phân tích sâu cấu trúc cây truyền nhớ Carry Tree thông qua các giai đoạn: tiền xử lý (tính tín hiệu lan truyền $P_i = A_i \oplus B_i$ và tạo nhớ $G_i = A_i \cdot B_i$), mạng tạo nhớ song song để tính các tín hiệu nhớ trung gian $CP_{i:j}$ và $CG_{i:j}$, cùng giai đoạn hậu xử lý để xuất bit tổng $S_i$. Các mô hình bộ cộng được so sánh gồm Ripple Carry Adder (RCA), Carry Save Adder (CSA), Brent-Kung, Kogge-Stone, Modified Kogge-Stone và Regular SQRT BK CSA.

Các khái niệm then chốt bao gồm: Trễ truyền trung bình $t_p = (t_{pLH} + t_{pHL})/2$ đo tại điểm chuyển tiếp 50% của dạng sóng; Công suất tiêu tán trung bình $P_{avg} = \frac{1}{T} \int_{0}^{T} i_{DD}(t) \cdot V_{DD} dt$; và Kỹ thuật tối ưu mạch logic 22 Transistor nhằm giảm điện dung ngõ ra và triệt tiêu dòng ngắn mạch.

Phương pháp nghiên cứu

Nghiên cứu sử dụng nguồn dữ liệu mô phỏng chuẩn xác từ phần mềm thiết kế vi mạch chuyên dụng Cadence Virtuoso ở mức sơ đồ nguyên lý (Schematic) và Mentor Graphics ModelSim ở mức kiểm thử logic chức năng. Toàn bộ mô hình mạch được thiết kế dựa trên thư viện công nghệ TSMC 45nm, hoạt động tại điện áp cấp nguồn $V_{DD} = 1.0\text{ V}$, tần số xung clock $0.5\text{ GHz}$ (chu kỳ xung $2\text{ ns}$), thời gian sườn lên và sườn xuống của xung tín hiệu được thiết lập chuẩn xác là $1\text{ ps}$.

Cỡ mẫu kiểm thử bao gồm 16 cặp vector tín hiệu ngõ vào đa chu kỳ (a[15:0] và b[15:0]) với độ rộng xung biến thiên từ 1 ns đến 6 ns và chu kỳ xung dao động từ 2 ns đến 12 ns. Phương pháp chọn mẫu là kỹ thuật tạo mẫu ngẫu nhiên có trọng số chu kỳ xung, bao phủ toàn diện các trường hợp biên khắc nghiệt từ giá trị 0000h đến FFFFh nhằm kích hoạt tất cả các đường trễ tới hạn (critical paths) tiềm ẩn trong mạch.

Lý do lựa chọn phương pháp phân tích quá độ (Transient Analysis) trên môi trường Cadence Virtuoso là vì phương pháp này cho phép đo đạc chính xác các thông số vật lý ở cấp độ transistor, phản ánh trung thực hiện tượng sụt áp, dòng rò và điện dung ký sinh trong công nghệ bán dẫn 45nm. Timeline nghiên cứu được thực hiện xuyên suốt trong 6 tháng, từ tháng 1 đến tháng 6 năm 2019, đảm bảo quy trình kiểm chứng nghiêm ngặt từ khâu logic đến mô phỏng dạng sóng vật lý.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình mô phỏng và đo đạc thực nghiệm trên môi trường Cadence Virtuoso đã mang lại những phát hiện quan trọng:

Thứ nhất, kiến trúc bộ nhân Vedic 16x16 bit phân cấp (được ghép nối từ 4 bộ nhân 8x8 bit, 1 bộ cộng 16 bit và 1 bộ cộng 24 bit) đạt độ chính xác chức năng 100% trên toàn bộ 32 bit ngõ ra (v[31:0]) tại tần số 0.5 GHz, xử lý hoàn hảo các phép nhân nhị phân phức tạp với độ trễ truyền ổn định.

Thứ hai, việc tích hợp bộ cộng Modified Kogge-Stone kết hợp Regular SQRT BK CSA giúp rút ngắn thời gian trễ tới hạn từ mức 1.85 ns của cấu trúc Ripple Carry Adder xuống dưới 0.95 ns. Tốc độ tính toán được cải thiện khoảng 48.6% so với cấu trúc RCA và nhanh hơn khoảng 22.3% so với cấu trúc Carry Save Adder truyền thống.

Thứ ba, việc áp dụng cấu trúc cổng New XOR-XNOR và tế bào Full Adder cải tiến 22 Transistor (22T Full Adder) đã làm giảm công suất tiêu tán trung bình từ 25% đến 32% so với mạch Full Adder 28T CMOS truyền thống. Sự cắt giảm này đến từ việc loại bỏ các nút chuyển mạch không cần thiết và giảm điện dung ký sinh tại các ngõ ra trung gian.

Thứ tư, cấu trúc Regular SQRT BK CSA chia thành 5 nhóm kích thước tăng dần đã giải quyết triệt để nhược điểm tiêu tốn diện tích và tắc nghẽn đường dây (routing congestion) của bộ cộng Kogge-Stone chuẩn, giúp tối ưu hóa diện tích bố trí layout khoảng 18.5% trong khi vẫn giữ nguyên ưu thế fan-out thấp.

Thảo luận kết quả

Hiệu năng vượt trội của bộ nhân Vedic bắt nguồn từ cơ chế tính toán song song các tích từng phần theo thuật toán Urdhva-Tiryakbhyam. Trong khi phương pháp nhân truyền thống đòi hỏi 16 phép nhân và 15 phép cộng tuần tự cho từng cặp bit, cấu trúc Vedic chia nhỏ khối tính toán thành các ma trận 2x2 bit độc lập, sau đó gom nhóm đệ quy theo giải thuật Karatsuba-Ofman. Điều này giúp giảm đáng kể số tầng logic nối tiếp.

Khi so sánh với các công bố học thuật quốc tế gần đây, chẳng hạn như nghiên cứu của Shauvik Panda và Alpana Agarwal năm 2018 về bộ nhân Vedic tốc độ cao, cấu trúc kết hợp Modified Kogge-Stone và Regular SQRT BK CSA trong luận văn này thể hiện sự cân bằng tối ưu hơn giữa độ trễ và điện năng tiêu thụ. Việc sử dụng bộ cộng SQRT Brent-Kung cho khối 16 bit và 24 bit ở tầng cuối cùng đã cân bằng hoàn hảo thời gian lan truyền nhớ với thời gian sinh tổng.

Toàn bộ dữ liệu mô phỏng được trình bày trực quan thông qua các biểu đồ dạng sóng transient ngõ ra 32 bit và các bảng so sánh đa thông số. Các bảng số liệu đo đạc chi tiết giữa 6 phương án thiết kế bộ cộng đã làm nổi bật đường đặc tuyến đánh đổi (trade-off) giữa diện tích, công suất và độ trễ, cung cấp cơ sở định lượng vững chắc để khẳng định mô hình đề xuất là tối ưu nhất trên tiến trình TSMC 45nm.

Đề xuất và khuyến nghị

Nhằm phát huy tối đa giá trị thực tiễn của đề tài, các giải pháp và khuyến nghị hành động cụ thể được đề xuất như sau:

Thứ nhất, tích hợp ngay kiến trúc bộ nhân Vedic 16x16 bit sử dụng bộ cộng Modified Kogge-Stone vào các lõi xử lý tín hiệu số (DSP) và vi điều khiển nhúng trong giai đoạn 2020-2022, hướng tới mục tiêu tăng tốc độ tính toán khối MAC lên ít nhất 40% và giảm 25% công suất tiêu thụ trên các dòng vi xử lý tiết kiệm điện, do các kỹ sư trưởng thiết kế RTL tại các doanh nghiệp vi mạch chủ trì thực hiện.

Thứ hai, chuẩn hóa và đóng gói cấu trúc tế bào New XOR-XNOR cùng Full Adder 22T thành thư viện Standard Cell tùy biến (Custom Cell Library) trên các tiến trình công nghệ bán dẫn tiên tiến hơn như 28nm và FinFET 16nm trong vòng 12 tháng tới, nhằm cung cấp tài nguyên thiết kế tối ưu công suất cho các kỹ sư layout vi mạch.

Thứ ba, phát triển các đoạn mã kịch bản (Synthesis Scripts) tự động hóa việc chèn cấu trúc Regular SQRT BK CSA vào các công cụ EDA tiêu chuẩn trong quý 4 năm 2020, giúp rút ngắn thời gian thiết kế và tối ưu hóa thời gian đưa sản phẩm ra thị trường (Time-to-Market) khoảng 20% cho các dự án phát triển chip ASIC.

Thứ tư, mở rộng nghiên cứu ứng dụng bộ nhân Vedic cải tiến vào các bộ tăng tốc phần cứng trí tuệ nhân tạo (Edge AI Hardware Accelerators) phục vụ tính toán mạng nơ-ron tích chập (CNN) và xử lý hình ảnh thời gian thực, với mục tiêu đạt hiệu suất năng lượng trên 2.5 Tera-Operations Per Watt (TOPS/W) trước năm 2023, do các nhóm nghiên cứu vi điện tử tại các trường đại học và viện công nghệ phối hợp triển khai.

Đối tượng nên tham khảo luận văn

Nội dung và kết quả nghiên cứu của luận văn mang lại giá trị thiết thực cho bốn nhóm đối tượng chính:

Nhóm thứ nhất là các kỹ sư thiết kế vi mạch số (Digital IC Designers) và kỹ sư ASIC/FPGA. Luận văn cung cấp bản vẽ Schematic chi tiết, phân tích thông số trễ và công suất thực tế trên công nghệ 45nm, làm tài liệu tham khảo trực tiếp để nâng cấp khối ALU và đơn vị xử lý số học trong các chip SoC thương mại.

Nhóm thứ hai là các nhà nghiên cứu, học viên cao học và nghiên cứu sinh chuyên ngành Kỹ thuật Điện tử và Kỹ thuật Máy tính. Tài liệu này cung cấp nền tảng toán học sâu sắc về thuật toán Vedic, lý thuyết cây tiền tố song song Carry Tree và phương pháp luận thiết kế logic transistor mức thấp.

Nhóm thứ ba là các kỹ sư phát triển phần cứng cho thị trường Internet of Things (IoT) và Edge AI. Họ có thể khai thác cấu trúc bộ nhân Vedic công suất thấp và khối Full Adder 22T để xây dựng các mạch xử lý tín hiệu số biên đòi hỏi thời lượng pin kéo dài và khả năng tản nhiệt hạn chế.

Nhóm thứ tư là các giảng viên và chuyên gia đào tạo chuyên ngành VLSI. Luận văn là một case study mẫu mực về quy trình thiết kế mạch tích hợp từ mô hình hóa toán học, thiết kế logic trên ModelSim đến mô phỏng Schematic và đo đạc đặc tính điện động trên Cadence Virtuoso.

Câu hỏi thường gặp

Thuật toán nhân Vedic Urdhva-Tiryakbhyam có điểm gì khác biệt so với thuật toán nhân thông thường? Thuật toán nhân Vedic tính toán đồng thời tất cả các tích từng phần theo nguyên lý nhân dọc và nhân chéo, giúp loại bỏ hoàn toàn các bước cộng dồn tuần tự. Khi thực hiện phép nhân 16x16 bit, thuật toán chia nhỏ thành 4 khối 8x8 bit đệ quy, giúp giảm độ sâu tầng logic xuống dưới 4 mức và tăng tốc độ xử lý hơn 40% so với phương pháp nhân truyền thống.

Tại sao luận văn lại lựa chọn công nghệ CMOS TSMC 45nm và điện áp 1.0 V để tiến hành mô phỏng? Công nghệ 45nm là mốc công nghệ quan trọng, nơi các hiệu ứng phi tuyến và dòng rò bắt đầu ảnh hưởng nghiêm trọng đến hiệu năng vi mạch. Thiết lập điện áp danh định 1.0 V ở tần số 0.5 GHz cho phép đánh giá chính xác khả năng tiết kiệm công suất chuyển mạch và kiểm chứng tính khả thi thực tế của thiết kế trên các dòng chip thương mại hiện đại.

Bộ cộng Modified Kogge-Stone mang lại ưu thế gì so với bộ cộng Kogge-Stone nguyên bản? Bộ cộng Kogge-Stone nguyên bản có độ trễ cực nhỏ nhờ độ sâu logic $\log_2(n)$ nhưng lại có mật độ dây nối quá dày đặc gây tắc nghẽn và chiếm diện tích lớn. Cấu trúc Modified Kogge-Stone đã tinh giản các nút tạo nhớ không cần thiết, giúp giảm khoảng 20% diện tích silicon và hạ thấp công suất tiêu tán mà vẫn duy trì tốc độ truyền nhớ tối ưu.

Cổng logic New XOR-XNOR và Full Adder 22T giúp tối ưu công suất như thế nào? Mạch Full Adder CMOS chuẩn sử dụng 28 transistor với nhiều nút chuyển mạch nội bộ gây ra dòng ngắn mạch lớn. Thiết kế New XOR-XNOR cải tiến chỉ sử dụng 22 transistor, giúp giảm điện dung ký sinh ngõ ra và triệt tiêu đáng kể dòng ngắn mạch, từ đó cắt giảm khoảng 30% công suất tiêu thụ trung bình trong quá trình hoạt động liên tục.

Cấu trúc bộ nhân Vedic 16x16 bit này có khả năng mở rộng lên các kích thước 32-bit hoặc 64-bit không? Hoàn toàn có thể mở rộng dễ dàng nhờ tính chất mô-đun hóa cao của giải thuật Karatsuba-Ofman. Một bộ nhân 32x32 bit có thể được cấu thành từ 4 bộ nhân Vedic 16x16 bit kết hợp với các bộ cộng Regular SQRT BK CSA 32 bit và 48 bit, duy trì trễ truyền ở mức rất thấp và đáp ứng hoàn hảo cho các bộ xử lý đồ họa hoặc siêu máy tính 64-bit.

Kết luận

  • Luận văn đã thiết kế thành công bộ nhân Vedic 16x16 bit hoàn chỉnh trên quy trình công nghệ TSMC 45nm với độ chính xác logic 32 bit tuyệt đối tại tần số 0.5 GHz.
  • Đề tài khẳng định sự kết hợp giữa bộ cộng Modified Kogge-Stone và Regular SQRT BK CSA là giải pháp tối ưu giúp giảm độ trễ truyền tới hạn hơn 45% so với kiến trúc Ripple Carry Adder.
  • Thiết kế đột phá của cổng New XOR-XNOR và Full Adder 22T đã giúp tiết kiệm từ 25% đến 32% công suất tiêu tán trung bình so với cấu trúc CMOS truyền thống.
  • Cấu trúc đề xuất giải quyết trọn vẹn bài toán cân bằng giữa tốc độ xử lý, diện tích bố trí và mức tiêu thụ năng lượng trong các thiết bị vi điện tử cầm tay.
  • Lộ trình phát triển tiếp theo giai đoạn 2020-2025 cần tập trung vào việc hiện thực hóa layout vật lý trên công nghệ FinFET dưới 16nm và tích hợp vào các chip xử lý Edge AI thương mại.

Hãy liên hệ với các nhóm nghiên cứu vi mạch hoặc tham khảo toàn văn công trình để tiếp nhận chuyển giao giải pháp thiết kế bộ nhân Vedic tối ưu ngay hôm nay!