28/07/2026
NVIDIA chia sẻ chi tiết kiến trúc GPU Rubin và sơ đồ thiết kế trên die
NVIDIA vừa công bố phân tích chuyên sâu về kiến trúc GPU Rubin, một trong những bước tiến lớn nhất của hãng trong việc mở rộng năng lực tính toán trên quy mô nhiều rack, nhiều hệ thống và nhiều trung tâm dữ liệu.
Rubin được thiết kế để đạt hiệu năng tính toán 50 PetaFLOPS trong các tác vụ sparse NVFP4. Ở cấu hình đầy đủ, GPU này sở hữu:
- 224 Streaming Multiprocessors (SMs).
- 288 GB bộ nhớ HBM4.
- 336 tỷ transistor.
- 896 Tensor Cores tích hợp Transformer Engine thế hệ thứ ba.
Để đạt được hiệu năng tính toán lớn, NVIDIA tổ chức các tài nguyên GPU thành các Graphics Processor Clusters (GPCs), sử dụng bộ nhớ đệm L2 Cache tập trung.
Hoạt động cùng các GPC là GigaThread Engine, chịu trách nhiệm điều phối khối lượng công việc và tối ưu việc sử dụng tài nguyên GPU. Rubin cũng tích hợp các phân vùng MIG Control, cho phép chia một GPU thành nhiều GPU ảo, tương tự cách CPU hiện đại hỗ trợ nhiều lõi xử lý ảo.
HBM4 mang lại băng thông bộ nhớ lên tới 22 TB/s
Ở khía cạnh bộ nhớ, NVIDIA hợp tác với các đối tác để trang bị 288 GB HBM4 thông qua các stack bộ nhớ 12-High.
Các bộ điều khiển HBM chuyên dụng cùng lớp vật lý (PHY) giúp Rubin đạt băng thông bộ nhớ tối đa 22 TB/s, thuộc nhóm cao nhất hiện nay.
Ngoài ra:
- Tensor Memory Accelerator được nâng cấp nhằm tối ưu hiệu quả di chuyển dữ liệu.
- NVLink 6 đảm nhiệm việc mở rộng và kết nối giữa các GPU.
- Băng thông giao tiếp GPU-to-GPU đạt 3.600 GB/s.
- NVLink-C2C cung cấp kết nối CPU-GPU với băng thông 1.800 GB/s.
- GPU còn tích hợp PCIe Gen 6 Switch, hỗ trợ giao tiếp với các thiết bị bên ngoài ở mức 256 GB/s.

Rubin cải thiện khả năng giao tiếp giữa các GPU
Một trong những lợi thế lớn nhất của Rubin là khả năng scale-up communication, giúp các GPU giao tiếp hiệu quả với nhau trong cùng một hệ thống rack.
Trước đây, việc truyền dữ liệu giữa các GPU đòi hỏi quá trình đồng bộ và phối hợp, có thể tạo ra độ trễ khi hệ thống phải chờ dữ liệu được truyền hoàn tất.
Với Rubin, NVIDIA áp dụng cơ chế device-initiated communication, cho phép từng GPU chủ động quản lý việc truyền dữ liệu của mình. Cách tiếp cận này loại bỏ nhu cầu điều phối từ bên ngoài, giảm độ trễ và nâng cao hiệu quả giao tiếp giữa các GPU.
Vera Rubin NVL72 giảm tiêu thụ điện năng
Các hệ thống AI quy mô lớn tiêu thụ lượng điện rất lớn, trong đó một rack NVL72 chứa tới 72 GPU.
Đối với Vera Rubin NVL72, NVIDIA đã phát triển công nghệ Intelligent Power Smoothing nhằm đưa toàn bộ hệ thống hoạt động trong một giới hạn công suất cố định.
Trong các tác vụ AI, mức tiêu thụ điện thường thay đổi rất nhanh khi GPU chuyển từ trạng thái chờ CPU sang hoạt động ở công suất tối đa.
Nhờ Intelligent Power Smoothing:
Mức tiêu thụ điện trung bình giảm khoảng 10% so với Grace Blackwell NVL72.
Công suất đỉnh trong khoảng thời gian 50 ms giảm khoảng 20%.
Bên cạnh đó, NVIDIA còn tích hợp DSX MaxLPS để tối ưu ngân sách điện năng, góp phần nâng cao hiệu quả vận hành của toàn bộ hệ thống AI ở quy mô rack.

