NVIDIA Vera Rubin kết hợp tăng tốc AI, tính toán khoa học FP64 gốc và làm mát bằng chất lỏng 45°C để biến các giá GPU dày đặc thành các máy tính siêu phân tử thực tế hơn cho nghiên cứu và nhà máy AI.
NVIDIA Vera Rubin đang mở rộng định nghĩa về một máy tính siêu phân tử AI. Thay vì tách biệt mô phỏng hiệu suất cao truyền thống với học máy, nền tảng này được thiết kế để chạy các bộ giải số, mô hình AI khoa học, phân tích dữ liệu và quy trình nghiên cứu tác nhân trong một môi trường tính toán tăng tốc duy nhất.
NVIDIA cho biết hệ thống tính toán khoa học Vera Rubin có thể cung cấp hơn bảy exaflops hiệu suất AI, năm petaflops hiệu suất double-precision gốc và băng thông bộ nhớ cực cao trên các cấu hình chứa tới 144 GPU. Sự kết hợp này nhắm tới các khối lượng công việc như mô hình khí hậu, động lực học chất lỏng tính toán, hóa học lượng tử, nghiên cứu vật liệu và thăm dò năng lượng.
Tuy nhiên, tính toán dày đặc tạo ra một thách thức vật lý: nhiệt. Hệ thống Vera Rubin được thiết kế xoay quanh làm mát bằng chất lỏng trực tiếp có thể hoạt động với chất làm mát được cung cấp ở nhiệt độ lên tới 45°C. Ngược lại với trực giác, cho phép nước làm mát ấm hơn có thể cải thiện hiệu quả cơ sở bằng cách giảm hoặc loại bỏ làm lạnh cơ học trong các khí hậu phù hợp.
Vera Rubin kết hợp AI và siêu máy tính truyền thống
Nhiều quy trình khoa học kết hợp nhiều giai đoạn tính toán. Các nhà nghiên cứu có thể chạy mô phỏng độ chính xác cao, đào tạo mô hình thay thế, so sánh dữ liệu thực nghiệm và sử dụng AI để tìm kiếm trong không gian tham số khổng lồ. Việc di chuyển các giai đoạn đó giữa các hệ thống riêng biệt gây ra trì hoãn, di chuyển dữ liệu và phức tạp vận hành.
Vera Rubin kết hợp GPU Rubin, CPU Vera, kết nối chip tốc độ cao, mạng, đơn vị xử lý dữ liệu và thư viện khoa học CUDA-X. Hỗ trợ FP64 gốc rất quan trọng vì nhiều mô phỏng đòi hỏi độ chính xác số cao hơn nhiều so với suy luận AI sinh tổng hợp phổ biến. Do đó, nền tảng này nhằm phục vụ cả HPC truyền thống và các khối lượng công việc AI cho khoa học mới nổi.
Các tổ chức nghiên cứu lớn đang xây dựng quanh Vera Rubin
Các triển khai đã công bố mang lại cho Vera Rubin vai trò vượt ra ngoài câu chuyện nhà máy AI thương mại của NVIDIA. Trung tâm Siêu máy tính Leibniz dự định sử dụng nền tảng cho Blue Lion, một hệ thống dự kiến vào năm 2027 sẽ hỗ trợ thiên văn học, khoa học môi trường, khoa học đời sống, mô phỏng và học máy.
Hệ thống Doudna của NERSC được xây dựng cho động lực học phân tử, năng lượng hợp nhất, khoa học vật liệu, phát hiện thuốc, thiên văn học và các nghiên cứu khác của Bộ Năng lượng. Phòng thí nghiệm Quốc gia Los Alamos cũng đã chọn công nghệ Vera Rubin cho các hệ thống trải dài an ninh quốc gia, khoa học mở, mô hình nền tảng và mô phỏng phức tạp. Các hệ thống thương mại từ nhiều nhà sản xuất dự kiến sẽ bắt đầu đến vào cuối năm 2026.
Tại sao làm mát máy chủ AI bằng chất lỏng 45°C lại quan trọng
Làm mát bằng chất lỏng trực tiếp vào chip thu nhiệt gần các GPU, CPU và các thành phần công suất cao khác. Chất lỏng mang nhiều nhiệt hơn không khí đáng kể, cho phép các giá hỗ trợ mật độ tính toán mà sẽ khó làm mát bằng quạt và điều hòa không khí phòng thông thường.
Nhiệt độ chất làm mát cho phép cao hơn tạo cơ hội lớn hơn để tỏa nhiệt bằng không khí môi trường hoặc thiết bị cơ sở đơn giản hơn. Người vận hành có thể cần ít làm lạnh cơ học hơn, điều này có thể giảm điện năng làm mát, tiêu thụ nước và độ phức tạp hạ tầng. Tiết kiệm thực tế vẫn phụ thuộc vào khí hậu địa phương, mức sử dụng giá, thiết kế vòng nước và chênh lệch nhiệt độ đạt được qua hệ thống làm mát.
Thiết kế hệ thống AI giờ đây mở rộng vào tòa nhà
Thế hệ Vera Rubin chứng minh rằng máy chủ không thể được đánh giá riêng biệt với cơ sở. Khay tính toán, tấm lạnh, đơn vị phân phối chất làm mát, cung cấp điện, mạng, cơ khí giá và hệ thống tỏa nhiệt phải được thiết kế cùng nhau nếu người vận hành muốn duy trì mức sử dụng cao liên tục.
Điều này thay đổi việc mua sắm hạ tầng AI. Các tổ chức phải đánh giá công suất điện khả dụng, nhiệt độ vòng làm mát, dự phòng, phát hiện rò rỉ, quy trình bảo trì và cơ hội tái sử dụng nhiệt cùng với thông số kỹ thuật GPU. Bộ tăng tốc nhanh hơn mang lại giá trị hạn chế khi các giới hạn cơ sở ngăn nó hoạt động ở mật độ đầy đủ.
Ý nghĩa của Vera Rubin đối với người dùng AI và người mua hạ tầng
Đối với các nhà nghiên cứu, Vera Rubin có thể rút ngắn quy trình kết hợp mô phỏng, dữ liệu khoa học và phân tích hỗ trợ AI. Đối với nhà phát triển mô hình và nhà cung cấp đám mây, kỹ thuật toàn stack tương tự có thể tăng lượng tính toán hữu ích được tạo ra trong giới hạn điện năng và làm mát cố định.
Người mua nên xem các con số hiệu suất và hiệu quả của NVIDIA như các mục tiêu thiết kế hệ thống cần được xác thực với khối lượng công việc và cơ sở của riêng họ. Việc mở rộng ứng dụng, sẵn sàng phần mềm, chi phí mua sắm, nâng cấp điện, chuyển đổi làm mát và độ trưởng thành vận hành sẽ quyết định liệu các lợi thế lý thuyết của Vera Rubin có trở thành kết quả nghiên cứu hoặc kinh doanh đo lường được hay không.