NVIDIA 베라 루빈은 AI 가속, 네이티브 FP64 과학 컴퓨팅 및 45°C 액체 냉각을 결합하여 조밀한 GPU 랙을 연구 및 AI 공장에 더 실용적인 슈퍼컴퓨터로 전환합니다.
NVIDIA 베라 루빈은 AI 슈퍼컴퓨터의 정의를 확장하고 있습니다. 기존의 고성능 시뮬레이션과 머신러닝을 분리하는 대신, 이 플랫폼은 수치 해석기, 과학 AI 모델, 데이터 분석 및 에이전트 연구 워크플로우를 하나의 가속 컴퓨팅 환경 내에서 실행하도록 설계되었습니다.
NVIDIA에 따르면 베라 루빈 과학 컴퓨팅 시스템은 최대 144개의 GPU 구성을 통해 7엑사플롭스 이상의 AI 성능, 5페타플롭스의 네이티브 배정밀도 성능 및 극한의 메모리 대역폭을 제공할 수 있습니다. 이 조합은 기후 모델링, 전산 유체 역학, 양자 화학, 재료 연구 및 에너지 탐사와 같은 작업 부하를 목표로 합니다.
그러나 더 조밀한 컴퓨팅은 물리적 문제인 열을 발생시킵니다. 베라 루빈 시스템은 최대 45°C의 냉각수를 공급받아 작동할 수 있는 직접 액체 냉각을 중심으로 설계되었습니다. 직관과 달리, 더 따뜻한 냉각수를 허용하면 적합한 기후에서 기계식 냉각을 줄이거나 제거하여 시설 효율성을 향상시킬 수 있습니다.
베라 루빈은 AI와 전통 슈퍼컴퓨팅을 결합하다
많은 과학적 워크플로우는 여러 컴퓨팅 단계를 결합합니다. 연구자들은 고정밀 시뮬레이션을 실행하고, 대리 모델을 훈련하며, 실험 데이터를 비교하고, AI를 사용해 방대한 매개변수 공간을 탐색할 수 있습니다. 이러한 단계를 분리된 시스템 간에 이동시키면 지연, 데이터 이동 및 운영 복잡성이 발생합니다.
베라 루빈은 루빈 GPU, 베라 CPU, 고속 칩 연결, 네트워킹, 데이터 처리 장치 및 CUDA-X 과학 라이브러리를 결합합니다. 네이티브 FP64 지원은 많은 시뮬레이션이 주류 생성 AI 추론보다 훨씬 높은 수치 정밀도를 요구하기 때문에 중요합니다. 따라서 이 플랫폼은 기존 HPC와 신흥 AI-과학 작업 부하 모두를 지원하도록 설계되었습니다.
주요 연구 기관들이 베라 루빈을 중심으로 구축 중
발표된 배포는 베라 루빈이 NVIDIA의 상업적 AI 공장 내러티브를 넘어서는 역할을 한다는 것을 보여줍니다. 라이프니츠 슈퍼컴퓨팅 센터는 2027년에 예정된 블루 라이온 시스템에 이 플랫폼을 사용할 계획이며, 천체물리학, 환경 과학, 생명 과학, 시뮬레이션 및 머신러닝을 지원할 예정입니다.
NERSC의 두드나 시스템은 분자 역학, 핵융합 에너지, 재료 과학, 신약 개발, 천문학 및 기타 에너지부 연구를 위해 구축되고 있습니다. 로스앨러모스 국립연구소도 국가 안보, 개방 과학, 기초 모델 및 복잡한 시뮬레이션을 아우르는 시스템에 베라 루빈 기술을 선택했습니다. 여러 제조업체의 상업용 시스템은 2026년 말부터 도입될 것으로 예상됩니다.
AI 시스템 설계가 이제 건물까지 확장되다
베라 루빈 세대는 서버를 시설과 별도로 평가할 수 없음을 보여줍니다. 컴퓨트 트레이, 콜드 플레이트, 냉각수 분배 장치, 전력 공급, 네트워킹, 랙 기계 및 열 방출 시스템은 운영자가 일관된 높은 활용도를 원한다면 함께 설계되어야 합니다.
이는 AI 인프라 구매 방식을 변화시킵니다. 조직은 GPU 사양과 함께 사용 가능한 전기 용량, 냉각 루프 온도, 중복성, 누수 감지, 유지보수 절차 및 열 재사용 기회를 평가해야 합니다. 시설 제약으로 인해 가속기가 최대 밀도로 작동하지 못하면 더 빠른 가속기는 제한된 가치를 제공합니다.