A NVIDIA Vera Rubin combina aceleração de IA, computação científica FP64 nativa e resfriamento líquido a 45°C para transformar racks densos de GPU em supercomputadores mais práticos para pesquisa e fábricas de IA.
A NVIDIA Vera Rubin está expandindo a definição de um supercomputador de IA. Em vez de separar a simulação convencional de alto desempenho do aprendizado de máquina, a plataforma foi projetada para executar solucionadores numéricos, modelos científicos de IA, análise de dados e fluxos de trabalho de pesquisa agente dentro de um único ambiente de computação acelerada.
A NVIDIA afirma que um sistema de computação científica Vera Rubin pode fornecer mais de sete exaflops de desempenho em IA, cinco petaflops de desempenho nativo em dupla precisão e largura de banda extrema de memória em configurações contendo até 144 GPUs. Essa combinação é direcionada a cargas de trabalho como modelagem climática, dinâmica dos fluidos computacional, química quântica, pesquisa de materiais e exploração de energia.
No entanto, a computação mais densa cria um desafio físico: o calor. Os sistemas Vera Rubin são projetados em torno do resfriamento líquido direto que pode operar com o fluido refrigerante fornecido a até 45°C. De forma contraintuitiva, permitir água de resfriamento mais quente pode melhorar a eficiência da instalação ao reduzir ou eliminar o resfriamento mecânico em climas adequados.
Vera Rubin une IA e supercomputação tradicional
Muitos fluxos de trabalho científicos combinam várias etapas de computação. Pesquisadores podem executar uma simulação de alta precisão, treinar um modelo substituto, comparar dados experimentais e usar IA para explorar um enorme espaço de parâmetros. Mover essas etapas entre sistemas desconectados introduz atrasos, movimentação de dados e complexidade operacional.
Vera Rubin combina GPUs Rubin, CPUs Vera, conexões de chip de alta velocidade, rede, unidades de processamento de dados e bibliotecas científicas CUDA-X. O suporte nativo a FP64 é importante porque muitas simulações requerem precisão numérica substancialmente maior do que a inferência de IA generativa convencional. Portanto, a plataforma destina-se a atender tanto cargas de trabalho convencionais de HPC quanto emergentes de IA para ciência.
Grandes instituições de pesquisa estão construindo em torno da Vera Rubin
As implantações anunciadas dão à Vera Rubin um papel além da narrativa comercial da fábrica de IA da NVIDIA. O Centro de Supercomputação Leibniz planeja usar a plataforma para o Blue Lion, um sistema programado para 2027 que apoiará astrofísica, ciência ambiental, ciências da vida, simulação e aprendizado de máquina.
O sistema Doudna do NERSC está sendo construído para dinâmica molecular, energia de fusão, ciência dos materiais, descoberta de medicamentos, astronomia e outras pesquisas do Departamento de Energia. O Laboratório Nacional de Los Alamos também selecionou tecnologias Vera Rubin para sistemas que abrangem segurança nacional, ciência aberta, modelos fundamentais e simulações complexas. Sistemas comerciais de vários fabricantes devem começar a chegar no final de 2026.
Por que resfriar servidores de IA com líquido a 45°C é importante
O resfriamento líquido direto ao chip captura o calor próximo às GPUs, CPUs e outros componentes de alta potência. O líquido transporta consideravelmente mais calor do que o ar, permitindo que racks suportem densidades de computação que seriam difíceis de resfriar usando ventiladores e ar condicionado convencional em nível de sala.
Uma temperatura mais alta permitida para o fluido refrigerante cria uma oportunidade maior para rejeitar calor usando ar ambiente ou equipamentos de instalação mais simples. Os operadores podem precisar de menos resfriamento mecânico, o que pode reduzir o consumo de eletricidade para resfriamento, consumo de água e complexidade da infraestrutura. As economias reais ainda dependerão do clima local, utilização do rack, design do circuito de água e da diferença de temperatura alcançada no sistema de resfriamento.
O design do sistema de IA agora se estende ao edifício
A geração Vera Rubin demonstra que o servidor não pode mais ser avaliado separadamente da instalação. Bandejas de computação, placas frias, unidades de distribuição de fluido refrigerante, fornecimento de energia, rede, mecânica de rack e sistemas de rejeição de calor devem ser projetados juntos se os operadores quiserem utilização consistentemente alta.
Isso muda a compra de infraestrutura de IA. As organizações devem avaliar a capacidade elétrica disponível, temperaturas do circuito de resfriamento, redundância, detecção de vazamentos, procedimentos de manutenção e oportunidades de reutilização de calor junto com as especificações da GPU. Um acelerador mais rápido oferece valor limitado quando as restrições da instalação impedem seu funcionamento em densidade total.
O que Vera Rubin significa para usuários de IA e compradores de infraestrutura
Para pesquisadores, Vera Rubin pode encurtar fluxos de trabalho que combinam simulação, dados científicos e análise assistida por IA. Para desenvolvedores de modelos e provedores de nuvem, a mesma engenharia de pilha completa pode aumentar a quantidade de computação útil produzida dentro de um envelope fixo de energia e resfriamento.
Os compradores devem tratar as cifras de desempenho e eficiência da NVIDIA como metas de design de sistema que requerem validação contra suas próprias cargas de trabalho e instalações. Escalabilidade de aplicação, prontidão de software, custo de aquisição, atualizações elétricas, conversão de resfriamento e maturidade operacional determinarão se as vantagens teóricas da Vera Rubin se tornam resultados mensuráveis de pesquisa ou negócios.