Infinity는 Nvidia의 가장 견고한 강점 중 하나인 CUDA의 개발자 집중도를 겨냥하고 있습니다. 단순히 실리콘을 쫓는 대신, 추론에 필요한 저수준 커널을 작성하고 튜닝하는 소프트웨어 레이어를 구축하여 GPU, 특수 가속기, 엣지 NPU 전반에서 모델이 효율적으로 실행되도록 합니다. 새로운 자금 조달 라운드와 초기 칩 파트너와 함께, 이 회사는 수개월에 걸친 수작업 최적화를 몇 시간 또는 며칠로 압축하는 휴대성 엔진으로 스택을 포지셔닝하고 있습니다. 약속은 이론적 우아함이 아니라 이종 하드웨어를 실용적인 용량으로 전환하는 것으로, 맞춤형 커널 엔지니어링이 불가능한 팀을 위해 비용, 지연 시간, 공급업체 종속성을 줄이는 것입니다.
기술적으로, Infinity의 접근법은 대상 연산자와 모델 그래프에 대해 커널 변형을 생성, 테스트, 반복적으로 개선하는 에이전트 루프에 중점을 둡니다. 처리량(초당 토큰 수), p99 지연 시간, 메모리 사용량을 측정한 후 각 칩의 스케줄링, 메모리 계층, 명령어 집합을 활용하도록 코드 경로를 자동으로 재작성합니다. 최종 제품은 범용 추론 라이브러리와 유사하며, 아키텍처 전반에 일반화되는 휴대 가능한 연산자, 커널 템플릿, 학습된 휴리스틱의 레지스트리입니다. 특히, 시스템은 새로운 모델, 양자화 방식, 가속기가 등장할 때 스스로 최적화하여 초기 성과 이후에도 성능 향상이 누적되도록 목표합니다.
구매자에게는 지렛대 효과가 있습니다. 현재 대부분의 추론 스택은 PyTorch와 TensorFlow 파이프라인이 CUDA 중심이고 포팅 비용이 높아 Nvidia를 기본으로 합니다. 신뢰할 만한 크로스 칩 레이어는 계산 방식을 바꿉니다: 칩 공급업체는 고객이 코드를 다시 작성하지 않고도 실리콘을 노출할 수 있고, 클라우드 제공업체는 가격/성능 균형을 맞추기 위해 함대를 혼합할 수 있으며, 기업은 용량 부족 시 대안을 시험할 수 있습니다. 초기에는 연산자 세트가 좁고 예측 가능한 곳에서 성과가 기대되며—안정적인 모델 군, 양자화 프로필, 배치 형태를 가진 생산용 LLM 서비스—CUDA의 방대한 라이브러리와 일반 목적 동등성은 이후에 가능합니다.
실행 위험은 여전히 존재합니다. 휴대성은 정확도를 유지하고 생산 트래픽에서 반복 가능한 이득을 제공할 때만 가치가 있습니다. 팀은 Infinity를 작업 부하 수준 KPI에 명확한 SLA가 연결된 최적화 파트너로 취급해야 합니다: p99 지연 시간에서 목표 토큰/초 및 특정 하드웨어에서 백만 토큰당 비용. 견고한 파일럿에는 연산자 범위 감사, 골든 세트 정확성 검사, A/B 카나리아, 롤백 경로가 포함되어야 합니다. 모델 수준의 향상이 실질적이라면, 성능 개선에 연동된 수익 공유 가격 책정이 고정 라이선스보다 매력적일 수 있습니다. 그렇지 않으면 CUDA가 기본입니다. 성공은 엄격한 벤치마킹, 투명한 원격 측정, 빠른 연산자 로드맵 종료에 의해 결정됩니다.


