InfinityはNvidiaの最も強固な優位性の一つであるCUDAの開発者の引力に挑戦しています。生のシリコンを追いかけるのではなく、推論に必要な低レベルカーネルを自動生成・チューニングするソフトウェアレイヤーを構築し、GPU、専門アクセラレータ、エッジNPU上で効率的にモデルを動作させることを可能にしています。新たな資金調達と初期のチップパートナーを得て、同社は数ヶ月に及ぶ手作業の最適化を数時間または数日に圧縮する移植性エンジンとしてスタックを位置づけています。その約束は理論的な優雅さではなく、異種ハードウェアを実用的な容量に変え、カスタムカーネルエンジニアリングを行えないチームのコスト、レイテンシ、ベンダーロックインを削減することです。
技術的には、Infinityのアプローチは、ターゲットオペレーターとモデルグラフに対するカーネルバリアントを生成、テスト、反復的に改善するエージェントループに中心を置いています。スループット(秒あたりトークン数)、p99レイテンシ、メモリフットプリントを測定し、各チップのスケジューリング、メモリ階層、命令セットを活用するためにコードパスを自動的に書き換えます。最終製品はユニバーサル推論ライブラリに似ており、ポータブルなオペレーター、カーネルテンプレート、アーキテクチャを超えて一般化する学習済みヒューリスティックのレジストリです。重要なのは、システムが自己最適化を目指しており、新しいモデル、量子化スキーム、アクセラレータが登場するにつれて適応し、初期の成果後に停滞するのではなく性能向上が累積することです。
購入者にとっての意味はレバレッジです。現在、多くの推論スタックはPyTorchやTensorFlowのパイプラインがCUDA中心であり、移植コストが高いためNvidiaに依存しています。信頼できるクロスチップレイヤーはこの計算を変えます。チップベンダーは顧客にコードを書き換えさせることなくシリコンを公開でき、クラウドプロバイダーは価格と性能のバランスを取るためにフリートを組み合わせられ、企業は容量不足時に代替案を試せます。初期の成果はオペレーターセットが狭く予測可能な領域、つまり安定したモデルファミリー、量子化プロファイル、バッチ形状を持つLLMの本番サービスで期待され、CUDAの膨大なライブラリと同等になるのは将来的です。
実行リスクは依然として現実的です。移植性は精度を維持し、本番トラフィックで再現可能な成果を出す場合にのみ価値があります。チームはInfinityをワークロードレベルのKPIに結びついた明確なSLAを持つ最適化パートナーとして扱うべきです。具体的にはp99レイテンシでのトークン数/秒と特定ハードウェアでの100万トークンあたりコストを目標とします。堅牢なパイロットにはオペレーターカバレッジ監査、ゴールデンセットの正確性チェック、A/Bカナリア、ロールバック経路が含まれます。モデルレベルでの向上が顕著なら、性能改善に連動した収益分配型価格は固定ライセンスより魅力的です。そうでなければCUDAがデフォルトのままです。成功は厳格なベンチマーク、透明なテレメトリ、迅速なオペレーターのロードマップ完結によって決まります。


