Infinity 正在瞄準 Nvidia 最持久的優勢之一:CUDA 的開發者吸引力。它不是追逐原始矽晶片,而是構建一個軟體層,能撰寫並調優推論所需的低階核心,使模型能高效運行於 GPU、專用加速器及邊緣 NPU。憑藉新一輪融資和早期晶片合作夥伴,該公司將其堆疊定位為一個可攜性引擎,將數月的手動優化壓縮為數小時或數天。這個承諾不是理論上的優雅,而是將異構硬體轉化為實用容量——降低成本、延遲和供應商鎖定,適合無法負擔定制核心工程的團隊。
技術上,Infinity 的方法核心是一個代理循環,生成、測試並迭代改進目標運算子和模型圖的核心變體。它衡量吞吐量(每秒標記數)、p99 延遲和記憶體佔用,然後自動重寫程式碼路徑以利用每個晶片的排程、記憶體階層和指令集。最終產品類似一個通用推論庫:一個可攜運算子、核心範本和學習啟發式的註冊表,能跨架構泛化。關鍵是系統追求自我優化——隨著新模型、量化方案和加速器出現自動調整,使性能提升隨時間累積,而非初期勝利後停滯。
對買家而言,意義在於槓桿。當前大多數推論堆疊默認使用 Nvidia,因為 PyTorch 和 TensorFlow 管線以 CUDA 為中心,且移植成本高昂。一個可信的跨晶片層改變了計算方式:晶片供應商能展示其矽晶片而不強迫客戶重寫程式碼,雲端供應商能混合搭配車隊以平衡價格與性能,企業能在容量緊縮時壓力測試替代方案。預期早期會在運算子集較窄且可預測的場景取得進展——如穩定模型家族、量化設定和批次形狀的生產級大型語言模型服務——然後才有可能達到與 CUDA 廣泛庫的通用等效。
執行風險依然存在。可攜性只有在保證準確性並在生產流量上提供可重複增益時才有價值。團隊應將 Infinity 視為一個優化夥伴,並設定明確的服務水平協議(SLA),與工作負載層級的關鍵績效指標(KPI)掛鉤:目標是 p99 延遲下的每秒標記數和特定硬體上的每百萬標記成本。穩健的試點包括運算子覆蓋審核、黃金集正確性檢查、A/B 金絲雀測試及回滾路徑。如果模型層級提升顯著,與性能改進掛鉤的收益分成定價可能比固定授權更具吸引力。否則,CUDA 仍是預設選擇。成功將取決於嚴謹的基準測試、透明的遙測和快速的運算子路線圖完成。


