Infinity đang nhắm vào một trong những lợi thế bền vững nhất của Nvidia: sức hút dành cho nhà phát triển của CUDA. Thay vì theo đuổi phần cứng thô, họ xây dựng một lớp phần mềm tự động viết và điều chỉnh các kernel cấp thấp cần thiết cho suy luận, cho phép các mô hình chạy hiệu quả trên GPU, bộ tăng tốc chuyên dụng và NPU biên. Với một vòng gọi vốn mới và các đối tác chip ban đầu, công ty định vị ngăn xếp của mình như một động cơ di động hóa, nén hàng tháng tối ưu thủ công thành vài giờ hoặc vài ngày. Lời hứa không phải là sự thanh lịch lý thuyết; mà là biến phần cứng dị thể thành năng lực thực tiễn—giảm chi phí, độ trễ và sự phụ thuộc vào nhà cung cấp cho các nhóm không đủ khả năng kỹ thuật kernel tùy chỉnh.
Về mặt kỹ thuật, phương pháp của Infinity tập trung vào một vòng lặp tác nhân tự động tạo, kiểm tra và cải tiến lặp đi lặp lại các biến thể kernel cho các toán tử mục tiêu và đồ thị mô hình. Nó đo thông lượng (token mỗi giây), độ trễ p99 và bộ nhớ sử dụng, sau đó tự động viết lại các đường dẫn mã để tận dụng lịch trình, hệ thống bộ nhớ và tập lệnh của từng chip. Sản phẩm cuối cùng giống như một thư viện suy luận phổ quát: một đăng ký các toán tử di động, mẫu kernel và các quy tắc học được tổng quát hóa trên các kiến trúc. Quan trọng là hệ thống hướng tới tự tối ưu hóa—thích ứng khi có mô hình mới, các phương pháp lượng tử hóa và bộ tăng tốc xuất hiện—để hiệu suất tăng dần theo thời gian thay vì dừng lại sau những thành công ban đầu.
Đối với người mua, điều này có nghĩa là đòn bẩy. Hiện nay, hầu hết các ngăn xếp suy luận mặc định chọn Nvidia vì các pipeline PyTorch và TensorFlow tập trung vào CUDA và chi phí chuyển đổi cao. Một lớp chéo chip đáng tin cậy thay đổi phép tính: các nhà cung cấp chip có thể phơi bày silicon của họ mà không buộc khách hàng phải viết lại mã, các nhà cung cấp đám mây có thể phối hợp đội tàu để cân bằng giá/hiệu suất, và các doanh nghiệp có thể thử nghiệm các lựa chọn thay thế trong những lúc thiếu hụt năng lực. Dự kiến sẽ có sự thu hút ban đầu ở những nơi bộ toán tử hẹp và dự đoán được—phục vụ LLM sản xuất với các họ mô hình ổn định, hồ sơ lượng tử hóa và hình dạng lô—trước khi đạt được sự tương đương chung với thư viện rộng lớn của CUDA.
Rủi ro thực thi vẫn còn hiện hữu. Tính di động chỉ có giá trị khi nó bảo toàn độ chính xác và mang lại lợi ích lặp lại trên lưu lượng sản xuất. Các nhóm nên xem Infinity như một đối tác tối ưu hóa với các SLA rõ ràng gắn liền với KPI cấp công việc: mục tiêu token/giây tại độ trễ p99 và chi phí trên mỗi triệu token trên phần cứng cụ thể. Một thử nghiệm mạnh mẽ bao gồm kiểm toán phạm vi toán tử, kiểm tra độ chính xác bộ dữ liệu vàng, thử nghiệm A/B và các đường dẫn hoàn tác. Nếu sự cải thiện cấp mô hình là đáng kể, giá chia sẻ doanh thu liên kết với cải tiến hiệu suất có thể hấp dẫn so với giấy phép cố định. Nếu không, CUDA vẫn là mặc định. Thành công ở đây sẽ được quyết định bởi việc đánh giá chuẩn mực có kỷ luật, hệ thống giám sát minh bạch và đóng cửa nhanh lộ trình toán tử.


