Các cuộc đàm phán được báo cáo giữa Anthropic và Samsung về một con chip AI tùy chỉnh 2nm tiềm năng cho thấy cách các phòng thí nghiệm mô hình tiên phong đang cố gắng kiểm soát chi phí tính toán, nguồn cung và chiến lược suy luận.
Theo báo cáo, Anthropic đang khám phá các cuộc đàm phán ban đầu với Samsung về một con chip AI tùy chỉnh tiềm năng, đặt nhà phát triển Claude vào cùng cuộc trò chuyện chiến lược với OpenAI, Google, Amazon, Microsoft và Meta: các công ty mô hình nên kiểm soát bao nhiêu phần của ngăn xếp phần cứng AI?
Các cuộc đàm phán vẫn còn sơ bộ, và Anthropic chưa cam kết với con chip, thiết kế, kiến trúc máy chủ hay đối tác sản xuất nào. Nhưng việc quy trình 2nm và đóng gói tiên tiến của Samsung được cho là một phần của cuộc thảo luận đã đủ cho thấy ngành công nghiệp đang hướng tới đâu.
Các phòng thí nghiệm AI đang chịu áp lực từ hai phía. Họ cần lượng tính toán khổng lồ để đào tạo và phục vụ các mô hình tiên phong, đồng thời cần giảm chi phí suy luận cho các tác vụ lập trình, trợ lý doanh nghiệp, quy trình làm việc dài hạn và sử dụng chatbot với khối lượng lớn. Silicon tùy chỉnh là một con đường hướng tới kinh tế tốt hơn, linh hoạt nguồn cung hơn và tối ưu sâu hơn quanh kiến trúc mô hình riêng của phòng thí nghiệm.
Tại sao Anthropic quan tâm đến chip tùy chỉnh
Các mô hình Claude của Anthropic ngày càng được sử dụng cho lập trình, công việc doanh nghiệp, phân tích ngữ cảnh dài, quy trình làm việc có tác nhân và sử dụng API với khối lượng lớn. Những khối lượng công việc đó rất tốn kém khi phục vụ ở quy mô lớn. Ngay cả những cải tiến nhỏ về hiệu quả suy luận cũng có thể quan trọng khi hàng triệu người dùng và nhà phát triển gọi mô hình liên tục.
Một con chip tùy chỉnh cuối cùng có thể cho phép Anthropic điều chỉnh phần cứng theo các mẫu mô hình riêng, nhu cầu bộ nhớ, mục tiêu độ trễ và ngăn xếp triển khai của mình. Mục tiêu không nhất thiết là thay thế Nvidia ngay lập tức, mà là tạo đòn bẩy: giảm chi phí trên mỗi token, nguồn cung dự đoán hơn và giảm phụ thuộc vào một hệ sinh thái GPU bên ngoài.
Samsung mang đến cho Anthropic một con đường phần cứng khác biệt
Samsung có chiến lược thú vị vì kết hợp chuyên môn về bộ nhớ, đóng gói tiên tiến và sản xuất đúc chip. Chip AI không chỉ là về die tính toán. Chúng phụ thuộc nhiều vào băng thông bộ nhớ, đóng gói, kết nối, hiệu quả năng lượng và khả năng lắp ráp hệ thống hoàn chỉnh ở quy mô lớn.
Cuộc thảo luận 2nm được báo cáo quan trọng vì các node quy trình tiên tiến có thể cải thiện hiệu suất và hiệu quả năng lượng, nhưng sản xuất ở ranh giới công nghệ là khó khăn. Đối với Samsung, một chiến thắng lớn từ phòng thí nghiệm AI sẽ là tín hiệu mạnh mẽ rằng mảng đúc chip của họ có thể cạnh tranh cho các khối lượng công việc AI giá trị cao so với các lựa chọn sản xuất thống trị ngành.
Đây là về kinh tế suy luận cũng quan trọng như đào tạo
Đào tạo thu hút sự chú ý vì cần các cụm máy lớn, nhưng suy luận có thể là nút thắt mô hình kinh doanh. Mỗi phản hồi chat, bước tác nhân lập trình, tác vụ phân tích tài liệu, cuộc gọi công cụ và quy trình doanh nghiệp đều tiêu thụ tính toán. Khi sử dụng AI mở rộng, phục vụ mô hình với chi phí thấp trở nên quan trọng không kém việc xây dựng chúng.
Đó là lý do chip tùy chỉnh ngày càng hấp dẫn. Một con chip tối ưu cho các mẫu cụ thể của một gia đình mô hình có thể làm cho việc sử dụng với khối lượng lớn bền vững hơn. Nó cũng có thể hỗ trợ các chiến lược định tuyến mô hình, nơi các chip khác nhau phục vụ các khối lượng công việc dựa trên chi phí, độ trễ và độ phức tạp.
Khoảng cách giữa đàm phán và sản xuất là rất lớn
Chip AI tùy chỉnh rất khó, tốn kém và chậm. Một cuộc trò chuyện được báo cáo với Samsung không có nghĩa là Anthropic sẽ ra mắt phần cứng sớm. Công ty vẫn cần xác định mục đích chip, xác thực kiến trúc, đảm bảo đóng gói và bộ nhớ, xây dựng hệ thống máy chủ, tích hợp phần mềm, kiểm tra độ tin cậy và chứng minh kinh tế vượt trội so với các lựa chọn hiện có.
Cũng có rủi ro chiến lược. Nếu chip tùy chỉnh quá hẹp, nó có thể lỗi thời khi kiến trúc mô hình thay đổi. Nếu quá tổng quát, nó có thể không mang lại đủ lợi thế so với GPU. Kết quả tốt nhất là một lộ trình phần cứng bổ sung cho Nvidia, Amazon Trainium, Google TPU và các bộ tăng tốc khác thay vì ép Anthropic vào một con đường đơn lẻ dễ gãy.
Điều này có ý nghĩa gì với người dùng công cụ AI
Đối với người dùng, chip tùy chỉnh có thể nghe xa vời, nhưng chúng có thể định hình trải nghiệm sản phẩm trực tiếp. Kinh tế phần cứng tốt hơn có thể mang lại phản hồi nhanh hơn, giá API rẻ hơn, giới hạn tần suất cao hơn, quy trình làm việc dài hạn tốt hơn, tác nhân lập trình giá cả phải chăng hơn và các tùy chọn triển khai doanh nghiệp mạnh mẽ hơn.
Người dùng NexusAI nên theo dõi xem các phòng thí nghiệm AI có thể biến chiến lược chip thành lợi thế thực tiễn hay không. Các tín hiệu chính không chỉ là các thông báo, mà còn là lịch trình triển khai, chi phí trên mỗi token, độ trễ, khả năng có mô hình, giá doanh nghiệp, độ tin cậy suy luận và liệu phần cứng mới có cho phép các quy trình làm việc trước đây quá đắt đỏ hay không.