Gemini 3.6 Flash được định vị như một mô hình làm việc chính, cắt giảm lãng phí ở những nơi tác nhân mất tiền: đầu ra dài dòng, vòng suy luận không cần thiết và gọi công cụ quá mức. Kết quả báo cáo nhấn mạnh việc giảm số token cho mỗi lần hoàn thành và độ trễ thấp hơn trong khi cải thiện độ chính xác mã hóa và hiểu biết đa phương thức. Quan trọng là, sự thay đổi về giá củng cố thông điệp—3.6 Flash nhằm giảm tổng chi phí cho mỗi tác vụ hoàn thành, không chỉ giá mỗi token. Trong thực tế, điều này có thể thay đổi mô hình nào thắng thầu cho khối lượng công việc doanh nghiệp: mô hình giải quyết yêu cầu với ít sự thay đổi phối hợp nhất thường thắng mô hình đứng đầu một điểm chuẩn duy nhất. Đây là một sự điều chỉnh quan trọng cho những người xây dựng tối ưu hóa ở cấp hệ thống, không chỉ ở cấp độ lời nhắc.
Hãy xem xét các quy trình tác nhân điển hình: một mô hình điều khiển lập kế hoạch, phân công cho các tác nhân phụ, gọi công cụ hoặc hộp cát mã, sửa đổi bản nháp và xác nhận đầu ra. Mỗi vòng lặp làm tăng chi phí token, độ trễ và rủi ro thất bại. Nếu 3.6 Flash đạt được ít bước và ít lần gọi công cụ hơn trong khi vẫn giữ được độ chính xác, đồ thị phối hợp sẽ thu nhỏ lại và tốc độ xử lý tăng lên với ngân sách không đổi. Các điểm chuẩn được trích dẫn cho mã hóa, sử dụng máy tính và công việc kiến thức cho thấy sự cải thiện độ chính xác chuyển thành ít chu kỳ sửa lỗi hơn. Kết hợp với khả năng sử dụng máy tính tích hợp, các nhóm có thể chuyển chính sách tương tác từ các kịch bản dễ vỡ sang các hành động gốc mô hình, tiếp tục giảm chi phí hạ tầng và độ trễ đuôi chi phối trải nghiệm người dùng ở quy mô lớn.
Flash‑Lite mở rộng chiến lược cho các tác vụ có khối lượng lớn, nhạy cảm với độ trễ như tìm kiếm tăng cường truy xuất, phân loại và trích xuất tài liệu. Khi một khối lượng công việc bị chi phối bởi các tác vụ phụ có thể song song hóa, token trên giây và thời gian hoàn thành nhất quán thường quan trọng hơn độ chính xác đỉnh của tác vụ. Ngược lại, biến thể tập trung vào an ninh kết hợp điều chỉnh mô hình chuyên biệt với xác minh đa tác nhân để tìm và vá các lỗ hổng một cách hiệu quả—một sự công nhận rõ ràng rằng kiến trúc phù hợp thường là các mô hình nhỏ hơn, nhanh hơn kết hợp với thiết kế quy trình mạnh mẽ. Cùng nhau, dòng sản phẩm này báo hiệu một sách hướng dẫn thực dụng: định tuyến theo độ phức tạp tác vụ, giới hạn độ sâu suy luận và đo lường kinh tế theo mỗi lần hoàn thành thay vì lựa chọn mô hình một kích cỡ cho tất cả.
Đối với người mua, điều này thay đổi sự thận trọng. Thay vì coi điểm chuẩn là định mệnh, hãy chạy các thử nghiệm có tính chi phí song song với các chỉ số token trên mỗi tác vụ hoàn thành, số bước trung bình để thành công, số lần gọi công cụ, vòng sửa lỗi và thời gian xác minh của con người. Định giá mô hình không chỉ theo tỷ lệ mỗi token mà còn theo chi phí để đạt được các mục tiêu cấp dịch vụ. Đặt ngân sách cứng cho suy luận và gọi công cụ trong chính sách thời gian chạy, và kiểm tra cách hệ thống suy giảm dưới áp lực ngân sách. Cấu hình chiến thắng sẽ là cấu hình đáp ứng các tiêu chuẩn chất lượng trong khi tối thiểu hóa tổng chi phí token, chi phí phối hợp, phút có con người tham gia và các phiên bị bỏ dở. Đó là nơi 3.6 Flash được thiết kế để cạnh tranh.


