Grok 4.7 của SpaceXAI được thiết kế cho công việc lập trình và kiến thức kéo dài. Cửa sổ ngữ cảnh 500K token giảm thiểu việc truy xuất lặp lại bằng cách cho phép toàn bộ kho mã, các khác biệt đa tệp hoặc tài liệu đặc tả rộng lớn được giữ trong bộ nhớ. Thị giác tích hợp của mô hình bổ sung tiện ích cho việc gỡ lỗi ảnh chụp màn hình, xem xét biểu đồ và giải thích trạng thái giao diện người dùng. Quan trọng nhất, 4.7 nhấn mạnh lý luận xHigh và tự xác minh, cho phép thực thi nhiều bước lâu hơn, đáng tin cậy hơn với ít sự chuyển giao giữa các công cụ hơn. Được cung cấp ở mức giá tương đương 4.6 với biến thể nhanh có sẵn, nó trực tiếp nhắm vào môi trường phát triển, đại lý lập trình và các nhiệm vụ chuyên nghiệp nhiều giờ nơi giới hạn ngữ cảnh và xác minh trước đây gây cản trở.
Các tín hiệu ban đầu cho thấy hiệu suất giá cả mạnh mẽ cho các tác vụ mã hóa kéo dài, với cải tiến trên CursorBench 4.0 và khả năng chịu đựng tốt hơn trong công việc văn phòng và terminal nhiều giờ. Các cải tiến trên DeepSWE và EEBench cho thấy độ chính xác lý luận và phục hồi lỗi mạnh hơn trong các lĩnh vực kỹ thuật, trong khi việc huấn luyện nhận thức về harness của mô hình nhằm giảm sự trôi dạt trong hội thoại của quy trình đại lý. Sự kết hợp giữa ngữ cảnh dài hơn và mặc định an toàn hơn sẽ đơn giản hóa kiến trúc: ít thủ thuật chia nhỏ hơn, bộ truy xuất nhẹ hơn và khung nhắc nhở nhỏ hơn. Đối với các nhóm xử lý các tài liệu đặc tả lớn hoặc tuân thủ, bộ nhớ làm việc mở rộng của 4.7 có thể biến các quy trình đa lượt thành kế hoạch một lượt với các ghi chú scratchpad trong ngữ cảnh và các kiểm tra tự động có cấu trúc.
An toàn được củng cố rõ rệt. Bộ bảo vệ mới báo cáo khả năng chống jailbreak mạnh hơn và xử lý sử dụng kép tốt hơn mà không chặn quá mức các công việc bảo mật hợp pháp. Điều này quan trọng đối với việc áp dụng doanh nghiệp, nơi các hệ thống đại lý thường giao thoa với terminal, thực thi mã và dữ liệu nhạy cảm. Về mặt vận hành, 4.7 có sẵn qua API, các bộ công cụ lập trình và bộ định tuyến với giá 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra, với tùy chọn cấp độ nhanh hơn gấp đôi tốc độ và giá. Các nhóm nên chạy thử nghiệm song song trên khối lượng công việc thực tế của họ, đo lường chất lượng hoàn thành nhiệm vụ, độ tin cậy gọi công cụ và tổng chi phí cho mỗi nhiệm vụ hoàn thành thay vì chỉ đo độ trễ hoặc điểm chuẩn đơn lẻ.


