在未达到内部编码目标后决定暂停 Gemini 3.5 Pro 不仅仅是产品延期——它证明了前沿模型发布游戏已经改变。买家已经了解到,精彩的演示可能掩盖版本控制环境的脆弱性、不稳定的工具调用路径,以及在长上下文代码任务中成本激增的情况。除非模型在良好监控的工作流中持续实现可衡量的提升,满足可靠性服务水平目标(SLO),并且符合预算,否则竞争性的发布公告不再推动企业路线图。胜利者越来越多是那些能够证明在代码库、CI/CD 沙箱和多区域部署中实现稳定、可复现提升的,而不仅仅是那些率先发布的。
编码性能成为焦点,因为它既可读又可货币化,但测量起来却极具挑战。Pass@k 分数会随着采样温度、测试时工具和提示脚手架的变化而波动;代码库污染可能会夸大结果;评估工具往往无法模拟真实限制,如不稳定的软件包镜像或 API 配额限制。在生产环境中,模型必须在上下文增长、工具调用延迟和增量重构之间保持质量不退步。团队现在期望透明的方法论、污染审计和方差区间,而不仅仅是单一的头条分数。当内部目标未达成时,推迟发布以弥补评估差距不再是失误,而是发布纪律成熟的标志。
可靠性和成本已成为同等重要的决策变量。可靠性意味着在突发负载下延迟稳定,工具故障时优雅降级,可预测的内存占用,以及反映业务影响的错误预算。成本不再仅仅是每千个标记的费用;而是涵盖长上下文、重试、保护措施和代理编排的端到端总拥有成本(TCO)。那些展示清晰吞吐曲线、排队行为和批处理经济性的供应商更具优势。对于客户而言,成功依赖于工作负载级别的评估:影子生产流量、热图回归和将 pass@k 与周期时间、事件率及云支出关联的 A/B 保留测试。结果是采用路径更慢但更稳健,且上线后不愉快的惊喜更少。
现在该做什么:抵制反应性迁移,加强评估工具,并通过任务配置多样化模型暴露。将长上下文编码、测试生成和重构视为具有不同延迟和成本范围的独立赛道。要求供应商披露污染控制、工具使用评估和保护措施下的成本。最后,基准测试完整工作流——代码库索引、检索、计划与执行编码、编译/测试周期——以确保改进转化为真实的开发者效率。前沿进展加速,但采购门槛更高;有纪律的买家将获得持久收益,同时避免频繁更换和无法恢复的集成成本。


