DeepSeek 的 V4-Flash 标志着市场的转折点:在极低推理成本下的吞吐量和可预测性,能够在许多实际工作负载中超越峰值推理能力。大多数企业代理执行重复且依赖工具的任务——分类、提取、去重、丰富或模板化响应——这些任务的失败模式已知且质量标准已制定。在这些环境中,模型成本和稳定性占主导地位。采购中心正从能力演示转向单位经济学:每美元、每分钟、每瓦特成功完成的任务数量。这个视角偏好为速度和短中期上下文设计的闪电级模型,前提是流程中有护栏和基于事实的输入以保持准确性在服务水平协议内。
评估按任务成本需要测量整个循环,而非仅仅是令牌数:平均工具调用次数、因拒绝或幻觉导致的重试次数、验证通过次数以及人工介入升级次数。稍微智能但较慢的模型如果在并发下触发更多工具调用或超时,仍可能失败。相反,精简的模型如果能控制在提示预算内,有效压缩上下文,并实现高首次通过率,则能获胜。获胜的配置通常将闪电级推理与确定性检索、模式验证和函数调用约束结合——将复杂性从模型转移到编排层,在那里更容易测试、缓存和优化。
采购的含义是根据工作负载组合购买,而非头条基准。按任务原型创建路由策略:常规的 CRUD 类自动化、半结构化文档操作和客户支持宏倾向于闪电级;法律起草、跨领域综合或模糊故障排除则保留高端路径。借助代理路由器和可观测性,可以为每个工作流设定严格预算,让系统选择满足质量门槛的最便宜模型。随着时间推移,财务和运营关注的指标将变为每美元成功率和 p95 延迟下的每分钟任务数,而非排行榜分数。


