Fusion是一个为编码工作设计的双代理框架:前沿主导模型负责规划和审核;更经济的助手模型负责执行。它们不是将整个对话在模型间传递,而是交换结构化的简报和结果,同时各自维护自己的持续上下文。这种分工至关重要。在线程中途切换模型往往会破坏缓存并导致返工。在Fusion中,基于简报的委派保持上下文稳定,让助手能快速执行实现,并将昂贵的推理保留给主导模型的检查点。根据报告的基准测试结果,这种方式实现了前沿级别的质量,同时显著降低成本——尤其是在执行稳定性占主导的任务中。
战略转变从模型选择转向编排质量。每个令牌的价格低估了更优秀的规划者如何撰写更紧凑的简报、减少重试次数并最小化主导与助手之间的反复交流。实际上,更强(有时更昂贵)的主导模型通过更早委派和减少审核,反而能降低系统成本。同样,更有能力的助手虽然每个令牌成本更高,但通过首次正确实现减少整体交互次数。这就是Fusion宣称的合理之处:它将价格按任务而非令牌计算,将规划、执行和审核协调成一个保护缓存、减少波动的工作流。
对于买家来说,这重新定义了评估清单。基准测试依然重要,但关键问题转向了框架策略:规划如何形成、委派内容、主导审核频率以及错误如何升级。试点使用Astra或Claude类主导模型的团队应在任务层面衡量成本、时间和质量,并监控令牌和交互在各阶段——规划、设置、实现、调试、验证、收尾——的实际分布。如果大部分成本集中在实现和调试阶段,采用具有持续上下文和提示缓存的双代理框架很可能优于简单路由或单模型循环。
采用并非零成本。委派简报必须针对所选组合进行调优;助手的自主性应随能力提升;塑造计划的探索通常应由主导承担,除非助手足够强大避免误判。组织还需建立治理机制:可追踪的审核检查点、跨缓存的可复现运行,以及防止助手越权使用工具或权限的护栏。但其优势显著:稳定的规划通道将前沿智能集中于关键环节,执行通道则快速响应代码变更,无需频繁唤醒昂贵的智能核心。


