NVIDIA 的 AVO 结果引人注目,不是因为它引入了新模型,而是因为它重新定义了什么使自主代理在长远任务中表现出色。完整的 AVO 系统在 ARC-AGI-3 公共测试集上达到了 100.00 的 RHAE,解决了 25 个环境中的 183 个关卡。相同架构此前独立运行了七天的 GPU 内核优化,探索了数百条路径,提交了数十个内核,在 DGX B200 配置上超越 FlashAttention-4 达到最高 10.5% 的提升。共同点是代理框架:持久记忆用于传承经验,工具使用用于验证假设,监督避免陷入死胡同,恢复机制保障持续进展——将原始模型能力转化为持久成果。
对于技术采购者和构建者来说,这将优化前沿从模型替换转向系统工程。长时间运行的代理需要状态连续性、结构化反馈、明确的回滚和检查点,以及能够揭示动作效率的遥测,而不仅仅是奖励或准确率快照。记忆基底减少重复探索;监督控制修剪无效循环;严格的评估接口确保改进基于执行而非仅凭提示。结果是:每个环境动作完成更多工作,回退更少,成本与结果的可预测性更强。随着推理令牌和环境步骤预算收紧,动作效率成为代理性能的关键指标。
AVO 还强调了一种可推广的架构模式:稳定的核心代理循环配合可插拔的环境工具和观察格式。在 ARC-AGI-3 中,代理仅通过文本操作,通过交互推断规则,同时在记忆中维护不断演进的假设。在工程任务中,它结合代码编辑与编译器和性能分析反馈。领域不同,循环不变。因此,组织应投资于可复用的代理框架,具备一致的日志记录、模型无关接口、用于审计的确定性重放,以及保障安全和成本的策略控制。这样衡量时,模型选择只是众多调节器之一——重要但不再是长远自主的主要杠杆。


