NVIDIAのAVOの成果が注目されるのは、新しいモデルを導入したからではなく、自律エージェントが長期的に有能であるための要素を再定義したからです。完全なAVOシステムはARC-AGI-3公開セットで100.00 RHAEを達成し、25の環境で183のレベルをクリアしました。同じアーキテクチャは以前、GPUカーネル最適化のために7日間独立して稼働し、数百の経路を探索し、FlashAttention-4をDGX B200構成で最大10.5%上回るカーネルを数十コミットしました。共通点はハーネスにあります。持続的な記憶で学習を継続し、ツールを使って仮説を検証し、監督で停滞を防ぎ、回復で進捗を維持することで、生のモデル能力を持続可能な成果に変えています。
技術的な購入者や開発者にとって、これは最適化の焦点がモデルの入れ替えからシステムエンジニアリングへと移ることを意味します。長時間稼働するエージェントには状態の連続性、構造化されたフィードバック、明確なロールバックとチェックポイント、そして報酬や精度のスナップショットだけでなく行動効率を明らかにするテレメトリが必要です。記憶基盤は冗長な探索を減らし、監督制御は非生産的なループを削減し、厳密な評価インターフェースは改善がプロンプトだけでなく実行に基づくことを保証します。その結果、環境アクションあたりの作業量が増え、後退が減り、コスト対成果の予測可能性が向上します。推論トークンや環境ステップの予算が厳しくなる中、行動効率がエージェント性能の通貨となっています。
AVOはまた、一般化可能なアーキテクチャパターンを強調しています。安定したコアエージェントループにプラグ可能な環境ツールと観察フォーマットを組み合わせる構造です。ARC-AGI-3では、エージェントはテキストのみで動作し、対話を通じてルールを推測し、進化する仮説を記憶に保持しました。エンジニアリングタスクでは、コード編集とコンパイラやプロファイラのフィードバックを組み合わせました。ドメインは変わってもループは変わりません。組織は一貫したログ記録、モデル非依存のインターフェース、監査のための決定的な再生、そして安全性とコストのためのポリシー制御を備えた再利用可能なハーネスに投資すべきです。こうした観点から見ると、モデル選択は多くの調整の一つに過ぎず、長期的な自律性の主なレバーではなくなっています。


