長年にわたり、効率化とはより良いプロンプトやより大きく高性能なモデルを意味してきました。SoL-Piはその重点をモデルの周囲の足場、つまりタスクを計画し、観察を収集し、ツールを呼び出し、出力を評価し、再プロンプトを行うハーネスに置き換えます。その核心は自動化です。再帰的な自動リサーチループがハーネスへの差分(例:観察フィルター、計画の深さ、ログポリシー)を生成し、制御された試験を実行して勝者を保持します。その結果、小さな改善が積み重なり大きな節約となります。コーディングエージェントでは、ターン数の削減や無駄なコンテキストの減少として現れ、実時間の高速化とコスト削減をもたらします。モデルの再訓練や交換は不要です。
なぜこれが機能するのでしょうか?多くのエージェントスタックは避けられる方法でトークンを消費しています。繰り返されるシステムプロンプト、冗長なツールスキーマ、再生されるファイル差分、観察に漏れ込むデバッグログなどです。SoL-Piは構造化されたプローブとアブレーションテストでこれらのパターンを探り、代替案を提案します。例えば、完全なコンテキスト再生の代わりにデルタプロンプトを使い、ログのサンプリングと編集、些細なケースの早期終了チェック、計画と探索の適応的深さ、ツールの入出力圧縮などです。これらの最適化はトークン量とステップ数の両方を削減し、成功率を維持しつつレイテンシを低減します。実際には、ハーネスは四半期ごとではなく毎時反復可能な最適化レイヤーとなります。
エンジニアリングやプロダクトチームにとっての示唆は運用面にあります。トークン予算、ステップ予算、ハーネスポリシーを第一級のSLOとして扱いましょう。ステップごとのトークン数、観察サイズの分布、ツール呼び出しの往復回数をカウンターで計測し、カナリアタスクやシャドウ評価を作成し、pass@k、回帰リスク、人間のオーバーライドに関するガードレールでロールアウトを制御します。CFOにとってのメリットは明快で、チケット、PR、マージされた変更あたりの単価が下がりますが、信頼性も向上します。ステップ数が減ることでドリフトの可能性が減るためです。重要なのは、ベンチマークや単一モデルの特異性に過剰適合せず、リポジトリやタスクタイプ全体に一般化できる最適化を見つけることです。
SoL-Piはベンダー戦略の再定義も促します。モデル外の最適化はプロバイダーやバージョンを超えて適用可能で、現在のモデルの寿命を延ばし、ROIが明確なアップグレード評価の時間を稼ぎます。PIIのスクラビング、ポリシー編集、再現可能なトレースなどの企業制約とも親和性が高いです。多くの成果は送信しないことの判断から生まれるためです。このパターンは広がるでしょう。エージェントとツールの間に位置するハーネスレベルのコンパイラ、スキーマ最小化ツール、観察プランナーがフィードバックループを強化し、すべてのトークンを最大限に活用します。


