DeepSeekのV4-Flashは市場の転換を示しています:非常に低い推論コストでのスループットと予測可能性が、多くの実際のワークロードでピーク推論を上回ることができます。ほとんどの企業エージェントは繰り返しの多いツール中心のタスク(分類、抽出、重複排除、強化、テンプレート応答など)を実行しており、失敗モードは既知で品質基準は規定されています。これらの環境では、モデルのコストと安定性が支配的です。購買センターは能力デモから単位経済へと移行しています:ドル、分、ワットあたりの成功タスク数です。この視点は、パイプラインがガードレールと根拠のある入力を強制してSLA内の精度を維持する限り、速度と短中期コンテキスト向けに設計されたフラッシュティアモデルを支持します。
タスク単価を評価するには、トークンだけでなくループ全体を測定する必要があります:平均ツール呼び出し回数、拒否や幻覚による再試行、検証パス、人間介入のエスカレーションなどです。わずかに賢いが遅いモデルでも、同時実行時により多くのツール呼び出しやタイムアウトを引き起こすと負ける可能性があります。逆に、プロンプト予算内に収まり、コンテキストを効果的に圧縮し、高い一次合格率を達成するスリムなモデルは勝つことができます。勝利する構成は通常、フラッシュティア推論と決定論的検索、スキーマ検証、関数呼び出し制約を組み合わせており、複雑さをモデルからオーケストレーションに移すことで、テスト、キャッシュ、最適化が容易になります。
調達の示唆は、ヘッドラインベンチマークではなくワークロードの組み合わせに基づいて購入することです。タスクの典型タイプごとにルーティングポリシーを作成します:ルーチンのCRUDのような自動化、半構造化ドキュメント操作、カスタマーサポートのマクロはフラッシュティアに傾きます;法的文書作成、クロスドメインの統合、曖昧なトラブルシューティングはプレミアムパスを維持します。エージェントルーターと可観測性を活用すれば、ワークフローごとに厳しい予算を設定し、品質基準を満たす最も安価なモデルをシステムに選択させることができます。時間が経つにつれて、財務と運用にとって重要な指標は、リーダーボードスコアではなく、p95レイテンシでのドルあたり成功数と分あたりタスク数になります。


