수년간 효율성은 더 나은 프롬프트나 더 크고 강력한 모델을 의미했습니다. SoL-Pi는 그 초점을 모델 주변의 구조물, 즉 작업을 계획하고 관찰을 수집하며 도구를 호출하고 출력을 평가하고 재프롬프트하는 하니스(harness)로 전환합니다. 핵심 아이디어는 자동화입니다: 재귀적 자동 연구 루프가 하니스에 대한 차이점(예: 관찰 필터, 계획 깊이, 로그 정책)을 생성하고, 제어된 실험을 통해 우수한 결과를 유지합니다. 그 결과는 작지만 꾸준한 개선이 쌓여 실질적인 절감으로 이어집니다. 코딩 에이전트에서는 더 적은 턴과 낭비되는 컨텍스트 감소, 실제 시간 가속과 비용 절감으로 나타나며, 모델을 재학습하거나 교체하지 않고도 가능합니다.
왜 이런 방식이 효과적일까요? 대부분의 에이전트 스택은 불필요한 방식으로 토큰을 소모합니다: 반복되는 시스템 프롬프트, 장황한 도구 스키마, 재생되는 파일 차이, 그리고 관찰에 누출되는 디버그 로그 등이 그것입니다. SoL-Pi는 구조화된 탐침과 제거 테스트를 통해 이러한 패턴을 찾아내고, 대안으로 델타 프롬프트(전체 컨텍스트 재생 대신), 로그 샘플링 및 편집, 사소한 경우 조기 종료 검사, 계획 및 탐색을 위한 적응형 깊이, 도구 입출력 압축 등을 제안합니다. 이러한 최적화는 토큰 양과 단계 수를 모두 줄여 지연 시간을 낮추면서 성공률을 안정적으로 유지합니다. 실제로 하니스는 분기별이 아닌 시간 단위로 반복 가능한 최적화 계층이 됩니다.
엔지니어링 및 제품 팀에게 주는 시사점은 운영적입니다: 토큰 예산, 단계 예산, 하니스 정책을 최우선 SLO로 다루세요. 단계별 토큰, 관찰 크기 분포, 도구 호출 왕복 횟수에 대한 카운터를 추가하고, 카나리아 작업과 섀도우 평가를 만들며, pass@k, 회귀 위험, 인간 개입에 대한 가드레일로 롤아웃을 통제하세요. CFO에게는 티켓, PR, 병합 변경당 단가 절감이라는 명확한 이점이 있지만, 단계 수 감소는 드리프트 가능성을 줄여 신뢰성도 향상시킵니다. 핵심은 벤치마크나 특정 모델 특성에 과적합하지 않고 저장소와 작업 유형 전반에 일반화할 수 있는 최적화를 찾는 것입니다.
SoL-Pi는 공급업체 전략도 재정의합니다. 모델 외부의 최적화는 공급자와 버전을 넘나들며 잘 작동해 현재 모델의 수명을 연장하고 명확한 ROI로 업그레이드를 평가할 시간을 벌어줍니다. PII 스크러빙, 정책 편집, 재현 가능한 추적 등 기업 제약과도 잘 맞습니다. 많은 이득이 보내지지 않는 데이터를 결정하는 데서 오기 때문입니다. 이 패턴은 확산될 것으로 예상됩니다: 에이전트와 도구 사이에 위치해 피드백 루프를 강화하고 모든 토큰을 최대한 활용하는 하니스 수준 컴파일러, 스키마 최소화 도구, 관찰 계획자 등이 등장할 것입니다.


