TAU-HOME.COM
LOADING

동일 모델에서도 에이전트 하네스·도구 스키마를 줄여 비용을 최대 3배 절감하는 팁

동일한 LLM을 사용하더라도 에이전트 하네스의 시스템 프롬프트와 도구 스키마 크기를 최적화하면 성능 저하 없이 토큰 비용을 최대 3배 절감할 수 있습니다. SWE-bench Verified 벤치마크 기반 하네스 비교 연구의 핵심 요약과 실무 팁을 정리합니다.

tau · 2026년 10월 9일

#AI-Agents #Agent-Harness #Prompt-Optimization #Cost-Reduction #SWE-bench

동일 모델에서도 에이전트 하네스·도구 스키마를 줄여 비용을 최대 3배 절감하는 팁

AI 연구 및 교육 커뮤니티 DAIR.AI(@dair_ai)가 동일한 기반 모델을 고정한 상태에서 에이전트 하네스(Agent Harness) 설계가 성능과 비용에 미치는 영향을 분석한 최신 연구 결과를 공유했습니다.

SWE-bench Verified 벤치마크 기반 에이전트 하네스별 성능 및 비용 비교 차트

이미지 출처: DAIR.AI (@dair_ai)

이번 연구의 핵심 결론은 단순합니다. 하네스에 주입되는 시스템 프롬프트와 도구(Tool) 스키마의 크기를 최소화하는 것만으로도, 정확도 손실 없이 작업당 비용을 최대 3배까지 절감할 수 있다는 점입니다.

에이전트 하네스 간 성능 격차와 실측 결과

연구진은 동일한 LLM을 기반으로 대표적인 세 가지 코딩 에이전트 하네스인 Claude Code, mini-SWE-agent, OpenCode를 SWE-bench Verified 벤치마크(총 447개 과제)에서 비교 평가했습니다.

  • 전체 447개 과제 기준 점수차: Claude Code와 mini-SWE-agent는 447개 과제 전체에서 불과 5점 이내의 점수 차이를 기록했습니다.
  • 하네스 교체 vs 재실행 변동폭: 하네스를 다른 것으로 교체했을 때 발생하는 성능 변동은 동일한 하네스를 단순히 다시 실행했을 때의 오차 범위와 거의 비슷한 수준이었습니다.
  • 고난도 45개 과제 세트 검증: 난이도가 높은 45개 과제 셋에서는 하네스 교체와 동일 하네스 재실행 모두 약 13%의 과제에서 결과가 뒤집히는(flipped) 동일한 수준의 변동성을 보였습니다.

즉, 동일 모델 조건에서는 하네스 구조 자체보다 프롬프트와 스키마 설계의 효율성이 실질적인 비용 대비 효용을 결정합니다.

비용 차이가 발생하는 근본 원인: 매 스텝 누적되는 오버헤드

하네스 간에 최대 3배에 달하는 비용 격차가 발생하는 이유는 시스템 프롬프트와 도구 스키마의 전달 방식 때문입니다.

대부분의 에이전트 루프는 매 스텝마다 시스템 프롬프트와 전체 도구 정의 스키마를 모델에 다시 전송합니다. 에이전트가 문제를 해결하기 위해 실행하는 추론 및 도구 호출 스텝 수가 늘어날수록, 매 턴 고정적으로 전송되는 베이스라인 토큰 비용이 선형적으로 곱절 청구됩니다.

따라서 하네스 시스템 프롬프트를 장황하게 구성하거나 쓰지 않는 도구 스키마를 방대하게 열어두면, 정확도 향상 없이 토큰 소비량만 급격히 증가하게 됩니다.

실무 적용 팁: 가벼운 에이전트 하네스 설계 원칙

  1. 도구 스키마 다이어트: 에이전트에 등록하는 도구 설명(description)과 매개변수 JSON Schema를 필수 필드 위주로 간결하게 유지합니다.
  2. 시스템 프롬프트 군더더기 제거: 하네스 차원에서 주입하는 역할 정의와 행동 지침을 핵심 원칙 중심으로 최소화합니다.
  3. 스텝 누적 방지: 컨텍스트 윈도우 관리를 통해 매 턴 반복 전송되는 정적 컨텍스트의 오버헤드를 제어합니다.

원문 출처