Unreal Labs, 비동기 실행으로 비용 40% 절감하는 오픈소스 에이전트 하네스 'Unreal Agent' 공개

Unreal Labs가 턴 대기 없이 도구를 비동기 병렬 처리하여 Codex 대비 최대 40% 비용을 절감하는 오픈소스 AI 에이전트 하네스 Unreal Agent를 공개했습니다. Terminal-Bench 4.0 실측 벤치마크와 아키텍처를 분석합니다.

tau · 2026년 9월 23일

#UnrealAgent #AIAgent #OpenSource #CostEfficiency #Codex

Unreal Labs, 비동기 실행으로 비용 40% 절감하는 오픈소스 에이전트 하네스 'Unreal Agent' 공개

2026년 9월 22일, AI 연구 개발사 언리얼 랩스(Unreal Labs)가 대형 언어 모델(LLM) 기반 코딩 및 시스템 작업의 실행 비용을 대폭 절감한 오픈소스 하네스 '언리얼 에이전트(Unreal Agent)'를 공식 발표했습니다. 기존 에이전트 프레임워크가 모델 추론 턴과 도구 실행을 동기식으로 번갈아 수행하며 발생하던 대기 시간과 불필요한 토큰 오버헤드를 해소하고, 비동기 툴 실행 루프와 단일 bash 툴 구조를 도입하여 주요 벤치마크에서 OpenAI의 Codex 대비 최대 40%의 비용 절감 효과를 입증했습니다.

Unreal Labs의 오픈소스 AI 에이전트 하네스 Unreal Agent 소개 및 벤치마크 인포그래픽

이미지 출처: Unreal Labs (@unreallabsai)

기존 상용 및 오픈소스 코딩 에이전트 하네스는 대개 모델이 도구 호출(Tool Call)을 요청하면 하네스가 해당 도구를 실행하고 결과를 반환할 때까지 다음 추론 턴을 완전히 멈추는 구조를 취해 왔습니다. 언리얼 랩스는 이러한 동기식 턴 구조가 장시간 소요되는 컴파일, 테스트, 환경 탐색 과정에서 모델 추론 주기를 불필요하게 낭비하게 만든다는 점에 주목했습니다.

비동기 실행 루프와 단일 bash 도구 중심 아키텍처

언리얼 에이전트의 핵심 기술 차별점은 모델의 추론 턴과 도구 실행을 독립적으로 분리한 비동기 실행 루프(Asynchronous Execution Loop)에 있습니다.

하네스는 장시간 실행되는 쉘 명령이나 스크립트 작업을 백그라운드 프로세스로 즉시 구동하고, 모델은 도구 작업의 완료를 마냥 기다리지 않고 다른 분석이나 후속 계획을 계속해서 진행할 수 있습니다. 백그라운드에서 진행되던 도구의 실행 결과는 수신되는 즉시 에이전트의 컨텍스트로 전달되어 실시간으로 반영됩니다.

이러한 비동기 파이프라인은 두 가지 중요한 실무적 이점을 제공합니다.

첫째, 사용자는 에이전트가 백그라운드 도구를 구동 중인 상황에서도 언제든지 명령을 입력하거나 작업 방향을 조향(Steering)할 수 있습니다. 장기 실행 작업이 끝날 때까지 입력을 차단당하던 사용자 경험이 근본적으로 개선되었습니다.

둘째, 에이전트가 모델 호출 사이에 독립적인 도구 작업들을 보다 지능적으로 스케줄링하고 병렬 배치(Batching)할 수 있습니다. 언리얼 에이전트는 수십 개의 세부 전용 도구 스키마를 모델에 주입하는 대신 단일 bash 도구 환경을 기본 인터페이스로 제공하며, 시스템 프롬프트를 통해 상호 독립적인 명령들을 한 번에 일괄 실행하도록 유도합니다. 이를 통해 스키마 정의로 인한 입력 토큰 낭비를 줄이고 전체 왕복 턴 수를 크게 단축시켰습니다.

Terminal-Bench 4.0 실측 벤치마크: 성능 동률과 39% 비용 절감

언리얼 랩스는 GPT-6 Astra(xhigh 추론 강도) 모델을 백엔드로 사용하여 에이전트 성능 평가 벤치마크인 '터미널 벤치 4.0(Terminal-Bench 4.0)'에서 언리얼 에이전트의 성능과 비용을 실측 비교했습니다.

터미널 벤치 4.0은 소프트웨어 엔지니어링, 시스템 환경 설정, 복잡한 데이터 분석 등 실제 터미널 환경에서 수행되는 고난도 작업을 평가하는 표준 벤치마크입니다. 공개된 실측 데이터에 따르면 언리얼 에이전트는 Codex 공식 리더보드 기준과 정확히 동일한 57.9%의 성공률을 기록하면서도, 총 실행 비용을 39% 이상 절감했습니다.

에이전트 (Agent)성공률 (Pass Rate)총 비용 (Total $)시험당 입력 토큰 (In/trial)시험당 출력 토큰 (Out/trial)턴 수 (Turns)도구 호출 수 (Tools)실행 기록 (Harbor)
Unreal Agent57.9%$1,4281.73M32k283727133053
Codex (리더보드 기준)57.9%$2,350
Pi55.0%$1,8272.83M35k44576ccd097a

측정 결과에 따르면 언리얼 에이전트는 총 1,428달러를 소비하여 Codex 리더보드 기준(2,350달러) 대비 약 39.2% 낮은 비용으로 동일한 57.9%의 문제 해결률을 달성했습니다.

또 다른 오픈소스 하네스인 Pi와의 비교에서도 언리얼 에이전트의 효율성이 두드러졌습니다. Pi가 55.0% 성공률과 1,827달러의 비용을 기록한 반면, 언리얼 에이전트는 성공률을 2.9%p 높이면서도 전체 비용을 약 21.8% 절감했습니다. 특히 작업당 입력 토큰을 Pi의 2.83M에서 1.73M으로 낮추고, 평균 턴 수를 44회에서 28회로, 도구 호출 횟수를 57회에서 37회로 대폭 압축하여 토큰 소모와 지연 시간을 동시에 줄였습니다.

언리얼 랩스는 코딩 영역뿐만 아니라 비코딩 및 과학 연구 벤치마크와 실제 프로덕션 워크로드에서도 성능 저하 없이 최대 40% 수준의 비용 절감 효과가 유지된다고 밝혔습니다.

오픈소스 공개 현황과 프로덕션 환경 고려사항

언리얼 에이전트는 깃허브(GitHub) 저장소를 통해 전체 소스 코드가 오픈 라이선스로 완전 개방되었습니다. 엔터프라이즈 환경에서 자체 모델 엔드포인트나 하네스를 구축하는 개발팀 누구나 코드를 내려받아 커스터마이징할 수 있습니다.

다만 프로덕션 도입 시에는 몇 가지 구조적 특성을 감안해야 합니다.

첫째, 최대 40%의 비용 절감 수치는 독립적인 터미널 작업과 툴 병렬 배치가 가능한 워크로드에서 극대화됩니다. 이전 도구의 실행 결과에 엄격히 종속되는 순차적 워크플로우의 경우 비동기 배치로 인한 절감 폭이 벤치마크 수치보다 제한적일 수 있습니다.

둘째, 단일 bash 도구를 통해 임의의 명령을 실행하고 백그라운드 프로세스를 관리하는 아키텍처 특성상, 엄격한 컨테이너 격리와 파일 시스템 샌드박싱 환경이 필수적입니다. 프로덕션 배포 시 호스트 시스템 보호 및 권한 통제 정책이 사전에 구성되어야 합니다.

대규모 AI 코딩 에이전트를 운영하는 조직에 있어 추론 비용과 응답 지연은 핵심적인 운영 과제입니다. 비동기 툴 실행과 간결한 도구 설계를 통해 프런티어 성능을 유지하면서 비용을 40% 가까이 덜어낸 언리얼 에이전트의 접근법은 차세대 에이전트 하네스 설계의 유의미한 방향성을 제시하고 있습니다.

출처