Claude Code 모드로 비용 추적과 지능형 모델 라우팅 대시보드를 구축하는 방법
Claude Code의 신규 모드(Mod) 시스템과 TypeSafe Jev를 결합해 서브에이전트 모니터링, 비용 추정 및 작업별 모델 추천 대시보드(run-ledger)를 구축하는 4단계 실전 팁과 프롬프트.
Claude Code 환경에서 다중 서브에이전트를 운용할 때 발생하는 토큰 소모와 실행 비용을 실시간으로 통제하고 최적의 모델을 배정하는 실전 아키텍처가 공개되었습니다. AI 개발자 @Av1dlive(Avid)는 Claude Code 2.1.287 이상에 도입된 모드(Mod) 시스템과 TypeSafe의 경량 의사결정 엔진 Jev를 결합하여, 서브에이전트의 실행 상태와 API 예상 비용을 집계하고 작업별 모델 라우팅을 추천하는 대시보드 플러그인 run-ledger 구축 4단계 가이드를 공유했습니다.
![]()
이미지 출처: Avid (@Av1dlive)
이번 팁은 프롬프트 한 번으로 플러그인 뼈대와 대시보드 UI를 스캐폴딩하고, 무분별한 고비용 모델 호출을 방지하기 위해 '추천 우선(Recommendation-first)' 라우팅 규칙을 적용하는 전체 프로세스를 다룹니다.
1단계: Jev 환경 설정 및 모델 레지스트리 연결
첫 번째 단계는 의사결정 엔진인 Jev를 작업 환경에 준비하고 사용할 모델 레지스트리에 연결하는 것입니다.
Jev는 복잡한 텍스트 생성을 수행하지 않고 구조화된 마이크로 의사결정만을 초고속으로 판정하는 경량 모델입니다. 서브태스크가 고성능 추론 모델을 필요로 하는지 아니면 경량 소형 모델로 충분한지를 판단하는 분류기로 동작합니다.
- 모델 레지스트리 연동: 사용하고자 하는 대상 모델 풀(예: 최신 프론티어 모델, 범용 코딩 모델, 경량 분류 모델 등)의 식별자와 가격 정보를 Jev 환경에 연결합니다.
- 연결 및 가용성 검증: 등록된 모델들이 정상적으로 응답 가능한 상태인지 엔드포인트 연결 테스트를 수행합니다.
2단계: Claude Code 모드(run-ledger) 생성 프롬프트 주입
Claude Code 2.1.287 이상 버전을 실행하고, plugin-authoring 모듈을 로드하여 대시보드 모드를 생성하는 아래 프롬프트를 에이전트에 입력합니다.
build a mod called run-ledger. load plugin-authoring and use the API types for my installed version.
create a dashboard that shows:
- estimated cost per run, model, and source plugin where known
- which model handles each task
- each subagent’s status, latest action, and elapsed time
include token counts, cache usage, and reported retries. count each request once. keep background tasks linked to their original run.
use dated prices. label costs as API estimates, not subscription charges. show unknown when data is missing.
connect the mod to my existing Jev setup. give Jev the task, available models, prices, budget, and relevant past results. ask it to recommend a model and explain why.
start with recommendations. make automatic routing optional for eligible subagents. show the recommended model, actual model, result, and cost. include Jev’s own cost.
keep state across hot reloads. add details and export. the dashboard itself must make no model calls.
validate the plugin. test rendering, costs, attribution, and duplicate counting. give me steps for a live test.
핵심 아키텍처 제약 및 요구사항
위 프롬프트는 에이전트가 플러그인을 빌드할 때 지켜야 할 엄격한 설계 원칙을 포함하고 있습니다.
- 대시보드 자체의 제로 모델 호출 원칙: 대시보드 UI 렌더링 자체가 별도의 LLM API를 호출해 추가 비용을 발생시키는 것을 원천 차단합니다.
- 단일 요청 단일 집계(Deduplication): 토큰 카운트, 캐시 사용량, 재시도 횟수를 집계할 때 각 요청을 정확히 1회만 계산하고, 백그라운드 태스크는 원본 실행(Run)과 연결을 유지합니다.
- 명확한 비용 레이블링: 구독료가 아닌 'API 추정 비용(API estimates)'으로 명시하고, 기준 일자(dated prices)를 명기하며 누락된 데이터는
unknown으로 표시합니다. - 점진적 자동 라우팅 전환: 처음에는 Jev의 추천 모델과 추천 사유만 제시하고, 검증된 서브에이전트에 한해 선택적으로 자동 라우팅을 허용합니다. Jev 자체의 판단 비용도 지출 내역에 포함됩니다.
- 핫 리로드 상태 보존 및 CSV 내보내기: 코드 수정 중에도 상태를 유지하며, 수집된 모든
run-ledger데이터를 CSV 파일로 내보낼 수 있도록 구성합니다.
3단계: 핫 리로드 기반 동작 테스트 및 검증
프롬프트 실행 후 안내가 표시되면 핫 리로드(Hot reload)를 승인하고 다음 3가지 시나리오를 실행하여 플러그인을 검증합니다.
- 단순 태스크 실행: 단일 요청이 대시보드에 정상 등록되고 1회만 집계되는지 확인합니다.
- 서브에이전트 태스크 실행: 서브에이전트의 진행 상태, 최신 액션, 소요 시간이 실시간 갱신되는지 확인합니다.
- 모드 트리거 모델 호출: Jev가 입력된 태스크 난이도와 예산을 바탕으로 적절한 모델을 추천하고, 추천된 모델이 실제로 해당 태스크를 정상 수행하는지 확인합니다.
4단계: 영구 플러그인 설치 및 실전 운용
테스트가 완료되면 Claude Code에게 임시 작업 폴더에 생성된 빌드 산출물을 영구 플러그인 디렉토리로 복사하여 설치하도록 지시합니다.
설치가 완료되면 실행 대시보드에서 매 작업마다 소모되는 예상 비용을 즉시 확인하고, 작업의 복잡도에 따라 권장되는 최적의 모델을 선택하거나 자동 배정하여 비용 대비 최상의 결과물을 얻을 수 있습니다.
원문 출처
- Avid (@Av1dlive) X 포스트: how to use claude code mods like a top 1% user, step by step