투게더 AI, 17달러로 파인튜닝 가능한 Jev 스타일 분류 모델 'tev1-4B-experimental' 오픈소스 공개
Together AI 엔지니어 Hassan이 Qwen3.5 4B를 17달러에 파인튜닝한 Jev 스타일 경량 분류 모델 tev1-4B-experimental을 공개했습니다. 가중치와 레시피가 오픈소스로 공개되었으며 서버리스로 즉시 호출 가능합니다.
2026년 9월 24일, Together AI의 엔지니어 Hassan El Mghari(@nutlope)가 Qwen3.5 4B 모델을 베이스로 약 17달러의 연산 비용을 들여 파인튜닝한 Jev 스타일의 초경량 의도 분류 모델 'tev1-4B-experimental'을 전격 공개했습니다. 전체 코드와 훈련 데이터 레시피는 GitHub 리포지토리(togethercomputer/tev1)를 통해 오픈소스로 배포되었으며, Together AI의 서버리스 인프라에도 즉시 등록되어 100만 입력 토큰당 0.042달러(출력 토큰 무료)의 초저비용으로 직접 호출할 수 있습니다.
이미지 출처: Together AI
17달러 연산 비용과 오픈소스 파이프라인
현대 AI 에이전트 시스템에서는 단순한 의도 분류나 분기 처리를 고비용의 대형 추론 모델에 맡기는 대신, 초경량 분류 모델을 앞단에 배치하는 아키텍처가 빠르게 자리잡고 있습니다. 이번에 공개된 tev1-4B-experimental은 이러한 소형 특화 모델을 개발자가 직접 저비용으로 구축할 수 있는 실증적인 청사진을 제시합니다.
- 기반 베이스 모델: 컴팩트한 파라미터 대비 추론 성능이 검증된 Qwen3.5 4B 모델을 베이스로 채택했습니다. 불필요하게 거대한 가중치를 사용하지 않고도 복잡한 입력 의도를 정밀하게 분기할 수 있는 기반을 다졌습니다.
- 극단적인 비용 효율성: 약 17달러의 연산 비용만으로 실용적인 수준의 커스텀 분류기를 완성했습니다. 대규모 훈련 대비 연산 비용을 대폭 절감하여 목적에 특화된 모델을 빠르게 확보할 수 있습니다.
- 오픈소스 파이프라인 전면 개방: GitHub 저장소(togethercomputer/tev1)를 통해 가중치뿐만 아니라 데이터 정제 레시피와 튜토리얼을 모두 공개했습니다. 개발자가 코드베이스를 직접 탐색하거나 코딩 에이전트에게 리포지토리를 전달하여 자체 데이터셋으로 파인튜닝을 자동 실행하도록 유도할 수도 있습니다.
Together AI 서버리스 배포와 100만 토큰당 0.042달러 가격 정책
학습 파이프라인과 가중치 공개에 그치지 않고, 개발자가 즉시 프로덕션 워크플로우에 연동할 수 있도록 클라우드 추론 환경도 함께 마련되었습니다.
- 서버리스 카탈로그 즉시 등록: Together AI 서버리스 엔드포인트에
together/Tev1-4B-experimental식별자로 등록되어 API 키 발급 즉시 호출할 수 있습니다. - 출력 토큰 무료 정책: 입력 토큰 100만 개당 0.042달러가 부과되며, 출력 토큰 100만 개당 비용은 0달러로 책정되었습니다. 자유로운 문장 생성이 아닌 라우팅 선택지 결정 및 분류에 집중하는 특성을 살려 출력 비용 부담을 완전히 제거했습니다.
실험적 모델 분류와 프로덕션 도입 시 유의점
이번 출시는 최근 오픈소스 커뮤니티에서 이어지고 있는 경량 추론 분류기 트렌드와 맞닿아 있습니다. 앞서 지난 9월 20일 자레드 파머(Jared Palmer)가 Qwen 기반의 오픈 결정 모델 제품군 'Kev'를 공개한 데 이어, Together AI는 이번 튜토리얼을 통해 독자적인 소형 분류기를 직접 훈련하고 서비스에 도입하는 장벽을 획기적으로 낮췄습니다. 다만 실제 프로덕션 워크플로우에 결합하기 전에 다음과 같은 특성을 면밀히 검토해야 합니다.
- 실험적 체크포인트 한계: 모델명에 명시된 대로
experimental단계의 초기 모델입니다. 프로덕션 배포 전 특정 도메인 데이터셋을 기준으로 분류 정밀도와 재현율을 자체 검증하는 과정이 필수적입니다. - 결정 및 분류 전용 인터페이스: 일반적인 대화형 챗봇이나 긴 문서 작성용 모델이 아닙니다. 입력된 요청의 의도를 판별하고 미리 정의된 클래스로 분기하는 구조화된 판단(Decision)에 특화되어 있으므로, 텍스트 생성 결과물을 기대하는 용도에는 적합하지 않습니다.
경량 분류 모델을 에이전트 전면에 배치해 불필요한 고비용 LLM 호출을 걸러내는 '작업 라우팅' 아키텍처는 토큰 비용 절감과 응답 속도 최적화를 동시에 달성할 수 있는 실전 전략으로 평가받고 있습니다.