Supersonic Labs, CPU에서 구동되는 144.3M 초경량 의사결정 모델 'Julia-1' 공개
Supersonic Labs가 텍스트 생성 대신 다지선다 의사결정과 분류에 특화된 144.3M 오픈 모델 Julia-1을 Apache 2.0으로 출시했습니다. 일반 CPU, 모바일 ONNX, 브라우저 WebGPU 환경에서 고속 추론을 지원합니다.
브라질의 AI 연구소 슈퍼소닉 랩스(Supersonic Labs)가 2026년 9월 26일, 일반 CPU 및 온디바이스 환경에서 고속으로 작동하는 144.3M(1억 4,430만) 파라미터 크기의 경량 의사결정 전용 오픈소스 언어 모델 '줄리아-1(Julia-1)'을 아파치 2.0(Apache 2.0) 라이선스로 공식 출시했습니다.

이미지 출처: Supersonic Labs (@supersonicai)
기존 대형 언어 모델(LLM)이 문장 생성에 수십억 개의 매개변수와 막대한 GPU 연산 자원을 투입하는 것과 달리, 줄리아-1은 텍스트 분류와 구조화된 선택지 결정이라는 단일 워크로드에만 집중하도록 설계된 특화 소형 모델입니다.
텍스트 생성 대신 '다지선다 분류와 의사결정'에 집중한 아키텍처
줄리아-1의 가장 두드러진 구조적 특징은 대화형 챗봇 형태의 자유 텍스트 생성을 완전히 배제했다는 점입니다.
작업자가 입력 컨텍스트와 함께 질문, 그리고 2개에서 최대 20개의 후보 답변 선택지를 모델에 전달하면, 모델은 각 옵션에 대한 확률 분포를 계산해 가장 적합한 단일 선택지를 반환합니다.
- 목적 특화 추론: 문장을 토큰 단위로 자기회귀(autoregressive) 생성하는 오버헤드가 없어, 에이전트 라우팅, 사용자 의도 파악, 텍스트 스코어링 작업에 최적화되었습니다.
- 결정론적 결과 도출: 불필요한 서술어나 환각 없이 사전에 정의된 후보군 내에서 명확한 확률 값과 결정을 내립니다.
- 완전한 오픈 가중치: 아파치 2.0 라이선스로 배포되어 기업 및 개인 개발자가 상용 서비스 환경에 제약 없이 통합하고 수정할 수 있습니다.
복잡한 추론이나 코딩 대신 단순 의사결정과 호출 경로 라우팅에 고비용 프론티어 모델을 사용하던 AI 워크플로우에서, 토큰 비용과 응답 지연 시간을 획기적으로 낮출 수 있는 실질적인 대안으로 주목받고 있습니다.
CPU·모바일·WebGPU를 아우르는 초경량 엣지 추론 성능
줄리아-1은 값비싼 클라우드 GPU 인프라 없이도 로컬 환경에서 즉각적인 연산이 가능하도록 하드웨어 접근성을 극대화했습니다.
공식 릴리즈에 따르면, 파이썬 3.11 이상 환경에서 일반 CPU 및 BF16을 지원하는 GPU를 통해 로컬에서 직접 구동할 수 있습니다. 또한 허깅페이스를 통해 ONNX 빌드(Julia-1-ONNX)가 함께 제공되어 브라우저 내 WebGPU 및 모바일 장치에서도 추가 변환 작업 없이 추론을 실행할 수 있습니다.
- Apple M4 칩셋: 중위(median) 레이턴시 33.15ms 기록.
- 삼성 갤럭시 탭 SM-X510: 태블릿 환경에서 203ms의 중위 레이턴시 달성.
- 엣지 및 클라이언트 완결형 동작: 네트워크 연결이나 외부 API 호출 없이 로컬 기기 내에서 의사결정 파이프라인을 완결할 수 있습니다.
이러한 지연 시간 지표는 네트워크 왕복 시간(RTT)을 고려할 때 원격 클라우드 API 호출보다 훨씬 빠른 응답성을 체감할 수 있게 해줍니다.
실무 도입 시 검토할 벤치마크 한계와 배포 경로
슈퍼소닉 랩스는 투명한 벤치마크 공개를 강조하며, 실제 서비스 설계 시 고려해야 할 현실적인 한계와 측정 조건도 함께 명시했습니다.
첫째, 후보 선택지의 수가 늘어날수록 처리 지연 시간이 급격히 증가합니다. 2~20개의 표준 선택지에서는 수십 밀리초 단위로 응답하지만, 72개 클래스를 한 번에 좁혀야 하는 Banking77 벤치마크 평가에서는 3,713.54ms가 소요되는 것으로 나타났습니다. 따라서 레이블 수가 많은 분류 작업의 경우 계층형 트리 구조로 분할하여 접근하는 전략이 권장됩니다.
둘째, 개발사 측이 제시한 'Jev 대비 5배 빠른 속도'라는 비교 벤치마크는 프랑스 리전에서 원격 호스팅 API로 호출된 Jev 인스턴스와 로컬 줄리아-1 구동 환경을 비교한 결과입니다. 네트워크 지연이 포함된 측정 조건의 차이를 고려하여 실측해야 합니다.
셋째, 슈퍼소닉 랩스는 자체 호스팅 API 출시를 예고했으나 공식 릴리즈 시점 기준 아직 일반 사용자 대상 서비스는 열리지 않은 상태입니다. 현재 실무 환경에 도입하려면 허깅페이스에 공개된 모델 가중치(SupersonicLabs/Julia-1) 또는 ONNX 런타임을 내려받아 자체 인프라에 배포해야 합니다.