Xyne, Qwen3.6 기반 260k 컨텍스트 오픈소스 결정 모델 'XOR' 공개
Xyne가 Jev 대안을 표방하는 오픈소스 멀티모달 결정 모델 XOR을 허깅페이스에 공개했습니다. Qwen3.6 기반으로 260k 컨텍스트 윈도우와 텍스트 및 시각 분류를 지원하며 데이터 주권 확보를 겨냥합니다.
2026년 9월 24일, AI 연구 개발팀 자인(Xyne)이 타입세이프(TypeSafe)의 상용 결정 모델인 제브(Jev)의 오픈소스 대안을 표방하는 멀티모달 결정 모델 'XOR'을 공식 발표하고 허깅페이스(Hugging Face) 저장소(juspay/xor)를 통해 오픈 가중치를 공개했습니다. 알리바바의 오픈 파운데이션 모델인 Qwen3.6(Qwen-3.6-35B)을 기반으로 구축된 XOR은 텍스트 분류뿐만 아니라 시각적 인터페이스와 문서 분석을 아우르는 시각(Visual) 분류를 네이티브로 지원하며, 기존 결정 모델의 입력 한계를 극복하기 위해 260k 토큰에 달하는 대규모 컨텍스트 윈도우를 기본 제공합니다.

이미지 출처: Xyne (@XyneAI)
최근 복합 에이전트 워크플로우와 자율형 도구 호출 파이프라인이 보편화되면서, 프롬프트 의도 분류, 적합 도구 선택, 모델 티어 라우팅 등 마이크로 의사결정을 초저지연·저비용으로 전담하는 전용 결정 모델(Decision Model)의 중요성이 급격히 부각되고 있습니다. 그러나 지금까지 시장을 선점해 온 고성능 결정 솔루션은 비공개 상용 클라우드 API 형태에 집중되어 있어, 엔터프라이즈 환경에서 민감한 사내 문서나 시스템 화면 캡처 데이터를 외부로 전송해야 하는 데이터 주권(Data Sovereignty) 우려가 지속적으로 제기되어 왔습니다. Xyne의 이번 XOR 릴리스는 자체 인프라와 온프레미스 환경에서 완전히 구동 가능한 엔터프라이즈급 결정 라우팅 생태계를 오픈소스로 조성하려는 시도로 평가받고 있습니다.
260k 컨텍스트 윈도우와 텍스트·시각 멀티모달 분류 아키텍처
XOR의 가장 뚜렷한 아키텍처 특징은 기존 경량 결정 모델의 단문 분류 한계를 벗어나 260k 토큰 규모의 대용량 컨텍스트 처리 능력과 시각 인지 기능을 결합했다는 점입니다.
기존의 제브(Jev) 등 전문 라우터 모델들은 신속한 판단을 위해 주로 짧은 텍스트 문자열이나 제한된 프롬프트 컨텍스트를 판별하는 데 집중해 왔습니다. 반면 XOR은 베이스 모델인 Qwen3.6의 멀티모달 및 장문 처리 역량을 계승하여, 긴 시스템 로그, 장기 에이전트 대화 히스토리, 코드베이스 분석 결과는 물론 복잡한 GUI 화면 캡처나 서식 문서를 단일 입력으로 받아 정밀한 분류 판단을 내릴 수 있도록 설계되었습니다.
- 텍스트 및 시각(Visual) 통합 분류: 텍스트 명령뿐 아니라 운영체제 화면, 애플리케이션 UI 스크린샷, 대시보드 도표를 직접 시각적으로 인코딩하여 다음 에이전트 행동이나 도구 호출 대상을 결정합니다.
- 260k 확장 컨텍스트: 컨텍스트 절단(truncation) 없이 방대한 사전 맥락을 보존한 상태에서 라우팅 결정을 내릴 수 있어 장문 분석 파이프라인에 최적화되었습니다.
- 엔터프라이즈 데이터 주권 보장: 데이터 주권과 보안 준수가 필수적인 기업 환경을 겨냥하여, 외부 상용 API 의존 없이 자체 서버 및 격리 인프라에서 배포 및 운용할 수 있도록 오픈 가중치를 제공합니다.
벤치마크 성과와 초기 릴리스의 보정 한계
Xyne 개발팀은 공식 발표를 통해 XOR의 벤치마크 지표를 공개하며 상용 선두 모델과의 비교 수치를 제시했습니다.
공개된 평가 인포그래픽에 따르면, 231개 공개 JevBench v1.2 결정 태스크(쉬움 48개, 표준 72개, 하드 111개 평가 서브셋)에서 XOR은 88.3%의 전체 정확도(Accuracy)를 기록하여 공식 Jev(86.1%) 대비 +2.2%p, 바닐라 베이스 모델인 Qwen-3.6-35B(84.8%) 대비 +3.5%p 앞선 결과를 나타냈습니다. 가중 정확도로 환산한 지능 지수(Intelligence, 0~100) 평가에서도 XOR은 89.5점을 기록해 공식 Jev(87.8점)와 베이스 모델(85.9점)을 상회했습니다. 특히 111개의 고난도 결정 태스크(Hard tier)에서는 77.5%의 정확도를 기록해 공식 Jev(72.1%) 대비 +5.4%p 높은 점수를 기록했습니다.
그러나 Xyne 측은 "현재 XOR이 모든 벤치마크 지표에서 Jev를 앞서는 것은 아니다(Xor isn't besting Jev at everything right now)"라고 선을 그으며, "일부 벤치마크에서는 놀라운 결과를 보여줄 것이며 이제 막 시작한 단계"라고 덧붙였습니다. 또한 이번 릴리스를 오픈소스 커뮤니티와의 협력을 위한 출발점으로 삼고 지속적인 사후 훈련 및 예측 확률 신뢰도 보정(Calibration)을 이어갈 방침입니다.
엔지니어링 쟁점과 로드맵: 추론 지연시간과 모델 경량화 과제
XOR 공개 직후 AI 엔지니어링 커뮤니티에서는 모델의 실전 효용성을 둘러싸고 활발한 기술적 토론이 이어졌습니다.
가장 집중적인 논의가 이루어진 부분은 추론 지연시간(Latency)과 파라미터 규모입니다. 결정 모델의 핵심 가치가 복잡한 고비용 LLM 호출을 건너뛰고 빠른 초저지연 라우팅을 수행하는 데 있는 만큼, Qwen3.6 기반의 35B급 파라미터 규모는 로컬 엣지 디바이스나 실시간 마이크로서비스로 운용하기에 연산 비용과 VRAM 요구량이 다소 높다는 피드백이 제기되었습니다. 또한 대형 VLM 임베딩 기반의 단일 패스(Single-pass) 판단 구조와 경량 라우터들을 단계적으로 배치하는 캐스케이드(Cascade) 파이프라인 간의 아키텍처 적합성도 주요 논점으로 다루어졌습니다.
이러한 피드백에 대해 Xyne은 오픈소스 생태계와의 협업을 통해 다음과 같은 단계적 개발 로드맵을 추진하겠다고 발표했습니다:
- 소형 및 로컬 버전(Smaller / Local versions): 엣지 장비 및 로컬 환경에서 적은 VRAM으로도 초저지연 실행이 가능한 경량화 및 소형화 모델 개발.
- 도메인 특화 버전(Domain specific flavors): 특정 산업 및 전문 업무 워크플로우에 최적화된 맞춤형 결정 체크포인트 제공.
- 고정밀 확률 보정(Better calibration): 프로덕션 파이프라인에서 신뢰할 수 있는 임계값 기반 분기가 가능하도록 예측 확률 신뢰도 최적화.
Xyne의 XOR은 독점 상용 API 중심이었던 결정 모델 시장에 오픈소스 기반의 데이터 주권과 멀티모달 처리라는 대안을 제시하며, 자체 호스팅을 추구하는 엔터프라이즈 에이전트 인프라에 의미 있는 선택지를 더했습니다.