Ollama, Cloudflare 오픈소스 의사결정 모델 Clef·Clef-Flash 공식 지원
Ollama가 Cloudflare의 27B 및 9B 오픈소스 멀티모달 의사결정 모델 Clef와 Clef-Flash의 로컬 구동을 공식 지원합니다. Jev 호환 /v1/systemone 엔드포인트를 통해 단일 순방향 패스로 고속 라우팅과 분류 결정을 로컬 환경에서 실행할 수 있습니다.
로컬 AI 런타임 플랫폼 올라마(Ollama)가 2026년 10월 3일, 클라우드플레어(Cloudflare)가 개발한 오픈소스 멀티모달 의사결정(Decision) 모델인 '클레프(Clef)'와 '클레프 플래시(Clef-Flash)'의 공식 로컬 서빙 지원을 시작했습니다. 최신 Ollama 0.35.1 이상 환경에서 간단한 CLI 명령어(ollama pull clef, ollama pull clef-flash)로 모델을 내려받아 온프레미스에서 즉시 구동할 수 있습니다.

이미지 출처: Ollama (@ollama) / X
이번에 추가된 Clef 패밀리는 텍스트를 한 토큰씩 순차 생성하는 전통적인 자동회귀(Autoregressive) LLM과 달리, 단 한 번의 순방향 신경망 패스(Single Non-autoregressive Pass)로 여러 질문에 대한 선택지별 확률을 동시 계산해 구조화된 결정을 반환하는 시스템 1(System One) 특화 모델입니다.
Clef 27B와 Clef Flash 9B의 아키텍처 및 주요 제원
클라우드플레어 워커스 AI(Workers AI) 팀이 아파치 2.0(Apache 2.0) 라이선스로 공개한 Clef 시리즈는 모델 크기와 처리 속도에 따라 정밀 판정용 27B 모델과 초저지연 라우팅용 9B 모델 두 가지로 나뉩니다.
- Clef (27B,
ollama pull clef): Qwen3.8-27B를 베이스로 파인튜닝된 플래그십 의사결정 모델입니다. 복잡한 정책 검증, 계약 및 서식 다중 항목 판정, 고정밀 라우팅 등 최고 수준의 분류 정확도가 필요한 작업에 최적화되어 있습니다. - Clef Flash (9B,
ollama pull clef-flash): Qwen3.5-9B를 기반으로 경량화된 초고속 모델입니다. 클라우드플레어의 디시전 인덱스(Decision Index) 벤치마크에서 38.8ms의 중앙값 지연시간을 기록해 27B 모델(209.3ms) 대비 약 5배 빠른 응답 속도를 보여주며, 지연시간에 민감한 실시간 게이트웨이 및 핫패스(Hot-path) 라우팅에 적합합니다. - 64K 컨텍스트 윈도우: 기존 텍스트 의사결정 모델인 Jev(32K) 대비 2배 확장된 64K 토큰 상태 윈도우를 지원하여 긴 대화 기록이나 방대한 시스템 상태 로그를 한 번에 검토할 수 있습니다.
- 멀티모달 비전 인코더 탑재: 순수 텍스트 및 구조화 JSON뿐만 아니라 스크린샷, 영수증, 문서 사진, 이미지(PNG/JPEG/WebP)를 입력 상태와 함께 평가할 수 있는 비전 인코더를 기본 내장했습니다.
단일 순방향 패스 원리와 /v1/systemone REST API 규격
기존 대형 언어 모델을 활용한 라우팅은 LLM이 생성한 텍스트 응답을 JSON 파서나 정규식으로 다시 추출해야 하며, 환각이나 형식 파손, 긴 추론 지연시간이 지속적인 병목으로 작용했습니다.
반면 Clef는 입력 상태(state)와 질문 스키마(questions)를 전달받으면, 임베딩된 선택지 공간 전체의 조건부 확률을 단일 연산으로 산출합니다. 텍스트 생성 루프가 없으므로 출력 파싱 오류가 원천 차단되며, 각 선택지에 대한 정밀한 확률값(Probabilities)과 신뢰도(Confidence)가 즉시 반환됩니다.
Ollama는 Typesafe Jev 및 System One 규약과 100% 호환되는 POST /v1/systemone 엔드포인트를 통해 Clef를 로컬 애플리케이션과 연동합니다.
# Clef 모델 로컬 호출 예시
curl http://localhost:11434/v1/systemone -d '{
"model": "clef",
"state": {
"ticket": "중복 결제가 발생했습니다. 추가 결제 금액을 환불해 주세요.",
"attached": "고객 은행 거래 내역서 스크린샷 첨부됨"
},
"questions": {
"team": {
"type": "choice",
"instructions": "이 문의를 처리해야 할 담당 부서는 어디인가?",
"criteria": {
"billing": "결제, 청구서 및 환불",
"technical": "시스템 장애, 버그 및 연동",
"other": "기타 일반 문의"
}
},
"refund": {
"type": "noul",
"instructions": "고객이 명시적으로 환불을 요청하고 있는가?"
},
"urgency": {
"type": "score",
"instructions": "이 티켓의 긴급도는 어느 수준인가?",
"criteria": ["일반", "주의", "긴급"]
}
}
}'
지원되는 질문 타입은 다지선다형(choice), 예/아니오 불리언 판정(noul), 다단계 척도 평가(score) 등 3가지이며, 단일 요청에서 최대 64개의 질문을 한 번에 평가할 수 있습니다.
실무 적용 시나리오와 도입 시 고려사항
로컬 Ollama 인프라에 Clef를 도입하면 클라우드 API 호출 비용과 외부 데이터 유출 우려 없이 다양한 엔지니어링 파이프라인을 자동화할 수 있습니다.
- 고객 지원 티켓 자동 분류 및 라우팅: 긴급 문의 여부와 적합한 담당 부서를 수십 밀리초 내에 확정하여 상담원 배정을 무인 자동화합니다.
- AI 에이전트 도구 실행 게이트웨이(Guardrails): 에이전트가 위험한 셸 명령어 실행이나 DB 쓰기 작업을 수행하기 직전, 안전 정책 준수 여부를 사전 검증하는 핫패스 게이트로 활용합니다.
- 민감 데이터 로컬 사전 필터링: 화면 캡처나 사용자 세션 로그가 검색 엔진이나 클라우드 저장소로 인덱싱되기 전, 개인정보 포함 여부를 온디바이스에서 즉각 분류합니다.
도입 시 주의점:
- 런타임 버전 요구사항: Clef 구동을 위해 반드시 Ollama 0.35.1 이상 최신 버전을 설치해야 합니다.
- 클라이언트 라이브러리 상태: 현재 Ollama CLI 인터랙티브 대화 모드나 Python/JS 공식 클라이언트 SDK에는 의사결정 엔드포인트가 통합되지 않았으므로, 직접 HTTP API(
curl/fetch)를 호출하거나 TypeSafe SDK를 연동해야 합니다. - 용도 구분: Clef는 자유로운 대화나 창작 글쓰기를 위한 모델이 아니므로 일반 챗봇 용도로는 작동하지 않으며, 분류 및 라우팅 전용 결정 엔진으로만 운용해야 합니다.
출처
- Ollama 공식 라이브러리: Ollama Clef Model Registry
- Ollama 공식 라이브러리: Ollama Clef-Flash Model Registry
- Ollama 공식 X (@ollama): 2026-10-03 Clef & Clef Flash Release Announcement
- Cloudflare 공식 블로그: Introducing Clef: our open-source decision models
- Hugging Face 저장소: Cloudflare/clef