Ollama Cloud, DeepSeek-V4.1-Flash 전면 배포: 미국·유럽 호스팅 및 제로 데이터 보존 제공
Ollama Cloud에 DeepSeek-V4.1-Flash가 공식 배포되었습니다. 미국·유럽 리전 분산 호스팅, 데이터 비저장(Zero Data Retention), DeepSeek 공식 API와 동일한 토큰당 요금(오프피크 할인 포함) 및 무료 종량제 지원의 핵심 내용을 정리합니다.
2026년 9월 11일, 오픈소스 LLM 실행 프레임워크인 Ollama가 공식 X 계정(@ollama)을 통해 DeepSeek의 최신 멀티모달 플래그십 경량 모델인 'DeepSeek-V4.1-Flash'를 자사 클라우드 인프라인 Ollama Cloud에 전면 배포(fully rolled out) 완료했다고 발표했습니다. 이번 릴리즈로 개발자들은 고사양 로컬 워크스테이션 구축 없이도 Ollama Cloud 환경에서 대규모 MoE 모델을 즉시 호출할 수 있게 되었습니다.

이미지 출처: @ollama (X) / Ollama Library
이번 배포는 단순한 신규 모델 추가에 그치지 않고, 기업 및 개발 조직의 데이터 보안 요구를 반영한 제로 데이터 보존(Zero Data Retention) 정책, 미국과 유럽에 걸친 분산 리전 호스팅, 그리고 DeepSeek 공식 API와 완전히 동일한 토큰당 과금 체계 및 50% 오프피크 할인까지 함께 적용된 것이 특징입니다.
미국·유럽 멀티 리전 분산 호스팅과 제로 데이터 보존(Zero Data Retention)
클라우드 기반 인공지능 API를 프로덕션 환경에 도입할 때 조직이 직면하는 가장 큰 진입 장벽은 데이터 프라이버시와 네트워크 지연 시간 문제입니다. Ollama Cloud는 이러한 규제 및 운영 상의 고민을 완화하기 위해 인프라와 보안 정책을 대폭 강화했습니다.
- 미국(US) 및 유럽(Europe) 리전 분산 호스팅: 지리적으로 분산된 데이터센터에 인프라를 배치하여 북미와 유럽 사용자 모두에게 지연 시간을 최소화한 안정적인 API 처리 파이프라인을 제공합니다.
- 철저한 제로 데이터 보존(Zero Data Retention) 정책: 사용자가 전송한 프롬프트 입력과 모델이 생성한 응답 텍스트를 서버에 일체 로깅하거나 저장하지 않습니다. 나아가 해당 입출력 데이터가 향후 AI 모델 재학습이나 평가 데이터셋 구축에 절대 활용되지 않도록 보장합니다.
그동안 사내 보안 규정이나 민감 정보 유출 우려로 인해 퍼블릭 클라우드 모델 호출을 제한해온 엔터프라이즈 개발 환경에서도 높은 신뢰도를 바탕으로 모델을 연동할 수 있는 기반이 마련되었습니다.
552B MoE 아키텍처와 1M 컨텍스트 멀티모달 사양
Ollama Cloud에 배포된 DeepSeek-V4.1-Flash는 대규모 연산 효율을 극대화한 아키텍처를 자랑합니다. 552B 총 매개변수 규모의 희소 혼합 전문가(MoE, Mixture of Experts) 방식을 채택하여 고품질 추론 역량과 빠른 응답 속도를 균형 있게 구현했습니다.
- 최대 100만(1M) 토큰 컨텍스트 지원: 방대한 기술 문서, 대규모 코드베이스 전체, 장편 서적에 이르는 방대한 문맥을 단일 세션에서 손실 없이 처리할 수 있는 초장문 컨텍스트 윈도우를 기본 지원합니다.
- 네이티브 시각 이해(Vision) 기능 탑재: 텍스트 분석에 국한되지 않고 다이어그램, 도표, UI 화면 캡처, 복잡한 이미지 데이터를 직접 해석하고 추론할 수 있는 멀티모달 능력을 제공합니다.
- DeepSeek-V4-Pro 대비 향상된 속도와 효율: 공식 성능 지표에 따르면 V4.1-Flash는 기존 DeepSeek-V4-Pro를 능가하는 추론 처리 속도와 비용 효율성을 달성했습니다.
다만 본 모델은 로컬 하드웨어에서 가중치를 내려받아 오프라인으로 실행하는 기존 방식이 아닌, Ollama Cloud 기반 클라우드 추론 방식(deepseek-v4.1-flash:cloud)으로 서비스됩니다. 따라서 모델 호출 시 안정적인 인터넷 연결과 유효한 Ollama 계정 인증이 필수적으로 요구됩니다.
DeepSeek 공식 API 요금 일치: 오프피크 50% 할인과 종량제 지원
Ollama Cloud는 서드파티 호스팅 서비스에서 흔히 발생하는 중개 수수료나 추가 마진을 배제하고 매우 공격적인 가격 정책을 채택했습니다.
- 공식 API 동일 요금(Price Parity): DeepSeek 공식 API와 완벽하게 일치하는 토큰당 과금(per-token pricing)이 적용되어, 개발자는 별도의 프리미엄 비용 없이 친숙한 Ollama 인터페이스를 통해 모델을 호출할 수 있습니다.
- 오프피크(Off-Peak) 50% 할인 연동: 시간대별 트래픽 분산을 위해 DeepSeek 공식 정책과 동일한 오프피크 요금제가 그대로 적용됩니다. 피크 시간 대비 50% 할인된 요금으로 대량 추론을 수행할 수 있습니다.
- 무료 계정 종량제(Pay-as-you-go) 지원: 복잡한 최소 결제 조건이나 월정액 약정 없이 무료 계정 사용자도 신용카드를 등록해 쓴 만큼만 결제하는 종량제 방식으로 즉시 사용할 수 있으며, 기존 Ollama Pro, Max, Team 구독 플랜 사용자에게도 기본 접근 권한이 제공됩니다.
사용자는 배치 작업이나 데이터 파이프라인 구축 시 피크 시간과 오프피크 시간대의 요금 차등을 사전에 파악하여, 스케줄링을 통해 전체 추론 비용을 최대 50%까지 절감하는 실전 전략을 수립할 수 있습니다.
출처
- Ollama 공식 라이브러리: Ollama Library - DeepSeek-V4.1-Flash
- Ollama 공식 X (@ollama): DeepSeek-V4.1-Flash Ollama Cloud 전면 배포 공지