2GB RAM으로 스마트폰과 노트북에서 오프라인 에이전트를 구동하는 소형 오픈소스 모델 'MiniCPM5-2B'

OpenBMB와 칭화대, 모델베스트가 약 2.52B 파라미터 규모의 온디바이스 특화 오픈소스 언어 모델 MiniCPM5-2B를 공개했습니다. 2GB 수준의 RAM 환경과 최대 128K 컨텍스트를 지원하여 스마트폰과 노트북에서 완전 오프라인으로 코딩 및 도구 호출 에이전트를 구동할 수 있

tau · 2026년 9월 10일

#MiniCPM #OpenBMB #온디바이스AI #에이전트 #오픈소스LLM #개발도구

2GB RAM으로 스마트폰과 노트북에서 오프라인 에이전트를 구동하는 소형 오픈소스 모델 'MiniCPM5-2B'

OpenBMB와 칭화대학교, 모델베스트(ModelBest/面壁智能)가 공동 개발한 약 2.52B 파라미터 규모의 온디바이스 특화 오픈소스 언어 모델 'MiniCPM5-2B'가 공개되었습니다. 일반적인 엣지 디바이스 환경인 2GB 수준의 RAM에서도 구동 가능하도록 설계된 소형 모델로, 고성능 클라우드 GPU나 상시 인터넷 연결 없이도 로컬 기기에서 독립적인 자율 에이전트 워크플로우를 처리할 수 있는 오픈소스 개발 도구입니다.

에이전트, 도구 호출, 코딩, 롱 컨텍스트 등 도메인별 MiniCPM5-2B 성능 비교 레이더 차트

이미지 출처: OpenBMB / Tsinghua University / ModelBest

소형 언어 모델(SLM)이 경량 디바이스 환경으로 빠르게 침투하는 흐름 속에서, MiniCPM5-2B는 단순 텍스트 질의응답을 넘어 코딩, 구조화된 툴 유즈(Tool Use), 자율 에이전트(Hermes agent 등) 작업을 오프라인 엔드포인트에서 직접 실행하도록 최적화되었습니다.

2GB RAM 구동 환경과 최대 128K 컨텍스트 네이티브 지원

MiniCPM5-2B의 핵심 아키텍처 강점은 극도로 제한된 하드웨어 리소스에서도 장문 컨텍스트 처리와 에이전트 동작이 가능하다는 점입니다.

  • 온디바이스 2GB RAM 최적화: 스마트폰이나 저전력 노트북 등 메모리 자원이 한정된 모바일 및 엣지 환경에서 구동할 수 있어, 네트워크 단절 상태에서도 디바이스 내부에서 데이터를 처리하는 완전 오프라인 환경을 구현합니다.
  • 최대 약 128K 컨텍스트 지원: 소형 파라미터 체급임에도 네이티브로 최대 128K 토큰에 달하는 긴 컨텍스트 길이를 지원하여, 장문 문서 분석, 다단계 에이전트 추론 기록 보존, 코드베이스 맥락 유지에 유연하게 대응합니다.

또한 vLLM과 Hugging Face 생태계와의 표준 호환성을 갖추고 있어 기존 추론 인프라에 손쉽게 통합할 수 있습니다. vLLM 환경에서는 단 한 줄의 서빙 명령어로 로컬 API 서버를 기동할 수 있습니다:

vllm serve openbmb/MiniCPM5-2B --port 8000

4B 이하 벤치마크 1위 달성과 훈련 리소스 전면 공개

MiniCPM5-2B는 소형 온디바이스 모델의 실효성을 입증하기 위해 객관적 지표와 훈련 인프라 전반을 투명하게 개방했습니다.

Artificial Analysis Intelligence Index v4.1.1 평가에서 점수 23을 기록하며 4B 파라미터 이하 오픈소스 모델 부문 1위에 올랐으며, 총 34개 벤치마크 종합 평가에서 평균 53.9점을 기록했습니다. 이는 파라미터 효율성과 추론 정밀도를 동시에 입증한 결과입니다.

특히 이번 릴리즈는 단순 모델 가중치(Weights) 배포에 그치지 않고, 모델 개발에 투입된 핵심 리소스 생태계를 함께 공개했습니다:

  • Meshy: 강화학습(RL) 파이프라인 프레임워크
  • JustRL II: 온디바이스 추론 및 훈련 스택
  • UltraData-SFT-Agent-2609: 50만 건 규모의 정제된 고품질 에이전트 지도학습(SFT) 데이터셋

훈련 전 과정의 방법론과 데이터셋이 공개됨에 따라, 개발자 및 연구진은 자체 도메인 특화 에이전트로 파인튜닝하거나 온디바이스 워크플로우에 맞춤형으로 재학습시킬 수 있습니다.

실무 적용 범위와 로컬 기기 운용 시 고려사항

MiniCPM5-2B는 엣지 디바이스 기반의 자동화 파이프라인 구축을 희망하는 개발자에게 높은 효용을 제공하지만, 소형 모델 고유의 특성을 고려한 명확한 작업 분담이 필요합니다.

초경량 모델 특성상 방대한 지식을 요구하는 일반 상식 질의나 백과사전식 범용 텍스트 생성보다는, 명확한 스키마가 정의된 툴 호출, JSON 및 구조화 데이터 추출, 단일 워크플로우 자동화 등 경계가 분명한 에이전트 작업에 투입할 때 가장 높은 안정성을 발휘합니다.

또한 실제 스마트폰이나 보급형 노트북 등 저사양 로컬 기기에서 실시간 수준의 반응 속도와 메모리 점유율을 확보하기 위해서는 Q4, Q8 등 적절한 양자화(Quantization) 포맷을 적용하고, 타깃 디바이스에 최적화된 로컬 추론 런타임을 설정하는 작업이 권장됩니다.

원문 출처

  • OpenBMB 공식 GitHub 리포지토리: OpenBMB/MiniCPM — MiniCPM5-2B 모델 아키텍처, 도메인별 벤치마크 레이더 차트 및 온디바이스 최적화 가이드.
  • Paul Couvert (@itsPaulAi) X 기술 분석: MiniCPM5-2B On-Device Agent Overview — 2GB RAM 오프라인 구동 및 에이전트 벤치마크 실무 요약.
  • Hugging Face 모델 허브: openbmb/MiniCPM5-2B — 공식 가중치 배포 및 파라미터 체크포인트.