Edge0: 35B 모델을 1~2.5GB 메모리로 온디바이스 구동하는 오픈소스 프레임워크
클라우드나 데스크톱 GPU 없이 Apple Silicon 기기에서 피크 메모리 1~2.5GB 수준으로 35B 매개변수 모델을 구동할 수 있도록 설계된 오픈소스 온디바이스 AI 프레임워크 Edge0을 살펴봅니다.
원격 클라우드 인프라나 대규모 데스크톱 GPU 클러스터에 의존하지 않고 로컬 기기 자체에서 대형 언어 모델(LLM)을 직접 실행하려는 온디바이스 AI 분야에 주목할 만한 오픈소스 도구가 등장했습니다. 개발팀(Samuel Zeng / Edge0)은 최대 35B 매개변수 규모의 모델을 불과 1~2.5GB의 피크 메모리(Peak Memory) 환경에서 추론할 수 있도록 지원하는 프레임워크인 'Edge0'을 공식 GitHub 리포지토리를 통해 오픈소스로 공개했습니다.

이미지 출처: Tony Simons (@tonysimons_) via X
대다수 개발자와 연구자들에게 30B 이상의 대규모 모델은 수십 기가바이트(GB) 이상의 VRAM이나 통합 메모리를 요구하는 무거운 워크로드로 인식되어 왔습니다. Edge0은 이러한 하드웨어 장벽을 극복하고, 클라우드 API 호출 비용 부담과 민감한 데이터의 외부 유출 우려를 원천적으로 차단하며 제한된 하드웨어 자원을 갖춘 로컬 환경에서도 대형 모델을 실행할 수 있도록 설계되었습니다.
35B 모델을 1~2.5GB 메모리로 구동하는 경량화 구조
Edge0 프레임워크가 제시하는 가장 핵심적인 기술적 성과는 35B 매개변수 모델을 피크 메모리 1~2.5GB 범위 내에서 안정적으로 구동한다는 점입니다.
통상적으로 FP16 또는 8비트/4비트 양자화 모델조차 30B급 규모에서는 수십 GB의 메모리 상주 용량을 필요로 합니다. Edge0은 전체 가중치를 시스템 메모리에 한꺼번에 적재하는 전통적인 방식 대신, 극단적인 메모리 절약을 목표로 하는 경량화 및 메모리 스트리밍 파이프라인을 지향합니다.
- 극소 메모리 상주 파이프라인: 35B 모델의 연산 과정에서 시스템 전체 피크 메모리 사용량을 1~2.5GB 수준으로 억제하여, 여유 메모리가 적은 기기에서도 메모리 부족(OOM) 오류 없이 프로세스를 유지할 수 있도록 돕습니다.
- 데이터 주권 및 비용 절감: 고가의 상용 클라우드 추론 API나 원격 서버 유지 비용 없이 로컬 디바이스 내부에서 연산이 완결되므로, 네트워크 단절 환경에서도 동작하며 데이터 프라이버시를 안전하게 보호합니다.
이러한 메모리 경량화 접근법은 클라우드 종속성을 낮추고 개인화된 로컬 인텔리전스를 구축하려는 개발자들에게 실질적인 대안을 제시합니다.
Apple Silicon과 MLX 백엔드 기반 실행 환경
Edge0의 현재 공개 릴리스는 Apple Silicon 생태계를 1차 타깃으로 삼아 아키텍처가 구성되어 있습니다.
공식 GitHub 리포지토리(Edge0-AI/edge0)에 따르면, Edge0은 Apple의 머신러닝 프레임워크인 MLX 백엔드를 기본적으로 지원합니다. 이를 통해 M1, M2, M3, M4 프로세서가 탑재된 Mac 기기에서 고유의 통합 메모리(Unified Memory) 구조를 활용해 온디바이스 추론을 수행합니다.
- macOS 및 MLX 환경 지원: Apple Silicon에 최적화된 연산 백엔드를 활용하여 통합 메모리 환경에서 모델 가중치를 효율적으로 다루며 로컬 추론을 구동합니다.
- 로컬 개발자 접근성: 고가의 외장 GPU 랙을 구축하지 않고도 Apple Silicon 기반의 개인용 Mac 환경에서 대규모 모델의 로컬 추론 및 파이프라인 테스트를 진행할 수 있습니다.
소셜 발표 및 시연 영상에서는 스마트폰(iPhone)을 포함한 모바일 기기에서의 온디바이스 구동 데모가 함께 소개되어 큰 관심을 모았으나, 현재 공개된 소스코드 상에서는 macOS 환경의 MLX 백엔드가 우선적으로 명시되어 있습니다.
실무 적용 시 고려해야 할 성능 트레이드오프와 주의점
Edge0을 실제 개발 프로젝트나 연구 워크플로우에 도입하기 전, 아키텍처 특성에서 비롯되는 기술적 제약 사항들을 명확히 이해해야 합니다.
- 추론 속도(TPS) 및 응답 지연 시간: 35B 모델을 1~2.5GB라는 극소 메모리로 구동하기 위해서는 레이어 단위의 가중치 스트리밍이나 고강도 양자화, 메모리 스왑 기법이 필수적으로 수반됩니다. 따라서 가중치 전체가 메모리에 상주하는 고성능 GPU 환경과 비교할 때 토큰 생성 속도(Tokens Per Second)가 상대적으로 낮고 응답 지연 시간이 길어질 수 있습니다.
- 플랫폼 지원 범위: 현재 시점의 공식 릴리스는 Apple Silicon macOS(MLX) 환경을 우선 지원하며, x86_64 아키텍처 기반의 Linux, Windows, 또는 Android 환경은 아직 공식 지원 대상에 포함되어 있지 않습니다.
- 모바일 배포 준비도: 소셜 데모에서 소개된 iOS 기반 모바일 구동을 프로덕션 환경에 적용하기 위해서는 추후 공개될 후속 코드베이스와 추가 빌드 설정 절차에 대한 지속적인 모니터링이 요구됩니다.
Edge0은 제한된 하드웨어 리소스 환경에서 대형 언어 모델의 로컬 실행 가능성을 대폭 확장한 도구로서, 경량 온디바이스 AI 파이프라인의 발전 방향을 보여주는 의미 있는 오픈소스 프로젝트입니다.
출처
- GitHub 리포지토리: Edge0-AI/edge0 — 35B 모델 온디바이스 추론을 위한 Edge0 공식 오픈소스 리포지토리
- 소셜 발표 소스: Tony Simons (@tonysimons_) via X — Edge0 온디바이스 구동 발표 및 35B 모델 1~2.5GB 메모리 데모 소개