DS4 엔진 기반 DeepSeek V4 Flash 로컬 구동: 128GB M4 Max 맥에서 284B 온디바이스 실행
살바토레 산필리포의 C·Metal 기반 경량 추론 엔진 DS4를 통해 284B 매개변수(13B 활성) DeepSeek V4 Flash 멀티모달 모델이 128GB M4 Max 맥에서 Q2 양자화 81GB 빌드로 로컬 구동되었습니다.
Redis 제작자 살바토레 산필리포(Salvatore Sanfilippo, antirez)가 개발한 오픈소스 경량 추론 엔진 DS4(DwarfStar)를 통해 총 284B 매개변수를 갖춘 DeepSeek V4 Flash 멀티모달 모델이 128GB 통합 메모리 사양의 Apple Silicon Mac에서 완전히 로컬로 구동되었습니다. 외부 클라우드 API나 무거운 파이썬 런타임 종속성 없이 순수 C와 Apple Metal 가속을 기반으로 온디바이스 비전 처리와 텍스트 추론을 동시에 수행합니다.

이미지 출처: https://github.com/antirez/ds4
DS4 엔진 아키텍처와 C·Metal 기반 네이티브 경량화
DS4(DwarfStar)는 현대 LLM 서빙 프레임워크가 안고 있는 무거운 추상화 레이어를 걷어내기 위해 설계된 경량 네이티브 추론 엔진입니다. Python 런타임은 물론 llama.cpp나 cgo 같은 외부 브릿지 종속성 없이 단일 C 코드베이스와 Apple Metal 셰이더로 직접 구현되었습니다.
개발 환경 구축과 실행 경로 또한 간결합니다. 표준적인 make 명령어로 네이티브 바이너리를 즉시 컴파일할 수 있으며, 실행 시 로컬 애플리케이션 및 코딩 하네스와 즉각 연동 가능한 OpenAI 호환 HTTP API 서버를 자체 제공합니다. 방대한 프레임워크 오버헤드가 배제되어 엔진 자체의 메모리 점유율이 극도로 낮고 프로세스 기동 속도가 빠른 것이 핵심적인 기술적 강점입니다.
DeepSeek V4 Flash의 284B MoE 구조와 실측 벤치마크
DeepSeek V4 Flash는 전체 284B 매개변수 중 토큰당 13B 매개변수만을 활성화하는 Mixture-of-Experts(MoE) 아키텍처를 채택한 프론티어급 오픈 가중치 모델입니다. 압축 희소 어텐션(CSA, Compressed Sparse Attention)과 고압축 어텐션(HCA, Heavily Compressed Attention) 메커니즘을 기반으로 1M 토큰의 기본 컨텍스트 윈도우를 효율적인 메모리 사용량으로 처리합니다.
이 거대 모델을 단일 워크스테이션에서 구동하기 위해 IQ2XXS(Q2) 초고압축 양자화 가중치 빌드가 적용되었습니다. 프로젝터 및 주요 출력 레이어에 선택적 정밀도(AProjQ8, SExpQ8, OutQ8)를 배분한 DeepSeek-V4-Flash-Vision-Exp-IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ8.gguf 빌드의 실제 디스크 및 메모리 적재 크기는 약 81 GiB입니다.
macOS 26.5.2 기반 128GB M4 Max Mac Studio 환경에서 DS4 최신 커밋(110afdd)을 적용해 실측된 Weschera 벤치마크 레시피에 따르면, 복합 추론 단계(Thinking On)에서 약 29.8 tok/s의 일관된 생성 속도를 기록했습니다. 통합 메모리 대역폭을 Metal 커널 레벨에서 효율적으로 활용함으로써 모바일 워크스테이션급 하드웨어에서도 실용적인 인터랙션 속도를 유지합니다.
온디바이스 비전 처리 지원과 하드웨어 제약 사항
이번 구동에서 주목받은 또 다른 요소는 로컬 비전(Vision-Exp) 파이프라인의 온디바이스 처리입니다. 입력 이미지의 인코딩과 프로젝터 연산이 외부 원격 서버로 전송되지 않고 DS4 엔진 내부에서 네이티브로 완결되어, 민감한 로컬 시각 데이터의 프라이버시를 온전히 보호합니다.
다만 이 파이프라인을 실무에 도입하기 전 명확한 하드웨어 및 모델 한계를 고려해야 합니다.
- 최소 128GB 통합 메모리 필수: 81 GiB에 달하는 모델 가중치와 KV 캐시, 작업 버퍼를 온메모리에 적재해야 하므로 128GB 사양의 Mac Studio 또는 M4 Max 맥북 프로가 필수적이며, 16GB~64GB 메모리를 장착한 일반 기기에서는 로딩 자체가 불가능합니다.
- 2비트 양자화에 따른 정밀도 손실: 284B 모델을 81 GiB로 압축하는 과정에서 2비트(IQ2XXS) 양자화가 적용되었기 때문에, 16비트 FP16 원본이나 8비트 FP8 정밀도 대비 미세한 추론 품질 저하가 존재할 수 있습니다.
- 엔진 커밋 호환성: 멀티모달 Vision-Exp 프로젝터 텐서를 정상적으로 매핑하고 Metal 커널에서 가속하려면 최신 DS4 빌드와 전용 GGUF 가중치 구성을 정확히 일치시켜야 합니다.
출처
- antirez/ds4 GitHub 저장소: 살바토레 산필리포가 개발한 C·Metal 기반 경량 오픈소스 추론 엔진 공식 코드베이스 및 모델 카드.
- Weschera Mac Studio 실측 벤치마크 레시피: 128GB M4 Max Mac Studio 환경에서의 DeepSeek V4 Flash 29.8 tok/s 실측 데이터.
- J.Draven (@itsjdraven) 로컬 구동 검증 리포트: 128GB M4 Max 머신에서의 81 GiB Q2 모델 및 온디바이스 비전 처리 실증.
- DeepSeek 공식 V4 프리뷰 릴리스 공지: 284B 총 매개변수 및 13B 활성 매개변수 아키텍처와 1M 컨텍스트 사양 안내.