8GB 미만 RAM에서 CPU·GPU 구동: PrismML 3치 양자화 기반 의사결정 모델 'Bev' 공개
AI 엔지니어 Reza Sayar가 PrismML의 3치 Bonsai 압축을 적용해 8GB 미만 RAM 환경에서 CPU와 GPU로 구동되는 초경량 의사결정 모델 'Bev'를 공개했습니다. 오픈소스 가중치와 코드가 배포됩니다.
AI 엔지니어 레자 사야르(Reza Sayar)가 2026년 9월 23일(현지시간), 8GB 미만(<8GB)의 RAM 환경에서 CPU와 GPU 모두 단독 구동이 가능한 초경량 마이크로 의사결정 모델 'Bev(Bonsai Jev)'를 공식 발표하고 가중치와 실행 코드를 오픈소스로 공개했습니다.
소형 언어 모델의 온디바이스 로컬 배포는 AI 에이전트 시스템과 워크플로우 오케스트레이션에서 핵심 인프라 과제로 꼽혀왔습니다. 이번에 공개된 Bev는 프론티어 압축 기술을 연구하는 프리즘ML(PrismML)의 3치(Ternary) '분재(Bonsai)' 양자화 기법을 마이크로 의사결정 및 라우팅 특화 모델인 제브(Jev) 아키텍처에 접목했습니다. 이를 통해 고가의 서버용 가속기 없이도 일반 소비자용 PC나 보급형 노트북의 제한된 하드웨어 리소스에서 신속한 분류 및 라우팅 판별을 처리할 수 있도록 설계되었습니다.
프리즘ML 3치(Ternary) 분재 압축 기법과 Bev의 아키텍처
Bev 모델의 핵심 기술적 차별점은 프리즘ML 연구진이 주도한 3치 기반의 Bonsai 압축 프레임워크를 기반 모델에 적용했다는 점입니다.
단순 파라미터 프루닝이나 기존의 4비트 정수(INT4) 양자화 방식은 모델의 추론 정확도 손실이 크거나 특정 벤치마크에서 점수 급락이 발생하는 한계가 있었습니다. 반면 프리즘ML의 Bonsai 기법은 가중치를 -1, 0, +1의 3개 상태(Ternary)로 표현하면서 그룹 단위의 FP16 스케일링을 결합하는 방식을 사용합니다. 이를 통해 모델의 전체 구조와 문맥 이해 성능을 최대한 보존하면서도 가중치 파일 용량과 연산 복잡도를 획기적으로 낮춥니다.
실제로 프리즘ML은 앞서 Qwen3.8 27B 모델을 기반으로 독자적인 Ternary Bonsai 파이프라인을 적용해 약 5.9GB 용량의 'Bonsai 2 27B'를 구현한 바 있습니다. 프리즘ML의 발표 및 모델 카드에 따르면, 이는 풀 정밀도 대비 약 9배(9x) 작은 크기이면서도 자체 평가 기준 전체 벤치마크 평균 성능의 98.2%를 유지한 수치였습니다. 레자 사야르는 이와 유사한 고효율 3치 압축 메커니즘을 경량 라우팅 모델에 특화하여 단일 로컬 환경에서 즉각 반응할 수 있는 초경량 의사결정체 Bev를 완성했습니다.
8GB 미만 메모리 점유와 CPU·GPU 로컬 런타임 호환성
Bev의 가장 실질적인 가치는 8GB 미만의 가용 메모리 환경에서 구동된다는 점입니다. 고성능 외장 GPU가 없는 환경에서도 CPU 단독 연산이 가능하며, 통합 GPU나 보급형 그래픽 카드를 탑재한 일반 랩톱에서도 무리 없이 실행됩니다.
기존의 로컬 에이전트 시스템에서는 단순 분류나 도구 호출 여부를 판단하기 위해서도 수 기가바이트에서 수십 기가바이트에 달하는 LLM 가중치를 항상 메모리에 상주시켜야 했습니다. Bev는 이러한 라우팅 잡무를 8GB 미만의 공간에서 독자적으로 전담하여 상위 거대 모델 호출 빈도를 줄이고 전체 시스템 지연 시간을 크게 단축합니다.
다만 실제 현장 배포 시에는 몇 가지 하드웨어 및 런타임 요소를 함께 고려해야 합니다.
- 전용 3치 런타임 지원: 3치 가중치({-1, 0, +1})의 효율적 계산을 온전히 누리기 위해서는 전용 연산 커널이나 최적화된 추론 런타임(수정된 llama.cpp 빌드 등) 지원이 필수적입니다.
- 전체 애플리케이션 메모리 구성: 정적 가중치 외에도 키-값(KV) 캐시 크기, 컨텍스트 윈도우, 런타임 작업 메모리가 추가되므로 실제 운영 체제 및 타 프로세스와의 메모리 경합을 사전에 점검해야 합니다.
- 하드웨어 아키텍처별 대역폭 한계: CPU 단독 구동 시에는 메모리 대역폭 제약으로 인해 GPU 가속 환경에 비해 토큰 생성 속도가 낮아질 수 있으며, 이는 즉시 판별이 요구되는 실시간 라우팅 루프에서 지연 시간으로 나타날 수 있습니다.
사야르는 해당 스레드를 통해 텍스트, 오디오, 이미지, 비디오 입력을 지원하는 Gemma4-12B 기반 멀티모달 모델 'Jev-Omni' 역시 약 8GB VRAM 점유 수준으로 구동되는 GGUF 가중치 체크포인트가 함께 공개되었음을 안내하며 경량화 의사결정 라인업의 확장성을 소개했습니다.
깃허브 및 허깅페이스 오픈소스 배포와 생태계 영향
Bev의 추론 코드와 가중치 파일은 오픈소스 생태계에 전면 공개되었습니다.
실행 스크립트와 레퍼런스 구현체는 깃허브(GitHub: Reza2kn/Bev)를 통해 배포되고 있으며, 사전 학습된 가중치는 허깅페이스(Hugging Face: Reza2kn/Bev) 저장소에서 직접 다운로드할 수 있습니다. 개발자들은 자신의 로컬 파이프라인이나 경량 에이전트 하네스에 즉시 Bev 가중치를 연결해 테스트할 수 있습니다.
초경량 로컬 의사결정 모델의 등장은 에이전트 아키텍처 설계에 중요한 전환점을 제공합니다. 값비싼 클라우드 API 호출에 의존하지 않고도 클라이언트 단말 내부에서 즉각적인 1차 판단, 도구 선택, 컨텍스트 분류를 로컬 모델에 위임함으로써 프라이버시 보호와 인프라 운영 비용 절감을 동시에 달성할 수 있기 때문입니다. 8GB 미만이라는 현실적인 하드웨어 장벽은 향후 개인용 개발 장비나 엣지 디바이스 환경에서 자율 에이전트의 실용성을 한층 넓힐 것으로 기대됩니다.
출처
- Reza Sayar 공식 X (@iamRezaSayar): 2026-09-23 Bev(Bonsai Jev) 공식 릴리즈 발표
- GitHub 공식 저장소: Reza2kn/Bev 소스 코드 및 로컬 구동 가이드
- Hugging Face 모델 허브: Reza2kn/Bev 3치 사전학습 가중치
- Hugging Face 모델 허브: Reza2kn/Jev-Omni-Q4_K_M-GGUF 멀티모달 모델