구글 Antigravity SDK, LiteRT 엔진 기반 'Gemma 4' 로컬 오프라인 실행 공식 지원
구글이 Antigravity SDK에 Google AI Edge의 LiteRT 엔진을 접목하여 Gemma 4 26B A4B 오픈 모델을 완전한 오프라인 환경에서 API 비용 없이 구동하는 로컬 에이전트 지원을 발표했습니다.
구글의 Sachin Kotwani 그룹 프로덕트 매니저(GPM)와 Taylor Mullen 수석 엔지니어(Principal Engineer)는 2026년 9월 23일 공식 개발자 블로그를 통해 코딩 에이전트 프레임워크인 Antigravity SDK에 로컬 AI 모델 실행 워크플로우를 공식 지원한다고 발표했습니다. 이번 릴리즈는 Google AI Edge의 경량 고성능 온디바이스 추론 엔진인 LiteRT(LiteRT-LM)를 백엔드로 채택하여, 최신 오픈 가중치 모델인 Gemma 4 26B A4B를 외부 네트워크 연결이나 API 토큰 과금 없이 개발자의 로컬 워크스테이션에서 직접 구동할 수 있도록 지원합니다.

이미지 출처: Google Developers Blog / Google AI Edge
LiteRT 기반 온디바이스 런타임과 두 가지 에이전트 설정 모드
새롭게 공개된 Antigravity SDK는 로컬 모델 환경을 손쉽게 구성할 수 있도록 두 가지 주요 설정 인터페이스를 제공합니다. 첫 번째는 구글의 온디바이스 런타임과 직결되는 LiteRTAgentConfig이며, 두 번째는 서드파티 호환 서버를 위한 LocalOpenAIAgentConfig입니다.
- LiteRTAgentConfig:
.litertlm형식의 패키징된 모델 체크포인트를 디바이스 상에서 직접 구동합니다. 내부적으로 로컬 루프백 관리 서버를 자동 기동하며, 애플 실리콘의 Metal 및 엔비디아 CUDA 기반 GPU 가속, NPU, CPU 백엔드를 자동으로 판별해 최적의 연산 경로를 설정합니다. 특히 리소스 제약이 있는 온디바이스 환경을 위해.lightweight()프리셋이 함께 적용됩니다. 이 프리셋은 빌트인 도구를 핵심 코딩 작업으로 제한하고, 소형 컨텍스트 윈도우에 맞추어 시스템 프롬프트를 경량화하며, 64k 크기의 LiteRT KV 캐시 한도에 맞춰 컨텍스트 압축(compaction) 임계치를 자동으로 구성합니다. - LocalOpenAIAgentConfig: Ollama, LM Studio, vLLM 등 로컬 머신에서 이미 가동 중인 OpenAI 호환 엔드포인트에 Antigravity 에이전트를 연결할 수 있도록 유연한 브릿지를 제공합니다.
Gemma 4 26B A4B 체크포인트 배포 및 CLI 워크플로우
Antigravity 팀이 권장하는 기본 로컬 모델은 Google DeepMind의 기술을 계승한 Gemma 4 26B A4B 인스트럭트 모델입니다. 개발자는 Google AI Edge의 CLI 도구인 litert-lm을 사용하여 허깅페이스 허브로부터 모델 가중치를 다운로드하고 로컬 체크포인트로 즉시 임포트할 수 있습니다.
litert-lm import \
--from-huggingface-repo=litert-community/gemma-4-26B-A4B-it-litert-lm \
gemma-4-26B-A4B-it-gpu.litertlm \
gemma4-26b
해당 임포트 명령어는 약 16.8GB 용량의 최적화 가중치를 받아와 ~/.litert-lm/models/gemma4-26b/model.litertlm 경로에 등록합니다. 등록이 완료된 체크포인트는 SDK 코드 내에서 model_path 매개변수에 지정하여 즉시 에이전트 루프에 투입할 수 있으며, 독립 실행형 명령줄 도구인 litert-lm run을 통해서도 투기적 디코딩(speculative decoding) 및 멀티모달 추론 성능을 사전에 점검할 수 있습니다. 리눅스, macOS, 윈도우(WSL) 등 주요 데스크톱 환경을 모두 지원합니다.
오프라인 보안성과 하드웨어 요구 사양 및 실무 제약
로컬 에이전트 파이프라인 도입의 가장 큰 장점은 완전한 오프라인 환경 구축과 민감 코드 유출 방지입니다. 에이전트의 프롬프트, 소스 코드 파싱 결과, 도구 호출 파라미터가 외부 상용 클라우드 API로 전송되지 않으므로, 엄격한 규제 준수가 요구되는 엔터프라이즈 환경이나 망분리 연구 개발망에서도 제약 없이 코딩 지원 에이전트를 가동할 수 있습니다.
다만 프로덕션 환경 투입 전 고려해야 할 하드웨어 제약도 명확히 제시되었습니다. 26B 파라미터 규모의 Gemma 4 모델을 안정적으로 구동하기 위해서는 최소 24GB 이상의 GPU VRAM 또는 통합 메모리(Unified Memory)가 권장됩니다. 또한 클라우드 프런티어 모델 대비 컨텍스트 윈도우 용량(LiteRT KV 캐시 64k)과 복합 멀티스텝 추론 역량에 하드웨어적 한계가 존재하므로, 일상적인 코드 생성과 단위 작업은 로컬 에이전트가 처리하고 대규모 아키텍처 리팩토링은 필요 시 클라우드 모델로 전환하는 하이브리드 워크플로우 구성이 권장됩니다.