12GB GPU에서 MiniMax H3 비디오 돌리기: Kijai INT8 VAE로 VRAM 46% 절감 및 최적화 세팅
RTX 5070 12GB 등 중저가 VRAM 환경에서 고용량 MiniMax H3 비디오를 생성할 때, Kijai의 INT8 ConvRot VAE를 적용해 VRAM 소모를 4,965MB에서 2,677MB로 46% 줄이고 화질 손실 없이 15초 더 빠르게 생성하는 실전 세팅 팁.
X(구 트위터)의 AI 크리에이터 Tom𝕎(@Tomw852)가 2026년 9월 17일, 12GB VRAM 그래픽카드(NVIDIA GeForce RTX 5070 12GB) 환경에서 고품질 오픈소스 비디오 모델인 MiniMax H3를 효율적으로 구동할 수 있는 Kijai의 INT8 ConvRot VAE 적용 벤치마크와 실전 ComfyUI 최적화 세팅 노하우를 공유했습니다. 기본 FP16 VAE 대비 VAE 단계의 VRAM 사용량을 46% 절감하고 생성 시간까지 단축한 실증 데이터가 공개되어 중저가 로컬 하드웨어 사용자들의 주목을 받고 있습니다.

이미지 출처: Tom𝕎 (@Tomw852)
RTX 5070 12GB 실측: VAE VRAM 46% 절감과 15초 속도 향상
MiniMax H3는 텍스트, 이미지, 비디오, 오디오를 통합 처리하며 네이티브 스테레오 오디오를 갖춘 2K 해상도 비디오를 최대 15초까지 생성할 수 있는 강력한 오픈소스 파운데이션 모델입니다. 그러나 고품질 비디오를 로컬에서 디코딩하는 과정에서 VAE(변분 오토인코더)가 막대한 비디오 메모리를 점유하기 때문에, 12GB 내외의 VRAM을 탑재한 대중적인 그래픽카드에서는 메모리 부족(OOM) 오류가 빈번하게 발생하는 기술적 장벽이 있었습니다.
Tom𝕎은 자신의 RTX 5070 12GB 시스템에서 15초 분량의 비디오를 생성하며 공식 FP16 VAE와 Kijai의 신규 INT8 ConvRot VAE(minimax_h3_video_vae_int8_convrot.safetensors)를 동일 조건에서 1:1로 비교 테스트하고 시스템 로그를 공개했습니다.
- 공식 FP16 VAE: VRAM 피크 4,965 MB 점유, 총 생성 소요 시간 417.8초
- Kijai INT8 ConvRot VAE: VRAM 피크 2,677 MB 점유, 총 생성 소요 시간 402.9초
측정 결과 INT8 ConvRot VAE를 적용했을 때 VAE 단계에서 약 2,288 MB(약 46%)에 달하는 메모리가 절감되었으며, 전체 렌더링 시간도 약 15초 단축되었습니다. 작성자는 나란히 배치한 비교 영상을 통해 세부 디테일의 시각적 손실이 사실상 전혀 관찰되지 않는 수준이라고 밝혔습니다. 또한 커뮤니티 답글을 통해 "이번 46% 절감 수치는 전체 워크플로우가 아니라 VAE 디코딩 단계에서 4,965 MB가 2,677 MB로 줄어든 것"이라며, VRAM 여유가 빠듯한 12GB 카드에서 안정적인 비디오 생성을 가능하게 하는 결정적인 여유 공간을 확보해 준다고 설명했습니다.
12GB VRAM 실전 파이프라인: INT8 하이브리드 베이스 모델과 LoRA 세팅
Tom𝕎은 12GB GPU 환경에서 메모리 병목을 피하면서 고화질 영상을 안정적으로 뽑아내기 위해 조합한 모델 및 가중치 구성 스택을 함께 공개했습니다. 베이스 모델부터 VAE, 가속 LoRA에 이르는 구체적인 구성은 다음과 같습니다.
- 베이스 모델: DaSiWa MiniMax H3 Hybrid V2 INT8 (Civitai 공유 모델). 풀사이즈 모델 대신 가중치가 경량화된 INT8 버전을 기본 모델로 채택하여 메인 트랜스포머 단계의 VRAM 부담을 1차적으로 줄입니다.
- VAE: Kijai INT8 ConvRot VAE (
minimax_h3_video_vae_int8_convrot.safetensors). Comfy-Org 공식 저장소 및 Kijai 실험 저장소에서 배포 중인 VAE 가중치를 VAE 로더 노드에 연결합니다. - LoRA 가속 및 스타일:
- Turbo V4 Step 600 (강도 1.0): 추론 스텝 수를 획기적으로 줄여 생성 속도를 높이는 가속 LoRA입니다.
- Realism People LoRA (강도 0.8): 인물의 피부 질감과 자연스러운 디테일을 살려주는 스타일 보정 LoRA입니다.
- 선택적 2차 패스 (Optional 2nd Pass): LMS V1.0 R64 LoRA (강도 0.8). 추가적인 퀄리티 보정이 필요한 경우 2차 정제 패스에 적용합니다.
작성자는 공식 문서와 커뮤니티의 오픈소스 노드를 결합하여 직접 구성한 ComfyUI 워크플로우를 기반으로 구동하고 있으며, 이전 포스트의 워크플로우 아키텍처를 토대로 노드 연결을 확장할 수 있다고 덧붙였습니다.
커뮤니티 실증 데이터와 3060 12GB 확장 및 디코딩 트러블슈팅
Kijai의 INT8 ConvRot VAE 공개 이후 오픈소스 커뮤니티에서도 다양한 시스템 사양에서의 벤치마크 결과와 실무 피드백이 잇따르고 있습니다. Hugging Face 토론 스레드에 공개된 디코딩 단독 벤치마크(5초 분량 1344×768 해상도 기준)에 따르면, 기존 FP16 VAE가 19.5초의 디코드 시간과 4.9GB의 파일 크기를 기록한 반면 INT8 ConvRot은 10.0초의 디코드 시간과 3.0GB 파일 크기로 약 1.5배에서 2배에 달하는 디코딩 속도 향상을 입증했습니다. 이때 원본 대비 상대 RMS 오차는 0.97%에 불과해 육안으로는 구별이 불가능한 수준입니다.
하위 사양인 RTX 3060 12GB 환경을 사용하는 이용자들의 실증 사례도 활발히 보고되고 있습니다. 16GB 시스템 RAM과 RTX 3060 12GB 시스템을 사용하는 한 이용자는 "이전에는 0.8MP 해상도가 한계였지만, Kijai INT8 VAE 도입 후 10초 1MP 영상과 15초 0.7MP 영상(최대 3개 이미지 레퍼런스 기반 R2V) 생성이 가능해졌다"고 전했습니다. 또한 8스텝 Turbo LoRA와 신규 VAE를 조합해 864×480 해상도의 5초 영상을 약 4.5분 만에 렌더링하는 등 보급형 12GB 그래픽카드에서도 로컬 비디오 생성의 실용성이 대폭 향상되었습니다.
다만 초기 설정 시 주의해야 할 기술적 주의사항도 존재합니다. 일부 사용자의 경우 VAE 교체 후 프리뷰에서는 영상이 정상 출력되지만 저장된 비디오 파일에서 오디오만 나오고 화면이 검게 나오는(black video) 현상을 겪기도 했습니다. 이는 구버전 노드 호환성이나 파일 링크 오류로 인해 발생할 수 있으므로, Comfy-Org 공식 저장소의 정식 safetensors 링크(minimax_h3_video_vae_int8_convrot.safetensors)를 통해 최신 파일을 다운로드하고 워크플로우의 VAE Decode 노드 연결을 최신 상태로 유지하는 것이 권장됩니다.
원문 출처
- X (구 트위터) @Tomw852 원문 포스트: RTX 5070 12GB MiniMax H3 Kijai INT8 VAE 벤치마크 및 리소스 스레드
- Hugging Face Comfy-Org: MiniMax H3 INT8 ConvRot VAE (minimax_h3_video_vae_int8_convrot.safetensors)
- Civitai: DaSiWa MiniMax H3 Hybrid V2 INT8 베이스 모델
- Hugging Face drbaph: MiniMax H3 Turbo LoRA ComfyUI