ComfyUI용 MiniMax H3 2패스 잠재 업스케일 워크플로 v2.0: RTX 5090서 7초 비디오 60초 컷
MiniMax H3 기반 비디오 생성을 위한 2패스 잠재 업스케일 워크플로 v2.0이 Civitai에 공개되었습니다. RTX 5090에서 1MP 7초 비디오를 60초 만에 렌더링하는 세팅과 구조를 살펴봅니다.
오픈웨이트 비디오 생성 파운데이션 모델인 MiniMax H3를 ComfyUI 환경에서 고속 렌더링할 수 있도록 설계된 신규 워크플로 'Minimax H3 - Refmod + Reference - 2 Pass Latent Upscale Workflow' v2.0이 AI 크리에이터 R@aiaicreate(@aiaicreate)를 통해 글로벌 모델 공유 플랫폼 Civitai에 공개되었습니다.

이미지 출처: X @aiaicreate / Civitai
이번에 공개된 워크플로는 차세대 플래그십 그래픽카드인 NVIDIA GeForce RTX 5090 환경에서 1메가픽셀(1MP, 약 1376×768 해상도 기준) 규격의 7초 분량 비디오를 약 60초 만에 생성해내는 실측 처리 속도를 입증하며 로컬 AI 영상 제작 커뮤니티의 큰 주목을 받고 있습니다.
2단계 잠재 업스케일(2-Pass Latent Upscale)의 원리와 v2.0 개선점
일반적인 AI 비디오 생성 워크플로에서 고해상도 결과물을 얻기 위해 사용하는 전통적인 방식은 저해상도 프레임을 먼저 픽셀 이미지로 VAE 디코딩한 뒤, 다시 VAE 인코딩을 거쳐 업스케일러를 통과시키는 복잡한 왕복(Round-trip) 연산을 수반합니다. 이 과정에서 상당한 VRAM 대역폭과 연산 시간이 소모될 뿐만 아니라, 프레임 경계면에서 디테일 왜곡이나 레퍼런스 원본과의 시각적 일관성 저하가 빈번하게 발생합니다.
R@aiaicreate가 공개한 2단계 잠재 업스케일 파이프라인은 이러한 구조적 병목을 해결하기 위해 잠재 공간(Latent Space) 내에서 직접 해상도를 확장하는 전용 잠재 업스케일러 방식을 채택했습니다.
- 1단계 기본 패스(Base Generation): 입력된 참조 이미지(Reference image)와 참조 전용 모델(Refmod)을 바탕으로 목표 영상의 구도, 카메라 무빙, 캐릭터 특징을 저해상도 잠재 상태에서 빠르게 포착합니다.
- 2단계 잠재 업스케일(Latent Upscale Pass): 무거운 VAE 픽셀 변환 왕복을 거치지 않고 잠재 텐서 상태에서 직접 고해상도로 스케일업을 수행하여 1MP 수준의 정밀한 디테일을 부여합니다.
- v2.0 릴리즈의 핵심 변경점: 제작자는 배포 노트를 통해 "가장 빠른 워크플로(Fastest possible workflow)이며, 이전 버전 대비 레퍼런스와의 일관성(better consistency with reference)을 크게 강화했다"고 밝혔습니다.
RTX 5090 실측 벤치마크와 렌더링 효율성
최신 생성형 비디오 모델들은 고용량 파라미터와 시간축(Temporal) 어텐션 연산 특성상 단 몇 초의 클립을 렌더링하는 데에도 수 분에서 수십 분이 소요되는 경우가 흔합니다. 특히 로컬 워크스테이션에서 1080p나 1MP 이상의 해상도로 비디오를 직접 생성하는 작업은 연산 비용 부담이 큽니다.
이번 워크플로는 하드웨어 리소스를 극대화하여 다음과 같은 실측 벤치마크를 기록했습니다.
- 하드웨어 사양: NVIDIA GeForce RTX 5090 환경
- 출력 해상도 및 규격: 1MP (1376×768, 가로형 16:9 규격) / 7초 재생 클립
- 총 렌더링 소요 시간: 약 60초 (1분 안팎)
- 생성 파이프라인 특징: 레퍼런스 기반 비디오(Reference-to-Video, R2V) 모드에서 인물 및 사물의 시각적 정체성을 안정적으로 유지하면서 고속 추론 달성
기존 20~24GB VRAM 환경에서 고해상도 긴 비디오를 생성할 때 발생하던 속도 저하를 잠재 업스케일러의 연산 절감 효과와 RTX 5090의 연산 유닛 확장을 통해 1분 수준으로 단축함으로써, 여러 차례 프롬프트와 파라미터를 변경하며 테스트해야 하는 프로덕션 워크플로의 반복 주기(Iteration cycle)를 비약적으로 개선했습니다.
ComfyUI 노드 세팅 및 실전 적용 시 주의점
Civitai에서 해당 워크플로를 다운로드하여 로컬 ComfyUI 환경에 구축할 때 원활한 구동을 위해 사전에 점검해야 할 기술적 주의사항들이 존재합니다.
- 커스텀 노드 종속성 점검: 복합 파이프라인 특성상 H3 모델 전용 노드 및 잠재 업스케일러 노드가 정상 설치되어 있어야 합니다. 배포 직후 커뮤니티에서는 특정 시퀀스 업스케일러(
NvidiaDLSSImageSequenceUpscale등) 노드 인식 여부에 대한 문의가 제기되기도 했으므로, ComfyUI-Manager의 'Missing Nodes' 기능을 활용해 누락된 커스텀 패키지를 반드시 선행 설치해야 합니다. - 전용 잠재 업스케일러 가중치 모델 배치: 잠재 비디오 업스케일을 정상 처리하기 위해서는 H3 전용 업스케일러 모델(
h3_clean_latent_upscaler_film_epoch200.safetensors등)이 올바른 모델 디렉토리(예:ComfyUI/models/h3_latent_upscaler또는 설정된 모델 경로)에 위치해야 합니다. - VRAM 및 해상도 분기 관리: RTX 5090이 아닌 이전 세대 GPU(RTX 4090, 24GB VRAM 환경 등)에서 구동할 경우, 1단계 기본 해상도와 2단계 업스케일 비율을 시스템 가용 메모리에 맞게 단계적으로 조정하여 VRAM 부족(Out of Memory) 현상을 방지해야 합니다.
원문 출처
- Civitai 모델 배포 페이지: Minimax H3 - Refmod + Reference - 2 Pass Latent Upscale Workflow v2.0
- R@aiaicreate 공식 X (@aiaicreate): MiniMax H3 2 Pass Latent Upscale Workflow v2.0 배포 안내