MiniMax H3와 DepthAnything으로 3D 영상을 선화 애니메이션으로 변환하는 실전 파이프라인

GPT-6 Astra와 BlenderMCP로 제작한 3D 스팀펑크 영상을 ComfyUI DepthAnything, GPT Image 2.5, MiniMax H3와 결합해 선화 애니메이션으로 전환한 실전 워크플로우와 참조 이미지 드리프트 제어 팁을 정리합니다.

tau · 2026년 9월 10일

#MiniMaxH3 #DepthAnything #ComfyUI #BlenderMCP #GPTImage2.5 #영상AI #선화애니메이션 #제작팁

MiniMax H3와 DepthAnything으로 3D 영상을 선화 애니메이션으로 변환하는 실전 파이프라인

3D CG 렌더링 영상을 2D 셀 애니메이션이나 손그림 선화 스타일로 변환하려는 시도는 생성형 비디오 모델 등장 이후 꾸준히 이어져 왔으나, 기존 3D 특유의 질감과 모델링 폴리곤 느낌이 그대로 남는 문제가 빈번했습니다. AI 콘텐츠 개발자 신 키요시(@kiyoshi_shin)는 GPT-6 Astra와 BlenderMCP를 활용해 구축한 스팀펑크풍 3D 도시 영상을 시작점으로 삼아, ComfyUI DepthAnything, GPT Image 2.5, MiniMax H3를 단계별로 유기적으로 결합하여 완성도 높은 2D 선화 애니메이션으로 재해석하는 실전 파이프라인을 공개했습니다.

MiniMax H3와 DepthAnything을 활용한 3D 스팀펑크 도시 영상의 선화 애니메이션 변환 화면

이미지 출처: 新清士@AIコンテンツ開発者 (@kiyoshi_shin) on X

3D 원본의 한계 극복: Depth 비디오 전처리 필수화

단순히 3D 렌더링 비디오 파일과 스타일 참조 이미지를 MiniMax H3(Hailuo)에 직접 투입하면 원하는 수준의 2D 화풍 변환이 이루어지지 않습니다. 초기 실험 결과, 3D 원본 영상을 그대로 입력할 경우 비디오 생성 모델이 3D 모델의 입체 음영과 텍스처를 우선 보존하려 하므로 2D 선화 스타일이 덧씌워지지 않고 3D 질감이 고스란히 노출되는 실패로 귀결되었습니다.

이를 해결하기 위해 15초 분량의 원본 3D 영상 전체를 ComfyUI 환경에서 DepthAnything 모델을 통해 심도 비디오로 전처리하는 단계를 적용했습니다. 표면 텍스처와 음영을 완전히 제거하고 순수한 기하학적 깊이 정보(Depth Map)만 남긴 흑백 심도 영상을 비디오 제어 신호로 활용함으로써, 비디오 모델이 기존 3D 셰이더의 질감에 얽매이지 않고 새로운 2D 드로잉 스타일을 자연스럽게 렌더링할 수 있는 기반을 마련했습니다.

참조 이미지 수량 최적화와 프레임 드리프트 방지

스타일 전이를 위한 참조 이미지 구성에서도 실전적인 시행착오와 최적화 공식이 도출되었습니다. 원본 영상의 구도와 분위기를 정확히 이식하기 위해 원본 3D 비디오에서 핵심 전환점이 되는 스크린샷 3장을 추출한 뒤, 이를 GPT Image 2.5를 통해 독창적인 콘셉트 아트 선화 스타일 이미지로 사전 변환했습니다.

이후 비디오 생성 시 참조 이미지 수량을 6장으로 늘려 투입한 실험에서는 장면 전개 도중 프레임 간 스타일 왜곡과 깜빡임, 형태가 무너지는 드리프트(Drift) 현상이 뚜렷하게 관찰되었습니다. 다량의 참조 이미지가 서로 상충하는 스타일 가이드를 모델에 제공하기 때문입니다. 최종적으로 참조 이미지를 핵심 구도 3장 내외로 타이트하게 제한하고, 나머지 세부 묘사와 프레임 간 보간은 비디오 생성 AI의 자율적인 추론에 맡기는 방식이 장면 전체의 시각적 일관성을 가장 안정적으로 유지하는 것으로 확인되었습니다.

Claude Astra 기반 통합 프롬프트 오케스트레이션

이번 파이프라인의 전 과정은 Claude(Astra) 환경에서 오케스트레이션되었습니다. 3D 스팀펑크 도시의 기본 에셋을 BlenderMCP로 빌드하는 단계부터, 각 파이프라인 모듈 간 데이터 규격 조율, Hailuo 사이트에 입력할 정밀한 카메라 무빙 및 선화 스타일 묘사 프롬프트 작성, 메이킹 파트 문서화에 이르기까지 모든 제어 지침이 LLM 내부에서 유기적으로 조율되었습니다.

3D 공간의 구조적 안정성을 Blender와 DepthAnything으로 확보하고, 화풍의 예술적 방향성을 GPT Image 2.5로 고정한 뒤, 시간축 일관성을 MiniMax H3의 비디오 추론에 위임하는 분업 구조는 향후 3D 기반 애니메이션 제작 파이프라인의 실무적 표준으로 주목받고 있습니다.

출처