TAU-HOME.COM
LOADING

숏폼 드라마와 광고 영상을 한곳에서 제작하는 로컬 오픈소스 AI 스튜디오 'AI Art Engine'

에셋 관리, 스토리보드 분경, 노드 그래프 생성부터 내장 MCP 서버를 통한 Claude Code 연동까지 한 번에 처리하는 로컬 우선 오픈소스 AI 제작 데스크톱 툴 'AI Art Engine'을 소개합니다. 텍스트·이미지·영상·3D 노드를 연결해 숏폼 드라마 및 광고 파이프라인을 자

tau · 2026년 10월 5일

#AIArtEngine #AI영상제작 #숏폼드라마 #MCP #ClaudeCode #노드그래프 #오픈소스

숏폼 드라마와 광고 영상을 한곳에서 제작하는 로컬 오픈소스 AI 스튜디오 'AI Art Engine'

AI 영상 제작 환경에서 콘티 작성, 이미지 생성, 비디오 변환, 음성 더빙을 각각 다른 웹 서비스에서 진행하며 에셋이 로컬 디스크 곳곳에 파편화되던 불편을 해결하기 위해 개발된 오픈소스 데스크톱 창작 소프트웨어 'AI Art Engine(Justin-sky/ai-art-engine)'이 주목받고 있습니다. 프로젝트 파일과 생성 결과물을 전적으로 사용자 PC에 보존하는 로컬 중심(local-first) 구조를 기반으로, 시각적 노드 그래프와 내장 MCP(Model Context Protocol) 서버를 결합해 복합 AI 영상 제작 파이프라인을 데스크톱 단일 환경으로 통합했습니다.

숏폼 드라마, 제품 광고 영상, 전자상거래(이커머스) 마케팅 클립, 지식형 스피치 영상, 게임용 3D 에셋 추출 등 다양한 시각 콘텐츠 제작에 최적화된 사전 구축 템플릿을 제공하며, 외부 AI 코딩 에이전트가 소프트웨어를 직접 원격 제어할 수 있는 개방형 브릿지 아키텍처를 갖추고 있습니다.

로컬 우선(Local-first) 아키텍처와 시각적 노드 그래프 파이프라인

AI Art Engine의 핵심 가치는 클라우드 SaaS 플랫폼에 프로젝트와 원본 에셋이 종속되지 않는 독립적인 제작 환경에 있습니다.

기존 상용 웹 툴들과 달리 모든 대본, 씬 분경 데이터, 앵커 이미지, 비디오 클립, 오디오 트랙, 3D 모델 파일은 사용자가 지정한 로컬 디렉토리에 직접 저장됩니다. 사용자는 텍스트, 이미지, 비디오, 음성, 3D 모델 생성 노드를 캔버스 위에서 시각적인 노드 그래프(Graph)로 연결해 복합 파이프라인을 일괄 실행할 수 있습니다.

  • 원클릭 워크플로우(One-Click Workflow): 수동으로 노드를 하나씩 배치하지 않고도 12개 이상의 산업별 사전 설정 템플릿이나 자연어 지시를 통해 완전한 생성 파이프라인을 자동 생성합니다.
  • 숏폼 드라마 Agent 파이프라인:
    1. 원작 대본을 텍스트 모델이 씬별 비트(beat) 분경표로 분해합니다.
    2. 분경 데이터를 기반으로 3×3 형태의 9궁격(9-grid) 분경 캔버스를 생성하고, 이를 9장의 개별 앵커 이미지로 분할하여 고해상도 확대를 수행합니다.
    3. 앵커 이미지를 2×2 형태의 4궁격(4-grid) 동적 분경으로 전개해 총 36개의 동적 그리드 클립을 추출합니다.
    4. 36개의 모션 프롬프트를 바탕으로 최종 36개의 연속 동적 비디오 클립을 일괄 렌더링합니다.
  • 다단계 감독 심사(Review) 노드: 파이프라인 진행 과정에 4단계의 검토 노드(review1~review4)가 배치되어, 품질 기준 미달 시 불필요한 토큰 소모와 비디오 API 호출 낭비를 조기에 차단합니다.

내장 MCP 서버와 Claude Code·Codex 에이전트 연동 구조

AI Art Engine의 또 다른 독보적인 차별점은 대화형 코딩 에이전트와의 네이티브 연동입니다.

애플리케이션을 구동하면 로컬 루프백 주소(127.0.0.1)에 Bearer 토큰 인증 기반의 전용 MCP(Model Context Protocol) 도구 서버가 자동으로 활성화됩니다. 연결 정보와 보안 토큰은 로컬 설정 파일(%APPDATA%/aiartengine/mcp.json)에 안전하게 기록되어 재부팅 후에도 일관되게 유지됩니다.

  • 무의존성 브릿지(scripts/mcp-bridge.mjs): Node.js 18+ 환경에서 실행되는 경량 브릿지 스크립트를 통해 Claude Code, Codex 등 외부 AI 에이전트가 표준 입출력(stdio)으로 MCP 명령을 전달하면, 브릿지가 로컬 HTTP 엔드포인트로 변환해 앱을 조종합니다.
  • 에이전트 자율 제작: 에이전트는 대화창에서 프로젝트 구조를 직접 파악하고, 노드 그래프를 읽고 수정하며, 일괄 생성 작업을 지시하거나 진행 중인 작업 큐 상태를 조회할 수 있습니다.
  • Blender 3D 환경 연동: 외부 에이전트가 3D 소프트웨어인 블렌더(Blender)와도 동시에 연동하여, 프롬프트 지시를 통해 기본 메시 구조를 배치하고 스크린샷을 캡처해 검증하는 입체 에셋 보조 작업까지 수행할 수 있습니다.
  • 앱 내 통합 AI 대화 패널: 작업 공간 좌측의 대화창(DeepSeek Harness 런타임)에서 @ 기호로 프로젝트 내 에셋을 직접 호출하며 인앱 어시스턴트에게 콘티 기획 및 생성 명령을 내릴 수 있습니다.

폭넓은 BYOK(Bring Your Own Key) 생태계와 도입 시 고려사항

AI Art Engine은 특정 단일 인공지능 공급자에 얽매이지 않고 사용자가 보유한 API 키를 직접 등록해 사용하는 BYOK 방식을 전면 채택하고 있습니다.

  • 지원 모델 제공자: OpenRouter(텍스트·비디오 및 의사결정 Decisions API 지원), OpenAI, DeepSeek, 智谱(Zhipu AI), Kimi, xAI, Google(Gemini), vLLM, Ollama, LM Studio, 火山方舟(Volcengine Ark), 可灵(Kling AI), MiniMax, 通义千问(Tongyi Qianwen / Qwen), 魔塔(ModelScope), ComfyUI, MagicRouter 등 폭넓은 상용 및 오픈소스 API를 지원합니다.
  • 3D 생성 모델 연동: Meshy, Tripo, Rodin(Hyper3D), Luma AI, Lux3D 등 최신 전문 3D 메시 생성 엔진을 노드로 직접 연결할 수 있습니다.
  • 하드웨어 요구 사양: 외부 클라우드 API 호출 위주로 파이프라인을 운영할 경우 일반 사양의 PC에서도 원활하게 구동됩니다. 고성능 GPU는 ComfyUI 워크플로우나 Ollama 로컬 LLM을 사용자 컴퓨터에서 직접 추론할 때에만 요구됩니다.

실무 워크플로우에 도입하기 전 다음과 같은 제약 사항을 확인해야 합니다.

  1. 소프트웨어 내 모델 미탑재: AI Art Engine은 파이프라인을 편성하고 제어하는 스튜디오 소프트웨어이며 모델 자체를 내장하지 않습니다. 텍스트, 이미지, 비디오 생성을 실행하려면 최소 1개 이상의 상용 API 키와 잔여 크레딧이 반드시 준비되어 있어야 합니다.
  2. 클라우드 객체 스토리지(OSS·COS·TOS) 선택 연동: 비디오 생성 시 외부 스트리밍 URL이나 참조 비디오 링크 주소가 요구되는 일부 비디오 모델을 사용할 경우 클라우드 스토리지 설정이 필요합니다. 순수 로컬 이미지 및 영상 렌더링 목적이라면 해당 설정을 건너뛰어도 무방합니다.
  3. UI 언어 및 리소스 구성: 개발사 공식 저장소와 매뉴얼 리소스 중 일부에 중국어 인터페이스 및 자료가 포함되어 있어, 글로벌 사용자 환경에 맞춘 모델 매핑과 설정 숙지가 선행되어야 합니다.

Windows, macOS, Linux 크로스 플랫폼 바이너리 설치 패키지를 공식 GitHub Releases를 통해 다운로드할 수 있으며, 숏폼 콘텐츠 크리에이터나 마케팅 에이전시의 1인 제작 파이프라인 효율을 크게 높여줄 수 있습니다.

출처