TAU-HOME.COM
LOADING

클로드 Opus 5.5로 75~90초 숏폼 카툰 설명 영상 자동 제작하는 프롬프트 워크플로우

클로드 코드 실행 환경에서 Kokoro TTS, Playwright 캔버스 렌더링, FFmpeg을 연동해 캐릭터 디자인부터 7개 씬 대본, 음성 합성, 25~35개 샷 애니메이션까지 4단계 승인만으로 완성하는 9:16 카툰 영상 마스터 프롬프트 및 실전 가이드.

tau · 2026년 10월 8일

#claude #motion-design #tts #kokoro #playwright #ffmpeg #prompt-engineering

클로드 Opus 5.5로 75~90초 숏폼 카툰 설명 영상 자동 제작하는 프롬프트 워크플로우

AI 실무 가이드 전문 채널인 AI Guides(@free_ai_guides)가 클로드(Claude)의 코드 실행 환경을 활용해 75~90초 분량의 9:16 세로형 카툰 설명 영상을 제작하는 4단계 프롬프트 워크플로우를 공개했습니다. 복잡한 영상 생성 확산 모델 대신, 클로드 Opus 5.5의 코드 인터프리터 기능과 오픈소스 경량 음성 합성 엔진인 Kokoro, 헤드리스 브라우저 렌더링 도구인 Playwright, 그리고 미디어 처리 엔진인 FFmpeg을 하나의 파이프라인으로 묶어 프레임 왜곡 없는 고품질 벡터 애니메이션 영상을 제작하는 실전 기법입니다.

클로드 Opus 5.5와 Kokoro TTS 및 Playwright 기반 숏폼 카툰 설명 영상 자동화 파이프라인 개요 인포그래픽

이미지 출처: AI Guides (@free_ai_guides) on X

파이프라인 구성 요건과 3대 핵심 엔진 사양

이번 워크플로우의 핵심은 이미지 확산 모델 특유의 캐릭터 일관성 붕괴 문제를 원천 차단하기 위해, 캐릭터와 그래픽 요소를 코드로 직접 제어하는 아키텍처를 채택했다는 점입니다. 전체 파이프라인을 구동하기 위한 필수 준비물과 핵심 엔진 사양은 다음과 같습니다.

  • 실행 환경 및 기초 에셋: 파이썬 코드 실행 기능이 지원되는 클로드 환경(Claude Opus 5.5 권장), 4가지 표정(중립, 충격, 웃음, 슬픔)이 정리된 캐릭터 모델 시트(Character Model Sheet), 영상 주제를 담은 참조 자료(Reference Material), 그리고 단계별 실행을 지시하는 마스터 프롬프트입니다.
  • 음성 합성(Voiceover) 엔진: ONNX 기반 경량 TTS 패키지인 kokoro-onnx를 사용합니다. 파이썬 환경에서 pip install kokoro-onnx soundfile --break-system-packages 명령어로 필요한 라이브러리를 설치합니다.
  • 음향 모델 및 보이스 세팅: 고품질 연산을 위해 풀 프리시전 모델인 kokoro-v1.0.onnx와 보이스 정의 파일인 voices-v1.0.bin을 로드하며, 보이스는 am_michael을 지정합니다. 발화 속도는 0.95 x 1.25 계수로 설정합니다.
  • 오디오 노멀라이제이션: 음성 트랙은 -16 LUFS 표준 라우드니스로 노멀라이즈하고 -1.5 dB 트루 피크(True Peak) 리미트를 적용해 모바일 숏폼 플랫폼 재생 시 왜곡이나 클리핑이 발생하지 않도록 마스터링합니다. 커뮤니티 피드백에서는 후반 작업 시 개별 대사별 레벨 밸런스를 미세 조정하는 것이 체감 완성도를 높이는 팁으로 공유되었습니다.

단일 HTML 캔버스와 Playwright·FFmpeg 렌더링 구조

시각적 모션과 비디오 생성은 단일 HTML5 캔버스 기반의 프로그래밍 방식 렌더링을 활용합니다. 무거운 외부 영상 편집기를 사용하지 않고 코드로 비디오 타임라인을 완성하는 세부 메커니즘입니다.

  • 단일 캔버스 뷰포트: 9:16 비율인 세로 해상도 1080x1920 캔버스 1개에 모든 그래픽, 타이포그래피, 배경, 캐릭터 요소를 24fps 규격으로 배치합니다.
  • 코드 기반 벡터 캐릭터 드로잉: 캐릭터 모델 시트에 정의된 4가지 감정 상태(중립, 충격, 웃음, 슬픔)를 캔버스 벡터 패스 및 수치 데이터로 직접 드로잉합니다. 이를 통해 영상 전반에 걸쳐 캐릭터의 이목구비와 형태가 어긋나지 않는 일관성을 유지합니다.
  • Playwright 헤드리스 프레임 캡처: Playwright를 이용해 헤드리스 크로미움(Chromium) 브라우저를 백그라운드에서 구동하고, 캔버스의 매 프레임을 24fps 타이밍에 맞춰 정밀하게 캡처하여 디스크에 프레임 이미지 시퀀스로 기록합니다.
  • FFmpeg 최종 인코딩 및 자막 합성: 캡처된 프레임 시퀀스와 Kokoro에서 생성된 보이스오버 오디오를 FFmpeg으로 결합합니다. H.264 비디오 코덱과 AAC 오디오 코덱이 적용된 MP4 컨테이너로 인코딩하며, 가독성을 고려한 번인(Burned-in) 자막 렌더링과 독립 자막 파일인 SRT 내보내기를 동시에 처리합니다.

4단계 단계별 승인 워크플로우와 실전 최적화 기법

이 파이프라인의 실무적 강점은 무작정 영상을 한 번에 뽑아내는 것이 아니라, 각 제작 페이즈마다 인간 작업자의 승인을 거치는 체계적인 4단계 프로세스를 따른다는 점입니다.

  • 1단계: 대본(Script) 승인: 전체 분량을 190215단어로 통제하고 7개 씬(도입 후크, 익숙한 일상, 문제 균열, 작동 기제, 새로운 발견, 파급 결과, 핵심 요약) 구조로 구성합니다. 총 2535개의 샷으로 장면을 분할하며, 중요한 순간에 시청자가 내용을 곱씹을 수 있도록 2~3초 동안 정지하는 홀드 샷을 1개 배치합니다.
  • 2단계: 보이스오버(Voiceover) 검증: 합성된 오디오가 75~90초 목표 길이에 부합하는지 점검합니다. 특히 문장별 발화 속도(SPS, 초당 음절 수)를 측정해 목표치인 초당 약 4.6 음절 기준을 충족하는지 확인합니다. 어색하거나 발음이 뭉개지는 문장만 선별하여 재녹음함으로써 전체 재생성 시간을 줄입니다.
  • 3단계: 비디오 동기화 및 모바일 안전 영역: 음성 문장의 시작과 끝 타이밍에 맞춰 샷 전환 시점을 정밀하게 일치시킵니다. 인스타그램 릴스나 틱톡, 유튜브 쇼츠 등 모바일 앱의 상·하단 UI에 자막이나 핵심 오브젝트가 가려지지 않도록 상단 250픽셀, 하단 420픽셀의 안전 여백(Safe Zones)을 철저히 유지합니다.
  • 4단계: 모바일 실기기 검수(Phone Check): PC 모니터에서 작업을 마친 뒤 실제 스마트폰 디스플레이에서 영상을 재생하여 작은 화면에서의 자막 가독성, 화면 전환 속도, 소리 명료도를 최종 점검하고 배포를 확정합니다.

원문 출처