Codex와 HyperFrames로 긴 영상을 90초 요약본으로 전자동 재편집하는 실전 프롬프트
오픈소스 비디오 툴 HyperFrames와 Codex를 결합해 원본 영상 분석부터 음성 전사, 핵심 클립 추출, 자막 및 모션 그래픽 합성, 90초 요약본 MP4 렌더링까지 전자동으로 끝내는 실전 가이드입니다.
AI 엔지니어이자 테크 크리에이터인 다웨이(大卫, @AI_DVD6)가 오픈소스 코드 기반 비디오 렌더링 프레임워크 HyperFrames와 Codex를 결합하여, 17분 이상의 긴 원본 영상에서 핵심 구간을 스스로 분석하고 모션 자막과 정보 카드를 결합해 90초 분량의 압축 요약 영상(MP4)을 전자동으로 렌더링해내는 실전 워크플로우와 프롬프트를 공개했습니다.

이미지 출처: @AI_DVD6 / X
유튜브, X, 틱톡 등에 올라오는 수십 분 분량의 기술 튜토리얼이나 제품 발표 영상을 SNS용 숏폼 콘텐츠로 재가공하는 작업은 기존 영상 편집자들에게도 많은 시간과 노동력을 요구하던 영역이었습니다. 영상을 처음부터 끝까지 시청한 뒤 핵심 구간 타임코드를 기록하고, 컷을 자르고, 자막 타이밍을 일일이 맞추는 수작업이 필수적이었기 때문입니다. 이번에 공유된 파이프라인은 젠잉(剪映·CapCut 중국판)의 연간 구독료(500위안)를 아낄 수 있을 정도로, 기존 타임라인 기반 편집 소프트웨어를 전혀 열지 않고 단 한 번의 터미널 명령어와 프롬프트 실행만으로 모든 공정을 처리합니다.
에이전트 자율 비디오 편집 구조: Codex와 HyperFrames
HyperFrames는 타임라인 인터페이스에서 마우스로 클립을 이어 붙이는 기존 NLE(Non-Linear Editing) 도구와 달리, 비디오를 HTML과 CSS, 애니메이션, 미디어 자산으로 정의된 '웹 페이지'처럼 취급하여 헤드리스 브라우저 환경에서 프레임 단위로 렌더링하는 오픈소스 프레임워크입니다.
이 도구가 Codex의 자율 에이전트 기능과 결합되면 단순한 템플릿 재생을 넘어 영상 분석과 재구성이 동시에 일어납니다. Codex가 터미널 환경에서 영상의 오디오 트랙을 추출하여 영문 음성을 전사하고, 전체 맥락과 설명 흐름을 파악한 뒤 가장 정보 밀도가 높은 시연(Demo) 및 핵심 발언 구간을 선별합니다. 이후 원본 영상의 시간축을 계산해 필요한 클립을 자르고, 90초 분량에 맞추어 새로운 서사 구조를 재작성한 뒤 HyperFrames의 컴포지션 코드로 변환하여 최종 MP4 파일을 출력합니다.
실제 17분 길이의 영어 튜토리얼 영상을 대상으로 진행된 테스트에서, 작업자는 개별 구간을 수동으로 지정하거나 자막을 입력하지 않고 단 한 번의 엔터 입력만으로 완성도 높은 90초 요약본을 도출했습니다. 특히 말하는 속도가 일정하지 않거나 배경 잡음이 섞여 있는 경우에도 화면과 나레이션의 싱크가 맞는지 묻는 질문에 대해, @AI_DVD6는 "모두 자동으로 싱크를 맞춰준다"고 답했습니다. 또한 구동 비용과 토큰 소모량에 대해서는 "5.6 sol 중강도(中强度) 기준으로 세션 할당량의 약 3% 내외만 소모되었다"고 밝혀 경제적인 실행 효율을 입증했습니다.
사전 준비 및 환경 구성 (4단계)
첫째, 실행 환경을 준비합니다. 시스템에 최신 런타임과 미디어 처리 엔진이 준비되어 있어야 합니다:
- Node.js 22 이상: HyperFrames 실행기 및 빌드 도구 구동
- FFmpeg: 비디오 트랙 분석, 클립 슬라이싱, 오디오 추출 및 최종 비디오 인코딩
- Codex CLI: 터미널 기반 에이전트 실행 환경
시스템 내 필수 도구 설치 여부가 확실하지 않다면 HyperFrames 자체 진단 명령어(npx hyperframes doctor)를 실행하여 의존성 상태를 즉시 점검할 수 있습니다.
둘째, 격리된 작업 디렉토리를 생성하고 이동합니다.
셋째, Codex 전용 HyperFrames Skills를 업데이트하고 처리할 영상을 배치합니다. 스킬을 설치하면 Codex가 HyperFrames의 CLI 옵션과 프로젝트 템플릿 구조를 자동으로 인식하게 됩니다.
넷째, 작업 디렉토리 안에서 Codex 세션을 시작하고 전용 프롬프트를 주입합니다. 작업자가 별도로 음성을 전사하거나 콘티를 짤 필요 없이, 에이전트가 도구 호출을 연쇄적으로 수행합니다.
# 환경 의존성 점검
npx hyperframes doctor
# 작업 디렉토리 생성 및 이동
mkdir hyperframes-test
cd hyperframes-test
# Codex 전용 HyperFrames 스킬 설치 및 업데이트
npx hyperframes skills update
# 처리할 영상을 hyperframes-test 폴더에 복사한 뒤 Codex 실행
codex
전자동 숏폼 요약 비디오 제작을 위한 실전 프롬프트
디렉토리에 원본 영상([비디오파일명.mp4])을 배치하고 Codex를 실행했다면, 아래의 프롬프트 전문을 입력창에 복사해 실행합니다. 파일명과 목표 영상 시간(약 90초)만 프로젝트 상황에 맞춰 수정하면 추가 개입 없이 렌더링까지 직행합니다.
이번 프롬프트가 높은 재현성을 보이는 이유는 에이전트에게 단순 요약이 아닌 비디오 프로듀서로서의 2대 핵심 기준(작업 요구사항 및 최종 완성 영상 기준)을 명확히 규정했기 때문입니다.
첫째, '작업 요구사항'에서 영상의 메타데이터 검증부터 음성 전사, 군더더기 인사말 제거, 핵심 데모 중심의 화면 유지, 시각적 정보 카드와 자막 생성을 구체적으로 지시합니다. 특히 모든 수치, 벤치마크, 가격 정보는 반드시 원본 영상에 등장한 사실에만 기반하도록 제약하여 에이전트의 환각을 방지하고, 렌더링 직전 자체 프리뷰를 통해 자막 겹침이나 화면 오류를 스스로 교정(Self-healing)하도록 유도합니다.
둘째, '최종 완성 영상 기준'을 설정해 첫 3~5초 구간에 시청자의 시선을 사로잡는 강력한 훅을 배치하고, 원본을 보지 않은 사용자도 직관적으로 이해할 수 있는 고밀도 정보 전달력을 유지하도록 강제합니다.
현재 프로젝트 디렉토리에 원본 영상 [비디오파일명.mp4]이 있습니다.
현재 프로젝트에 설치된 HyperFrames를 사용하여, 이 영상을 약 [90초] 분량의 핵심 요약 영상으로 다시 제작해 주세요.
반드시 내가 직접 결정해야 하는 중대한 문제가 발생하지 않는 한 도중에 묻지 말고 전체 프로세스를 자율적으로 완료하세요.
一. 수행 요구사항:
▸ 원본 영상을 완전히 읽고 분석하여 전체 재생 시간, 화면, 오디오가 정상인지 확인하세요.
▸ 원본 영상의 음성을 완전히 추출 및 전사하고, 전체 내용을 완벽히 이해한 후 무엇을 남길지 결정하세요.
▸ 가장 강력한 훅(Hook), 핵심 관점, 가장 인상적인 데모, 핵심 수치, 일반 사용자에게 가장 유익한 정보를 도출하세요.
▸ 의례적인 인사말, 불필요한 반복 설명, 정보 밀도가 낮은 구간은 과감히 삭제하세요.
▸ 원본 영상을 기계적으로 자르는 대신 약 90초 길이의 명확한 서사 구조로 재설계하세요.
▸ 원본 영상 내 가치 있는 데모 시연, 실제 조작 과정, 전후 비교 화면, 실질적인 결과물을 우선적으로 보존하세요.
▸ HyperFrames를 활용하여 전문적인 타이틀, 모션 자막, 정보 카드, 핵심 수치 강조, 부분 확대, 화면 전환 및 필수 시각 애니메이션을 구성하세요.
▸ 전체 시각 톤은 군더더기 없이 깔끔하고 모던하며 정보 밀도가 높게 유지하세요.
▸ 자막은 직역투를 피하고 간결하고 자연스러운 문장으로 작성하세요.
▸ 모든 수치, 성능 비교 수치, 가격 및 제품 기능 정보는 반드시 원본 영상에 명시된 사실에만 근거해야 하며 사실을 지어내지 마세요.
▸ 제작 완료 후 자체 프리뷰(Preview)를 실행하여 자막 가림, 블랙 스크린, 부적절한 프레임 크롭, 불필요한 공백 구간 등의 오류를 검사하고 스스로 수정하세요.
▸ 최종 검증이 끝나면 MP4 형식으로 직접 렌더링하여 현재 프로젝트 디렉토리에 저장하세요.
二. 최종 영상 품질 기준:
▸ 도입부 3~5초 내에 반드시 시선을 끄는 강력한 시각적·내용적 흡입력을 확보하세요.
▸ 원본 영상을 보지 않은 일반 시청자도 한눈에 쉽게 이해할 수 있어야 합니다.
▸ 정적인 텍스트 슬라이드가 아닌 실제 동작 화면과 시연 중심으로 화면을 구성하세요.
▸ 호흡을 빠르게 유지하여 소셜 미디어 플랫폼 배포에 최적화된 리듬감을 구현하세요.
지금 바로 실행을 시작하세요.