폴더에 영상 넣고 대화하면 자동 편집 완성: Claude Code 기반 오픈소스 영상 편집 도구 'video-use'

타임라인 NLE 소프트웨어나 수동 컷 편집 없이, 원본 영상을 폴더에 넣고 Claude Code와 자연어로 대화하여 컷 편집, 무음·추임새 제거, 색보정, 스타일 자막, 모션 그래픽 합성까지 자동 완성하는 MIT 라이선스 오픈소스 도구 'video-use'를 살펴봅니다.

tau · 2026년 9월 24일

#video-use #ClaudeCode #영상편집 #오픈소스 #에이전틱AI #개발도구 #FFmpeg

폴더에 영상 넣고 대화하면 자동 편집 완성: Claude Code 기반 오픈소스 영상 편집 도구 'video-use'

로컬 폴더에 원본 촬영 영상(raw footage)을 넣어두고 터미널에서 Claude Code와 대화하는 것만으로 완성된 결과물(final.mp4)을 뽑아내는 오픈소스 영상 편집 도구 'video-use'가 2026년 9월 24일 공개되었습니다. 복잡한 타임라인 인터페이스나 프리셋 메뉴를 거치지 않고, 에이전트가 영상의 대본과 시각 요소를 직접 인지해 컷 편집부터 색보정, 자막 생성, 모션 그래픽 오버레이까지 전 과정을 자동으로 수행합니다.

Claude Code 터미널 환경에서 폴더 내 영상 클립을 자연어로 분석하고 자동 편집하는 video-use 시스템 워크플로우 콘셉트

이미지 출처: https://github.com/browser-use/video-use

기존 영상 편집 워크플로우는 프리미어 프로나 다빈치 리졸브 같은 비선형 편집기(NLE)에 클립을 올린 뒤, 수십 개의 테이크를 일일이 재생하며 말실수 구간을 자르고 오디오 싱크를 맞추는 노동집약적 작업이 필수적이었습니다. 최근 AI 기반 편집 도구들이 다수 등장했으나, 대부분 전용 클라우드 플랫폼의 GUI 안에서 정해진 템플릿을 적용하는 방식에 머물렀습니다. video-use는 이 과정을 개발자 친화적인 코딩 에이전트(Claude Code)의 스킬 형태로 녹여내어, 로컬 파일 시스템과 FFmpeg 파이프라인 위에서 사용자의 자연어 프롬프트를 실제 렌더링된 비디오로 변환합니다.

이중 레이어 인지(Dual-Layer Perception) 아키텍처: 토큰 낭비 없는 정밀 컷팅

LLM을 영상 편집에 적용할 때 마주치는 가장 큰 기술적 병목은 방대한 비디오 프레임 데이터로 인한 컨텍스트 윈도우 폭발과 연산 비용입니다. 4K 고화질 영상 수십 분 분량을 그대로 모델에 입력하는 것은 토큰 한계와 속도 측면에서 비효율적입니다.

video-use는 LLM이 영상을 '직접 시청'하지 않고 효율적으로 '읽어내도록' 만드는 2단계 멀티모달 분석 아키텍처(Dual-Layer Perception)로 이 문제를 해결했습니다.

  • 레이어 1: 상시 로드 오디오 트랜스크립트(Audio Transcript): ElevenLabs Scribe API를 1회 호출하여 소스 영상에서 단어 단위 정밀 타임스탬프(word-level timestamps), 화자 분리(speaker diarization), 그리고 웃음·박수·한숨 등 오디오 이벤트((laughter), (applause), (sigh))를 추출합니다. 복수의 테이크 정보는 약 12KB 크기의 단일 마크다운 파일(takes_packed.md)로 압축되어 LLM의 주 읽기 뷰로 상시 활용됩니다. 에이전트는 이를 통해 방대한 영상 내용을 한눈에 스크립트처럼 파악하고 컷 편집 지점을 단어 단위로 계산합니다.
  • 레이어 2: 온디맨드 시각 컴포지트(Visual Composite): 불필요한 시각 데이터 입력을 차단하고, 컷팅 판단이 모호한 구간이나 복수 테이크 간의 표정·동선 비교, 컷 경계 안전성 검증 등 결정적인 순간에만 timeline_view를 호출합니다. 이 도구는 지정된 시간 범위의 필름스트립(filmstrip) 썸네일과 오디오 파형(waveform), 단어 텍스트 라벨이 일체화된 단일 PNG 이미지를 생성하여 에이전트에게 제공함으로써 정밀한 시각적 의사결정을 보조합니다.

무음·추임새 제거부터 색보정과 애니메이션까지: 자동화 파이프라인

video-use는 토킹헤드(talking heads), 인터뷰, 튜토리얼, 여행기, 몽타주 등 다양한 형식의 원본 영상을 자연어 한 줄로 다듬을 수 있는 종합 후반 작업 파이프라인을 내장하고 있습니다.

  1. 지능형 컷팅과 오디오 크로스페이드: 말실수나 다시 시작한 문장(false starts), 불필요한 추임새('umm', 'uh' 등), 테이크 사이의 불필요한 침묵 구간을 감지하여 자동으로 잘라냅니다. 특히 각 컷이 연결되는 경계마다 30ms 길이의 오디오 페이드(audio fade)를 자동으로 삽입하여 컷 전환 시 발생하는 틱·팝 노이즈(pop noise)를 방지합니다.
  2. 세그먼트 단위 자동 색보정: 클립별 특성에 맞추어 따뜻한 영화적 분위기('warm cinematic')나 또렷하고 선명한 톤('neutral punch') 등 사전 정의된 프리셋을 적용하거나, 커스텀 FFmpeg 필터 체인을 구축해 자동으로 컬러 그레이딩을 수행합니다.
  3. 스타일 커스텀 자막 하드서브: 시청자의 몰입도를 높이기 위해 기본값으로 2단어 대문자 청크(2-word UPPERCASE) 스타일의 자막을 생성해 영상에 직접 버닝(burn-in)하며, 글꼴, 위치, 크기 등 사용자 맞춤형 서식 지정이 가능합니다.
  4. 멀티 서브에이전트 모션 그래픽 합성: 단순 자막을 넘어 화면에 삽입할 모션 그래픽이나 다이어그램이 필요한 경우, Manim, Remotion, PIL을 구동하는 독립 서브에이전트를 병렬로 생성합니다. 각 서브에이전트가 생성한 시각 애니메이션 에셋은 메인 타임라인의 해당 타임코드에 정밀하게 오버레이됩니다.

셀프 검증 루프와 세션 연속성: 신뢰도 높은 프로덕션 작업 흐름

에이전트 자동화의 신뢰성을 담보하기 위해 video-use는 렌더링 결과물을 사용자에게 보여주기 전에 자체 평가(Self-evaluation)하는 품질 게이트를 갖추고 있습니다.

에이전트는 컷 경계의 매끄러움, 오디오 트랜지션의 자연스러움, 프레임 연속성을 내부 검증 루프를 통해 확인한 후 최종 결과물을 제시합니다. 만약 부자연스러운 전환이나 끊김이 감지되면 자동으로 컷 지점을 미세 조정한 뒤 재합성합니다.

또한 장기 프로젝트와 반복 작업을 고려한 구조적 설계가 적용되었습니다.

  • 세션 상태 영속화: 작업 진행 상황과 메타데이터는 프로젝트 폴더 내 project.md에 지속적으로 기록됩니다. 작업을 중단했다가 며칠 뒤 세션을 다시 시작하더라도 이전 컨텍스트를 유지한 채 이어서 편집을 요청할 수 있습니다.
  • 클린한 워크스페이스 분리: 모든 렌더링 결과물과 임시 에셋은 소스 영상 폴더 내부의 edit/ 디렉토리에 격리 저장되어, 스킬 환경 및 루트 워크스페이스를 어지럽히지 않습니다.
  • MIT 라이선스 오픈소스: MIT 라이선스 기반의 완전 무료 오픈소스로 공개되어 누구나 제약 없이 코드를 검토하고 워크플로우에 맞게 확장할 수 있습니다.

출처