Pruna AI, 텍스트·이미지·오디오 통합 비디오 모델 'P-Video-2' 공식 출시

Pruna AI가 최대 1080p 48fps 해상도와 20초 길이, 네이티브 오디오 동시 생성을 지원하는 P-Video-2를 공개했습니다. 초당 $0.015부터 시작하는 드래프트 모드와 클라우드 제공 정보를 전합니다.

tau · 2026년 9월 12일

#AI #비디오생성 #P-Video-2 #PrunaAI #멀티모달 #Replicate #Segmind

Pruna AI, 텍스트·이미지·오디오 통합 비디오 모델 'P-Video-2' 공식 출시

인공지능 모델 최적화 및 경량화 전문 기업 Pruna AI가 2026년 9월 10일, 텍스트와 이미지, 오디오 입력을 단일 엔드포인트에서 결합한 차세대 멀티모달 비디오 생성 모델 'P-Video-2'를 공식 발표했습니다. 시각적 표현과 오디오 사운드트랙을 각각 별개의 단계로 렌더링하던 기존 파이프라인의 분절을 해소하고, 하나의 생성 주기로 비디오와 고음질 오디오를 동시 합성하는 통합 아키텍처가 적용되었습니다.

Pruna AI 멀티모달 비디오 생성 모델 P-Video-2 공식 브랜드 비주얼 아트워크

이미지 출처: Pruna AI (playground.pruna.ai)

이번 릴리즈는 생성 AI 영상 제작 현장에서 요구되는 고해상도 지원, 프레임레이트 제어, 실시간성에 근접한 추론 속도, 그리고 예측 가능한 비용 체계를 폭넓게 겨냥하고 있습니다. 개발자와 프로덕션 스튜디오가 프로토타입 검증부터 최종 마스터링까지 단일 모델 파이프라인에서 대응할 수 있도록 다각도의 모드 옵션을 제공합니다.

단일 엔드포인트 기반 T2V·I2V·오디오 조건화 및 네이티브 사운드 동시 생성

P-Video-2의 가장 핵심적인 기술적 진보는 입력 모달리티의 통합성과 네이티브 오디오 동시 생성 역량입니다.

기존 생성형 비디오 워크플로우에서는 텍스트 프롬프트 기반 생성(T2V)과 정지 이미지 기반 모션 부여(I2V) 모델이 분리되어 있거나, 영상 생성 후 별도의 오디오 모델을 통해 사운드 효과를 후처리 매핑해야 하는 복잡한 결합 구조가 일반적이었습니다. Pruna AI는 이러한 파이프라인을 단일 API 엔드포인트로 일원화했습니다.

  • 통합 조건화 입력: 사용자는 텍스트 프롬프트뿐 아니라 참조 이미지, 그리고 오디오 트랙을 조건화 입력값으로 전달할 수 있습니다.
  • 48kHz 스테레오 오디오 동시 생성: 시각 프레임이 합성되는 동일한 추론 루프 내에서 장면에 부합하는 48kHz 고음질 스테레오 사운드가 함께 생성되어, 별도의 오디오 후가공 없이도 즉시 재생 가능한 비디오 패키지를 완성합니다.
  • 오디오 기반 재생 시간 고정: 오디오 조건화 입력을 활성화할 경우 생성되는 비디오의 총 길이는 업로드된 오디오 트랙의 길이에 자동으로 정렬되며, API 호출 시 지정된 일반 duration(길이) 파라미터는 무시되는 규칙이 적용됩니다.

이러한 통합 인터페이스는 단편 영상 클립 제작뿐 아니라 음악 비디오, 광고 모션 그래픽, 소셜 미디어용 숏폼 콘텐츠의 제작 마찰을 크게 줄여줍니다.

최대 1080p 48fps 스펙과 드래프트·스탠다드 모드별 생성 속도 및 비용 구조

영상 품질과 렌더링 효율성 측면에서도 프로덕션 실무에 최적화된 유연한 성능 구성을 갖추었습니다.

P-Video-2는 최대 1080p 풀HD 해상도를 지원하며, 전통적인 영화 및 드라마 표준인 24fps뿐 아니라 한층 부드러운 카메라 무브먼트와 모션을 표현할 수 있는 48fps 고프레임 생성을 함께 제공합니다. 단일 생성으로 추출 가능한 최대 클립 길이는 최대 20초에 달합니다.

추론 효율성과 비용 통제를 위해 두 가지 상이한 렌더링 모드를 제공합니다.

  • 드래프트(Draft) 모드: 신속한 콘티 확인과 프롬프트 아이데이션을 위한 경량 모드입니다. 출력 영상 1초당 약 0.41초 만에 렌더링을 완료하며, 720p 해상도 기준 생성 1초당 $0.015의 저렴한 비용으로 호출할 수 있습니다.
  • 스탠다드(Standard) 모드: 최종 배포 및 상용 퀄리티를 위한 고정밀 모드입니다. 영상 1초당 약 0.91초의 처리 속도를 보이며, 720p 해상도 기준 생성 1초당 $0.025부터 시작합니다.

초당 과금 단가를 세분화하여 대량 배치 작업이나 실시간 반응형 인터랙티브 서비스에서도 인프라 예산을 정밀하게 계획할 수 있는 구조를 마련했습니다.

멀티 클라우드 배포 현황과 공식 벤치마크 파트너 공개 일정

P-Video-2는 특정 단일 플랫폼의 독점적 호스팅에 갇히지 않고, 출시 당일부터 광범위한 서드파티 클라우드 추론 생태계 전반에 라이브 배포되었습니다.

개발자와 엔터프라이즈 고객은 이미 구축해 둔 클라우드 공급자 환경에 맞추어 즉시 엔드포인트를 호출할 수 있습니다. 현재 공식 지원되는 클라우드 파트너 목록은 다음과 같습니다.

  • 지원 플랫폼: Replicate, Segmind, Cloudflare, Runware, RunPod, Eachlabs, Wavespeed AI, Eden AI 등 주요 AI 인프라 플랫폼

Pruna AI는 다양한 추론 엔진과의 협력을 통해 개발자들이 기존 프로덕션 스택을 교체하지 않고도 P-Video-2를 플러그인 형태로 즉각 도입할 수 있도록 지원하고 있습니다.

한편, 정량적 성능 지표에 대해서는 공식 평가 기관과의 협업 일정이 예고되었습니다. Pruna AI 측은 Datapoint AI, Rapidata, DesignArena 등 공식 벤치마크 파트너사를 통한 상세 벤치마크 결과가 출시 시점 기준 추후 순차적으로 공개될 예정이라고 안내했습니다. 자체 홍보성 수치에 매몰되지 않고 제3자 평가 기관의 교차 검증을 통해 객관적인 비디오 품질과 생성 안정성을 입증하겠다는 전략입니다.

출처