TAU-HOME.COM
LOADING

엔비디아, VAE·ViT 인코더 없앤 픽셀 공간 통합 멀티모달 모델 'PixelUMM' 오픈소스 공개

NVIDIA 연구진이 VAE와 ViT를 제거하고 원본 픽셀 공간에서 이미지 및 비디오의 시각적 이해와 생성을 단일 인코더-프리 구조로 처리하는 'PixelUMM'의 코드와 모델 가중치를 오픈소스로 공개했습니다.

tau · 2026년 10월 5일

#NVIDIA #PixelUMM #OpenSource #Multimodal #ComputerVision #nv-tlabs

엔비디아, VAE·ViT 인코더 없앤 픽셀 공간 통합 멀티모달 모델 'PixelUMM' 오픈소스 공개

NVIDIA 연구진(nv-tlabs) 소속의 콩 웨이(Cong Wei, @CongWei1230) 등이 2026년 10월 5일, 사전 학습된 비전 인코더나 잠재 압축기를 배제하고 원본 픽셀 공간에서 시각적 이해와 생성을 통합 처리하는 멀티모달 모델 'PixelUMM'의 공식 코드와 가중치, 연구 논문을 오픈소스로 공개했습니다.

기존 멀티모달 비전 모델(VLM 및 LMM)은 대부분 이미지와 비디오를 처리할 때 사전 학습된 ViT(Vision Transformer) 인코더로 특징을 추출하거나, 확산 모델 기반 생성을 위해 VAE(Variational Autoencoder)의 압축 잠재 공간에 의존해 왔습니다. PixelUMM은 이러한 중간 인코더 구조를 완전히 걷어내고, 원본 픽셀 데이터(Raw Pixels)를 단일 통합 신경망에서 직접 입력받아 처리하는 인코더-프리(Encoder-Free) 패러다임을 구현했습니다.

ViT와 VAE를 걷어낸 '인코더-프리' 픽셀 공간 통합 아키텍처

현대 멀티모달 AI 시스템에서 시각적 이해(Understanding)와 시각적 생성(Generation)은 서로 다른 하위 모듈로 분리되어 설계되는 경우가 많았습니다. 이해 작업에는 고해상도 패치 특징을 요약하는 사전 훈련 ViT가 필수적으로 쓰였고, 생성 작업에는 픽셀을 잠재 벡터로 압축했다가 복원하는 VAE 디코더 파이프라인이 결합되었습니다.

  • 단일 신경망 완결 구조: PixelUMM은 이미지 및 비디오를 별도의 인코더나 압축 잠재 공간을 거치지 않고 원본 픽셀 단위로 직접 토큰화합니다.
  • 이해와 생성의 기능 통합: 별개의 특화 모델을 파이프라인으로 연결하지 않고, 단일 아키텍처 내에서 시각적 추론과 이미지·비디오 생성 태스크를 동시에 수행할 수 있도록 설계되었습니다.
  • 인코더 병목 및 정보 손실 방지: 사전 학습 인코더가 학습 과정에서 걸러내는 저수준 픽셀 정보나 VAE 압축 손실 없이, 원본 시각 신호의 풍부한 정보를 그대로 신경망이 직접 학습하도록 유도합니다.

이러한 인코더-프리 접근법은 복잡하게 얽혀 있던 비전-언어 모델의 전처리 및 특징 추출 파이프라인을 단순화하고, 모델이 시각 세계를 바라보는 방식을 하나의 통일된 픽셀 표현 체계로 정리했다는 점에서 주목받고 있습니다.

비디오 토큰화 어블레이션: 공간·시간 압축 효율성과 p32/t1 구성

비디오 데이터를 원본 픽셀 수준에서 다룰 때 가장 큰 실무적 난제는 시공간 토큰의 폭발적인 증가입니다. 연구진은 토큰당 1,024개의 픽셀을 할당하는 동일 예산 하에서 공간(Patch size)과 시간(Temporal frames) 분할 방식을 비교하는 비디오 토큰화 어블레이션(Ablation) 실험을 수행했습니다.

  • 실험 조건: 비디오 토큰 1개당 1,024개 픽셀을 배치하는 두 가지 핵심 구성(p16/t4 대 p32/t1)을 비교했습니다.
  • p16/t4 구성: 공간 패치 크기 $16 \times 16$에 시간 축 4프레임을 결합 ($16 \times 16 \times 4 = 1,024$ 픽셀).
  • p32/t1 구성: 공간 패치 크기 $32 \times 32$에 시간 축 1프레임을 결합 ($32 \times 32 \times 1 = 1,024$ 픽셀).
  • 결과 검증: 어블레이션 실험 결과, 공간 패치를 넓히고 시간 프레임을 개별 분할한 p32/t1 구성이 p16/t4 대비 가장 낮은 훈련 손실(lowest training loss)을 달성했습니다.

이 결과는 픽셀 공간에서 비디오 멀티모달 모델을 훈련할 때 시간적 압축보다 공간적 세부 정보의 안정적인 표현이 손실을 줄이는 데 더 효과적일 수 있음을 시사하며, 인코더 없는 비디오 토큰화 설계의 실증적인 기준점을 제공합니다.

오픈소스 생태계 영향과 실무 도입 시 고려사항

연구진이 GitHub와 Hugging Face를 통해 모델 코드, 사전 학습 가중치, 연구 논문을 동시에 전면 공개함에 따라, 개발자와 연구진은 인코더-프리 추론 스택을 직접 확인하고 감사할 수 있게 되었습니다.

  • 추론 스택 직접 감사 가능: 연구진이 공개한 공식 리포지토리(nv-tlabs/PixelUMM)와 허깅페이스 가중치(nvidia/PixelUMM)를 통해 복잡한 서드파티 인코더 종속성 없이 모델 구조를 직접 분석할 수 있습니다.
  • 연산 및 메모리 자원 고려사항: VAE나 ViT의 사전 압축 없이 원본 픽셀을 직접 다루므로, 고해상도 비디오나 장시간 시퀀스를 처리할 때 활성화 텐서 크기와 연산 메모리 요구량이 커질 수 있습니다.
  • 프로덕션 서빙 환경 요건: 현재 공개된 형태는 연구 및 아키텍처 탐색 목적의 오픈소스 코드와 모델 가중치 단계입니다. 단일 GPU 또는 엔터프라이즈 환경에서 실제 프로덕션 서비스로 배포하기 위해서는 세부적인 런타임 추론 최적화와 메모리 스케일링 파이프라인 구성이 수반되어야 합니다.

출처