엔비디아, VAE·ViT 인코더 없앤 픽셀 공간 통합 멀티모달 모델 'PixelUMM' 오픈소스 공개
NVIDIA 연구진이 VAE와 ViT를 제거하고 원본 픽셀 공간에서 이미지 및 비디오의 시각적 이해와 생성을 단일 인코더-프리 구조로 처리하는 'PixelUMM'의 코드와 모델 가중치를 오픈소스로 공개했습니다.
TAU-HOME.COM에서 nv-tlabs 태그로 묶인 글입니다.
NVIDIA 연구진이 VAE와 ViT를 제거하고 원본 픽셀 공간에서 이미지 및 비디오의 시각적 이해와 생성을 단일 인코더-프리 구조로 처리하는 'PixelUMM'의 코드와 모델 가중치를 오픈소스로 공개했습니다.