TAU-HOME.COM
LOADING

LingBot-Map: 20 FPS 실시간 스트리밍 3D 복원을 위한 파운데이션 모델 오픈소스 공개

ECCV 2026 베스트 페이퍼 후보작 LingBot-Map이 공개되었습니다. Geometric Context Transformer와 Paged KV Cache를 결합해 10,000프레임 이상의 장기 비디오에서도 초당 약 20프레임 속도로 안정적인 3D 재구성을 지원합니다.

tau · 2026년 10월 9일

#LingBot-Map #3D복원 #컴퓨터비전 #ECCV2026 #오픈소스 #FlashInfer #PyTorch

LingBot-Map: 20 FPS 실시간 스트리밍 3D 복원을 위한 파운데이션 모델 오픈소스 공개

Robbyant 연구팀이 실시간 스트리밍 3D 복원을 위한 피드포워드(Feed-forward) 파운데이션 모델 'LingBot-Map'의 소스코드와 사전학습 가중치를 Apache-2.0 라이선스로 오픈소스 공개했습니다. 컴퓨터 비전 학술대회 ECCV 2026의 Best Paper Award 후보작으로 선정된 이 프로젝트는 장기 비디오 스트림에서 카메라 궤적 추적과 3D 형상 재구성을 동시에 실시간으로 처리합니다.

LingBot-Map 실시간 3D 복원 아키텍처 다이어그램 및 포인트 클라우드 시각화

이미지 출처: Robbyant Team / GitHub

기존 피드포워드 기반 3D 재구성 기법들은 프레임 수가 증가함에 따라 누적되는 기하학적 오차(드리프트)와 메모리 병목 현상으로 인해 수천 프레임 이상의 장시간 비디오를 처리하는 데 한계가 있었습니다. LingBot-Map은 기하학적 메모리 아키텍처와 Paged KV 캐시 최적화를 결합하여 이 문제를 구조적으로 해결했습니다.

GCT(Geometric Context Transformer) 아키텍처와 드리프트 억제

LingBot-Map의 핵심은 앵커 컨텍스트(Anchor Context), 포즈 레퍼런스 윈도우(Pose Reference Window), 그리고 궤적 메모리(Trajectory Memory)를 단일 스트리밍 프레임워크로 통합한 GCT(Geometric Context Transformer) 아키텍처입니다.

  • 장거리 누적 오차 억제: 스트리밍 입력 과정에서 이전 시점의 핵심 기하 정보와 카메라 궤적을 통합 참조하여, 긴 시퀀스에서도 전체 좌표계의 왜곡이나 누적 드리프트를 효과적으로 제어합니다.
  • 고밀도 3D 형상 복원: 반복적인 전역 최적화(Bundle Adjustment) 연산 없이 순수 피드포워드 신경망 추론만으로 정밀한 포인트 클라우드 및 3D 형상을 복원합니다.

Paged KV Cache 기반 초당 20 FPS 실시간 추론

대규모 장기 시퀀스를 실시간으로 소화하기 위해 LLM 서빙에서 검증된 Paged KV 캐시 기법을 기하학적 어텐션 메커니즘에 적용했습니다.

  • 추론 성능: 518×378 입력 해상도 기준 약 20 FPS(초당 20프레임)의 안정적인 실시간 스트리밍 속도를 기록합니다.
  • 장기 시퀀스 지원: 10,000프레임 이상의 긴 비디오 시퀀스에서도 OOM(Out of Memory) 없이 일관된 메모리 사용량을 유지합니다.
  • 가속 백엔드: FlashInfer(flashinfer-python) 백엔드를 권장하며, 환경에 따라 PyTorch 네이티브 SDPA(Scaled Dot-Product Attention) 폴백을 지원합니다.

모델 체크포인트와 도구 생태계

프로젝트는 HuggingFace와 ModelScope를 통해 목적별 사전학습 모델 가중치를 배포하고 있습니다.

  • 제공 체크포인트: 범용 배포용 lingbot-map 가중치 및 연구·파인튜닝용 lingbot-map-stage1 사전학습 가중치 제공
  • 인터랙티브 웹 뷰어: Viser 기반의 실시간 3D 포인트 클라우드 시각화 웹 뷰어 내장
  • 하늘 영역 마스킹: 야외 환경 3D 재구성 시 노이즈를 유발하는 하늘 영역을 제거하기 위한 전용 ONNX 마스킹 모델 탑재

실행 요구사항 및 주요 주의점

실제 환경에 배포하거나 장시간 시퀀스를 처리할 때 다음 구성 요건과 제한 사항을 고려해야 합니다.

  • 권장 실행 환경: PyTorch 2.8.0 및 CUDA 12.8 환경을 권장하며, 최대 추론 속도 확보를 위해 FlashInfer 별도 설치가 권장됩니다. 오프라인 배치 렌더러 기능을 사용하려면 NVIDIA Kaolin 라이브러리 빌드가 필요합니다.
  • 포즈 붕괴 방지 및 모드 설정: 기본 설정에서는 상태 초기화(state resetting)가 비활성화되어 있어, 모델 훈련 시 관측된 최대 이동 범위를 벗어나면 포즈 추정에 왜곡이 생길 수 있습니다. 3,000프레임 이상의 장기 영상을 처리할 경우 윈도우 모드(--mode windowed)를 활성화하거나 키프레임 간격(--keyframe_interval)을 적절히 조절해야 합니다.

출처