Project Maya 신규 릴리스: 최대 16개 GPU 확장 지원 및 RTX 3090·Tesla V100 추론 속도 최적화
오픈소스 LLM 추론 엔진 Project Maya의 신규 릴리스가 공개되었습니다. 최대 16개 GPU 병렬 구성을 지원하며, RTX 3090 디코드 속도 향상과 Tesla V100 프리필 성능 개선(최대 674 tok/s)이 포함되었습니다.
오픈소스 대규모 언어 모델(LLM) 고속 추론 프레임워크인 'Project Maya'의 신규 릴리스가 2026년 10월 공식 공개되었습니다. 이번 업데이트는 멀티 GPU 분산 스케일링 확장과 구형 및 메인스트림 GPU 하드웨어에서의 디코드 및 프리필 처리 성능 최적화에 중점을 두었습니다.
Project Maya는 로컬 및 온프레미스 인프라에서 대형 언어 모델을 효율적으로 구동하도록 돕는 추론 가속 도구입니다. 개발자 커뮤니티(@needmorevram 등 기여자 협업)를 통해 배포된 이번 릴리스는 단일 장비를 넘어 최대 16개 GPU에 달하는 대규모 클러스터 스케일링 지원과 함께, 실무 환경에서 널리 활용되는 GPU 아키텍처를 겨냥한 속도 개선을 대거 포함했습니다.
최대 16개 GPU 확장과 분산 추론 지원
이번 릴리스의 핵심 기술 변경점은 병렬 처리 가능한 GPU 풀이 최대 16개로 대폭 확장된 점입니다.
- 16개 GPU 스케일아웃: 기존 대비 확장된 GPU 클러스터 구성을 지원하여, 단일 노드 또는 다중 노드 환경에서 고용량 파라미터를 갖춘 대형 모델을 분산 로드할 수 있습니다.
- 분산 연산 효율: 다중 GPU 환경에서 통신 병목을 최소화하고 모델 가중치 분할 및 텐서 병렬 처리를 안정적으로 수행할 수 있도록 파이프라인이 정비되었습니다.
RTX 3090 디코드 가속 및 Tesla V100 프리필(최대 674 tok/s) 성능 최적화
이번 릴리스에서는 현장 워크스테이션 및 데이터센터 레거시 GPU 환경의 실측 성능 벤치마크가 대폭 상향되었습니다.
- NVIDIA GeForce RTX 3090 디코드 최적화: 24GB VRAM을 갖춘 RTX 3090 카드에서 토큰 생성 단계인 디코드(decode) 처리 속도를 끌어올렸습니다.
- NVIDIA Tesla V100 프리필 속도 개선:
- 1x Tesla V100 환경: 프롬프트 입력 처리 단계인 프리필(prefill) 처리 속도가 최대 620 tok/s까지 향상되었습니다.
- 2x Tesla V100 환경: 프리필 속도가 최대 674 tok/s까지 측정되어 프롬프트 연산 병목을 개선했습니다.
- 24GB VRAM 대상 대형 모델(GLM 등) 튜닝: Qwen3.8 Flash Next 대비 파라미터 규모가 큰 GLM 등 대형 모델을 대상으로 24GB 카드에서 디코드 및 프리필 속도를 끌어올리는 추가 최적화 작업이 반영되었습니다.
하드웨어 지원 범위 및 도입 시 유의사항
Project Maya의 이번 성능 향상은 특정 하드웨어 환경과 아키텍처에 집중되어 있으므로 환경 구성 시 다음 사항을 확인해야 합니다.
- 이종 GPU(Heterogeneous) 혼합 구성 미확인: 서로 다른 아키텍처나 모델의 GPU를 혼합하여 클러스터를 구성하는 기능에 대해서는 현재 지원 여부가 명시되지 않았습니다.
- 비-NVIDIA(AMD Radeon 등) 지원 제한: AMD Radeon(예: RX 6750 XT 등)과 같은 타사 GPU 환경에 대한 지원은 아직 제한적이며, 최적화 혜택은 주로 NVIDIA CUDA 환경을 타깃으로 제공됩니다.
출처
- GitHub 저장소: mw00/project-maya
- Peasant Smith 공식 X 안내: Project Maya New Release Announcement