TAU-HOME.COM
LOADING

단일 DGX Spark에서 Qwen3.8-Flash-Next NVFP4 구동 실측: 1M 컨텍스트와 FP8 KV 캐시

128GB 통합 메모리 단일 DGX Spark에서 Qwen3.8-Flash-Next NVFP4 구동 실측이 공개되었습니다. FP8 KV 캐시로 1M 컨텍스트와 4개 스트림 동시 서빙을 지원합니다.

tau · 2026년 10월 7일

#DGX Spark #Qwen3.8 #NVFP4 #FP8 KV #로컬 LLM

단일 DGX Spark에서 Qwen3.8-Flash-Next NVFP4 구동 실측: 1M 컨텍스트와 FP8 KV 캐시

2026년 10월 7일, 단일 128GB 통합 메모리 사양의 NVIDIA DGX Spark(GB10) 머신에서 공식 4비트 양자화 모델인 Qwen3.8-Flash-Next NVFP4를 실측 서빙한 성능 지표와 구동 레시피가 공개되었습니다. 이번 실측은 FP8 KV 캐시를 결합해 최대 100만(1M) 토큰 수준의 초대형 컨텍스트와 멀티모달 입력을 단일 데스크톱 폼팩터에서 처리할 수 있음을 검증하며, 고성능 로컬 AI 인프라 구성의 현실적인 벤치마크를 제시했습니다.

기존에 대규모 매개변수 모델과 장문 컨텍스트를 동시에 다루기 위해서는 다중 GPU 클러스터나 대규모 서버 랙이 필수적으로 요구되었습니다. 그러나 이번에 보고된 Qwen3.8-Flash-Next NVFP4 런타임은 단일 노드의 메모리 대역폭과 FP8 캐시 기법을 정밀하게 조율하여, 독립 워크스테이션 1대만으로도 긴 문서 분석, 장시간 에이전트 세션, 다중 동시 요청을 안정적으로 소화할 수 있는 성능 프로필을 확인했습니다.

FP8 KV 캐시와 1M 컨텍스트: 143만 개 토큰 용량 확보

가장 주목할 만한 기술적 성과는 FP8 KV 캐시 적용을 통해 달성한 극적인 컨텍스트 확장성입니다.

일반적인 16비트(BF16) KV 캐시를 사용할 경우 수십만 토큰만으로도 128GB 통합 메모리의 상당 부분을 잠식하게 됩니다. 반면 이번 레시피는 FP8 형식의 KV 캐시를 도입하여 메모리 효율을 극대화했습니다.

  • 143만 토큰 규모의 KV 풀: 메모리 목표치 설정에 따라 약 1,431,164개의 KV 토큰 용량을 확보했습니다. 이는 기존 BF16 KV 캐시 구성 대비 약 1.8배에서 1.9배에 달하는 용량입니다.
  • 초장문 워크로드 수용: 100만(1M) 토큰에 달하는 컨텍스트 창을 지원함으로써 대용량 코드베이스 전수 분석, 수백 페이지 분량의 기술 문서 및 법률 검토, 브라우저 조작 에이전트의 긴 실행 궤적(trajectory)을 단절 없이 단일 세션에 적재할 수 있습니다.
  • 복수 에이전트 메모리 공유: 대규모 KV 캐시 풀 덕분에 단일 사용자의 단독 질의를 넘어, 여러 독립 에이전트 세션이 하나의 로컬 머신에서 컨텍스트를 유지하며 공존하는 것이 가능해졌습니다.

프리필 속도와 4개 동시 스트림 86 tok/s 처리량

추론 처리량(throughput) 측면에서도 긴 입력과 동시 요청 처리에 최적화된 수치가 실측되었습니다.

장문 프롬프트를 다룰 때 체감 응답 시간을 좌우하는 프리필(prefill) 단계에서 매우 빠른 처리 속도를 기록했습니다.

  • 초고속 프리필 성능: FP8 KV 환경에서 400K 토큰에 달하는 대규모 프롬프트에 대한 프리필 스트레스 테스트를 성공적으로 통과했으며, 이때 약 1,495 tok/s의 처리 속도를 나타냈습니다. 상대적으로 짧은 32K 토큰 프리필에서는 약 1,769 tok/s에 도달하며, 전반적으로 1,500~2,000 tok/s 범위의 안정적인 프리필 대역을 보여주었습니다.
  • 단일 스트림 산문 디코드: 단일 요청 기준 산문(prose) 생성 디코드 속도는 약 37 tok/s로 측정되었습니다.
  • 4개 동시 스트림 확장: 동시 요청을 4개 스트림으로 확장할 경우 총합(aggregate) 처리량은 약 86 tok/s까지 증가했습니다.

이러한 동시 처리량은 로컬 AI 서버를 단순한 개인용 대화창이 아닌, 백그라운드에서 복수의 에이전트 작업을 병렬로 분기하고 처리하는 워크스테이션 엔진으로 활용할 때 핵심적인 이점을 제공합니다.

멀티모달 입력 지원과 추측 디코딩 및 용량 트레이드오프

이번 런타임 구성은 텍스트뿐만 아니라 이미지 및 비디오 프레임 입력을 처리하는 비전-언어 멀티모달 파이프라인을 그대로 보존하고 있습니다. 하지만 실전 배치 시 고려해야 할 명확한 제약과 트레이드오프 역시 보고되었습니다.

  • 추측 디코딩(Speculative Decoding) 효율 저하: 텍스트 전용 요청과 달리, 멀티모달 입력이 포함될 경우 드래프트 모델이 멀티모달 임베딩을 직접 소비하지 못하는 구조적 한계가 존재합니다. 이로 인해 추측 디코딩 가속 효과가 제한되며, 이미지나 영상이 포함된 세션에서는 비추측 기본 디코드 속도로 회귀할 수 있습니다.
  • 비디오 토큰 소모율: 비디오 입력은 프레임 샘플링에 따라 막대한 양의 토큰을 소비합니다. 비록 1M 토큰 컨텍스트 창을 갖추었더라도 고해상도 장편 영상을 반복 입력할 경우 KV 캐시가 급격히 고갈되므로 세심한 프레임 다운샘플링과 토큰 관리가 요구됩니다.
  • 단일 스트림 대안 레시피와의 비교: 현재 오픈소스 커뮤니티와 개발자 포럼에는 단일 스트림 디코드 속도에 특화되어 더 높은 tok/s를 보고하는 다른 단일 Spark 레시피들도 존재합니다. 따라서 단일 사용자의 즉각적인 응답 레이턴시를 우선시할 것인지, 아니면 1M 컨텍스트와 멀티 에이전트 동시성을 우선시할 것인지에 따라 적합한 런타임을 선별해야 합니다.

출처