Rapid-MLX v0.15.4: Apple Silicon용 Qwen3.8-27B TensorFold 및 DFlash2 투기적 디코딩 지원

Apple Silicon 로컬 LLM 추론 엔진 Rapid-MLX v0.15.4가 Qwen3.8-27B 및 GLM-5.3 Flash를 위한 실험적 TensorFold 프로파일과 DFlash2 투기적 디코딩 가속을 지원합니다.

tau · 2026년 10월 3일

#Rapid-MLX #AppleSilicon #Qwen3.8 #SpeculativeDecoding #LLM #MLX

Rapid-MLX v0.15.4: Apple Silicon용 Qwen3.8-27B TensorFold 및 DFlash2 투기적 디코딩 지원

Apple Silicon 환경에서 고성능 로컬 LLM 추론을 지원하는 오픈소스 엔진 Rapid-MLX가 v0.15.4 릴리스를 통해 Qwen3.8-27B 모델 전용 실험적 프로파일인 qwen3.8-27b-tensorfold를 공개했습니다. 이번 릴리스는 DFlash2 기반 투기적 디코딩(Speculative Drafter) 구조를 결합하여 모델 가중치의 수정 없이 순차적 오토리그레시브(Autoregressive) 생성 병목을 완화하고 Apple Silicon 통합 메모리 환경에서의 텍스트 생성 처리량을 향상시키는 것이 특징입니다.

Rapid-MLX v0.15.4 Apple Silicon LLM 추론 엔진과 Qwen3.8-27B TensorFold DFlash2 투기적 디코딩 아키텍처 다이어그램

이미지 출처: Rapid-MLX

DFlash2 투기적 디코딩과 TensorFold 가속 파이프라인

투기적 디코딩은 경량 초안 모델(Drafter)이 여러 개의 미래 토큰 후보를 앞서 제안하고, 메인 타깃 모델이 단 한 번의 순방향 연산(Forward Pass)으로 해당 후보들을 일괄 검증하는 추론 가속 기법입니다.

Rapid-MLX v0.15.4의 qwen3.8-27b-tensorfold 프로파일은 DFlash2 드래프터를 Qwen3.8-27B 체크포인트와 결합하여 작동합니다.

  • 병렬 토큰 검증: 초안 모델이 생성한 토큰 예측이 허용될 때마다, 27B 타깃 모델이 고비용 순방향 패스 1회당 다수의 토큰을 확정 생성할 수 있어 순차적 디코딩 병목을 병렬 연산 구조로 전환합니다.
  • 출력 무결성 보존: 투기적 디코딩 메커니즘은 타깃 모델의 확률 분포에 맞춰 엄격하게 검증하므로, 양자화 손실이나 휴리스틱 변형 없이 원래 모델과 완전히 동일한 정밀도의 텍스트 출력을 보장합니다.
  • 하드웨어별 성능 특성: Mac M4 Max 환경의 커뮤니티 실측에서는 숫자 생성 시 154 tok/s, 코드 생성 시 114 tok/s 수준이 관측되었으나, 공식 릴리스 문서에서는 워크로드 특성과 하드웨어 대역폭에 따른 편차를 고려하여 고정된 배수 향상을 보증하지 않고 opt-in 실험 프로파일로 분류하고 있습니다.

TensorFold 제약 사항과 기본 4bit 프로파일의 역할 분담

새롭게 도입된 TensorFold 경로는 순수 텍스트 생성 처리량 극대화에 초점을 맞추고 있어, 실제 프로덕션 워크로드 적용 시 기능 지원 범위를 명확히 구분해야 합니다.

  • 단일 스트림 전용: 한 번에 오직 1개의 텍스트 요청(Single Stream)만 처리하도록 설계되어 다중 동시 접속 처리에는 적합하지 않습니다.
  • 에이전트 기능 제한: 도구 호출(Tool Calling), 멀티모달 미디어 입력, 문법(Grammar) 제약 조건을 지원하지 않으며 해당 요청이 인입될 경우 실행을 거부합니다.
  • 기본 qwen3.8-27b-4bit 경로 유지: 구조화된 도구 호출과 멀티모달 처리가 필요한 범용 워크로드를 위해 표준 4bit 프로파일이 풀기능 기본값으로 유지됩니다. $ rapid-mlx serve qwen3.8-27b-4bit 명령으로 기동되며, Hermes 도구 호출 규격과 <thought> 체인 오브 쏘트(CoT) 스트리밍을 /v1/chat/completions 및 /v1/responses 엔드포인트에서 지원합니다.
  • 기본 프로파일 실측 기준: Mac mini M4 Pro(48GB) 기준 표준 qwen3.8-27b-4bit는 16.3GB 가중치 크기에서 단일 스트림 24.1 tok/s, 4 스트림 집계 24.0 tok/s의 디코드 속도와 Metal 피크 메모리 25.3GB를 기록했습니다.

GLM-5.3 Flash MTP 지원 및 Apple Silicon 로컬 LLM 생태계 확장

이번 Rapid-MLX v0.15.4 업데이트는 Qwen3.8-27B 외에도 고용량 메모리 환경을 위한 지원을 함께 확장했습니다.

  • GLM-5.3 Flash TensorFold 프로파일: 256GB급 대용량 Mac 시스템을 위한 GLM-5.3 Flash 전용 TensorFold 가속 프로파일이 추가되었습니다.
  • MTP 헤드 기본 가속: 멀티 토큰 예측(Multi-Token Prediction) 아키텍처를 갖춘 모델의 MTP-head 가속이 기본 지원되어 대형 모델 구동 효율을 높였습니다.

Rapid-MLX의 이번 릴리스는 Apple Silicon 통합 메모리 환경에서 27B급 고성능 오픈 가중치 모델을 로컬 서빙할 때, 모델 자체의 손실성 압축 없이도 추론 파이프라인 최적화만으로 실용적인 생성 속도를 확보할 수 있는 진화된 경로를 보여줍니다.

출처