Rapid-MLX v0.15.4: Apple Silicon용 Qwen3.8-27B TensorFold 및 DFlash2 투기적 디코딩 지원
Apple Silicon 로컬 LLM 추론 엔진 Rapid-MLX v0.15.4가 Qwen3.8-27B 및 GLM-5.3 Flash를 위한 실험적 TensorFold 프로파일과 DFlash2 투기적 디코딩 가속을 지원합니다.
TAU HOME에서 SpeculativeDecoding 태그로 묶인 글입니다.
Apple Silicon 로컬 LLM 추론 엔진 Rapid-MLX v0.15.4가 Qwen3.8-27B 및 GLM-5.3 Flash를 위한 실험적 TensorFold 프로파일과 DFlash2 투기적 디코딩 가속을 지원합니다.