NVIDIA Model Optimizer: 양자화·가지치기·증류 통합 모델 가속 툴킷
NVIDIA Model Optimizer(ModelOpt)는 NVFP4·FP8 양자화, 구조화된 가지치기, 지식 증류를 단일 라이브러리로 통합해 TensorRT-LLM, vLLM, SGLang 배포 추론 속도를 최적화하는 오픈소스 프레임워크입니다.
TAU HOME에서 Quantization 태그로 묶인 글입니다.
NVIDIA Model Optimizer(ModelOpt)는 NVFP4·FP8 양자화, 구조화된 가지치기, 지식 증류를 단일 라이브러리로 통합해 TensorRT-LLM, vLLM, SGLang 배포 추론 속도를 최적화하는 오픈소스 프레임워크입니다.