Mia AI Lab, 신규 캘리브레이션 적용 GLM-5.3-Flash 4비트 EXL3 양자화 모델 공개
Mia AI Lab이 새로운 캘리브레이션 기술로 MoE 레이어 양자화 오차를 최대 46% 줄이고 코딩 정확도를 개선한 GLM-5.3-Flash 4bit(EXL3 4bpw TensorFold) 드롭인 업그레이드 모델을 공개했습니다.
2026년 10월 4일, 오픈소스 AI 연구 조직 Mia AI Lab(@MiaAI_lab)이 신규 캘리브레이션(Calibration) 기술을 적용한 대형 언어 모델 'GLM-5.3-Flash-EXL3-4bpw-TensorFold'를 허깅페이스(Hugging Face)에 공개했습니다. 이번 모델은 기존 커뮤니티에서 널리 활용되던 TR3 4bpw 양자화와 동일한 포맷을 유지하면서도 가중치 오차를 대폭 줄인 것이 특징입니다.

이미지 출처: @plotarmordev / Mia AI Lab
GLM-5.3-Flash는 Z.ai의 대규모 MoE(Mixture-of-Experts) 아키텍처 모델로, 4비트 양자화 시 전문가 레이어에서 발생하는 정보 손실을 최소화하는 것이 로컬 서빙의 핵심 과제로 꼽혀왔습니다. 이번 릴리즈는 모델 크기와 연산 속도를 기존과 동일하게 유지하면서도 실제 코딩 및 추론 정확도를 원본 풀 모델 수준에 한층 가깝게 끌어올렸습니다.
신규 캘리브레이션과 MoE 양자화 오차 28~46% 감소
이번 업데이트의 핵심은 4비트 양자화 과정에서 발생하는 수치적 오차의 보정입니다.
- 전문가 레이어 오차 28~46% 제거: 기존 TR3 4bpw 대비 4비트 라우팅 전문가(MoE) 레이어에 누적되던 양자화 오차를 28~46%가량 개선했습니다.
- 원본 모델 근접도 향상: 8개 주요 벤치마크 테스트 셋 중 7개에서 원본 풀 정밀도 모델의 성능에 2~18% 더 가깝게 수렴하는 결과를 보였습니다.
- 자신감 있는 오답(Confident Wrong Picks) 37% 억제: 양자화 모델이 잘못된 토큰을 높은 확률로 선택하는 이른바 '자신감 있는 오답' 발생 비율을 최대 37%까지 줄였습니다.
코딩 품질 개선과 드롭인(Drop-in) 교체 호환성
실제 개발 작업에서 체감할 수 있는 생성 품질과 서빙 편의성도 함께 개선되었습니다.
- 간결한 코드 생성 및 중간 잘림 완화: 코딩 관련 응답 길이가 평균 약 10% 더 간결해졌으며, 토큰 생성 도중 코드가 잘리는 현상(cut-off)이 유의미하게 줄었습니다.
- 완전한 드롭인(Drop-in) 업그레이드: 기존 TR3 4bpw와 동일한 파일 크기, VRAM 메모리 점유율, 디코딩 추론 속도를 유지하므로 기존 파이프라인의 인프라 설정을 변경하지 않고 가중치만 즉시 교체할 수 있습니다.
- 일관된 벤치마크 점수: 종합 벤치마크 총점 자체는 기존과 유사하게 유지되지만, 모호한 추론 단계에서의 오류 발생률이 낮아져 실제 코딩 환경에서의 안정성이 강화되었습니다.
서빙 환경 및 런타임 고려사항
Mia AI Lab의 이번 모델은 고성능 로컬 추론 및 온프레미스 서빙 인프라에 적합하도록 설계되었습니다.
- 전용 서빙 스택 지원: EXL3 및 TensorFold 형식에 최적화된 런타임(vLLM 커스텀 빌드, DGX Spark 및 SM120 아키텍처 등)에서 원활하게 구동됩니다.
- 정확도 중심의 트레이드오프: 첫 토큰 지연시간(TTFT) 단축보다는 생성 토큰의 논리적 정확도와 오차 최소화에 집중된 릴리즈로, 신뢰도 높은 코드 어시스턴트 구축을 원하는 엔지니어들에게 권장되는 무료 업그레이드입니다.
출처
- Hugging Face: Mia-AiLab/GLM-5.3-Flash-EXL3-4bpw-TensorFold 모델 저장소
- X (@plotarmordev): GLM-5.3-Flash EXL3 4bpw TensorFold 릴리즈 안내