27B급 Qwen3.8을 16GB GPU에 넣은 Swift 1.5 GSQ-RCO GGUF 양자화 릴리스
UkisAI의 추론 효율화 모델 Swift 1.5 Qwen3.8-27B를 llama.cpp용 초경량 2~3비트 GSQ-RCO GGUF로 패키징한 릴리스와 IQ3_S 16GB 실측 벤치마크 소식을 정리합니다.
UkisAI가 27B급 추론 효율화 모델인 Swift 1.5 Qwen3.8-27B를 llama.cpp 환경에서 바로 쓸 수 있는 초경량 GSQ-RCO GGUF 양자화물로 공개했습니다. OpenModelStats 기준 이 GSQ-RCO-GGUF 릴리스는 2026년 9월 24일부터 추적된 공개 모델이며, 2~3비트급 compact mixed-precision 구성을 표방합니다.

이미지 출처: ukisai / Hugging Face
이번 릴리스의 핵심은 모델 자체의 추론 효율화와 양자화 패키징이 분리된 두 단계라는 점입니다. Swift 1.5는 UkisAI가 Qwen3.8-27B의 파생 모델로 HF 모델카드에서 베이스 대비 thinking token 약 58.5% 감소와 약 0.35% 높은 점수를 표방한 모델이며, GSQ-RCO-GGUF는 그 Swift 1.5를 llama.cpp용으로 패키징한 양자화 릴리스입니다.
Swift 1.5와 GSQ-RCO-GGUF 릴리스의 관계
Swift 1.5 Qwen3.8-27B는 UkisAI의 설명에 따르면 Qwen3.8-27B의 추론 효율화 파생 모델로, thinking token을 약 58.5% 줄이면서 베이스보다 약 0.35% 높은 점수를 기록했다는 것이 모델카드의 주장입니다. 이는 UkisAI의 마케팅 주장이며 독립 검증된 수치가 아닙니다.
GSQ-RCO-GGUF 릴리스는 이 Swift 1.5를 대상으로 한 양자화 패키지입니다. Hugging Face 릴리스 페이지에 따르면 ISTA-DASLab의 GSQ-RCO per-tensor 할당을 Swift용으로 정제한 compact mixed-precision GGUF이며, llama.cpp용이고 MTP 헤드를 포함합니다. 모델 차원의 벤치마크와 양자화 측정치는 별개이므로, Swift 1.5의 점수 주장을 특정 양자화물의 품질로 그대로 읽어서는 안 됩니다.
- 베이스 모델: Swift 1.5 Qwen3.8-27B (UkisAI의 Qwen3.8-27B 추론 효율화 파생 모델)
- 이번 릴리스: Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF (compact 2~3비트 mixed-precision, llama.cpp용)
- 공개 추적 시작: OpenModelStats 기준 2026년 9월 24일
IQ3_S 실측 수치와 확인된 한계
제3자 집계 페이지(llm-bench.io, 2026년 10월 기준)는 IQ3_S-mtp 조합에 대해 커뮤니티 5회 측정 중 최대 약 51.2 tok/s의 로컬 추론 속도를 기록했다고 명시합니다. 같은 페이지의 집계 구조상 이 수치는 특정 하드웨어·도구·양자화 조합의 최고 기록이며, 해당 모델의 단일 대표 속도가 아닙니다.
별도 실측 노트(NemoClaw)는 RTX 2000 Ada 16GB 우분투 환경에서 IQ3_S 양자화물의 성능·메모리·추론·코딩 태스크를 평가했다고 명시합니다. 이 글에서 확인할 수 있는 검증 범위는 평가가 수행됐다는 사실까지이며, 개별 태스크 점수를 확정 수치로 인용하지 않습니다.
- 검증된 수치로 한정: HF 모델카드의 thinking token·점수 주장, llm-bench.io의 IQ3_S-mtp 최대 약 51.2 tok/s(5회 중 최고), NemoClaw의 16GB 환경 평가 수행 사실
- 제외한 수치: 원문 X 게시물의 본문이 중간("9.18× spee…")까지만 확보되어, 게시물이 주장한 디코드 속도 수치는 독립 검증하지 못했으므로 인용하지 않습니다
누구에게 의미 있나
16GB VRAM급 GPU에서 27B급 모델을 로컬로 돌리려는 사용자에게 이번 릴리스는 llama.cpp 호환 IQ3_S 경로를 제공한다는 점에서 의미가 있습니다. HF 릴리스 표에 따르면 IQ3_S 파일 크기는 약 11.77GB 수준으로 표기되어 있어, 16GB 환경에서 시도할 수 있는 용량대라는 점은 확인할 수 있습니다. 다만 실제 체감 속도와 컨텍스트·품질은 사용자의 GPU, llama.cpp 런타임 버전, 양자화 티어 선택에 따라 달라지므로, llm-bench.io의 조합별 표를 자신의 환경과 대조한 뒤 선택하는 것이 안전합니다.
출처
- Hugging Face: ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF
- Hugging Face: ukisai/Swift-1.5-Qwen3.8-27b (베이스 모델카드)
- OpenModelStats: Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF
- llm-bench.io: Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF:IQ3_S-mtp Benchmarks
- NemoClaw: Swift 1.5 Qwen3.8-27B GSQ-RCO IQ3_S 16GB LLM Performance Benchmark
- X 원문 신호: FHILY (@Oluwaphilemon1), 2026-10-07 게시물