무검열 Nex-N2.5-mini GGUF 출시: 18GB VRAM 단일 GPU로 로컬 구동하는 35B MoE 실전 팁
거부 반응이 제거된 무검열 Nex-N2.5-mini GGUF 빌드(IQ4_XS)가 공개되어 18GB VRAM 환경에서 로컬 구동이 가능해졌습니다. 35B MoE(3.5B 활성), 262K 컨텍스트, 비전 및 llama.cpp 에이전틱 코딩 지원 사양과 활용 팁을 정리합니다.
로컬 오픈소스 인공지능 커뮤니티와 보안 연구 분야에서 큰 주목을 받는 소형 고성능 모델 라인업에 중요한 업데이트가 공개되었습니다. 인공지능 연구자 Md Ismail Šojal(@0x0SojalSec)이 X(구 트위터)를 통해 거부 반응(Refusal)이 제거된 무검열(Uncensored) 버전의 'Nex-N2.5-mini' GGUF 양자화 빌드가 배포되었으며, IQ4_XS 양자화를 통해 18GB VRAM을 갖춘 단일 그래픽카드 환경에서 온전히 로컬 구동이 가능해졌다고 발표했습니다.

이미지 출처: Hugging Face (orcarouter/Nex-N2.5-mini-Uncensored-GGUF)
이번에 공개된 Nex-N2.5-mini GGUF 빌드는 전체 35B 매개변수 중 토큰 추론 시 3.5B 파라미터만을 활성화하는 희소 혼합 전문가(MoE, Mixture of Experts) 아키텍처를 기반으로 설계되었습니다. 대규모 모델의 풍부한 표현력과 소형 모델의 빠른 연산 속도를 동시에 확보한 동시에, llama.cpp 프레임워크와 직접 호환되도록 빌드되어 고사양 워크스테이션이 아닌 준전문가급 단일 GPU 환경에서도 손쉽게 구동할 수 있습니다.
18GB VRAM에서 구동하는 35B MoE(3.5B 활성)와 GGUF 양자화 사양
로컬 환경에서 대규모 언어 모델을 운용할 때 가장 큰 물리적 제약은 GPU 메모리 용량입니다. 통상 30B급 이상의 밀집(Dense) 모델을 단일 컨슈머 GPU에서 구동하기 위해서는 극단적인 가중치 양자화로 인한 품질 저하를 감수하거나 다중 GPU 분산 환경을 구성해야 했습니다.
Nex-N2.5-mini는 이러한 하드웨어 병목을 MoE 구조와 정교한 양자화 기법으로 해결했습니다.
- 35B 총 매개변수와 3.5B 활성 매개변수: 전체 가중치 규모는 35B에 달하지만, 각 추론 단계에서 활성화되는 전문가 레이어는 3.5B 수준에 불과합니다. 이를 통해 모델의 폭넓은 지식 베이스를 유지하면서도 연산 복잡도와 발열, 전력 소비를 획기적으로 낮췄습니다.
- IQ4_XS 양자화 기반 18GB VRAM 구동: 고효율 중요도 기반 양자화(IQ, Importance Matrix Quantization) 방식인 IQ4_XS 규격으로 패키징되어 18GB VRAM을 지원하는 그래픽카드 메모리에 안정적으로 상주합니다.
- 거부 반응 제거(Refusal Removed): 기존 상용 모델이나 안전성 튜닝 과정에서 부가되는 과도한 거부 필터를 해제하여 보안 취약점 점검, 코드 역공학, 레드팀 시뮬레이션 등 엄격한 연구 및 실험 환경에서 모델이 답변을 회피하지 않고 기술적 지시를 끝까지 수행하도록 조정되었습니다.
하이브리드 델타넷 어텐션과 262K 컨텍스트 및 비전 워크플로우
Nex-N2.5-mini는 단순한 텍스트 생성 모델에 머무르지 않고, 장문 맥락 처리와 멀티모달 시각 분석을 아우르는 하이브리드 신경망 설계를 채택했습니다.
- 하이브리드 게이티드 델타넷(Gated Delta-Net) + 풀 어텐션(Full Attention): 선형 복잡도를 가지는 회귀적 게이티드 델타넷 구조와 전역적 관계를 정밀하게 파악하는 풀 어텐션 메커니즘을 결합했습니다. 긴 시퀀스를 처리할 때 메모리 증가폭을 억제하면서도 정밀한 컨텍스트 회상 능력을 보존합니다.
- 262K 초장문 컨텍스트 윈도우 지원: 최대 262,144개 토큰에 달하는 대용량 문맥 창을 지원합니다. 수십 개의 소스 코드 파일 전체, 대규모 기술 문서, 복잡한 시스템 로그를 프롬프트에 통째로 주입하여 일관된 코드 분석과 맥락 추적이 가능합니다.
- 비전 프로젝터(mmproj) 동봉: 모델 패키지에 멀티모달 비전 프로젝터(mmproj) 파일이 기본 포함되어 있습니다. 스크린샷 캡처 화면, UI 인터페이스 다이어그램, 아키텍처 흐름도를 이미지로 직접 전달받아 화면 요소를 판별하고 컴퓨터 사용(Computer-Use) 스타일의 제어 워크플로우를 보조할 수 있습니다.
llama.cpp 기반 에이전틱 코딩 지원과 연구용 빌드 활용 시 주의사항
원작자 @0x0SojalSec이 제시한 핵심 사양 중 하나는 에이전틱 코딩(Agentic Coding) 도구 및 llama.cpp 에코시스템과의 즉각적인 상호 운용성입니다.
- llama.cpp 즉시 구동 지원: 별도의 전용 프레임워크나 독자적인 런타임 없이도 표준 최신 llama.cpp 바이너리 및 관련 도구(llama-server, llama-cli 등)에서 바로 모델 파일을 로드하여 추론 및 API 서빙을 시작할 수 있습니다.
- 컴퓨터 유즈(Computer-Use) 및 자율 에이전트 연동: 비전 입력과 시스템 제어 문맥을 함께 해석할 수 있어 터미널 명령 생성, IDE 연동, UI 조작 등 개발 에이전트 파이프라인의 백엔드 모델로 배치하기에 적합합니다.
- 연구용 빌드(Research Build) 명시: 원작자는 본 배포판이 상업용 엔드유저를 위한 완성형 챗봇(Production Chatbot)이 아닌 '연구용 빌드(Research Build)'임을 명확히 강조했습니다. 가드레일이 제거된 특성상 예기치 않은 출력이 발생할 수 있으므로, 대외 서비스 배포 목적이 아닌 로컬 보안 분석, 모델 평가, 자동화 에이전트 실험 용도로 제한하여 운용하는 것이 권장됩니다.
원문 공유 링크를 통해 Hugging Face 등 오픈 모델 저장소에서 GGUF 가중치 및 mmproj 바이너리를 직접 내려받을 수 있으며, 단일 워크스테이션 환경에서 무검열 MoE 모델의 자율 코딩 역량을 검증하고자 하는 개발자에게 최적의 실전 기준점을 제공합니다.
원문 출처
본 실전 가이드는 AI 보안 연구자 Md Ismail Šojal(@0x0SojalSec)이 공개한 무검열 Nex-N2.5-mini GGUF 배포 정보를 바탕으로 작성되었습니다. 모델 다운로드 및 세부 아키텍처 논의는 아래 원문 포스트 링크에서 직접 확인하실 수 있습니다.
- Md Ismail Šojal(@0x0SojalSec) 원문 X 포스트: https://x.com/0x0SojalSec/status/2098112178624889327
- 원문 공유 배포 링크: https://t.co/1jd789Rhwv