Apple MLR, 추가 학습 없이 루프형 트랜스포머 추론 성능 높이는 'LoopCD' 공개
애플 머신러닝 리서치(Apple MLR) 연구팀이 루프형 트랜스포머의 초기 반복 상태를 대조 신호로 활용해 AIME 2024 정확도를 61.9%에서 73.3%로 높이고 연산량을 최대 48.2% 절감하는 추론 기법 LoopCD를 발표했습니다.
애플 머신러닝 리서치(Apple MLR) 연구팀이 2026년 10월 2일, 가중치를 공유해 반복 실행하는 루프형 트랜스포머(Looped Transformers)의 추론 정확도와 연산 효율을 대폭 끌어올리는 무학습(Training-free) 대조 디코딩 프레임워크 'LoopCD' 논문(arXiv:2610.02185)을 공개했습니다.

이미지 출처: Apple MLR / Ruixiang Zhang (@onloglogn)
이번 연구는 루이샹 장(Ruixiang Zhang), 웨이하오 류(Weihao Liu) 등 Apple MLR 연구진이 주도한 것으로, 추가 파라미터 학습이나 보조 모델(Auxiliary Model) 없이 모델 내부의 초기 루프 상태를 약한 참조 신호로 활용해 토큰 선택 정확도를 극대화하고 추론 비용을 획기적으로 낮추는 방법을 제시합니다.
루프형 트랜스포머의 '버려지던 초기 상태'를 대조 신호로 전환
루프형 트랜스포머(Looped Transformers)는 단일 계층 블록의 파라미터를 여러 번 반복(Recurrent loop) 실행함으로써, 모델의 물리적 가중치 크기를 늘리지 않고도 연산 깊이(Depth)를 확장하는 구조입니다.
기존 루프형 모델 디코딩 방식은 매 토큰 생성 시 마지막 루프의 최종 표현만을 사용하고, 이전 루프에서 생성된 중간 은닉 상태(Hidden states)는 모두 폐기했습니다. 그러나 연구팀은 초기 루프 역시 동일한 다음 토큰을 예측하도록 훈련된 표현을 담고 있으며, 계산량이 적은 초기 단계의 출력이 자연스럽게 '약한 참조(Weak reference)' 역할을 수행할 수 있다는 점에 주목했습니다.
LoopCD는 별도의 소형 모델을 함께 띄워 비교하는 기존 대조 디코딩(Contrastive Decoding)과 달리, 단일 모델 내부에서 이미 생성된 초기 루프와 최종 루프의 출력을 직접 대조합니다.
- LoopCD-Logits: 로짓(Logit) 공간에서 최종 루프와 초기 루프의 확률 분포 차이를 계산해 토큰을 재정렬합니다. 단 한 번의 추가 출력 투영(Output pass)만으로 구현됩니다.
- LoopCD-Hidden: 언어 모델 헤드로 넘어가기 전 은닉 상태(Hidden-state) 공간에서 직접 대조를 수행하여, 추가적인 출력 연산 오버헤드(Zero output overhead) 없이 대조 신호를 반영합니다.
AIME 2024 73.3% 달성과 연산량(FLOPs) 최대 48.2% 절감
연구팀은 Ouro, Huginn, Parcae, Looped-Qwen3 등 4가지 대표적 오픈소스 루프형 트랜스포머 아키텍처를 대상으로 수학 및 코딩 벤치마크를 평가했습니다.
- 수학 추론(AIME 2024): Ouro-2.6B-Thinking 모델에 LoopCD를 적용했을 때 pass@1 정확도가 기존 61.88%(61.9%)에서 73.33%(73.3%)로 11.45%p 급상승했습니다.
- 코드 생성(HumanEval): Huginn 모델 기준 pass@1 성능이 22.56%(22.6%)에서 31.71%(31.7%)로 크게 향상되었습니다.
특히 LoopCD는 추론 정확도 향상뿐만 아니라 대규모 연산 절감 경로를 제공합니다. 루프 실행 횟수(Loop depth)를 절반으로 줄인 상태에서 LoopCD를 적용해도 7개 표준 벤치마크의 평균 성능이 기존 최대 루프 실행 수준으로 유지되었으며, 이를 통해 포워드 연산량(FLOPs)을 22.5%에서 최대 48.2%까지 절감할 수 있음을 실증했습니다. 연구진에 따르면 여러 반복 단계 중 '첫 번째 루프(First iteration)'를 약한 참조로 삼을 때 대조 효과가 가장 우수했습니다.
적용 대상과 실무적 고려사항
LoopCD는 추가 가중치 파인튜닝이나 보조 모델 호스팅 비용이 들지 않는 강력한 장점을 지니지만, 아키텍처적 특성에 따른 명확한 적용 경계가 존재합니다.
- 루프형 아키텍처 전용: 계층 간 가중치를 공유하는 루프형 트랜스포머(Looped Transformer)에 맞춰 설계된 기법으로, 계층이 독립적으로 적층된 표준 트랜스포머에는 직접 적용할 수 없습니다.
- 프론티어 모델 관련 배경: 소셜 미디어를 중심으로 차세대 프론티어 모델(GPT-6 Astra, Gemini 4 등)에 루프형 트랜스포머가 도입되고 있다는 업계 루머가 거론되고 있으나, 이번 연구의 실험 검증은 공개된 오픈소스 루프형 언어 모델들을 기반으로 엄밀하게 수행되었습니다.
복잡한 추론 작업을 수행하는 루프 기반 소형 특화 모델이나 온디바이스(On-device) 환경에서 제한된 연산 자원으로 추론 품질을 극대화해야 하는 엔지니어링 환경에 실질적인 최적화 해법을 제공할 것으로 기대됩니다.
출처
- arXiv: Decoding Looped Transformers Better for (Almost) Free (arXiv:2610.02185)
- Ruixiang Zhang 공식 X (@onloglogn): LoopCD 연구 발표 게시글