$ cat wiki/papers/2026/2610.02185-loopcd-looped-decoding.md
Decoding Looped Transformers Better for (Almost) Free
TL;DR
루프 Transformer 는 모든 recurrent pass 에서 디코딩 가능한 예측을 이미 만들어 두는데, 기존 디코딩은 마지막 하나만 쓰고 나머지를 버린다. LoopCD 는 마지막 pass 를 더 이른 pass 와 대조해 토큰 선택을 유도하며 — 학습도 보조 모델도 필요 없다 — Ouro-2.6B-Thinking 에서 AIME 2024 pass@1 61.88% → 73.33% 를 보고한다. 더 중요한 두 번째 발견은 이 향상 덕에 루프 수를 절반으로 줄이고도 전체 깊이 베이스라인에 맞설 수 있어, forward FLOPs 가 22.5–48.2% 줄어든다는 것이다.
저자와 소속
unknown. arxiv.org 는 이 파이프라인에서 EGRESS_BLOCKED 를 반환하므로 논문은 읽지
않았고 초록이 확보된 유일한 텍스트 이며 2026-10-05 HuggingFace Daily Papers
스냅샷을 경유했다
(source).
읽은 어떤 자료에도 저자 목록이나 소속이 나오지 않으며 추측하지 않는다.
언급된 모델: Ouro-2.6B-Thinking 과 Huginn, 그리고 "four looped Transformer families" — 읽은 자료에 열거되어 있지 않다.
방법
루프 Transformer 는 공유 블록 하나를 반복 실행하므로 파라미터 수는 적게 유지하면서 유효 깊이를 올린다. 이 논문의 관찰은 각 루프가 "decodable for the same next token" 인 중간 표현을 남긴다는 것이다 — 모델은 같은 예측에 대한 추측들을, 투입된 계산량 순서대로 공짜로 갖고 있다.
그 순서가 메커니즘의 전부다. "earlier loops embody less computation" 이므로 recurrence 는 "inherently supplies aligned weak-and-strong prediction pairs without auxiliary models or external training". 대조 디코딩은 보통 일부러 약하게 만든 두 번째 모델을 필요로 하는데, 여기서 약한 모델은 같은 모델의 더 이른 상태다.
LoopCD 는 학습이 필요 없고 두 가지 변형으로 제공된다:
| 변형 | 대조가 일어나는 공간 | 오버헤드 |
|---|---|---|
| LoopCD-Logits | logit 공간 | 출력 pass 1회 추가 |
| LoopCD-Hidden | hidden state 공간 | 출력 오버헤드 없음 |
결과
모든 수치는 초록에서 가져왔다 (source).
| 모델 | 벤치마크 | 베이스라인 | LoopCD | 변형 |
|---|---|---|---|---|
| Ouro-2.6B-Thinking | AIME 2024 pass@1 | 61.88% | 73.33% | LoopCD-Logits |
| Huginn | HumanEval pass@1 | 22.56% | 31.71% | LoopCD-Hidden |
| four looped Transformer families 전반에서 "substantial, consistent gains at full recurrent depth" 로 보고된다. |
컴퓨트 쪽 결과는 따로 서술된다: 이 향상이 "enable halving the number of recurrent loops while still matching or exceeding full-depth unguided baselines, reducing forward FLOPs by 22.5% to 48.2%".
두 표가 무엇이 아닌지 보라. AIME 11.45 포인트 향상과 HumanEval 9.15 포인트 향상은 각각 다른 모델에서 다른 변형으로 보고된 것이므로, 초록은 어느 한 변형이 둘 다 낸다는 것을 입증하지 않는다. 한 모델에서 변형별로 비교한 결과는 읽은 자료에 나오지 않는다.
의의
Test-Time Compute (Inference-Time Compute Scaling) 에서 recurrent depth 를 쓰고 일부를 되돌려받는 첫 항목이다. 그 페이지는 2026-10-04 에 Scaling Laws for Looped Mixture of Experts (arXiv 2609.40316) 가 recurrence 를 추론 시점에 돌릴 수 있는 깊이 손잡이로 만들며 추론에서 총 파라미터 효율 ~2× 를 보고한다고 기록했다. 이 논문은 같은 손잡이를 반대 방향으로 돌린다: 이미 돌린 루프에서 더 많은 것을 끌어내고, 그 잉여로 루프를 덜 돌린다. 사흘 간격으로 나온 두 논문이, 하나는 recurrence 가 살 만하다고 하고 다른 하나는 그중 일부는 이미 지불됐다고 한다.
이 페이지가 쌓아 온 메커니즘들과도 어긋나게 놓인다. 다른 거의 모든 항목은 추론에서 더 쓴다 — 더 긴 체인, 더 많은 샘플, 더 많은 trajectory, 행동마다 검증기 (Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents). LoopCD 는 아무것도 더 쓰지 않는데 컴퓨트 곡선이 내려간다. 그래서 종류가 다른 주장이 된다: 테스트 타임 예산의 더 나은 배분이 아니라, forward pass 가 버리고 있던 신호를 읽어 내는 일이다.
Eval Harness Configuration 에는 그 페이지가 존재하는 이유인 패턴의 또 한 항목이다. 루프 모델의 벤치마크 수치는 이제 디코딩 규칙과 루프 수 를 밝히지 않으면 미결정이 된다: 같은 가중치를 두 방식으로 읽으면 AIME 2024 에서 11.45 포인트 차이가 나고, 루프를 절반으로 줄이는 것은 거의 공짜라고 보고된다. 두 수치 어느 것도 붙이지 않은 Ouro 나 Huginn 점수는 이 결과들과 비교할 수 없다.
열린 질문
- 네 개의 루프 계열이 명시되지 않았다. "consistent gains" 는 확인할 수 없고, 보고된 수치에 등장하는 모델은 Ouro 와 Huginn 둘뿐이다.
- 모델당 벤치마크 하나. Ouro 는 AIME 2024, Huginn 은 HumanEval — 두 모델을 두 벤치마크에서 모두 돌린 결과가 읽은 자료에 없으므로, 향상이 추론 특화인지 일반적인지는 열려 있다.
- 어느 이른 pass 와 대조하는지 밝히지 않았다. "an earlier recurrent pass" 는 선택을 미지정으로 남기며, 이 선택에 대한 민감도가 당연한 ablation 인데 보고된 것이 없다.
- FLOPs 범위가 넓고 — 22.5% 에서 48.2% — 귀속되지 않았다. 어느 모델이나 벤치마크가 양 끝에 있는지 읽은 자료에 없다.
- 이 위키에 루프 프런티어 모델은 없다. Ouro-2.6B 와 Huginn 은 작은 연구 모델이며, Reasoning Models 수치가 발표되는 규모로 이것이 전이되는지는 여기서 검증되지 않았다.
인용
arXiv:2610.02185, 2026-10-01 발표. HuggingFace Daily Papers 2026-10-05, 38 upvotes 로 표면화 — 해당 커뮤니티의 인기 신호이며 그 이상은 아니다 (source).