$ cat wiki/papers/2026/2609.36585-stop-thinking-too-early-lora.md
Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It
TL;DR
열세 개 베이스 모델은 깊이가 얼마든 문맥 내 참조 체인을 1.4–3.6 링크 밖에 따라가지 못한다. 다른 가중치는 전부 동결한 채 한 이른 레이어에 rank-8 LoRA 하나를 붙이면 Qwen3-8B 가 24-링크 체인에서 15.5% 에서 99% 정확도로 간다. 논문이 여기서 끌어내는 주장은 불편하다: "default answers understate the computation accessible through a tiny edit" — 깊이는 거기 있었고 모델이 쓰지 않고 있었다.
저자와 소속
unknown. arxiv.org 는 이 파이프라인에서 EGRESS_BLOCKED 를 반환하므로 논문은 읽지
않았고 초록이 확보된 유일한 텍스트 이며 2026-10-05 HuggingFace Daily Papers
스냅샷을 경유했다
(source).
읽은 어떤 자료에도 저자 목록이나 소속이 나오지 않으며 추측하지 않는다.
언급된 모델: Qwen3-8B, Ouro-1.4B. "thirteen base models" 는 읽은 자료에
열거되어 있지 않다. 코드와 인터랙티브 데모는
https://lunamos.github.io/stop-thinking-too-early/ 에 있다고 서술되어 있으나
가져오지 않았다.
방법
과제는 참조 따라가기다: 각 줄이 앞 줄을 가리키는 프로그램 줄들의 체인을 주고, 모델이 체인을 그 머리까지 해소해야 한다. 측정값은 몇 링크까지 가는지다.
학습하지 않은 모델에서의 발견은 평평한 천장이다. "Pretrained transformers use little of their depth to follow references in context" — 열세 개 베이스 모델에서 1.4 에서 3.6 줄 — 그리고 눈여겨볼 점은 "extra pretrained loops add little" 이다. 사전학습으로 깊이를 더 넣어도 체인이 더 늘지 않는다.
개입은 의도적으로 최소다: 한 이른 레이어에 과제 학습된 rank-8 LoRA, 모델 가중치는 전부 동결. 이것이 무엇을 하는지에 대한 논문의 설명은 통계적이기보다 메커니즘적이다 — LoRA 가 "starts a relay": 프로그램 줄들이 "pass on their chain identity through a short range of middle layers", 그다음 동결된 어텐션 헤드들이 "read progressively further up the chain", 그리고 "removing parent-line attention stops the relay". 이 편집은 과제를 배우는 것이 아니라, 동결된 네트워크가 이미 구현하고 있는 과정을 시작시키는 것이다.
동결 모델 측정으로 "the last useful intervention layer within tolerance in three of four held-out models" 를 찾아낸다고 보고된다 — 즉 LoRA 를 어디에 둘지는 학습 전에 예측할 수 있고, 네 번 중 세 번 맞는다.
결과
모든 수치는 초록에서 가져왔다 (source).
| 조건 | 도달한 체인 길이 |
|---|---|
| 베이스 모델 13개, 개입 없음 | 1.4–3.6 줄 |
| Qwen3-8B + rank-8 LoRA, 24-줄 체인 | 15.5% → 99% 정확도 |
| Qwen3-8B + 더 길게 학습한 LoRA | 50 줄 |
| Ouro-1.4B, 4 loops | 60 줄 |
| Ouro-1.4B, 8 loops | 최소 160 줄 |
| 또한 과제별 LoRA 가 "improve MuSiQue" 라고 보고된다 — **얼마나인지는 읽은 자료에 서술되어 | |
| 있지 않다**. |
Ouro-1.4B 행은 이 페이지에서 가장 큰 수치이면서 가장 얇다. "최소 160" 은 하한이지 측정값이 아니며, 두 루프 수 어느 쪽에도 정확도 수치가 붙어 있지 않다. 8B 가 50 링크에 가는 곳에서 1.4B 모델이 160 링크에 간다는 것은 루프 덕으로 돌려지지만, 읽은 자료에 recurrence 와 LoRA 를 분리한 것은 없다.
의의
모델이 실제로 하는 일과 그 가중치가 할 수 있는 일 사이의 격차에 관한 결과 이므로, Reasoning Models 만큼이나 Mechanistic Interpretability 에 놓인다. relay 설명은 개입이 딸린 인과 서술이며 — parent-line 어텐션을 제거하면 메커니즘이 멈춘다 — 그 페이지가 상관보다 강하게 취급하는 증거 형태다.
Test-Time Compute (Inference-Time Compute Scaling) 에서는 같은 스냅샷 에 표면화된 Decoding Looped Transformers Better for (Almost) Free 의 불편한 이웃이다. LoopCD 는 루프 모델의 나중 pass 들에 디코딩이 버리는 신호가 있다고 말한다. 이 논문은 사전학습된 모델의 깊이에 forward pass 가 쓰기 시작조차 하지 않는 역량이 있고, "extra pretrained loops add little" 이 그 자체로는 참이라고 말한다. 함께 읽으면: recurrence 가 여유를 공급하고, 작고 의도적인 무언가가 그것을 켜야 한다. 두 논문은 서로를 읽지 않았으며, 이 위키는 각자가 서술한 것 이상으로 둘이 일치한다고 주장하지 않는다.
Eval Harness Configuration 쪽으로 옮길 수치는 한 레이어의 rank-8 adapter 로 15.5% 에서 99% 다. 그 페이지의 논지는 하네스 없는 벤치마크 점수는 측정이 아니라는 것인데, 이 결과는 같은 문제를 모델 로 확장한다. 조합적 과제에서 발표된 베이스 모델 수치는 이제 가중치에 대한 서술이 아니라 기본 디코딩 경로에 대한 서술이며 — 이 과제에서 둘의 격차는 83.5 포인트다.
열린 질문
- 열세 개 베이스 모델이 명시되지 않았으므로, 1.4–3.6 천장을 이 위키가 페이지를 가진 어떤 모델에 대해서도 확인할 수 없다.
- MuSiQue 향상이 수치 없이 주장된다. 언급된 유일한 비합성 벤치마크이며, 따라서 전이의 유일한 증거다.
- LoRA 는 과제 학습된 것이다. adapter 하나가 체인 따라가기 과제들 전반에 일반화되는지, 과제마다 따로 필요한지가 실무적 질문인데 다루어지지 않았다.
- 프런티어 모델은 어디에도 등장하지 않는다. Qwen3-8B 와 Ouro-1.4B 가 모델 집합 전부이며, 긴 추론 포스트 트레이닝을 거친 모델이 이미 relay 를 갖는지는 여기서 검증되지 않았다.
- 왜 사전학습만으로는 relay 가 생기지 않는가 는 이 결과가 제기하고 답하지 않는 질문이다.
인용
arXiv:2609.36585, 2026-09-29 발표. HuggingFace Daily Papers 2026-10-05, 68 upvotes 로 표면화 — 해당 커뮤니티의 인기 신호이며 그 이상은 아니다 (source).