$ cat wiki/concepts/test-time-compute.md
테스트 타임 연산 (추론 시점 연산 스케일링)
정의
추론(inference) 시점에 compute 를 추가 할당하여 출력 품질을 향상시키는 모든 기법. 학습된 모델은 고정하되 답을 만드는 과정에서 더 많이 생각/탐색/검증 한다.
대표 형태:
- Chain-of-Thought (CoT) — 중간 단계 명시적 생성
- Self-consistency — 여러 답 샘플링 후 다수결
- Tree-of-Thoughts / search — 분기 탐색
- Verifier-guided search — 별도 verifier 가 후보 평가
- Reflection / critic — 자기 비판 후 재시도
- Tool augmentation — 외부 계산기/검색 호출
왜 중요한가
- 본인 관심사 매칭 (reasoning 1.3x)
- 2024-2026 가장 큰 패러다임 전환 중 하나 — "더 큰 모델" 외 "더 오래 생각하는 모델"
- 학습 비용 한계 도달 가정 시 inference 비용 trade-off 핵심
- Reasoning Models 의 운영 메커니즘
현재 수준 (2026-07)
- OpenAI o-시리즈 후속 (GPT-Rosalind 등) — domain-specialized reasoning
- Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling — "simple and unified scaling" 만으로 gold-medal olympiad reasoning 달성 주장 — test-time compute 의 한계가 어디까지인지 데이터포인트
- Claude Opus 4.7 "multi-step tasks, thoroughness, consistency" — 암묵적 테스트 타임 연산 스케일링
두 달이 지난 지금 흥미로운 질문은 추론 연산이 얼마나 도움이 되느냐가 아니라 어디에 쓰이느냐, 그리고 그것이 정말 당신이 생각한 그 연산이냐다:
- 파라미터가 아니라 호라이즌 — Agents-A1(2026-06)은 활성 35B 로 에이전트 벤치마크에서 1조 파라미터 모델과 맞선다. 모델 크기가 아니라 에이전트 호라이즌(궤적 길이와 능력 폭)을 키운 결과다. 더 긴 궤적에 쓴 테스트 타임 연산이 30배의 파라미터가 사던 것을 샀다
- 그 연산이 훈련한 정책에 닿지 않을 수 있다 — MIPI 논문(2026-06)은 RL 이 훈련 프록시를 최적화하는 동안 다른 엔진이 추론을 서빙한다고 지적한다. 추론에 들인 노력이 훈련이 겨냥한 적 없는 정책에 적용되는 셈이다
- 가격 등급이 됐다 — Gemini 3.5 Pro는 "Deep Think" 를 월 $250 Ultra 등급 뒤에 둔다. 연구용 손잡이였던 테스트 타임 연산이 이제 비용 항목이며, 그것 자체가 "어디까지 효율적인가"에 대한 답이기도 하다
- 실패도 함께 커진다 — Ring-Zero는 약 100B 위에서만 나타나는 행동들을 기록했고, 그중에는 모호한 맥락에서 멈칫하는 것도 있다. 추론 연산을 늘린다고 신뢰성이 단조롭게 좋아지지는 않는다 → Reasoning Models
2026-10-04 — 일곱 번째 기제, 그리고 그것은 모델과 하네스 사이의 틈에 있다
이 페이지의 모든 기제는 컴퓨트를 생성 내부 (더 긴 체인, 답 전체를 더 많이 샘플링, 더 많은 순전파) 또는 트래젝터리 전반에 쓴다. Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents 는 그것을 바로 다음 행동 하나에 쓴다: 후보 셸 명령을 여러 개 샘플링하고, 검증하고, 하나만 실행으로 넘기며, 생성기와 하네스는 건드리지 않는다 (source).
TMAX-9B 생성기로 TerminalBench-Lite 에서 Pass@1 은 기준 에이전트 50.00% 에서 GPT-5.6 Sol 검증자와 행동 8개 샘플링 으로 68.03% 가 된다.
조건부가 결과이며, 예산을 배분하는 사람에게 이 페이지에서 가장 유용한 문장이다. 행동
샘플링을 늘려도 "yields little benefit under weak verification, whereas a capable verifier can exploit useful alternatives from the same generator" 다. 더 나은 행동은 이미 생성기의 분포
안에 있었다. 값을 한 컴퓨트는 그것을 더 많이 만드는 데 쓴 것이 아니라 구별하는 데 쓴
것이다. 이로써 이것은 아래 ## 열린 문제 의 "검증자 정확도가 새로운 천장이 된다" 항목의 직접
사례가 되며, 여기서는 그 천장이 주장이 아니라 측정된다.
배분에 관해 추가로 두 가지:
- 행동 스케일링과 트래젝터리 스케일링을 결합하면 트래젝터리 스케일링 단독보다 낫고, 추정 토큰 비용은 더 낮다. 이 페이지에서 두 배분 축을 점수가 아니라 비용으로 맞비교한 첫 결과다.
- 강한 검증자를 TMAX-9B 에 증류하면 Pass@1 이 더 오르며, 행동 생성기는 그대로다 — 따라서 프런티어 검증자에 대한 의존은 적어도 부분적으로는 가중치로 전환할 수 있다.
이것이 입증하지 않는 것. 68.03% 구성은 매 행동마다 프런티어 모델을 호출하며
그에 대한 비용 산정은 제시되지 않는다 — 보고된 토큰 비용 비교는 행동 스케일링 대
트래젝터리 스케일링이고, 둘 중 어느 것도 기준 에이전트와의 비교가 아니다. 이름이 밝혀진
벤치마크는 TerminalBench-Lite 뿐이며, "additional models, benchmarks, and harnesses" 는 구체적
내용 없이 주장된다. 그리고 TMAX-9B 는 이 위키가 페이지를 보유한 모델이 아니므로 50.00%
기준선은 보정되지 않았다. 논문은 읽지 않았다 — arxiv.org 는 이 파이프라인에서 차단되어 있고
초록이 확보된 유일한 텍스트다.
불편한 귀결은 Eval Harness Configuration 에 넘기지 않고 여기 둔다: 모델과 하네스가 모두 그대로인 채 Pass@1 이 18점 움직인다는 것은, TerminalBench-Lite 수치가 행동 선택 정책이 명시되지 않으면 미결정 이라는 뜻이다.
2026-08-25 — 여섯 번째 메커니즘, 그리고 이번엔 컴퓨트를 되찾는 이야기다
아래의 모든 메커니즘은 "추가 추론 컴퓨트를 어디에 쓸 것인가"에 답한다. ParaTempo: Efficient Parallel Reasoning via Temporal Confidence (arXiv:2608.16425) 는 병렬 추론에 대해 그 반대 질문 — 어느 분기가 이미 결정을 내렸고 따라서 멈출 수 있는가 — 을 던지고, 전체 예산을 하나의 신호로 통제한다 (source).
신호가 기여다. 논문은 기존 통제 신호 셋과 각각의 실패 이유를 지목한다: 최종 답 합의는 지연되고(컴퓨트를 다 쓴 뒤 도착한다), 국소 토큰 confidence 는 추론 진척과 약하게만 연결되며, 고립된 중간 probe 는 분기 수준 통제를 하기에 너무 잡음이 많다. Temporal confidence 는 세 번째를 집계로 잡음을 걷어낸 것이다 — 각 분기가 주기적으로 잠정 답 분포를 probe 당하고, 측도는 최근 probe 들이 얼마나 날카롭게 수렴하는지, 즉 측정값이 아니라 추세다.
하나의 숫자, 네 개의 행동, 그리고 궤적 간 동기화 없음: 확신이 낮은 분기를 가지치기, 계속 고착된 분기를 퇴역, 풀려난 컴퓨트로 새 분기를 포크, confidence 가중 투표가 수렴하면 전역 정지. 확신에 찬 분기를 퇴역시키는 것이 직관에 반하는 수다 — 고착을 더 밀어줄 승자가 아니라 완료로 취급하며, 이것이 가지치기 휴리스틱을 재배분기로 바꾼다.
보고된 값: 지연 21.832.2% 감소, 토큰 18.130.3% 감소, 정확도는 "competitive" — 정확도
수치도, 지목된 벤치마크도, probe 비용이 차감되었는지에 대한 언급도 없다. Agents (LLM Agents)
의 그날 스캐폴드 결과 둘과 마찬가지로 학습이 필요 없다.
검토되지 않은 위험은 구조적이다: 전역 정지는 confidence 가중 투표가 수렴할 때 발동하는데, 이는 self-consistency 가 정보를 얻기 위해 충분히 느려야 한다고 기대는 바로 그 수렴을 가속한다. 다수가 틀린 답으로 수렴하는 경우는 읽은 자료 어디에서도 시험되지 않았다.
2026-08-24 — 이 메커니즘이 로봇 제어로 넘어왔고, 착지점은 순서 결정이다
아래에 정리된 모든 메커니즘은 추론 컴퓨트를 텍스트 추론에 쓴다. τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation (arXiv:2608.16885) 는 그 발상을 계층적 vision-language-action 모델로 옮기는데, 흥미로운 지점은 어디에 놓느냐다: 모터 정책이 아니라 다음에 어떤 서브태스크를 시도할지를 정하는 상위 결정이다. 이 논문의 관찰은 표준적인 계층적 VLA 가 그런 선택을 매번 단 한 번의 forward pass 로 내린다는 것이고, 그래서 "어렵거나 중대한 선택에 추가 연산을 배분할 메커니즘이 없다" — 텍스트 영역에서 적응적 깊이와 탐색 기반 디코딩을 낳은 바로 그 불만이 로보틱스에서 독립적으로 등장한 셈이다.
구성은 검증기를 바꿔 끼운 search-with-a-verifier 다: 정책이 실행 메모리로 서브태스크를 제안하고, 필요할 때 확정 전에 월드 모델을 상대로 대안을 탐색한다. 이질적인 실세계 데이터 40,115시간 으로 학습했다. 보고된 결과: 추가 테스트 타임 컴퓨트가 in-domain 과 분포 이동 양쪽에서 다음 서브태스크 예측 정확도를 상당히 개선하고, 그 이득이 장기 지평 조작에서 더 높은 closed-loop 성공률로 이어진다 (source).
이 페이지가 그에 맞세워 둬야 할 것이 둘 있다. 초록에 수치가 하나도 없어서 — 정확도도, 성공률도, 컴퓨트 대비 성능 곡선도 — "compute-scalable" 은 여기서 측정된 성질이 아니라 설계상의 성질이고, 이 페이지는 아래 텍스트 영역 메커니즘들 옆에 놓을 수치를 갖지 못한다. 그리고 검증기가 감사되지 않았다: Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning (arXiv:2608.18746) 는 이틀 뒤, 잠재 월드 모델이 프로브에서는 잘 나오면서도 계획의 순위를 틀리게 매길 수 있음을 확립했다. 탐색 단계가 조용히 물려받을 실패가 정확히 그것이며, τ_0-VLA 는 자기 월드 모델을 겨눈 진단을 하나도 보고하지 않는다.
같은 주의 Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence (arXiv:2608.16590) 와도 방향이 어긋난다. 그쪽의 전제는 물리적 제어가 큰 모델이 낼 수 있는 것보다 더 빠른 결정을 필요로 한다는 것이다. 그럴듯한 화해 — Zetta 는 제어 루프를, τ_0-VLA 는 그 위의 서브태스크 경계를 말하고 있다는 것 — 을 어느 쪽도 진술하지 않으며, 그 경계가 어디에 놓이는지는 측정되지 않았다.
2026-08-23 — 청구서의 prefill 쪽, 프로덕션까지
이 페이지의 모든 기제는 추론 시점에 컴퓨트를 쓴다. 그런데 그중 어느 것도 기준선이 얼마인지 말하지 않았다. FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving (arXiv:2608.19758) 는 반대편 끝 — 어텐션의 이차 항이 가장 크게 무는 prefill 단계 — 을 다루며, 블록 희소 prefill 어텐션을 프로토타입에서 서빙 스택이 돌리는 물건으로 옮긴다: 극단적 희소성에서 근사 오차를 억제하는 평균 보정 항, FlashAttention-3/4 에 정렬되고 FP8 을 쓰도록 다시 쓴 연산자, 그리고 SGLang 같은 프레임워크를 받칠 수 있게 하는 네이티브 paged KV cache 와 continuous batching.
NVIDIA H20 에서 128K 컨텍스트 기준: FP8 로 FlashAttention-2 대비 최대 47.26배, BF16 으로 27.19배, 그리고 — 실제로 무게를 지는 수치인 — FA3/4 정렬 dense 베이스라인 대비 FP8 로 30.49배 (source).
여기서의 관련성은 방법이 아니라 예산이다. 적응적 깊이, 빔 서치, 언제 멈출지 아는 것 — 모두 서빙 스택이 채울 여력이 있는 컨텍스트를 전제한다. 이 연구가 그 전제를 값싸게 만든다. 그리고 MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arXiv:2608.20202) 와 SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (arXiv:2608.19799) 가 컨텍스트는 오히려 더 작아야 한다고 논하는 바로 그 2주 사이에 도착했다 — 즉 이것이 없애는 제약이 실제로 묶여 있던 제약이 아닐 수 있다.
정확도 비용은 이 캡처에 도달하지 않았다. 품질 상충이 서술되지 않은 희소 어텐션 속도 향상은 절반짜리 결과이고, 위 수치에는 모두 "최대"가 붙어 있다.
2026-08-21 — 다섯 번째 기제, 그리고 그 컴퓨트를 순전파 안에 쓴다
위의 모든 기제는 추론 컴퓨트를 토큰 에 쓴다 — 더 긴 사슬, 탐색, 검증자, 그리고 full-bandwidth transformer 의 경우 디코딩 단계 사이를 넓힌 채널. Looped Language Models Improve Compositional Tool Calling (arXiv:2608.18171) 은 그것을 순환 깊이 에 쓴다: looped 모델은 같은 파라미터를 여러 패스에 재사용하므로 파라미터를 늘리지 않고 추론 시점에 깊이가 달라지며, 논문은 이를 추론 벤치마크가 아니라 에이전트의 툴 사용 워크플로 한복판에서 시험한다.
긋는 경계가 유용한 부분이다. 순환 계산은 조합적·의존성 인지 툴 사용 — 여러 API 호출의 조율, 중간 상태 유지, 의존성 보존 — 을 돕는 반면, 단발 API 호출 에서의 이득은 "더 작고 모델 의존적" 이다. 단일 호출은 조회에 가깝고, 호출을 조합하려면 단계 간에 상태를 들고 가야 하며, 추가 깊이로 무언가를 사는 쪽은 후자뿐이다. API-Bank, BFCL, NESTful 에서 평가했고, looped 모델과 비-looped 모델을 동일한 SFT 레시피 로 학습시켰다.
그리고 배분 논변이 이달 세 번째로 서로 다른 기제에서 도착한다. 정확도는 대체로 순환 깊이에 따라 오르지만, 적응적 추론이 더 나은 컴퓨트–성능 균형 을 얻는다 — 필요할 때만 쓰기 때문이다. Thought-Level Beam Search for Reasoning (arXiv:2608.08020) 가 테스트 시점 컴퓨트를 예산이 아니라 배분으로 재정의한 것, 그리고 Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning (arXiv:2607.29211) 이 옳은 예산이 때로 0 이라고 한 것과 같은 결론이다. 서로 무관한 세 기제, 하나의 결론: 얼마나 쓰느냐보다 어디에 쓰느냐.
한계는 심각하고 그대로 적어 둔다: 초록에 수치가 하나도 없다. "대체로 이득" 과 "더 작고 모델 의존적" 은 크기가 아니라 방향이므로, looping 이 같은 FLOPs 를 더 큰 모델에 쓰는 것 — 같은 컴퓨트의 명백한 대안이고 논문이 보고하지 않는 비교 — 을 이기는지는 여기서 말할 수 없다.
2026-08-19 — 네 번째 기제, 그리고 새 방법이 전혀 필요 없다
아래 세 기제는 예산이 무엇을 사는지 를 바꾼다. R³-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets (arXiv:2608.16033) 는 아무것도 바꾸지 않고, 모델이 이미 가진 예산조차 덜 쓰고 있음을 보인다 (source).
설계가 힘을 준다. 수학, 경쟁 프로그래밍, 추상 추론에 걸쳐 여섯 문제가 하나의 예산을 공유하며, 도구 없는 설정과 에이전틱 설정 모두에서 수행된다. 비교 대상은 더 강한 모델이 아니라 같은 모델의 측정된 단일 문제 응답 곡선으로 만든 오프라인 오라클 이다. 즉 더 나은 배분 정책 아래 자기 자신과 비교되는 것이다.
| 결과 | 보고된 값 |
|---|---|
| 오라클 대 콘테스트, 여섯 모델 | 오라클 평균이 72개 셀 전부에서 콘테스트 평균과 같거나 그 이상; 71개에서 엄격히 더 높음 |
| 균등 배분 재생, 중간 정도의 도구 없는 압박 | 여섯 모델 중 네 모델에서 콘테스트 성능을 상회 |
| 고정 스케줄러, 강한 에이전틱 압박 | 세 모델 진단에서 적어도 하나가 아홉 셀 중 여섯에서 콘테스트 평균 상회 |
| 전략 갱신 | 제한적; 실패 양상은 압박 의존적이고, 영역 전반을 지배하는 정책은 없음 |
| 남길 문장은 두 번째 행이다. 여섯 모델 중 넷에서, 추론을 전혀 하지 않고 예산을 여섯으로 | |
| 나누는 편이 어떻게 나눌지 모델이 추론한 결과보다 낫다. 다른 세 기제는 모두 장치를 제안하지만 | |
| 이 기준선은 공짜다. |
같은 날 Eval Harness Configuration 의 부정적 결과와 다른 방향에서 수렴한다. How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 은 시험한 8개 하네스-모델 조합 전부에서 결여된 능력을 메타인지 루프 — 산출물을 근거와 대조하고, 고치고, 택한 경로를 되묻는 능력 — 라고 지목한다. 공유 예산을 배분하려면 지출 전에 각 문제에서 자신의 성공 가능성을 판단해야 하는데, 이는 그 능력을 토큰으로 값 매긴 것이다. 어느 논문도 다른 쪽을 인용하지 않는다. 이 짝짓기는 이 위키의 것이며 그렇게 표시한다. 또한 Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning (arXiv:2607.29211) 의 체계적 캘리브레이션 오류 를 거부가 아니라 배분의 측면에서 다시 말한 것이기도 하다.
이 위키가 추론 점수를 읽는 방식에 대한 귀결. 여기 있는 모든 그런 수치는 과제별 독립 예산에서 나온다. R³-Bench 는 그 체제가 같은 모델이 배분해야 할 때의 성능을 과대평가 한다고 말하는데, 배분해야 하는 상황이야말로 에이전트가 실제로 돌아가는 조건이다. 읽은 자료 어디에도 그 편차를 정량화한 것이 없고 어떤 소스도 시도하지 않으므로 어떤 모델 페이지의 수치도 조정하지 않았다. 적용할 보정이 아니라 측정에 알려진 편향으로 기록한다.
미해결이면서 중요한 점: 초록은 방향만 주고 크기는 결코 주지 않으며("72개 중 71개에서 엄격히 더 높음" 은 일률적인 0.3점으로도, 15점으로도 충족된다), 예산의 단위가 명시되지 않는다 — 그래서 아래 기제들의 토큰 수 주장과 비교할 수 없고, 이는 Eval Harness Configuration 이 추적하는 바로 그 결함이다.
2026-08-18 — 세 번째 기제, 그리고 옳은 예산이 0일 때가 있다는 주장
어제의 두 기제는 모두 모델이 결국 답한다고 전제한다. Thought-Level Beam Search for Reasoning (arXiv:2608.08020) 는 살아 있는 궤적 사이로 연산을 옮기고, Full-bandwidth transformer (arXiv:2608.08888) 는 한 스텝이 필요로 하는 양을 줄인다. Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning (arXiv:2607.29211) 은 범주가 다르다 — 추론 지출의 상당 부분이 아무리 추론해도 답이 나오지 않는 질문 위에 쓰이고 있으며 모델이 그것을 모른다고 말한다 (source).
수치 없이 진술된 진단은 이렇다. 보편적인 역량 초과 시도, 역량과 행동 사이의 체계적인 캘리브레이션 실패, 그리고 지배적 실패 양상으로서의 그럴듯한 추론 — 겉보기에 타당하고 미묘한 오류를 품은 출력 — 이 난도가 올라갈수록 심해진다는 것. 해법인 CaRL 은 헛된 추론보다 거절에 보상을 주도록 설계하고 과거의 실패를 거절 감독 신호로 바꾼다.
| 기제 | 무엇을 바꾸는가 | 답이 나오는가? |
|---|---|---|
| Thought-Level Beam Search for Reasoning (arXiv:2608.08020) | 살아 있는 궤적 사이의 배분 | 예 |
| Full-bandwidth transformer (arXiv:2608.08888) | 한 디코딩 스텝이 필요로 하는 것 | 예 |
| Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning (arXiv:2607.29211) | 아예 시작할지 여부 | 아니오 — 거절이 출력이다 |
| SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning (arXiv:2608.14277) | 학생이 언제 멈출지를 어디서 배우는가 | 예 |
네 번째 행이 이 날의 조용한 발견이다. SimpleOPD 는 종료 토큰 — </think>, `< | im_end | >` — 의 |
| advantage 를 마스킹하는데, 짧은 문맥의 학생이 장문맥 교사로부터 멈추는 행동을 물려받아 자기 | ||
| 응답 길이를 폭발시키기 때문이다. 멈추기는 학습된 행동이고 잘 옮겨 가지 않는다. CaRL 이 | ||
| 캘리브레이션 실패로 다루는 것과 같은 현상을, 추론 시점이 아니라 증류 파이프라인 안에서 관찰한 | ||
| 것이다 (source). |
상한은 덧셈이 아니다. 낭비 토큰을 없앤다고 주장하는 네 기제는 각자 없애는 토큰이 서로 겹치지 않을 때에만 합쳐지는데, 읽은 자료 어디에도 어느 둘이 그러하다는 근거가 없다. 넷 중 어느 것도 다른 것을 인용하지 않는다.
이 페이지가 특히 CaRL 에 대해 남기는 경고: 모델에게 거절의 대가를 지불하는 목표에는 자명한 퇴화 해가 있고, 초록이 내놓은 방어는 수치 없는 "효용을 희생하지 않고"뿐이다. 거절 비율이 이 결과를 읽는 데 필요한 단 하나의 숫자이고, 그것이 공표되지 않았다.
2026-08-17 — 낭비가, 같은 날 양쪽 끝에서 측정됐다
이 페이지의 열린 문제는 "사용자와 제품이 추론 비용을 얼마나 흡수할 수 있는가" 였다. 함께 도착한 두 가지가 그 질문의 틀을 바꾼다: 그 비용의 상당 부분이 이미 진 궤적에 쓰이고 있을 수 있고, 그렇다면 물어야 할 것은 흡수가 아니라 낭비다.
비용, 실무자가 측정한 것. Qwen 3.8 27B 를 M5 Max MacBook Pro 에서 17GB
GGUF 로 돌려, Simon Willison 은 "SVG 를 그려라" 프롬프트 하나가 추론 토큰 22,276개에
출력 토큰 3,223개 — 출력 토큰당 추론 토큰 6.9개 — 를 21분 동안 쓰는 것을 기록했다.
이는 모델의 출고 기본값의 동작이다: Qwen3.8 은 reasoning_effort 를 xhigh 로
출고하고, medium 과 low 는 있지만 사용자를 위해 선택되지 않는다. 그의 요약은 모델이
"두 문장짜리 답에 추론 토큰 2만 개를 기꺼이 태운다"는 것이다
(source).
회수, 알고리즘이 주장한 것. Thought-Level Beam Search for Reasoning (arXiv:2608.08020) 는 결정적 질문이 "얼마나 많은 compute 를 쓸 것인가에서 어디에 배분할 것인가로" 옮겨갔다고 주장하며, 표준 병렬 샘플링 대비 전체 토큰 최대 68.5% 감소를 정확도 상승과 함께 — HMMT-24 절대 +6.7, AIME-25 +3.3 — 그리고 2배 이상의 처리량을 동일 하드웨어에서 보고한다 (source).
둘은 같은 모델에 관한 것이 아니고 서로를 인용하지도 않는다. 이 짝지음은 이 위키의 것이다. 다만 측정된 비용과 주장된 회수율이 이 페이지에 함께 놓인 적은 없었고, 둘은 같은 방향을 가리킨다: 한계 추론 토큰은 값이 매겨지고 있는 그 토큰이 아니다.
같은 배치의 세 번째 결과는 같은 낭비를 추론 이전에 공격한다. Full-bandwidth transformer (arXiv:2608.08888) 는 직전 최상층 은닉 상태를 다음 디코딩 단계로 되먹이고 같거나 더 나은 정확도에서 더 짧은 추론 궤적을 보고한다 — 사고 사슬의 일부가 계산을 수행하는 것이 아니라 단계 사이로 운반하기 위해 존재하며, 수직 통로를 넓히면 그 토큰들이 불필요해진다는 함의다 (source).
Pricing 셀을 읽는 데 미치는 귀결. 세 가지 기구 — 궤적 사이의 재배분, 넓어진 잠재 통로,
그리고 기본 effort 수준 — 는 각각 토큰당 가격을 바꾸지 않은 채 같은 답변의 토큰 수를 바꾼다.
모델 페이지의 Pricing 행은 단가이므로 그중 무엇도 거기 보이지 않는다. 이는
Eval Harness Configuration 이 벤치마크 점수에 대해 펴는 것과 같은 관찰이,
리더보드가 아니라 청구서에 도착한 것이다.
스케일링 법칙 (열린 문제)
- Test-time compute 도 학습 compute 처럼 power-law 스케일링?
- 한계점 (saturation) 어디?
- 도메인별 (math vs coding vs science vs real-world) 다른 스케일링?
→ Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling 가 이 영역에 가장 최신 데이터 제공
2026-08-25 에 학습 쪽 스케일링 법칙이 도착했고, 그것은 모델이 아니라 탐색에 관한 것이다. Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts (arXiv:2608.20061) 는 대규모 MoE 학습의 최적 학습률을 두 번의 전이로 예측한다 — 최적값이 모델 width 전반에 유지되는 μP 적응, 그다음 작은 프록시 최적값에 대한 선형 회귀로 토큰 축을 따라 10조 토큰까지 R² = 0.95 로 외삽, 그리고 155B 전체 / 17B 활성 모델을 처음부터 사전학습해 검증. 위의 세 질문 중 어느 것에도 답하지 않으며, 여기 놓인 이유는 이 영역에서 적합도 통계치가 공표된 유일한 양이기 때문이다: 현재 작동하는 스케일링 법칙은 역량이 어디서 오는지가 아니라 연구소가 실행을 설정하는 데 무엇을 써야 하는지에 관한 것이다 (source)
2026-09-30 에 두 번째 학습 쪽 법칙이 도착했고, 이쪽은 위의 질문 하나에 실제로 답한다 — recurrence 에 대해서. Scaling Laws for Looped Mixture of Experts (arXiv 2609.40316, HuggingFace Daily Papers 2026-10-02, 업보트 15) 는 recurrence 와 sparsity 를 함께 모델 크기와 데이터와 나란히 모형화한 첫 스케일링 법칙으로 서술되며, 표준 dense 및 MoE 법칙을 특수 사례로 복원한다. 보고된 효율: sparsity 가 활성 파라미터 효율 ~3배, recurrence 가 추론에서 총 파라미터 효율 ~2배, 그리고 동일 학습 컴퓨트에서 법칙으로 도출한 recurrence 를 쓴 looped MoE 가 추론 벤치마크에서 ~2배 큰 non-looped MoE 와 동등 하며 — "while enabling test-time scaling through recurrence" (source).
마지막 구절이 이것을 학습 쪽만이 아니라 여기에 두는 이유다: recurrence 는 추론 시점에 돌릴 수
있는 깊이 손잡이 이고, 그래서 아키텍처 시점에 선택되는 테스트 타임 기제가 된다. 논문은
읽지 않았다 — arxiv.org 는 이 파이프라인에서 차단되어 있다 — 따라서 이것은 초록뿐이며,
위의 2026-08-25 법칙과 달리 적합도 통계치는 인용되지 않는다. 포화나 도메인 의존성은
다루지 않는다.
~3배 sparsity 수치는 일반적 주장이며 Kolibri-1 의 "four times its active parameter count" 에 대한 근거가 아니다. 다른 모델, 다른 측정이고, 후자는 벤더 자신의 표다. 같은 질문을 두 번 물은 것이며, 이 페이지는 어느 쪽도 다른 쪽의 근거로 다루지 않는다.
2026-10-05 — 아무것도 쓰지 않고, 그다음 컴퓨트를 돌려주는 이 페이지의 첫 기제
이 페이지의 다른 모든 기제는 무언가를 산다: 더 긴 체인, 더 많은 샘플, 더 많은 trajectory, 행동마다의 검증기. LoopCD 는 아무것도 사지 않는데 컴퓨트 곡선이 내려간다.
Decoding Looped Transformers Better for (Almost) Free (arXiv 2610.02185, HuggingFace Daily Papers 2026-10-05, 38 upvotes) 는 루프 Transformer 가 모든 recurrent pass 에서 디코딩 가능한 예측을 이미 만들고 있으며 기존 디코딩이 마지막 하나만 빼고 버린다는 점을 관찰한다. "earlier loops embody less computation" 이므로 recurrence 는 "inherently supplies aligned weak-and-strong prediction pairs without auxiliary models or external training" — 그래서 대조 디코딩에 두 번째 모델이 필요 없다. 학습 불필요이며 두 변형이 있다: LoopCD-Logits (출력 pass 1회 추가) 와 LoopCD-Hidden (출력 오버헤드 없음).
| 모델 | 벤치마크 | 베이스라인 | LoopCD |
|---|---|---|---|
| Ouro-2.6B-Thinking | AIME 2024 pass@1 | 61.88% | 73.33% |
| Huginn | HumanEval pass@1 | 22.56% | 31.71% |
| 그리고 환급: 이 향상이 "enable halving the number of recurrent loops while still matching or exceeding full-depth unguided baselines, reducing forward FLOPs by 22.5% to 48.2%" | |||
| (source). |
위의 스케일링 법칙 (열린 문제) 섹션에 있는 2026-09-30 스케일링 법칙에 비추어 읽으라.
Scaling Laws for Looped Mixture of Experts 는 recurrence 가 살 만하다고 주장한다 — 추론에서
총 파라미터 효율 ~2× — 그리고 그것이 recurrence 가 이 페이지에 실린 이유다. 이 논문은 산 것의
일부가 이미 지불됐고 출력에서 버려지고 있었다고 주장한다. 둘 다 서로를 인용하지 않는 논문의
초록만 읽은 것이며, 이 위키는 공동 결과를 주장하지 않는다; 사흘 간격으로 같은 손잡이를 양쪽에서
접근한 것으로 기록한다.
입증되지 않은 것: "four looped Transformer families" 는 명시되지 않았다; 모델마다 벤치마크가 정확히 하나이므로 어느 변형도 두 향상을 다 낸다고 보이지 않는다; 어느 이른 pass 와 대조하는지 미지정이다; 그리고 22.5–48.2% FLOPs 범위는 어느 모델이나 벤치마크에도 귀속되지 않았다. 이 위키에 페이지를 가진 루프 모델은 없고, 읽은 자료는 ~2.6B 파라미터를 넘어서 이 방법을 검증하지 않는다.
같은 스냅샷의 다른 깊이 결과, 그리고 그것은 반대로 작동한다
Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It (arXiv 2609.36585, 같은 2026-10-05 스냅샷, 68 upvotes) 는 사전학습된 베이스 모델 열세 개가 문맥 내 참조 체인을 1.4–3.6 링크 밖에 따라가지 못하며 — 이 페이지에 속하는 구절로 — "extra pretrained loops add little" 이라고 보고한다. 그다음 가중치를 전부 동결한 채 한 이른 레이어에 붙인 rank-8 LoRA 가 Qwen3-8B 를 24-링크 체인에서 15.5% 에서 99% 정확도로, Ouro-1.4B 를 4 loops 에서 60 링크, 8 loops 에서 최소 160 링크 로 끌어올린다 (source).
그래서 recurrence 는 기본 forward pass 가 쓰지 않는 여유를 공급하고, 작은 무언가가 그것을 시작해야 한다 — 논문 자신의 표현은 LoRA 가 "starts a relay" 한다는 것이다. 그것은 이 페이지가 추적하는 기제의 한계이며, 배분에 관한 결과가 아니다: 깊이를 더 쓰는 것은 그것을 쓰는 것과 같지 않다. Ouro-1.4B 수치에는 정확도 수치가 없고 "최소 160" 은 하한이므로, 측정값이 아니라 보고된 것으로 기록한다.
열린 문제
- Cost-quality trade-off — 사용자/제품 입장에서 얼마까지 inference 비용 감당?
- Latency — 추론 시 더 생각하는 모델은 응답 느림. 어떤 use case 가 감당?
- Verifier 정확도 — verifier 자체의 한계는 새 ceiling
- Compute allocation 최적화 — 같은 budget 을 어떻게 step / sample / search 에 배분?
주요 논문
-
When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis — 2026-09, 에이전트의 test-time 컴퓨트가 언제 값을 못 하게 되는지 를 이 페이지가 갖는 첫 측정: 토큰 예산마다 Elo 를 추적해, Elo 가 log 컴퓨트에 선형 으로 자라는 독립 샘플링 기준선과 견주고, 그 교차점을 scaling inflection point 라 부른다. 그 지점 크기의 병렬 세션으로 100M 토큰 을 쪼개자 FrontierCS Polyomino Packing 에서 긴 세션 하나 대비 +264 Elo, 짧은 세션 열 개 대비 +355 Elo. 공유된 AtCoder 과제에서 최상위 인간 참가자는 초선형 으로 향상한다. 어느 에이전트에 대해서도 inflection 값은 발행되지 않았다 (source)
-
ParaTempo: Efficient Parallel Reasoning via Temporal Confidence (arXiv:2608.16425) — 2026-08, temporal confidence 로 통제되는 병렬 추론: 지연 −21.8~32.2%, 토큰 −18.1~30.3%, 정확도는 "competitive" 라고만 보고 (source)
-
Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts (arXiv:2608.20061) — 2026-08, μP + 회귀로 MoE 최적 학습률을 10조 토큰까지 R² = 0.95 로 예측. 모델이 아니라 탐색에 관한 학습 쪽 스케일링 법칙 (source)
-
τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation (arXiv:2608.16885) — 2026-08, 계층적 VLA 안의 그 메커니즘: 서브태스크 선택이 결정마다 한 번의 forward pass 가 아니라 필요할 때 월드 모델을 상대로 대안을 탐색하는 일이 된다. 이질적 실세계 데이터 40,115시간 학습, 공개된 수치는 없음 (source)
-
Decoding Looped Transformers Better for (Almost) Free — 2026-10, 여기서 유일하게 학습 불필요이고 컴퓨트가 음수인 기제: 루프 모델의 마지막 pass 를 더 이른 pass 와 대조해 AIME 2024 pass@1 61.88% → 73.33% (Ouro-2.6B-Thinking) 와 HumanEval 22.56% → 31.71% (Huginn), 그다음 루프를 절반으로 줄여 forward FLOPs 22.5–48.2% 감소 (source)
-
Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It — 2026-10, 깊이를 사는 것의 한계: 베이스 모델 열세 개가 참조 체인을 1.4–3.6 링크 밖에 따라가지 못하고 "extra pretrained loops add little", 그리고 동결된 한 레이어의 rank-8 LoRA 가 Qwen3-8B 를 24-링크 체인에서 15.5% 에서 99% 로 올린다 (source)
-
Looped Language Models Improve Compositional Tool Calling (arXiv:2608.18171) — 조합적 툴 호출을 위한 순환 깊이; 적응적 추론이 고정 깊이를 앞선다
-
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling — 2026-05
-
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning (arXiv:2608.09888) — 2026-08, 테스트타임 연산을 디코딩된 토큰이 아니라 순환 잠재 상태에서 소비한다. 150M 모델이 ARC-AGI-1 pass@2 29.5% 를 과제당 계산 비용 $0.0007 에 보고하며, 벤치마크의 정확도 순위표가 아니라 비용-정확도 프런티어의 새 지점이라고 주장한다 (source)
-
Thought-Level Beam Search for Reasoning (arXiv:2608.08020) — 2026-08, 예산이 아니라 배분: 실행 도중 가지를 쳐내고 다시 뻗는 thought 단위 빔 서치로, 가지치기 기준선 대비 HMMT-24 절대 +6.7 / AIME-25 +3.3, 2배 이상의 처리량, 최대 68.5% 적은 토큰 (source)
-
Full-bandwidth transformer (arXiv:2608.08888) — 2026-08, 디코딩 단계 사이의 수직 통로를 넓힌다. 같거나 더 나은 정확도에서 더 짧은 추론 궤적, 그리고 1B 모델이 약 1.5배 더 많은 토큰으로 학습한 모델에 필적 (source)
-
Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning (arXiv:2607.29211) — 2026-07, 헛된 추론: 보편적인 역량 초과 시도와 체계적인 캘리브레이션 실패, 지배적 실패 양상으로서의 그럴듯한 추론. CaRL 이 보상을 거절 쪽으로 설계하고 실패를 거절 감독으로 바꾼다. 수치는 공표되지 않았다 (source)
-
R³-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets (arXiv:2608.16033) — 2026-08, 공유 예산 아래의 배분. 같은 모델의 단일 문제 곡선으로 만든 오프라인 오라클이 72개 셀 전부에서 콘테스트 성능과 같거나 그 이상이고 71개에서 엄격히 더 높다. 균등 배분 재생이 여섯 모델 중 네 모델에서 모델 자신의 선택을 이긴다 (source)
-
SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning (arXiv:2608.14277) — 2026-08, 토크나이저에 구애받지 않는 on-policy distillation. 짧은 문맥의 학생이 장문맥 교사의 멈추는 행동을 물려받기 때문에 종료 토큰의 advantage 를 마스킹한다. Intern-S2-Preview 가 ProofBench 에서 +21.2, 55.2 도달 (source)
관련 개념
- Reasoning Models — 이 메커니즘 사용하는 모델 클래스
- scaling-laws — 별도 페이지 작성 예정
- Agents (LLM Agents) — multi-step agent 도 test-time compute 의 한 형태
열린 논쟁
- "Simple scaling" 진영 (Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling 시사) vs "specialized methods" 진영 — 어느 쪽이 reasoning 발전 동력?
- Test-time vs train-time compute 분배 — pre-training scaling 이 saturate 한다면 어디로?
주목할 발언
- (Sam Altman): "automated AI research intern by 2026-09" 목표는 강한 test-time compute + agentic loop 전제
Referenced by
Sources
- sources/arxiv/2026-10-05/2610.02185-loopcd-looped-decoding.md
- sources/arxiv/2026-10-05/2609.36585-stop-thinking-too-early-lora.md
- sources/papers-daily/hf-daily-2026-10-05.md
- sources/arxiv/2026-10-04/2609.39982-mid-harness.md
- sources/papers-daily/hf-daily-2026-10-02.md
- sources/papers-daily/hf-daily-2026-09-16.md
- sources/papers-daily/hf-daily-2026-08-25.md
- sources/papers-daily/hf-daily-2026-08-24.md
- sources/papers-daily/hf-daily-2026-08-23.md
- sources/papers-daily/hf-daily-2026-08-21.md
- sources/papers-daily/hf-daily-2026-08-19.md
- sources/papers-daily/hf-daily-2026-08-18.md
- sources/arxiv/2026-08-12/2608.09888-bdh-cq.md
- sources/arxiv/2026-05-16/2605.13301-olympiad-reasoning.md
- sources/papers-daily/hf-daily-2026-08-17.md
- sources/x/2026-08-16-simonw-qwen-38-27b-overthinking.md