$ cat wiki/concepts/reasoning-models.md
추론 모델
concept갱신 2026-08-12생성 2026-05-16
정의
추론(reasoning) 과정 자체를 명시적으로 모델링하는 LLM 계열. test-time compute 를 추론 단계 (chain-of-thought, search, verification) 에 할당해 복잡한 문제 해결 능력 향상.
왜 중요한가
- 본인 관심사 매칭: reasoning (1.3x) × frontier models (1.3x)
- 2024-2026 가장 활발한 연구 흐름 — OpenAI o-시리즈 이후 산업 전반 추적
- 단순 scale-up 한계 보완하는 방향
현재 수준 (2026-08-02)
- 가장 강한 실증 (2026-05-20): OpenAI — Erdős 단위 거리 추측 반증 — 80년 미해결 순수 수학 문제 자율 해결. 일반 목적 reasoning 모델이 chain-of-thought 추론만으로 전문 수학자들도 몰랐던 증명 발견. 범용 reasoning이 전문 과학 분야에서 실질적 기여를 할 수 있다는 첫 명확한 증거.
- 최신 강한 주장: Olympiad-level reasoning via simple unified scaling (2026-05-16) — 수학 올림피아드 gold 수준 달성 주장
- Gemini 3.1 Deep Think — 자율 수학 연구 에이전트 (Aletheia, IMO 금메달, 18개 미해결 문제 해결, Feng26 논문 발표)
- Claude Opus 4.7 도 "multi-step tasks" 강조
5월 이후 이 흐름은 추론 모델이 어려운 문제를 풀 수 있는가 에서 훈련이 실제로 무엇을 최적화하는가, 그리고 규모에서만 나타나는 것은 무엇인가 로 옮겨왔다:
- RLVR 이 1조 파라미터에 닿다 — Ring-Zero(Ant Group, 2026-07)는 검증 가능한 보상 기반 RL 을 1T 규모에서 처음 보인 사례로 AIME 2026 에서 84.2% 를 기록했다. 약 100B 아래에서는 나타나지 않는 행동 5가지를 기록했고, 그중 저자들이 context anxiety 라 부르는 실패 양상 — 맥락이 모호할 때 얼버무리거나 멈칫하는 것 — 이 있다. 역량과 실패가 모두 규모에 의존한다는 뜻이므로 이는 역량 결과인 만큼이나 정렬 결과다 → AI Alignment
- 훈련 목표가 틀린 목표일 수 있다 — MIPI 논문(2026-06)은 RL 구현이 훈련 프록시를 최적화하는 사이 모델은 다른 추론 엔진으로 서빙되므로, 개선되는 정책이 실제 돌아가는 정책이 아니라고 주장한다. 사실이라면 특정 기법 하나가 아니라 모든 랩의 추론 훈련에 걸린다
- 추론이 모델이 아니라 제품 등급이 됐다 — Gemini 3.5 Pro는 "Deep Think" 를 월 $250 Ultra 등급 뒤에 두고, MAI-Thinking-1은 증류 없이 밑바닥부터 훈련한 Microsoft 의 첫 추론 특화 모델이며, MiniMax M3는 100만 컨텍스트를 장기 과제와 짝짓는다. 질문이 누가 추론 모델을 가졌는가에서 누가 그것을 돌릴 여력이 있는가로 옮겨갔다
- 사람도 움직였다 — 이 계보를 연 chain-of-thought 논문의 공저자 Jason Wei가 2026년 중반 OpenAI 를 떠나 Meta Superintelligence Labs 로 갔다
- 5월의 결과가 일회성이기를 그만두었다 (2026-08-01) — OpenAI 가 내부 Astra 로부터 수학·TCS 결과 열 건을 발표했고, 각각 Lean 4 인증서를 달고 있다. 최초의 명시적 비소픽 군, Connes' Rigidity Conjecture 반증, 양자 병렬 반복, Ehrhart's volume conjecture, 그리고 1978년 이후 처음으로 개선된 고차원 구 채우기 일반 상한이다. 총 토큰 비용은 Sol API 가격 기준 약 $2,000. 흥미로운 변화는 건수가 아니라 확인 방식이다. 5월에는 수학자들이 추론 기록을 읽고 증명으로 다시 썼는데, 이제는 산출물이 기계가 확인할 수 있는 인증서와 함께 도착하므로 검증이 더 이상 전문가의 시간이 나기를 기다리지 않는다. 형식화 전에 사람이 증명을 정리했으므로 전 과정이 자율적이지는 않다 → AI for Mathematics (source)
열린 문제
- "Reasoning" 정의의 일관성 — pattern matching vs genuine reasoning?
- Test-time compute scaling laws — 어디까지 효율적?
- 도메인 일반화 (math → coding → science → real world)
- Cost — 추론에 compute 더 쓰면 비용도 증가
- 훈련–추론 불일치 — RL 이 개선하는 정책이 실제로 서빙되는 정책이기는 한가(The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning)
- 규모 의존적 실패 — context anxiety 같은 행동은 약 100B 아래에서는 보이지 않으므로, 작은 모델에서 검증한 기법은 출시되는 모델에 대해 별로 말해 주지 않는다(Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning)
- 숨겨진 트레이스는 생태계 전체가 열쇠를 쥔 자물쇠로 잠겨 있다. 프런티어 제공자들은 chain-of-thought 를 서버 쪽에 두는 대신 암호화된 블록으로 클라이언트에 돌려주는 방식으로 숨긴다. Stealing Reasoning Traces from Proprietary LLM APIs (arXiv:2608.09867) 는 그 블록들이 하나의 제공자 안에서 세션·사용자·모델 사이에 교환 가능하다고 보고하며 — Anthropic, OpenAI, Google 이 지목되었다 — 따라서 더 약한 형제 모델이 강한 모델의 트레이스를 복호화해 그대로 출력하게 만들 수 있다. 강한 모델은 전혀 공격받지 않는다. 읽은 자료에서 벤더의 대응은 찾지 못했다 (source)
- 아예 언어화되지 않는 추론. BDH-CQ: In-Context Learning with Recurrent Latent Reasoning (arXiv:2608.09888) 는 잠재 공간에서 반복 연산하며 추론 토큰을 내놓지 않고, 150M 파라미터에서 ARC-AGI-1 pass@2 29.5% 를 과제당 계산 비용 $0.0007 에 보고한다. 이 방향이 유지된다면 위의 트레이스 기밀성 문제는 해소되고, 모델이 무엇을 했는지 읽어낼 수단도 함께 사라진다 (source)
주요 논문
- An OpenAI model has disproved a central conjecture in discrete geometry — 2026-05-20, 80년 미해결 수학 문제 자율 반증 (OpenAI general reasoning model)
- Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling — 2026-05, scaling 만으로 gold-medal 주장
- Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning — 2026-07, 1조 파라미터 RLVR. AIME 2026 84.2% 와 창발 행동 5가지
- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning — 2026-06, LLM RL 의 훈련–추론 간극
- Stealing Reasoning Traces from Proprietary LLM APIs (arXiv:2608.09867) — 2026-08-10, 암호화된 chain-of-thought 블록이 한 제공자 안에서 모델 간에 교환 가능하다
- BDH-CQ: In-Context Learning with Recurrent Latent Reasoning (arXiv:2608.09888) — 2026-08, 150M 규모의 순환 잠재 추론. ARC-AGI-1 비용-정확도 프런티어
관련 개념
- Test-Time Compute (Inference-Time Compute Scaling) — inference-time compute 배분이 reasoning models의 핵심 메커니즘
- Agentic Reinforcement Learning — multi-step reasoning + RL의 교차점
- AI for Mathematics — 이 계보에서 가장 강한 주장들이 도착하는 곳, 그리고 그것을 확인하는 방식
열린 논쟁
- "Simple unified scaling" vs "specialized methods" — 어느 쪽이 reasoning 발전을 견인하는가? (2605.13301 가 전자 측 주장)
- 1조 규모에서 한 번 관측된 창발 행동이 그 규모의 속성인지 그 훈련 실행의 속성인지 — Ring-Zero 는 5가지를 보고했고 아직 아무도 독립적으로 재현하지 않았다
Referenced by
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling에이전틱 강화학습에이전트 (LLM Agents)AI 정렬 (Alignment)수학을 위한 AI (AI for Mathematics)Ai2 (Allen Institute for AI)AlphaEvolveAn OpenAI model has disproved a central conjecture in discrete geometryAndrej KarpathyAstraBDH-CQ: In-Context Learning with Recurrent Latent Reasoning (arXiv:2608.09888)Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253)Co-Scientist (Google DeepMind)Conceptual Reasoning Index (CRI)DeepSeek체화 에이전트 (Embodied Agents)평가 하네스 설정Full-bandwidth transformer (arXiv:2608.08888)Gemini 3.1 Deep ThinkGemini 3.5 ProGoogle DeepMindGPT-Realtime-2 (OpenAI)Jason WeiKnowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning (arXiv:2607.29211)Looped Language Models Improve Compositional Tool Calling (arXiv:2608.18171)MAI-Thinking-1기계적 해석가능성MiniMax M3Mistral Large 3Moonshot AINoam ShazeerOpenAI사후 학습 스케일링R³-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets (arXiv:2608.16033)Ring-Zero: 창발적 추론을 위한 Zero RL의 1조 매개변수 규모 확장Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors (arXiv:2608.00675)SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning (arXiv:2608.14277)Software 3.0Stealing Reasoning Traces from Proprietary LLM APIs (arXiv:2608.09867)테스트 타임 연산 (추론 시점 연산 스케일링)The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement LearningThought-Level Beam Search for Reasoning (arXiv:2608.08020)주간 종합 — 2026-W21 (2026-05-11 ~ 2026-05-17)Yann LeCun