AI Trend Notifier
EN한
← wiki

$ cat wiki/concepts/post-training-scaling.md

사후 학습 스케일링

concept갱신 2026-10-01생성 2026-08-21

정의

다음 역량 증분이 사전학습이 끝난 뒤에 — 파라미터나 사전학습 토큰을 늘려서가 아니라 RL, 에이전틱 학습 환경, 그리고 모델이 그 안에서 학습되는 하네스를 확장해서 — 얻어진다는 주장.

2026-08-20, 한 랩 CEO 가 처음으로 이를 스케일링 법칙으로 명시했고, 역량 종류의 구분으로 제시했다:

역량선호한다고 보고된 것
암기더 많은 파라미터
추론더 많은 사후 학습 데이터와 유효 깊이
고급 스킬 (제시된 예: 소프트웨어 취약점 발견)지식 보유 임계를 넘고 나면 총 파라미터 수가 아님
Z.ai 의 CEO Jie Tang 에게 귀속되며, Latent Space 의 AINews 다이제스트가 "Death of
Params" 라는 제목으로 보도했다
(source).

이 페이지는 정착된 결과가 아니라 주장을 모은다. 벤더의 서술과 아래의 연구 결과는 의도적으로 따로 기록한다: 하나는 랩이 자기 모델에 대해 하는 이야기이고, 나머지는 우연히 같은 방향을 가리키는 독립 논문들이다.

왜 중요한가

"새 사전학습 없음" 패턴이 이 위키의 관찰이 아니라 모델을 출하하는 쪽에서 명명된 것이 처음이기 때문이다. Weekly Synthesis — W33 (2026-08-10 → 2026-08-16) 종합은 한 주에 나온 네 건의 출시가 새로 학습한 것이 없다고 기록했다 — GLM-5.3, Gemini 3.7 Flash, DeepSeek V4-Pro-0813, 그리고 Qwen 의 사후 학습 열. 그것은 릴리스 노트에서 읽어낸 패턴이었다. Jie Tang 의 주장은 같은 패턴을 메커니즘을 갖춘 스케일링 법칙 으로 단언하며, 실험으로 제시할 모델을 함께 내놓는다.

성립한다면 이 위키가 추적하는 세 가지의 의미가 달라진다:

  1. 파라미터 수가 역량 신호이기를 그만둔다. 여기 모든 모델 페이지가 그것을 싣고 있고, 비교 페이지는 그것이 가장 읽기 쉬운 행인 ## Spec 표에서 만들어진다.
  2. "오픈 웨이트" 가 역량을 전달하기를 그만둔다. GLM-5.3 의 베이스는 GLM-5.2 의 것이고, GLM-5.2 가중치는 2026-06-16 부터 MIT 라이선스로 공개돼 있다. 베이스는 이미 누구나 가질 수 있었다. 가질 수 없는 것은 사후 학습이다. Open-Weights Policy Fight 는 오픈 웨이트를 개방/폐쇄 분쟁의 축으로 다뤄 왔는데, 이는 공개된 산물을 덜 가치 있는 절반으로 만든다.
  3. 하네스가 학습 루프 안으로 들어온다. 그래서 벤치마크 수치는 평가 시점의 (모델, 하네스) 쌍에 대한 주장이기를 그만두고 가중치에 새겨진 것이 된다. 그 귀결은 Eval Harness Configuration 에서 전개된다.

해소하지 않고 페이지에 남겨 두는 반론: "사후 학습 스케일링" 은 노력 이 어디로 갔는지를 서술할 뿐, 사전학습이 더 이상 값을 하지 않는다는 뜻은 아니다. Gemini 4 의 사전학습 런은 2026-07-21 구글의 "가장 야심 찬" 런으로 확인됐고, 읽은 것 중 그 결과를 보고한 자료는 없다. 프런티어 사전학습 런이 진행 중인 동안 사후 학습 이득을 거두고 있다는 사실은 그 런이 실패하리라는 증거가 아니다.

현재 수준 (2026-10-01 기준)

on-policy distillation의 거듭제곱 법칙이며, 결과는 이 페이지의 핵심 주장과 반대로 작용한다. Scaling Properties of Same-Family On-Policy Distillation — 194 upvotes로 오늘 HuggingFace 스냅샷의 최상단 — 는 weak-to-strong, same-base, strong-to-weak 쌍에 걸쳐 same-family OPD에 스케일링 법칙을 맞춘다 (source).

주장발견
전이 구간held-out 정확도 G 가 학생의 초기화 지점으로부터의 sqrt(KL(π_θ ‖ π_ref)) 에 거의 선형으로 상승
weak-to-strong관측된 모든 쌍에서 학생의 최고 점수가 교사 자신의 점수를 넘어선다
교사 규모G_peak 는 대략 학생의 규모까지만 교사 규모와 함께 개선된다
교사 점수같은 gold score에서 작은 교사가 더 잘 전이한다
이 페이지의 논지는 역량이 파라미터가 아니라 사후학습 단계에서 점점 더 나온다는 것이다 — Z.ai의
"death of params" 프레이밍, 그리고 베이스가 바뀌지 않은 상태에서의 53 → 60 지표 이동. 이 논문은
그 단계의 산물이 값싸게 옮겨지고, 그것을 가진 가장 작은 것이 가장 값싸게 옮긴다고 말한다.
사후학습에 가치가 있고, 사후학습의 산출물이 교사 자신의 상한을 넘어 weak-to-strong으로 전이된다면,
그 방어선은 이 논지가 함축하는 것보다 얇다.

sqrt reverse-KL 매개화가 재사용 가능한 부분이다. 교사를 참조하지 않고 학생만으로 측정할 수 있는 x축을 OPD에 주며, 그것이 weak-to-strong 비교를 순환논증이 아니라 유의미한 것으로 만든다.

이 스냅샷이 담은 초록에는 절대 수치도, 모델 계열도, 파라미터 수도 없다. 이것은 법칙의 형태이며 그 위의 점이 아니고, arxiv.org 는 이 샌드박스에서 차단되어 있어 맞춰진 상수를 읽을 수 없다.

두 번째 연구소 단위 증류 고발 다음 날 도착했고, 그 인접성은 Adversarial Distillation에 기록되어 있다 — 이 논문은 연구소가 자기 계열 안에서 증류하는 상황을 다루며 허가 없는 사용에 대해서는 아무 말도 하지 않는다. 증거가 아니라 기제다.

현재 수준 (2026-09-27 기준)

이 페이지가 보유한 최초의 완전히 문서화된 사후 학습 레시피이며, 수치를 하나도 공개하지 않는다.

Rufus-Air: An Open LLM Post-Training Recipe (2026-09-24) 는 GLM-4.5-Air-Base (106B-A12B) 위에서 여덟 개의 직렬 단계를 문서화한다 — SFT, Reasoning RL, Coding RL, Instruction-Following RL, General Agent, Coding Agent, Search Agent, RLHF — 그리고 레시피를 재현하는 데 필요한 데이터, 보상 설계, 인프라, 단계 순서, 단계별 결과를 문서화한다고 진술한다 (source).

제약이 기여다: 오픈소스 구성 요소와 공개 데이터, 그 다수를 공개된 그대로 사용하며, 새로운 사람 주석 없이, 사내 증류 교사 없이 만들어졌다. 이 페이지에 있는 거의 모든 것은 랩이 자기 프런티어 모델에 사후 학습이 무엇을 사줬는지 레시피를 감춘 채 서술한 것이다. 이것은 반대쪽 문서다.

명시된 네 발견 중 세 번째가 힘을 가진 쪽이다:

  1. 다양하고 고품질인 SFT 가 강한 역량 하한을 세운다.
  2. 난이도 필터링이 RL 프롬프트를 생산적인 학습 범위 안에 유지한다.
  3. 보상 신뢰도가 단계 순서를 정하는 실용적 원칙을 제공한다.
  4. 인프라와 엔지니어링 선택은 구현 세부가 아니라 레시피의 일부다.

3번을 다시 쓰면: 신뢰할 수 있는 보상을 가진 단계를 먼저 두라, 뒤 단계가 앞 단계가 남긴 정책을 물려받기 때문이다. 여덟 단계 순서는 그와 일관된다 — 판정자가 점수를 주는 RLHF 앞에 검증 가능한 추론과 코딩 RL.

그리고 수치가 없다. "공식 GLM-4.5-Air 사후 학습 릴리스보다 개선된다" 와 "비슷한 크기의 오픈 모델들과 경쟁력 있다" 는 벤치마크도, 마진도, 비교 대상도 지명하지 않는다. 이 페이지는 그것을 결과로 환언하지 않고 부재로 기록한다: 대표 주장을 확인할 수 없는 재현성 논문은 발견이 아니라 레시피다.

비교가 얼마만큼의 값을 갖는지에 관한 맥락: 이 저장소가 캡처한 Artificial Analysis 표에는 GLM-4.5-Air 행이 없다. Z AI 항목은 GLM-5.3 (max) 45, GLM-5.3-Flash 42, GLM-5.3 (low) 34 이다 (source) — 개선 대상인 베이스는 그 발행자가 현재 게재하는 것보다 마이너 두 세대 뒤다.

"증류 교사 없음" 이라는 줄이 여기서 왜 중요한가. Anthropic 의 9월 위협 인텔리전스 보고서는 여러 중국 랩이 Claude 를 증류했다고 고발하고, Alibaba / Qwen AI Lab 는 Qwen 3.5–3.7 을 학습시켰다고 하는 캠페인에 대해 서로 맞지 않는 두 수치 집합을 안고 있다. 프런티어 교사 없이 "비슷한 크기의 오픈 모델들과 경쟁력 있다" 에 이르는 레시피는 그 교사가 얼마만큼의 값이었는지에 관한 데이터가 될 것이다. 수치가 붙지 않은 동안은 약한 데이터다.

현재 수준 (2026-09-05 기준)

생산 수단이 공표된 적 없던, 이름만 붙어 있던 재료가 이제 하나를 얻었다. 이 페이지의 주장은 다음 역량 증분이 사전학습 이후에 — RL, 생성된 학습 환경, 그리고 모델이 학습되는 하네스로부터 — 구매된다는 것이다. 그 목록에서 환경은 가장 약한 고리였다. 읽은 어떤 설명도 환경을 전제하기만 했고 대규모로 어디서 오는지는 말하지 않았다.

Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments (2026-09-03) 은 코드 에이전트를 돌리는 모든 연구소가 이미 대량으로 들고 있는 부산물로부터 환경을 제조하자고 제안한다. 명시된 비대칭: 에이전트 궤적은 대규모로 쌓였는데 현실적인 실행 가능 환경은 여전히 희소하다 — 그리고 사후 학습이 실제로 소비하는 것은 환경이다. 환경은 검증 가능한 여러 작업으로 다시 질의할 수 있고 실행 피드백을 돌려주는 반면, 궤적은 한 번 얼어붙은 시연 하나이기 때문이다. 방법이 딛고 선 관찰은 궤적의 도구 실행 이력이 그것이 돌던 환경의 구조와 내용을 드러낸다는 것이다. 기록된 파일 연산을 재생해 각 파일을 수정 전 상태로 되돌려 부분 워크스페이스를 얻고, 완성 에이전트가 빠진 파일과 의존성을 공급한다. 그다음 작업을 breadth(관련 환경 사이의 방향성 의존 관계를 캐내어 여러 코드베이스에 걸친 cross-workspace 질의를 합성)와 depth(단일 턴 질의를 사용자 에이전트가 구동하는 다중 라운드 세션으로 확장)로 확장한다 (source).

중심적 약점을 명시한 채 기록한다. 초록에 수치가 전혀 없다. 벤치마크도, 베이스라인도, 환경 개수도, 성공률도 없다. 복원된 환경으로 사후 학습한 모델이 그 환경이 유래한 궤적으로 학습한 모델을 이기는지가 실무적 질문의 전부인데 다루어지지 않는다. 구조적 의심 둘을 나란히 둘 만하다 — 완성 에이전트가 의존성 하나를 틀리게 추측하면 실행은 되지만 그 궤적이 돌던 환경은 아닌 환경이 나오고, 환경은 궤적이 존재하는 곳에서만 복원되므로 확보 가능한 분포는 에이전트가 이미 요청받은 작업의 분포다. 방법이 내세우는 커버리지 논증과 정반대다.

그리고 세 번째 재료인 하네스가 두 번째 재료와의 첫 통제된 비교를 얻었다. WHALE: A Simple Recipe for Joint Harness-Weight Optimization (2026-08-31) 은 어느 한쪽만 확장하는 대신 가중치 갱신과 하네스 탐색을 번갈아 돌려 weight-only, harness-only, Fast-Slow Training 대비 +4.15~24.38 pp 를 보고하며, 하중을 받는 발견으로 도메인에 따라 어느 쪽이든 병목이 될 수 있다고 말한다. 이 페이지에는 스케일링 주장에 대한 제약이다. 사후 학습 역량은 한 입력을 더 넣어 살 수 있는 단일 수량이 아니다. 얼어붙은 하네스에 대고 RL 을 확장하면 하네스에 막히고, 얼어붙은 가중치에 대고 하네스를 확장하면 가중치에 막힌다.

두 논문은 서로를 인용하지 않으며 Z.ai 의 주장도 인용하지 않는다. 이 구성은 이 위키의 것이다.

현재 수준 (2026-08-21 기준)

벤더의 주장과 그 증거. Z.ai 는 GLM-5.3 의 베이스가 GLM-5.2 의 것이며 손대지 않았고, 보고된 모든 이득이 확장된 사후 학습에서 — 장기 지평 환경에서의 RL 로 보고된다 — 나온다고 밝힌다. 벤더 서술이며 어느 수치에도 하네스가 공개되지 않았다 (source):

벤치마크GLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE46.266.9
AutomationBench26.248.2
Terminal-Bench 3.0 (4.6 → 28.3) 과 DeepSWE 66.9 는 **2026-08-14 에 독립적으로 포착한 수치와
일치한다** — GLM-5.3 에 보유돼 있다
(source). DeepSWE 와 AutomationBench 의 GLM-5.2
기준선은 새로 추가된 것이다.

벤더 주장을 참조하지 않고 도착한 연구 결과들. 사흘 사이 논문 네 편이 서로 다른 구성 요소를 움직이면서 가중치나 베이스를 고정한다:

논문확장되는 것고정되는 것대표 수치
LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393)프로덕션 하네스 안에서의 RL하네스의 제어 흐름SWE-bench Verified 64.0→70.4, 62.4→68.2, 57.2→66.6
Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528)엔드포인트 프록시를 통한 RL하네스가 루프를 소유Qwen3.5-9B 41.8→56.4 (SWE-bench Verified)
SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197)학습 환경 자체—30B 에서 평균 +5.3 / ACEBench-Agent +13.9
DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545)하네스 집단모델벤치마크 넷 평균 약 +17
Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence (arXiv:2608.16590)런타임 크리틱과 복구 스킬베이스 정책LIBERO-Pro 90.8%, RoboCasa 93.6%
2026-08-23 — 첫 제3자 수치이며, 벤더의 것보다 작다. Artificial Analysis 의 주간 캡처는
GLM-5.3 (max) 를 Intelligence Index 60 으로, GLM-5.2 (max) 를 53 으로
싣는다 — Z.ai 가 베이스가 바뀌지 않았다고 서술한 두 모델 사이의 **독립 종합 지표에서의 7점
이동**이다 (source). GLM-5.3 은
2026-08-16 캡처에 없었으므로 이번이 첫 등장이다.

이는 방향의 확증이자 크기의 교정이다. Z.ai 자신의 표현은 ~50% 코딩 개선과 Terminal-Bench 여섯 배 이동이다. 넓은 종합 지표를 재는 제3자는 +7점을 찾아내는데, 이는 실재하고 그 표에서 인접한 대부분의 행 사이 격차보다 크며, 같은 주장이 아니다. 정직하게 읽으면 새 사전학습 없이 사후 학습이 이 모델을 대략 한 티어 — GLM-5.2 의 이웃에서 Kimi K3 (max) 및 Grok 4.6 (xhigh) 와 공유하는 대역으로 — 밀어 올렸다는 것이다.

여전히 단위는 제공하지 않는다. 지표 델타는 결과이지 사후 학습의 양이 아니므로, 아래 열린 문제 1번은 이것으로 달라지지 않는다.

그리고 아무도 공개하지 않은 상한. StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089) 는 가중치를 건드리지 않고 GPT-5.6 Sol xhigh 를 Terminal-Bench 2.1 에서 95.3% 까지 끌어올렸고, 적응 비용은 $38 미만이었다. 이 군집의 어떤 결과도 수익이 어디서 멈추는지, 첫 배증 이후 사후 학습을 한 번 더 배증하면 무엇을 얻는지 보고하지 않는다.

열린 문제

  1. 이 축에서 가장 값싼 레버의 수익은 노력이 아니라 관계가 정한다. Distillation 은 사후 학습에서 모델을 움직이는 가장 값싼 방법이고, Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models (arXiv:2608.16647) 은 on-policy distillation 이 얼마나 멀리 닿는지가 교사/학생 origin 관계에 의해 지배된다고 보고한다 — same-origin 쌍은 언어·지평·도메인을 넘어 전이되고, cross-origin 쌍은 대체로 학습된 분포에만 들어맞는다 — 반면 교사를 결합하면 라우팅이 교사의 영향력을 가둘 수 없기 때문에 합집합이 아니라 혼합 비율에 좌우되는 시소가 나온다. GLM-5.3 에 관한 어떤 설명도 distillation 이 이 페이지가 논하는 사후 학습에 포함되는지 말하지 않으므로, 이것은 그 모델에 대한 주장이 아니라 레버에 대한 제약이다 (source)

  2. 단위가 무엇인가? "확장된 사후 학습" 은 양 없는 방향을 지시한다. 사전학습 스케일링 법칙은 파라미터, 토큰, FLOPs 로 진술되는데, 여기 어느 출처도 사후 학습 컴퓨트, 환경 수, 롤아웃 수를 주지 않는다. 그것이 나오기 전까지 이것은 노력이 어디로 갔는가 에 대한 주장이지 법칙이 아니다.

  3. 베이스는 정말 손대지 않았는가? Z.ai 주장의 가장 강한 형태는 반증 가능하며, 오늘부로 시험 가능하다: Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929) 는 체크포인트만으로, 데이터 없이, 자체 벤치마크에서 AUROC 1.0 으로 가중치 혈통을 검증한다. GLM-5.3 의 가중치가 공개되면 (~2026-08-28 예정) 주장은 믿는 대신 확인할 수 있다. 아무도 이를 하지 않았고, 그 방법은 MoE 프런티어 규모에서 시연된 바 없다.

  4. 다섯 개의 knob, 하나도 열거되지 않았다. Tang 은 다섯 개의 스케일링 knob 과 "XA-YB" MoE 희소성 표기를 든다고 보도되나, 읽은 것 중 둘 중 어느 것도 정의하지 않으므로 독자가 이 틀을 적용할 수 없다.

  5. 독립 측정을 견디는가? 여기 모든 GLM-5.3 수치는 하네스 미공개 벤더 서술이다 — 이 논지의 주된 증거인 릴리스에서, Eval Harness Configuration 이 지적하려 존재하는 바로 그 결함이다.

  6. 역량이 학습된 하네스 밖으로 전이되는가? ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 는 학습 이후 하네스만으로 1.48배 편차를 측정했고, LEGO-RL 은 별개로 학습된 체크포인트 셋을 보고할 뿐 교차 하네스 행렬은 없다. 사후 학습 이득이 하네스 특정적이라면 "사후 학습 스케일링" 과 "하네스 스케일링" 은 이름만 둘인 같은 축이다.

  7. 오픈 웨이트의 거래에는 무슨 일이 일어나는가? 베이스가 값싼 절반이라면, 랩은 가중치를 공개하고 Open-Weights Policy Fight 가 추적하는 모든 오픈 웨이트 약속을 충족시키면서 역량을 만든 쪽을 보유할 수 있다. Z.ai 의 단계적 공개 — 베이스는 GLM-5.2 와 공유, 사후 학습된 가중치는 안전성 평가 대기 — 는 정확히 그 형태를 한 첫 사례이고, 그것이 의도인지 아무도 말하지 않았다.

  8. 여기 있는 무엇도 사후 학습이 무엇을 앗아가는지를 재지 않는다. 이 페이지의 모든 수치는 top-1 점수다 — Terminal-Bench 3.0 4.6 → 28.3, 나머지도 마찬가지 — 즉 사후 학습된 모델이 얼마나 자주 맞히는지를 말할 뿐, 베이스 모델이 도달할 수 있던 거동이 얼마나 살아남았는지는 말하지 않는다. Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO (arXiv:2608.27351) (2026-08-27) 는 GRPO 가 entropy collapse 를 보이는 반면 Evolution Strategies 는 그렇지 않으며, ES 가 "improves Pass@1 while attaining higher Pass@K" 한다고 보고한다 — Pass@K 가 바로 도달 가능하게 남는 것의 척도다. 그것이 성립한다면 지배적인 사후 학습 방법은 헤드라인 수치를 부분적으로 모델을 좁힘으로써 사들이는 셈이고, 이 페이지의 중심 주장은 여기 누구도 보고하지 않은 양 위에 놓이게 된다. 정정이 아니라 열린 문제로 서술한다: 그 논문은 벤치마크도 모델도 절대 수치도 명시하지 않고, 여기 실린 벤더 결과 중 Pass@K 를 공개한 것은 하나도 없으므로 둘을 아직 나란히 놓을 수 없다 (source)

주요 논문

  • Scaling Properties of Same-Family On-Policy Distillation — same-family OPD 의 스케일링 법칙; weak-to-strong 학생이 교사를 넘어서고, 같은 점수에서는 작은 교사가 더 잘 전이한다

  • Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation — 2026-09-08, 그리고 12일 사이 같은 문제를 다룬 세 번째 항목이다: 목표로 삼을 수 없는 교사 신호를 어떻게 쓸 것인가. On-Policy Reverse Distillation 은 가장 어려운 판본을 택한다 — 교사가 실제로 더 약한 경우 — 그리고 교사를 모방하지 않는다. 학생의 롤아웃 위에서 교사가 자신의 레퍼런스 정책 대비 얼마나 이동했는지를 읽고, 학생의 검증기 기반 정책 그래디언트 가운데 이미 그 방향을 가리키는 성분만 증폭한다. 검증기가 지지하는 업데이트만 재조정하기 때문에 정책 최적화의 정류점이 보존되고, 따라서 약한 교사가 자신의 천장을 구조적으로 강요할 수 없다. 연속 세대 이전과 다중 교사 증류 모두에서 더 적은 학생 업데이트로 더 높은 성능이 보고되고, 응답 스타일 분석에서는 학생이 교사보다 검증기 RL 만으로 학습한 모델에 더 가깝게 남는다. 아래 두 항목과 함께 읽으면 검증기가 교사로부터 권한을 점차 가져오는 흐름이 보인다 — 관리해야 할 편향에서, 부호로, 이제 통과 관문으로. 읽은 어떤 자료에도 절대 수치, 벤치마크, 모델 이름이 없고, 셋 중 어느 것도 나머지 둘을 인용하지 않는다 (source)

  • NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness — 2026-09-08. 라우팅 계층이 학습 코퍼스가 된다: 각 턴의 예측된 역량 수요, 선택된 서비스 티어, 이후 상호작용을 기록하고, 구조 검증과 6차원 의미 평가를 거쳐, 추론·도구 호출·하니스 맥락이 뒤섞인 상태 그대로 학습 예시로 재생하며, 평가 피드백이 다음 학습 혼합을 정한다. 11개 벤치마크 매크로 평균은 4B 에서 58.94 → 64.87, 9B 에서 65.60 → 69.04 로 움직여, 후학습된 4B 를 9B 베이스로부터 0.73 안에 놓는다. 제목의 "recursive" 가 덮는 것은 닫힌 루프 한 번이며 — 논문 스스로 "초기 프로토타입" 이라 부른다 — 아래 항목이 제기하는 자기 생성 신호의 반복 문제는 정확히 이 논문이 답하지 않는 부분이다. 벤치마크 이름도, 벤치마크별 수치도 공개되지 않았다 (source)

  • One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation — 2026-08-26. On-Policy Self-Distillation 에 대한 새 실험 없는 리뷰: 교사는 학생이 테스트 시점에 갖지 못할 특권 정보를 조건으로 받은 모델 자신이며, 따라서 더 강하지 않고 더 잘 알 뿐이다 — 두 번째 큰 모델의 비용이 사라지고, 그래서 이 기법이 퍼졌다. 논지는 신호를 만드는 비대칭성이 동시에 신호를 편향시킨다는 것, 그리고 이 분야의 지배적 실패인 붕괴(모델이 만들어낼 수 있는 추론 경로가 점진적으로 좁아지는 것)가 세 레버가 지배하는 하나의 증상이라는 것이다: 신호를 어디에 적용하는가, 교사에게 무엇을 보여주는가, 안내가 언제 감쇠하는가. 붕괴는 OPSD 에 국한되지 않으며 특권 정보가 그것을 악화시킨다. 범위는 수학적 추론으로 한정 (source)

  • FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience — 2026-09-03, 그리고 위 항목과 한 쌍으로 읽는다. FlowBalance 는 조밀한 자기 안내를 유지하되 검증자가 그 부호를 정하게 한다: 이점이 양인 궤적에서는 유지, 음인 궤적에서는 반전, 롤아웃 그룹이 결과 선호를 표현하지 않으면 차단 — 이를 프로파일드 궤적 균형으로 실현하며 별도의 토큰 단위 모방 손실이 없다. 보고: Qwen3-4B 와 Qwen3-8B 에서 FlowRL 대비 평균 성능 향상, 학습 속도와 안정성 개선, 직접 OPSD 의 응답 길이 붕괴 회피, 통제된 AIME24 진단에서 더 높은 정답 전략 다양성. 읽은 자료에 절대 수치는 없고, 두 논문은 서로를 인용하지 않는다 — 그 짝짓기는 이 위키의 것이다. 리뷰가 말한 세 레버 중 정확히 하나를 움직이며, 그래서 리뷰 주장의 예시가 아니라 시험이 된다. 다양성을 보고했다는 것 자체가 더 드문 쪽이다: 홀드아웃 정확도는 붕괴를 볼 수 없다 (source)

  • SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers — 2026-09-03. 이 분야가 보통 빠뜨리는 대조군: looped-Transformer 비교는 대개 모델 크기를 고정한 채 돌려서 루프 모델에 추가 FLOPs 를 쥐여 준다. SMELT 는 토큰당 FLOPs, 비임베딩 파라미터, 그리고 KV 캐시를 맞추고, 그래도 우위가 살아남는다 — 컴퓨트 최적 프런티어에서 학습 FLOPs 의 6.8–18.0% 절약, 비임베딩 파라미터 54B 까지 네 크기에 걸쳐 별도의 Chinchilla 형 법칙으로 적합. 스케일링 결과를 보통 읽는 방식에 반하는 두 발견: 다운스트림 이득이 검증 손실의 예측을 넘어서고 (Code 에서 가장 크다), 샘플 길이와 인컨텍스트 예시에 따라 커져서 두 아키텍처가 단일 시퀀스 길이에서는 비교되지 않는다 (source).

  • LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) — 지명된 프로덕션 하네스 세 곳 안에서의 RL; Agent Lightning 이 생략한 하네스 정체를 제공한다.

  • Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) — 하네스드 에이전틱 RL 을 명명하고, 다른 네 프레임워크가 그 구조를 채택했다고 보고한다.

  • SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197) — 학습 환경 을 학습된 구성 요소로 만든다.

  • Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253) — 다양한 코호트의 동료 리워드로 RL 에서 정답 레이블을 제거한다.

  • DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) — 모델을 고정한 채 하네스를 진화시킨다.

  • StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089) — 이 군집에 달리 없는 비용 수치: $15 대 $574.68.

  • Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929) — 위 2번을 시험할 수 있는 도구.

  • Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO (arXiv:2608.27351) — 사후 학습이 무엇을 사는지가 아니라 무엇을 치르는지를 묻는 여기 유일한 항목: GRPO 의 entropy collapse 대 Evolution Strategies 의 더 높은 Pass@K.

  • Rufus-Air: An Open LLM Post-Training Recipe — Rufus-Air: An Open LLM Post-Training Recipe, 2026-09-24. GLM-4.5-Air-Base 위의 여덟 직렬 단계, 새 사람 주석 없고 사내 증류 교사 없음, 순서 원칙은 보상 신뢰도 — 그리고 어떤 종류의 벤치마크 수치도 없음 (source)

Referenced by

적대적 증류 (Adversarial Distillation)AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems에이전틱 강화학습에이전트 (LLM Agents)ApodexApodex 1.1: Scaling Agentic Intelligence for Complex Work (arXiv:2608.23283)2026년 8월 — 월간 다이제스트Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMsBeyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization (arXiv:2608.23311)Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253)EnvHarness: Awakening Static Worlds for Agent Learning (arXiv:2608.19880)Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models (arXiv:2608.16647)FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning ExperienceGLM-5.3Learning to Solve Hard Problems in RL for LLMs by Never Giving UpLEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393)Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts (arXiv:2608.20061)Liquid AINegative Self-Distillation: Learning to Reason by Avoiding FlawsNeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing HarnessOne Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation오픈 웨이트 정책 공방Paul ChristianoRethinking Critic Learning in PPO: Understanding and Mitigating Value FlatteningRewardVerse: Rubric-Guided Policy Optimization for Video Reward ModelingRufus-Air: An Open LLM Post-Training RecipeScaling Properties of Same-Family On-Policy DistillationSMELT: Scaling Laws for Compute-Matched MoE Looped TransformersSPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197)Terminal-Universe: Turning Agent Trajectories into Scalable Terminal EnvironmentsUnderstanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO (arXiv:2608.27351)주간 종합 — W34 (2026-08-17 → 2026-08-23)주간 종합 — W37 (2026-09-07 → 2026-09-13)When EOS Tokens Disagree: Understanding Length Inflation in On-Policy DistillationWikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill EvolutionZ.ai

Sources