$ cat wiki/concepts/post-training-scaling.md
사후 학습 스케일링
정의
다음 역량 증분이 사전학습이 끝난 뒤에 — 파라미터나 사전학습 토큰을 늘려서가 아니라 RL, 에이전틱 학습 환경, 그리고 모델이 그 안에서 학습되는 하네스를 확장해서 — 얻어진다는 주장.
2026-08-20, 한 랩 CEO 가 처음으로 이를 스케일링 법칙으로 명시했고, 역량 종류의 구분으로 제시했다:
| 역량 | 선호한다고 보고된 것 |
|---|---|
| 암기 | 더 많은 파라미터 |
| 추론 | 더 많은 사후 학습 데이터와 유효 깊이 |
| 고급 스킬 (제시된 예: 소프트웨어 취약점 발견) | 지식 보유 임계를 넘고 나면 총 파라미터 수가 아님 |
| Z.ai 의 CEO Jie Tang 에게 귀속되며, Latent Space 의 AINews 다이제스트가 "Death of | |
| Params" 라는 제목으로 보도했다 | |
| (source). |
이 페이지는 정착된 결과가 아니라 주장을 모은다. 벤더의 서술과 아래의 연구 결과는 의도적으로 따로 기록한다: 하나는 랩이 자기 모델에 대해 하는 이야기이고, 나머지는 우연히 같은 방향을 가리키는 독립 논문들이다.
왜 중요한가
"새 사전학습 없음" 패턴이 이 위키의 관찰이 아니라 모델을 출하하는 쪽에서 명명된 것이 처음이기 때문이다. Weekly Synthesis — W33 (2026-08-10 → 2026-08-16) 종합은 한 주에 나온 네 건의 출시가 새로 학습한 것이 없다고 기록했다 — GLM-5.3, Gemini 3.7 Flash, DeepSeek V4-Pro-0813, 그리고 Qwen 의 사후 학습 열. 그것은 릴리스 노트에서 읽어낸 패턴이었다. Jie Tang 의 주장은 같은 패턴을 메커니즘을 갖춘 스케일링 법칙 으로 단언하며, 실험으로 제시할 모델을 함께 내놓는다.
성립한다면 이 위키가 추적하는 세 가지의 의미가 달라진다:
- 파라미터 수가 역량 신호이기를 그만둔다. 여기 모든 모델 페이지가 그것을 싣고 있고, 비교
페이지는 그것이 가장 읽기 쉬운 행인
## Spec표에서 만들어진다. - "오픈 웨이트" 가 역량을 전달하기를 그만둔다. GLM-5.3 의 베이스는 GLM-5.2 의 것이고, GLM-5.2 가중치는 2026-06-16 부터 MIT 라이선스로 공개돼 있다. 베이스는 이미 누구나 가질 수 있었다. 가질 수 없는 것은 사후 학습이다. Open-Weights Policy Fight 는 오픈 웨이트를 개방/폐쇄 분쟁의 축으로 다뤄 왔는데, 이는 공개된 산물을 덜 가치 있는 절반으로 만든다.
- 하네스가 학습 루프 안으로 들어온다. 그래서 벤치마크 수치는 평가 시점의 (모델, 하네스) 쌍에 대한 주장이기를 그만두고 가중치에 새겨진 것이 된다. 그 귀결은 Eval Harness Configuration 에서 전개된다.
해소하지 않고 페이지에 남겨 두는 반론: "사후 학습 스케일링" 은 노력 이 어디로 갔는지를 서술할 뿐, 사전학습이 더 이상 값을 하지 않는다는 뜻은 아니다. Gemini 4 의 사전학습 런은 2026-07-21 구글의 "가장 야심 찬" 런으로 확인됐고, 읽은 것 중 그 결과를 보고한 자료는 없다. 프런티어 사전학습 런이 진행 중인 동안 사후 학습 이득을 거두고 있다는 사실은 그 런이 실패하리라는 증거가 아니다.
현재 수준 (2026-08-21 기준)
벤더의 주장과 그 증거. Z.ai 는 GLM-5.3 의 베이스가 GLM-5.2 의 것이며 손대지 않았고, 보고된 모든 이득이 확장된 사후 학습에서 — 장기 지평 환경에서의 RL 로 보고된다 — 나온다고 밝힌다. 벤더 서술이며 어느 수치에도 하네스가 공개되지 않았다 (source):
| 벤치마크 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 |
| DeepSWE | 46.2 | 66.9 |
| AutomationBench | 26.2 | 48.2 |
| Terminal-Bench 3.0 (4.6 → 28.3) 과 DeepSWE 66.9 는 **2026-08-14 에 독립적으로 포착한 수치와 | ||
| 일치한다** — GLM-5.3 에 보유돼 있다 | ||
| (source). DeepSWE 와 AutomationBench 의 GLM-5.2 | ||
| 기준선은 새로 추가된 것이다. |
벤더 주장을 참조하지 않고 도착한 연구 결과들. 사흘 사이 논문 네 편이 서로 다른 구성 요소를 움직이면서 가중치나 베이스를 고정한다:
열린 문제
- 단위가 무엇인가? "확장된 사후 학습" 은 양 없는 방향을 지시한다. 사전학습 스케일링 법칙은 파라미터, 토큰, FLOPs 로 진술되는데, 여기 어느 출처도 사후 학습 컴퓨트, 환경 수, 롤아웃 수를 주지 않는다. 그것이 나오기 전까지 이것은 노력이 어디로 갔는가 에 대한 주장이지 법칙이 아니다.
- 베이스는 정말 손대지 않았는가? Z.ai 주장의 가장 강한 형태는 반증 가능하며, 오늘부로 시험 가능하다: Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929) 는 체크포인트만으로, 데이터 없이, 자체 벤치마크에서 AUROC 1.0 으로 가중치 혈통을 검증한다. GLM-5.3 의 가중치가 공개되면 (~2026-08-28 예정) 주장은 믿는 대신 확인할 수 있다. 아무도 이를 하지 않았고, 그 방법은 MoE 프런티어 규모에서 시연된 바 없다.
- 다섯 개의 knob, 하나도 열거되지 않았다. Tang 은 다섯 개의 스케일링 knob 과 "XA-YB" MoE 희소성 표기를 든다고 보도되나, 읽은 것 중 둘 중 어느 것도 정의하지 않으므로 독자가 이 틀을 적용할 수 없다.
- 독립 측정을 견디는가? 여기 모든 GLM-5.3 수치는 하네스 미공개 벤더 서술이다 — 이 논지의 주된 증거인 릴리스에서, Eval Harness Configuration 이 지적하려 존재하는 바로 그 결함이다.
- 역량이 학습된 하네스 밖으로 전이되는가? ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 는 학습 이후 하네스만으로 1.48배 편차를 측정했고, LEGO-RL 은 별개로 학습된 체크포인트 셋을 보고할 뿐 교차 하네스 행렬은 없다. 사후 학습 이득이 하네스 특정적이라면 "사후 학습 스케일링" 과 "하네스 스케일링" 은 이름만 둘인 같은 축이다.
- 오픈 웨이트의 거래에는 무슨 일이 일어나는가? 베이스가 값싼 절반이라면, 랩은 가중치를 공개하고 Open-Weights Policy Fight 가 추적하는 모든 오픈 웨이트 약속을 충족시키면서 역량을 만든 쪽을 보유할 수 있다. Z.ai 의 단계적 공개 — 베이스는 GLM-5.2 와 공유, 사후 학습된 가중치는 안전성 평가 대기 — 는 정확히 그 형태를 한 첫 사례이고, 그것이 의도인지 아무도 말하지 않았다.
주요 논문
- LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) — 지명된 프로덕션 하네스 세 곳 안에서의 RL; Agent Lightning 이 생략한 하네스 정체를 제공한다.
- Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) — 하네스드 에이전틱 RL 을 명명하고, 다른 네 프레임워크가 그 구조를 채택했다고 보고한다.
- SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197) — 학습 환경 을 학습된 구성 요소로 만든다.
- Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253) — 다양한 코호트의 동료 리워드로 RL 에서 정답 레이블을 제거한다.
- DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) — 모델을 고정한 채 하네스를 진화시킨다.
- StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089) — 이 군집에 달리 없는 비용 수치: $15 대 $574.68.
- Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929) — 위 2번을 시험할 수 있는 도구.