AI Trend Notifier
EN
← wiki

$ cat wiki/concepts/post-training-scaling.md

사후 학습 스케일링

concept갱신 2026-08-21생성 2026-08-21

정의

다음 역량 증분이 사전학습이 끝난 뒤에 — 파라미터나 사전학습 토큰을 늘려서가 아니라 RL, 에이전틱 학습 환경, 그리고 모델이 그 안에서 학습되는 하네스를 확장해서 — 얻어진다는 주장.

2026-08-20, 한 랩 CEO 가 처음으로 이를 스케일링 법칙으로 명시했고, 역량 종류의 구분으로 제시했다:

역량선호한다고 보고된 것
암기더 많은 파라미터
추론더 많은 사후 학습 데이터와 유효 깊이
고급 스킬 (제시된 예: 소프트웨어 취약점 발견)지식 보유 임계를 넘고 나면 총 파라미터 수가 아님
Z.ai 의 CEO Jie Tang 에게 귀속되며, Latent Space 의 AINews 다이제스트가 "Death of
Params" 라는 제목으로 보도했다
(source).

이 페이지는 정착된 결과가 아니라 주장을 모은다. 벤더의 서술과 아래의 연구 결과는 의도적으로 따로 기록한다: 하나는 랩이 자기 모델에 대해 하는 이야기이고, 나머지는 우연히 같은 방향을 가리키는 독립 논문들이다.

왜 중요한가

"새 사전학습 없음" 패턴이 이 위키의 관찰이 아니라 모델을 출하하는 쪽에서 명명된 것이 처음이기 때문이다. Weekly Synthesis — W33 (2026-08-10 → 2026-08-16) 종합은 한 주에 나온 네 건의 출시가 새로 학습한 것이 없다고 기록했다 — GLM-5.3, Gemini 3.7 Flash, DeepSeek V4-Pro-0813, 그리고 Qwen 의 사후 학습 열. 그것은 릴리스 노트에서 읽어낸 패턴이었다. Jie Tang 의 주장은 같은 패턴을 메커니즘을 갖춘 스케일링 법칙 으로 단언하며, 실험으로 제시할 모델을 함께 내놓는다.

성립한다면 이 위키가 추적하는 세 가지의 의미가 달라진다:

  1. 파라미터 수가 역량 신호이기를 그만둔다. 여기 모든 모델 페이지가 그것을 싣고 있고, 비교 페이지는 그것이 가장 읽기 쉬운 행인 ## Spec 표에서 만들어진다.
  2. "오픈 웨이트" 가 역량을 전달하기를 그만둔다. GLM-5.3 의 베이스는 GLM-5.2 의 것이고, GLM-5.2 가중치는 2026-06-16 부터 MIT 라이선스로 공개돼 있다. 베이스는 이미 누구나 가질 수 있었다. 가질 수 없는 것은 사후 학습이다. Open-Weights Policy Fight 는 오픈 웨이트를 개방/폐쇄 분쟁의 축으로 다뤄 왔는데, 이는 공개된 산물을 가치 있는 절반으로 만든다.
  3. 하네스가 학습 루프 안으로 들어온다. 그래서 벤치마크 수치는 평가 시점의 (모델, 하네스) 쌍에 대한 주장이기를 그만두고 가중치에 새겨진 것이 된다. 그 귀결은 Eval Harness Configuration 에서 전개된다.

해소하지 않고 페이지에 남겨 두는 반론: "사후 학습 스케일링" 은 노력 이 어디로 갔는지를 서술할 뿐, 사전학습이 더 이상 값을 하지 않는다는 뜻은 아니다. Gemini 4 의 사전학습 런은 2026-07-21 구글의 "가장 야심 찬" 런으로 확인됐고, 읽은 것 중 그 결과를 보고한 자료는 없다. 프런티어 사전학습 런이 진행 중인 동안 사후 학습 이득을 거두고 있다는 사실은 그 런이 실패하리라는 증거가 아니다.

현재 수준 (2026-08-21 기준)

벤더의 주장과 그 증거. Z.ai 는 GLM-5.3 의 베이스가 GLM-5.2 의 것이며 손대지 않았고, 보고된 모든 이득이 확장된 사후 학습에서 — 장기 지평 환경에서의 RL 로 보고된다 — 나온다고 밝힌다. 벤더 서술이며 어느 수치에도 하네스가 공개되지 않았다 (source):

벤치마크GLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE46.266.9
AutomationBench26.248.2
Terminal-Bench 3.0 (4.6 → 28.3) 과 DeepSWE 66.9 는 **2026-08-14 에 독립적으로 포착한 수치와
일치한다** — GLM-5.3 에 보유돼 있다
(source). DeepSWE 와 AutomationBench 의 GLM-5.2
기준선은 새로 추가된 것이다.

벤더 주장을 참조하지 않고 도착한 연구 결과들. 사흘 사이 논문 네 편이 서로 다른 구성 요소를 움직이면서 가중치나 베이스를 고정한다:

논문확장되는 것고정되는 것대표 수치
LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393)프로덕션 하네스 안에서의 RL하네스의 제어 흐름SWE-bench Verified 64.0→70.4, 62.4→68.2, 57.2→66.6
Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528)엔드포인트 프록시를 통한 RL하네스가 루프를 소유Qwen3.5-9B 41.8→56.4 (SWE-bench Verified)
SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197)학습 환경 자체30B 에서 평균 +5.3 / ACEBench-Agent +13.9
DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545)하네스 집단모델벤치마크 넷 평균 약 +17
Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence (arXiv:2608.16590)런타임 크리틱과 복구 스킬베이스 정책LIBERO-Pro 90.8%, RoboCasa 93.6%
그리고 아무도 공개하지 않은 상한. StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089) 는 가중치를
건드리지 않고 GPT-5.6 Sol xhigh 를 Terminal-Bench 2.1 에서 95.3% 까지 끌어올렸고, 적응 비용은
$38 미만이었다. 이 군집의 어떤 결과도 수익이 어디서 멈추는지, 첫 배증 이후 사후 학습을 한 번 더
배증하면 무엇을 얻는지 보고하지 않는다.

열린 문제

  1. 단위가 무엇인가? "확장된 사후 학습" 은 양 없는 방향을 지시한다. 사전학습 스케일링 법칙은 파라미터, 토큰, FLOPs 로 진술되는데, 여기 어느 출처도 사후 학습 컴퓨트, 환경 수, 롤아웃 수를 주지 않는다. 그것이 나오기 전까지 이것은 노력이 어디로 갔는가 에 대한 주장이지 법칙이 아니다.
  2. 베이스는 정말 손대지 않았는가? Z.ai 주장의 가장 강한 형태는 반증 가능하며, 오늘부로 시험 가능하다: Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929) 는 체크포인트만으로, 데이터 없이, 자체 벤치마크에서 AUROC 1.0 으로 가중치 혈통을 검증한다. GLM-5.3 의 가중치가 공개되면 (~2026-08-28 예정) 주장은 믿는 대신 확인할 수 있다. 아무도 이를 하지 않았고, 그 방법은 MoE 프런티어 규모에서 시연된 바 없다.
  3. 다섯 개의 knob, 하나도 열거되지 않았다. Tang 은 다섯 개의 스케일링 knob 과 "XA-YB" MoE 희소성 표기를 든다고 보도되나, 읽은 것 중 둘 중 어느 것도 정의하지 않으므로 독자가 이 틀을 적용할 수 없다.
  4. 독립 측정을 견디는가? 여기 모든 GLM-5.3 수치는 하네스 미공개 벤더 서술이다 — 이 논지의 주된 증거인 릴리스에서, Eval Harness Configuration 이 지적하려 존재하는 바로 그 결함이다.
  5. 역량이 학습된 하네스 밖으로 전이되는가? ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 는 학습 이후 하네스만으로 1.48배 편차를 측정했고, LEGO-RL 은 별개로 학습된 체크포인트 셋을 보고할 뿐 교차 하네스 행렬은 없다. 사후 학습 이득이 하네스 특정적이라면 "사후 학습 스케일링" 과 "하네스 스케일링" 은 이름만 둘인 같은 축이다.
  6. 오픈 웨이트의 거래에는 무슨 일이 일어나는가? 베이스가 값싼 절반이라면, 랩은 가중치를 공개하고 Open-Weights Policy Fight 가 추적하는 모든 오픈 웨이트 약속을 충족시키면서 역량을 만든 쪽을 보유할 수 있다. Z.ai 의 단계적 공개 — 베이스는 GLM-5.2 와 공유, 사후 학습된 가중치는 안전성 평가 대기 — 는 정확히 그 형태를 한 첫 사례이고, 그것이 의도인지 아무도 말하지 않았다.

주요 논문

Referenced by

Sources