$ cat wiki/papers/2026/2609.29421-rufus-air.md
Rufus-Air: An Open LLM Post-Training Recipe
TL;DR
GLM-4.5-Air-Base (106B-A12B) 위의 공개되고 재현 가능한 사후 학습 레시피로, 여덟 개의 직렬 단계 — SFT, Reasoning RL, Coding RL, Instruction-Following RL, General Agent, Coding Agent, Search Agent, RLHF — 로 문서화되며, 오픈소스 구성 요소와 공개 데이터, 그 다수를 공개된 그대로 쓰고, 새로운 사람 주석도 사내 증류 교사도 없이 만들어졌다. 공식 GLM-4.5-Air 사후 학습 릴리스보다 개선된다고 진술된다 (source).
저자와 소속
스냅샷에 진술되지 않음 — 저자 목록도, 소속도 없다. arxiv.org 는 이 런의
샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추측하지 않고 unknown 으로 기록한다.
베이스 모델은 Z.ai 의 GLM-4.5-Air-Base 이고, 레시피는 그 랩 자신의 사후 학습 릴리스를 이긴다고 진술된다. 저자가 Z.ai 와 관계가 있는지는 확립되지 않았으며, 그것이 이 비교를 읽는 데 중요하다.
방법
여덟 단계, 직렬, 진술된 순서대로:
| # | 단계 |
|---|---|
| 1 | SFT |
| 2 | Reasoning RL |
| 3 | Coding RL |
| 4 | Instruction-Following RL |
| 5 | General Agent |
| 6 | Coding Agent |
| 7 | Search Agent |
| 8 | RLHF |
| 진술된 조직 원칙은 이중 진행이다: 기초에서 고급 역량으로, 그리고 **하드하고 검증 | |
| 가능한 보상에서 부드러운 판정자 기반 신호로**. |
논문이 문서화한다고 말하는 것: 레시피를 재현하는 데 필요한 데이터, 보상 설계, 인프라, 단계 순서, 단계별 결과.
제약이 기여다. 학습은 오픈소스 구성 요소와 공개 데이터, 그 다수를 공개된 그대로 쓰며, 새로운 사람 주석 없이, 사내 증류 교사 없이 이루어진다 — 그래서 레시피는 레이블링 예산이나 증류할 프런티어 모델이 없는 사람도 재현할 수 있다.
진술된 네 발견:
- 다양하고 고품질인 SFT 가 강한 역량 하한을 세운다.
- 난이도 필터링이 RL 프롬프트를 생산적인 학습 범위 안에 유지한다.
- 보상 신뢰도가 단계 순서를 정하는 실용적 원칙을 제공한다.
- 인프라와 엔지니어링 선택은 구현 세부가 아니라 레시피의 일부다.
3번이 힘을 가진 쪽이며, 단계 순서를 규칙으로 다시 쓴 것이다: 신뢰할 수 있는 보상을 가진 단계를 먼저 두라, 뒤 단계가 앞 단계가 남긴 정책을 물려받기 때문이다. 여덟 단계 표는 그에 대한 증거로 읽을 수 있다 — 판정자가 점수를 주는 RLHF 앞에 검증 가능한 코드와 추론 RL.
스냅샷에 진술되지 않음: 데이터셋, 보상 모델, 어떤 컴퓨트 수치, 초록이 문서화되어 있다고 말하는 단계별 수치, 그리고 "난이도 필터링" 이 무엇을 기준으로 삼는지.
결과
읽은 자료 어디에도 벤치마크 수치가 나타나지 않는다. 정량화되지 않은 비교 주장 둘:
- 공식 GLM-4.5-Air 사후 학습 릴리스보다 개선된다.
- 비슷한 크기의 오픈 모델들과 경쟁력 있다.
어느 쪽도 벤치마크, 마진, 비교 모델을 지명하지 않는다. 이 페이지는 그 주장들을 결과로 환언하지 않고 부재를 기록한다 — 숫자 없는 "보다 개선된다" 는 결과가 아니며, 초록은 단계별 결과가 논문에 있다고 진술하는데 그것은 여기서 읽을 수 없다.
이 저장소 자체의 캡처된 Artificial Analysis 표에는 대조할 GLM-4.5-Air 행이 없다: Z AI
행은 GLM-5.3 (max) 45, GLM-5.3-Flash 42, GLM-5.3 (low) 34 이다
(source). GLM-4.5-Air 는 그
발행자가 현재 게재하는 것보다 마이너 두 세대 뒤이며, 이는 그 비교가 얼마만큼의 값을
갖는지에 영향을 준다.
의의
Post-Training Scaling 은 사후 학습이 무엇을 사주는지에 관한 주장을 축적해 왔으며, 대부분은 랩이 자기 프런티어 모델에 대해 레시피를 감춘 채 공개한 것이다. 이것은 다른 종류의 문서다: 누구나 다운로드할 수 있는 베이스 위의 레시피이며, 비싼 입력을 의도적으로 배제한다.
배제된 입력이 이 위키의 현재 맥락에서 흥미로운 부분이다. Anthropic 의 9월 위협 인텔리전스 보고서는 여러 중국 랩이 Claude 를 증류했다고 고발하고, Alibaba / Qwen AI Lab 는 Qwen 3.5–3.7 을 학습시켰다고 하는 증류 캠페인에 대해 서로 맞지 않는 두 수치 집합을 안고 있다. Rufus-Air 는 사내 증류 교사를 쓰지 않았다고 진술한다 — 그래서 프런티어 교사 없이 "비슷한 크기의 오픈 모델들과 경쟁력 있다" 에 이르는 레시피는 그 교사가 얼마만큼의 값이었는지에 관한 데이터가 된다. 수치가 붙지 않은 동안은 약한 데이터이며, 그래서 위의 부재를 그렇게 평이하게 기록한다.
이 런의 다른 논문들을 상대로 관례적인 항목이기도 한데, 숨기지 않고 적어 둘 만하다. Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents, Agent-Editing World Model: Rethinking World Modeling for LLM Agents, Harness-Zero: Harness Distillation via Agent-as-Harness, Agensh: Scaling Organizational Intelligence to 1,024 Agents 는 모두 구성 요소를 지운다. Rufus-Air 는 SFT 뒤에 일곱 단계를 더하고 그 값이 순서에 있다고 논증한다. 둘 다 참일 수 있다 — 논문들은 미리 결정하는 것을 제거하고 있고 이 논문은 검증하는 것을 배열하고 있다 — 그러나 대비는 실재하며 이 위키는 한 주 동안 한쪽만 보고해 왔다.
7단계가 General Agent 와 Coding Agent 단계와 구별되는 Search Agent 단계라는 것은, 이
위키가 에이전트형 사후 학습이 한 국면이 아니라 에이전트 유형별로 쪼개진 것을 본 첫
사례다. 같은 스냅샷의 두 번째 검색 에이전트 논문과 짝을 이룬다: 2609.29444
IterSynth (upvote 9, 2026-09-24) 는 역할 분리형 deep-search 패러다임을 Role-Decoupled
Policy Optimization 과 함께 보고하며, 장기 지평 deep-search 벤치마크 다섯 개에서
IterSynth-8B 평균 50.7, 기존 최강 ≤8B 에이전트 대비 +4.2% 를 낸다
(source). 페이지 없음, 일회성
언급 규칙에 따르며 — 전용 검색 에이전트 학습 단계와 전용 검색 에이전트 아키텍처가 같은 25개
항목 안에 도착했기 때문에 여기 기록한다.
열린 질문
- 단계별 결과는 무엇인가? 초록은 문서화되어 있다고 말하는데 여기서 읽을 수 있는 것은 없고, 모든 비교 주장이 정량화되지 않았다.
- 저자는 Z.ai 인가? 레시피가 그 랩 자신의 사후 학습 릴리스를 이기며, 제3자인지 같은 랩인지가 그 주장의 의미를 바꾼다.
- "그 다수를 공개된 그대로" 가 무엇을 배제하는가? 나머지가 재현성 주장이 통상 실패하는 지점이다.
- 왜 GLM-4.5-Air-Base 인가? 리더보드가 게재하는 것보다 마이너 두 세대 뒤인데 읽은 자료에 그 선택에 대한 설명이 없다.
- 순서 원칙은 전이되는가? "보상 신뢰도가 단계를 배열한다" 는 하나의 베이스 모델 위 하나의 여덟 단계 실행에서 나온 실용적 원칙으로 진술된다.
인용
arXiv 2609.29421 — Rufus-Air: An Open LLM Post-Training Recipe, 2026-09-24. HuggingFace Daily Papers, 2026-09-27, upvote 13 — 그 커뮤니티의 인기 신호이며 품질이나 중요도 순위가 아니다 (source).
페이지 없이 위에서 함께 인용: arXiv 2609.29444 — IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis, 2026-09-24, upvote 9.