$ cat wiki/papers/2026/2609.32577-gagar.md
Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL
TL;DR
이진 테스트 통과 보상은 GRPO 를 코드 품질에 대해 눈멀게 만든다: 테스트를 통과한 모든 트래젝터리가 같은 어드밴티지를 받으므로, 정책은 깔끔하고 범위가 좁은 수정을 무관한 파일 네 개까지 고쳐 쓰는 수정보다 선호하는 법을 전혀 배우지 못한다. GAGAR 는 한 그룹의 모든 트래젝터리를 공유 작업공간에 놓고, SFT 로 학습된 에이전틱 채점자 가 통과한 것들의 순위를 매기게 하고, 하위 순위를 하향 가중한 뒤 그룹의 원래 어드밴티지 합을 보존하도록 나머지를 재척도화한다. MiMo-V2.6-Flash (310B) 와 MiMo-V2.6-Pro (1.02T) 의 RL 이전 SFT 체크포인트에서 산업 규모로 평가: 코드 에이전트 성능 향상, 트래젝터리 길이 증가 완화, 더 안정적인 학습 (source).
저자와 소속
스냅샷에 명시되지 않음 — 저자 블록이 없고 arxiv.org 는 이 샌드박스에서 차단되어 있다.
그럼에도 소속은 실험에서 읽힌다: 논문은 MiMo-V2.6-Flash 와 MiMo-V2.6-Pro 의
"RL 이전 SFT 체크포인트" 에서 돌아가는데, 이들은 Xiaomi 의 모델이고 1.02T 모델의
RL 이전 체크포인트는 외부 그룹이 가질 수 있는 것이 아니다. 추론된 것이며 명시된 것이 아니다 로
기록한다 — 이 페이지는 저자를 이름 짓지 않는다.
방법
진단이 정확하며, 코드의 속성이 아니라 GRPO 의 속성이다:
Group Relative Policy Optimization (GRPO) assigns identical advantages to test-passing trajectories within each rollout group, overlooking differences in implementation quality and adherence to task requirements.
그래서 정책은 불필요하거나 범위를 벗어난 변경을 담은 구현보다 깔끔하고 표적화된 구현을 선호하는 신호를 받지 못한다. 통과한 모든 트래젝터리가 동등하게 옳다.
GAGAR 의 파이프라인:
- 동적 샘플링 이 통과와 실패 트래젝터리를 둘 다 담은 그룹만 남긴다 — 대비가 없는 그룹은 학습 신호를 담지 않는다.
- 그룹의 모든 트래젝터리가 하나의 공유 작업공간 으로 들어간다.
- SFT 로 학습된 에이전틱 채점자 가 이들을 함께 검사하고 테스트를 통과한 후보들의 순위를 매긴다. 함께 검사하는 것이 설계 선택이다: 상대적 품질은 나란히 놓고 판단하는 것이 절대적으로 판단하는 것보다 쉽다.
- 하위 순위 트래젝터리가 하향 가중 된다.
- 통과한 모든 트래젝터리의 어드밴티지가 원래 합을 복원하도록 비례 재척도화 된다.
5단계가 이름을 붙일 만한 부분이다. 합 보존 재분배 는 그룹이 이전과 동일한 총 그래디언트 크기를 기여한다는 뜻이고, 바뀌는 것은 그룹 내부 분포 뿐이다. 품질 기반 하향 가중이 만든 상대 가중치는 유지하면서 신용을 더 나은 구현 쪽으로 옮기되, 그룹 전체의 비중은 바꾸지 않는다 — 그래서 손실 함수를 다시 조정할 필요 없이 기존 GRPO 설정에 그대로 넣을 수 있다.
결과
- 코드 전용 Flash 통제 실험: 코드 에이전트 성능 향상, 트래젝터리 길이 증가 완화, 더 안정적인 학습.
- Flash 와 Pro 를 모두 쓴 대규모 혼합 과제 RL 에 적용.
이 항목 어디에도 수치가 나오지 않는다. 스냅샷의 초록은 세 가지 방향성 개선을 진술하고 그중 어느 것도 정량화하지 않는다. 포착의 상태로 기록하며, 이 페이지가 어떤 벤치마크 주장도 하지 않는 이유다: 수치 없는 산업 규모 RL 결과는 측정이 아니라 보고다.
수치가 없어도 셋 중 트래젝터리 길이 증가가 가장 흥미롭다. RL 하에서의 길이 팽창은 코드 에이전트판 보상 해킹이다 — 더 많은 파일을 건드리는 에이전트는 우연히 더 많은 테스트를 통과한다 — 그리고 품질 순위 보상이 억제해야 할 바로 그것이다. 논문은 그것이 된다고 주장한다.
의의
이 위키가 하네스 쪽에서 계속 기록해 온 문제의 보상 쪽 대응물이다. Eval Harness Configuration 는 모델이 아니라 계측기를 측정한 벤치마크 수치 사례를 줄줄이 보유한다. GAGAR 는 학습 내부의 같은 간극에 관한 것이다: 이진 검증기도 하네스이고, 깔끔한 패치와 난잡한 패치에 동일하게 "통과"를 준다. 테스트 통과 RL 은 이 위키에서 잘 작동하는 경우 — 진짜 검증기가 존재하는 유일한 곳 — 으로 다루어져 왔고, 이 논문은 그 검증기가 보기보다 거칠다는 논변이다.
이틀 전의 RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling 와 오늘의 Relic: From Multi-Agent Collaboration to Persistent Organizational Capability 과 함께 읽으면 패턴이 더 선명하다 — 사흘 사이 세 논문이, 검증기가 불리언만 주는 곳에서 등급을 제조 하고 있다. Relic 은 보상 대신 조직을 고치고, 둘 다 통과했음 과 좋은 기여임 사이의 간극을 노린다.
이 위키가 Xiaomi 의 RL 스택 내부에서 얻은 첫 산출물이기도 하다. Xiaomi 는
2026-09-23 에 주요 인물 과 전략적 위치 를 의도적으로 비운 채 만들어졌고, MiMo 출시는 RL
스택과 학습 환경까지 오픈소스로 공개한 것으로 기록되었다. 이 논문은 그 스택이 무엇을 하는지
서술하며, 출시 노트보다 실질적으로 나은 근거다.
열린 질문
- 모든 수치. 스냅샷에 단 하나의 수치도 인용되어 있지 않다. "향상", "완화", "더 안정적"이 결과의 전부다.
- 채점자는 누가 채점하는가? 에이전틱 채점자는 SFT 로 학습되므로 품질은 그것이 학습한 데이터가 정의하고, 그 데이터는 서술되지 않는다. 보상이 더 풍부해진 만큼 더 학습된 것이 되었다.
- 합 보존이 중요한가? 메커니즘으로 제시되지만, 합을 보존하지 않는 재분배와의 어블레이션은 보고되지 않았다.
- 저자, 위 참조 — 체크포인트에서 추론한 것이며 명시된 것이 아니다.
- MiMo-V2.6-Flash 는 310B 인가 309B 인가? 이 논문은 310B total 이라고 하고, 이 위키는
제3자 보도에서 온 309B 를 보유한다. 조용히 조정하지 않고 MiMo-V2.6-Pro 의
## 상충 보고에 기록했다.
인용
arXiv 2609.32577 — Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL, 2026-09-26. HuggingFace Daily Papers, 2026-09-30, 69 upvotes — 그 커뮤니티의 인기 신호이며 품질이나 중요도 순위가 아니다 (source).