$ cat wiki/papers/2026/2609.22068-codemidas.md
CodeMidas: Scaling Agentic Coding RL Environments from Code Itself
TL;DR
기존 소스 코드를 — 그 외에는 아무것도 쓰지 않고 — 코딩 에이전트용 실행 가능한 RL 환경 으로 바꾸는 에이전트 파이프라인으로, 이슈와 커밋에 기대던 관행을 버린다. 3,185개 코드베이스에서 5,545개 학습 과제, 23개 언어. 이것으로 MiMo-V2.5 를 GRPO 로 학습하면 시도한 다섯 개 벤치마크가 모두 오르며, Terminal-Bench v2.1 +8.5% 를 포함한다.
저자와 소속
명시되어 있지 않다. HuggingFace Daily Papers 스냅샷은 arXiv id, 제목, 업보트 수, 게재일, 초록을 담는다. 저자 목록도 소속도 담지 않으며, arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 로 응답한다. 추측하지 않고 미상으로 기록한다.
방법
밝혀진 전제는 기존 관행의 한계다: 오픈소스 코드베이스는 RL 과제의 풍부한 원천이지만, 기존 방법은 이슈와 커밋 같은 개발 산출물에 기댄다 — 그러면 뽑아낼 수 있는 과제는 누군가 적어 둔 것으로 제한된다. CodeMidas 는 소스 코드를 유일한 과제별 입력 으로 삼는다 (source).
에이전트 연산은 푸는 데만이 아니라 환경 구축의 모든 단계에 배분된다:
- 에이전트가 구현된 기능을 탐색해 동작 명세를 작성 하고,
- 원본 코드의 실행에 근거한 테스트를 구성 하고,
- 후보를 실행 검사와 반복 해법 롤아웃으로 검증하고 거른다.
결과 데이터셋: 3,185개 오픈소스 코드베이스 에서 나온 5,545개 학습 과제, 23개 프로그래밍 언어 와 15개 기술 도메인 에 걸친다.
결과
MiMo-V2.5 를 GRPO 로 이 과제들에 학습시켰다. 공개된 수치는 모두 학습 전 베이스라인 대비 증가분이다:
| 벤치마크 | 과제 계열 | 증가분 |
|---|---|---|
| DeepSWE | 이슈 수정 | +11.7% |
| ProgramBench | 전체 프로그램 구성 | +17% |
| Terminal-Bench v2.1 | 터미널 작업 | +8.5% |
| "다섯 개 의 다양한 벤치마크 모두에서 성능이 오른다" 고 적혀 있지만 초록은 그중 셋만 이름과 수치를 준다. 나머지 둘에는 수치가 없으므로 여기에 총계는 기록하지 않는다. |
추가 주장 둘:
- 어블레이션: 고품질 학습 과제 수를 늘리면 성능이 계속 오른다 — 모델이 아니라 환경 집합에 관한 스케일링 주장이다.
- 궤적 분석: RL 로 학습한 에이전트는 코드베이스를 더 탐색하고 더 다양하게 자기검증 한다.
초록 어디에도 절대 점수가 없다 — 모든 숫자가 상대 증가분이므로, 이 중 어느 것도 이 위키의 다른 수치와 비교할 수 없다.
의의
엿새 사이 같은 수를 둔 네 번째 논문이고, 발견은 개별 결과가 아니라 그 묶음이다: 산출물이 곧 명세다.
ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks (09-21 에 기록) 은 실행 중인 레퍼런스 애플리케이션 을 명세로 삼고, 2609.22000 RecreationWorld 는 실행 중인 레퍼런스 를 숨겨진 동작 테스트의 오라클로 삼고, 2609.05571 Code2Skill 은 19,769개 저장소 를 스킬 뱅크로 바꾸며, CodeMidas 는 소스 코드 를 RL 환경으로 바꾼다. 넷 모두 사람이 쓴 과제 진술을 걷어내고, 그중 셋은 구축에서 사람을 완전히 걷어낸다.
CodeMidas 를 나머지 셋과 가르는 것은 루프의 어느 쪽에 있는가 다. ProgramDistill 과 RecreationWorld 는 평가 를 만들고, CodeMidas 는 같은 재료로 학습 환경 을 만든다. 이는 Agentic Reinforcement Learning 이 기록해 온 바로 그 비대칭이다 — 검증 가능한 환경이 에이전트 RL 의 병목이고, 그 공급은 사람의 주석 작업에 묶여 있었다.
Eval Harness Configuration 에도 남다른 각도로 걸린다: 환경이 에이전트에 의해 합성된다면 하네스는 이제 측정의 일부만이 아니라 학습 데이터의 일부 다.
열린 질문
- 다섯 중 어느 둘이 보고되지 않았는지, 그리고 얼마나 움직였는지. 수치 셋을 공개하면서 "다섯 개 모두 오른다" 고 하는 것은 이 위키가 대조할 수 없는 주장이다.
- 절대 점수. 베이스라인 수치가 없으면 Terminal-Bench v2.1 의 +8.5% 를 이 위키가 Ternary Bonsai 2 27B 와 Qwen 3.8 27B 에서 이미 갖고 있는 52.8 / 69.7 / 73.0 옆에 놓을 수 없다.
- 두 번째 베이스 모델에서도 이득이 남는지. 보고된 것은 MiMo-V2.5 뿐이다.
- 오염. 학습 과제는 오픈소스 코드베이스에서 만들고 평가 벤치마크도 오픈소스 코드베이스에서 만드는데, 초록은 중복 검사를 언급하지 않는다.
- 필터가 무엇을 버리는지. 유효성 필터로서의 "반복 해법 롤아웃" 은 현재 모델이 이미 가끔 풀 수 있는 과제를 고르게 되고, 이는 초록이 논하지 않는 환경 집합의 편향이다.
관련
- RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents — 2026-09-22 의 다른 논문 선택이자, 이 논문의 평가 쪽 쌍둥이
- ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks — 같은 치환, 한 겹 바깥에서
- Agentic Reinforcement Learning — 환경 공급 병목을 추적하는 곳
- Eval Harness Configuration
- Agents (LLM Agents)