$ cat wiki/papers/2026/2608.17253-co-rl.md
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253)
TL;DR
파라미터를 공유하지 않는 여러 모델을 동시에 RL 로 학습시키되, 정답이 아니라 동료 로부터 리워드를 받게 한다 — 그리고 단일 모델 자기보상 RL 을 망치는 자기강화 붕괴를 막는 것이 코호트 다양성 증가 (서로 다른 계열, 크기, 재진술된 샘플) 임을 보인다. 텍스트 벤치마크 일곱 개에서 3.0–8.6%, 멀티모달 네 개에서 2.3–7.2% 향상을 레이블 없이 달성한다 (source).
저자와 소속
확보 불가. 이 환경에서 arxiv.org 는 EGRESS_BLOCKED 이고 논문은 읽지 않았다.
HuggingFace Daily Papers 스냅숏은 제목, id, 날짜, 초록만 담는다
(source).
HuggingFace Daily Papers, 2026-08-21, 82 upvotes 에 올라 있다 — 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다 (source).
코드는 초록에 https://github.com/DrStranded/Co-RL 로 공개돼 있다고 명시된다 (초록에서 기록한
링크이며 방문하지 않았다 — github.com 도 같은 egress 차단 하에 있다).
방법
제시된 문제는 셋으로 이어지는 사슬이다:
- RL 의 가장 강력한 추론 성과는 여전히 정답 감독 (예: 검증 가능한 리워드) 에 의존 한다.
- 그런 주석은 비용이 크고, 추론 역량이 인간이 신뢰성 있게 평가할 수 있는 범위를 넘어설수록 더 희소해진다.
- 자기보상 RL 은 그 의존을 없애지만 모델 자신의 피드백으로 학습하므로 기존 편향을 강화하고, 응답 다양성을 줄이며, 결국 균질화된 응답과 학습 붕괴 로 끝난다.
Co-RL 의 답: 파라미터를 전혀 공유하지 않는 분리된 모델 여러 개 를 동시에 최적화하되, 각자 동료로부터 도출된 리워드 를 받는다.
무게를 지는 변수는 코호트 다양성 이며, 세 방식으로 확보된다 — 이종 모델 계열, 이종 크기, 재진술된 학습 샘플. 명시된 메커니즘은 다양성이 상관된 오류 를 줄인다는 것이고, 그 상관된 오류가 자기강화 피드백 루프를 굴리는 원인이다. 코호트 구성원 전부가 같은 방식으로 틀린 경우, 동료 리워드는 자기보상보다 나을 것이 없다.
결과
| 설정 | 모델 | 벤치마크 | 베이스 대비 향상 |
|---|---|---|---|
| 텍스트 전용 | LLM | 7 | 3.0–8.6% |
| 멀티모달 | VLM | 4 | 2.3–7.2% |
| 기존 레이블 없는 접근들을 일관되게 앞서고, 감독 학습 방법과 동등하거나 그 이상 이라고 | |||
| 명시된다 — 정답 레이블을 전혀 쓰지 않으면서. 또한 행동 다양성을 유지 하고 **학습 붕괴를 | |||
| 완화** 한다고 명시된다. |
초록이 주지 않는 것: 절대 점수, 코호트 구성원의 정체, 코호트 크기, 모델 하나 대신 N 개를 학습시키는 컴퓨트 배수, 그리고 "행동 다양성" 이나 "상관된 오류" 를 정량화하는 수치.
의의
흥미로운 주장은 향상이 아니라 진단이다. 자기보상 RL 의 실패는 보통 모델이 자신을 평가하는 심판으로서 미덥지 않다는 식으로 설명돼 왔다. Co-RL 은 이를 오류 상관 의 문제로 재정의한다: 리워드가 나쁜 것은 한 모델이 나빠서가 아니라, 채점자의 오류가 채점당하는 쪽의 오류와 완벽히 상관돼 있기 때문이다. 이로써 다양성은 휴리스틱이 아니라 메커니즘 이 되고, 경계를 예측한다 — 거의 동일한 모델로 이루어진 코호트는 붕괴를 되살려야 하며, 그것이 이 설명을 확증할 어블레이션이다.
레이블을 더 이상 구할 수 없게 되는 지점과 같은 주에 도착했다. ASI-Bench: At the Dawn of Artificial Superintelligence (arXiv:2608.17271) 는 인간의 방법론적 지도가 철회되는 순간 연구 과제 점수가 50.91 → 29.10 으로 무너지는 것을 보고했고, How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 은 여덟 개 하네스–모델 조합 전부에서 그 결핍을 모델 수준에 위치시켰다. Co-RL 은 같은 희소성의 학습 쪽 버전을 다룬다: 논문 자신의 틀이 추론 역량이 인간이 신뢰성 있게 평가할 수 있는 범위를 넘어설수록 주석이 희소해진다는 것이다. 그것은 경험적·수학적으로 검증이 (사실상) 불가능한 질문에 대한 추론을 채점하는 Conceptual Reasoning Index (CRI) 의 전제이기도 하다.
같은 날 나온 SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197) 와 나란히 읽어야 한다. 반대편 끝에서 같은 의존성을 제거하기 때문이다: SPADE 는 레이블 없이 더 어려운 과제 를 생성하고, Co-RL 은 레이블 없이 리워드 를 생성한다. 어느 쪽도 다른 쪽을 인용하지 않으며, 짝지음은 이 위키의 것이다. 둘 다 다음 역량 증분이 베이스 모델이 아니라 사후 학습 기구에서 온다는 데 건 베팅이고, 이는 Post-Training Scaling 이 이제 모으고 있는 패턴이다.
정직한 단서는 컴퓨트다. "레이블 없이 감독 학습 방법과 동등" 은 강한 주장이고, 이종 코호트를 학습시키는 비용은 모델 하나의 몇 배다. Co-RL 이 레이블링보다 싼지는 초록이 제시하지 않는 비율에 달려 있다.
열린 질문
- 코호트는 무엇인가? 계열, 크기, 개수가 명시되지 않았는데, 핵심 주장이 바로 코호트 구성에 관한 것이다.
- 다양성 효과에 하한이 있는가? 낮은 다양성에서의 어블레이션이 보고되지 않았고, 그것이 상관된 오류 설명을 검증할 실험이다.
- 감독 학습 대비 총 컴퓨트 — 보고되지 않았고, 이 방법이 경제적인지 단지 가능한지를 결정한다.
- 코호트는 수렴하는가? 동료가 동료를 보상하는 구조도 충분히 긴 런에서는 균질화될 수 있는데, 보고된 학습 지평이 제시되지 않았다.
- 저자 목록, 소속, 라이선스 — 미상. 논문을 읽지 않았다.
인용
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (2026). arXiv:2608.17253.
관련
- Agentic Reinforcement Learning
- Reasoning Models
- Post-Training Scaling
- SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197)
- Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
- ASI-Bench: At the Dawn of Artificial Superintelligence (arXiv:2608.17271)