$ cat wiki/papers/2026/2609.33987-opera.md
Opera — 코딩 에이전트의 지속적 피드백
TL;DR
Opera는 근본적인 문제가 해결될 때까지 비평자의 교정 내용을 활성 상태로 유지한다. 초록은 추론 중의 성능 향상과 비평자 지도로 생성한 롤아웃으로 학습한 뒤의 성능 향상을 보고한다. (source)
저자와 소속
저자는 Kai Mei, Zhiyuan Hu, Yutong Dai, Juntao Tan, Yifan Zhang, Dingjie Song, Dimitris N. Metaxas, Silvio Savarese, Ran Xu, Zeyuan Chen이다. 저장한 초록 페이지에는 소속이 명시되어 있지 않다. 최초 제출일은 2026-09-27이며, 검토한 버전의 수정일은 2026-10-08이다. (source)
방법
주기적 계기와 사건 발생에 따른 계기가 검토를 시작한다. 유형별 진단 연산자가 문제를 식별하고, 증거 감사가 전달 전 피드백을 점검하며, 지속적으로 보관되는 메모가 후속 행동을 추적해 조언을 따르는 것과 문제를 해결하는 것을 구분한다. 저자들은 대략적으로 온폴리시에 해당하는 이 롤아웃을 미세조정에도 사용한다. (source)
결과
- 네 가지 정책 모델에서 저자들이 보고한 해결률 개선의 최댓값은 Terminal-Bench 2.1에서 12.4 percentage points, SWE-Bench Pro 하위 집합에서 15.0, DeepSWE v1.1에서 8.9이다. 초록은 모델이 스스로 비평할 때에도 개선된다고 보고한다. (source)
- Qwen3.5-9B를 미세조정하면 추론 시 비평자 없이도 학습에 쓰지 않은 SWE-Bench Pro 저장소의 해결률이 10.2 percentage points 높아진다. 저자들은 더 강한 모델의 롤아웃으로 학습한 성능과 같으면서 Openhands에서 Terminus-2로 전환할 때 성능을 유지한다고 보고한다. 비교 대상은 이 전환에서 성능이 낮아진다. (source)
의의
Agents (LLM Agents) 관점에서 이 방법은 해결되지 않은 교정 사항을 명시적으로 기록하며, RunningTab — tracking unfinished workspace requirements의 미완료 요구사항 기록을 보완한다. 해석: 유용한 조언을 생성하는 일과 그 조언이 문제를 해결했는지 확인하는 일은 별개의 책임이다. (source) (RunningTab)
열린 질문
초록에는 절대 해결률, 모델별 수치, 비용을 맞춘 비교가 없다. 보고된 최댓값을 모든 모델에 적용되는 개선 폭으로 읽어서는 안 된다. 논문 전문과 구현은 검토하지 않았다. (source)
인용
arXiv:2609.33987 · Code · (source)