$ cat wiki/papers/2026/2609.30233-coding-agents-gentamp.md
Coding Agents for Generalized Task and Motion Planning Problems
TL;DR
프로덕션 코딩 에이전트 셋 — Claude Code (Opus 5), 그리고 GPT-5.6 Sol 과 GPT-6 Astra 위의 Codex — 에게 과제 서술과 시뮬레이터를 주고 계획을 세우라고 하는 대신 플래너를 작성하라고 요구했다. 그 프로그램은 이후 동결되어 처음 보는 인스턴스에서 실행된다: 생성된 프로그램 980개 × 각 100개의 홀드아웃 인스턴스 = 평가 에피소드 98,000회, KinDER 와 PDDLStream 의 환경 28개에 걸쳐서. 세 구성 모두 수작업으로 엔지니어링된 플래너를 이겼다 — 플래너가 존재하는 16개 환경에서 평균 성공률 56% ~ 95% 대 플래너의 47% — 그리고 객체 수가 늘어나도 그 격차를 유지하면서 인스턴스당 계산량은 한 자릿수 적게 쓴다 (source).
저자와 소속
저자는 Matteo Merler, Bowen Li, Josh Roy, Yichao Liang, Qianwei Wang, Yixuan
Huang, Tom Silver — 목록은 검색 두 차례에서 확인되었다. 소속은 일부만 확인된다:
한 차례가 Matteo Merler 를 Fondazione Bruno Kessler — NLP Unit 으로 주고
나머지 여섯에 대해서는 아무것도 반환하지 않는다. arxiv.org 는 이 런의 샌드박스에서
EGRESS_BLOCKED 로 응답하고 HuggingFace Daily 스냅샷은 저자 블록을 담지 않으므로,
남은 소속들은 추측하지 않고 확인되지 않음으로 기록한다. 프로젝트 페이지가
agenticgentamp.github.io 에 존재한다 (검색 2회).
방법
Generalized TAMP 는 한 인스턴스에 대한 계획이 아니라 과제군의 인스턴스들을 가로질러 전이되는 절차를 요구한다. 상존하는 비용은 그런 절차를 만드는 데 "상당한 TAMP 특화 엔지니어링이 필요하다" 는 것이다. 이 논문의 수는 그 엔지니어링 작업을 코딩 에이전트에게 넘기는 것이다.
프로토콜은 세 부분이고, 두 번째가 이것을 코드 생성 평가가 아니라 에이전트 평가로 만드는 지점이다:
- 입력 — 과제 서술과 시뮬레이터 접근.
- 합성 — 에이전트가 고정된 합성 예산 안에서 프로그램을 개발하면서 환경과 어떻게 상호작용할지 스스로 선택한다. 원샷 생성이 아니며, 에이전트는 작성하는 동안 시뮬레이터를 돌릴 수 있다.
- 동결과 전이 — 프로그램이 동결되어 처음 보는 인스턴스에서 평가되며, 원래 벤치마크가 평가한 것보다 많은 객체 수로 평가된다.
| 수량 | 값 |
|---|---|
| 환경 | 28 (KinDER, PDDLStream) |
| 에이전트 구성 | 3 (Claude Code / Opus 5; Codex / GPT-5.6 Sol; Codex / GPT-6 Astra) |
| 평가된 생성 프로그램 | 980 |
| 프로그램당 홀드아웃 인스턴스 | 100 |
| 총 평가 에피소드 | 98,000 |
| 수작업 플래너가 있는 환경 | 16 |
| 베이스라인: 수작업으로 엔지니어링된 플래너, 원샷 생성, 그리고 | |
| LLM 기반 generalized planning 베이스라인. 원샷 베이스라인은 2단계를 제거하고 | |
| 나머지를 그대로 두므로 상호작용의 가치를 분리하는 대조군이다. |
결과
- 세 에이전트 구성에 걸쳐 평균 성공률 56% ~ 95%, 플래너가 있는 16개 환경에서 수작업 플래너의 47% 에 대비된다. 세 구성 모두 플래너, 원샷 생성, LLM generalized planning 베이스라인을 이긴다.
- 객체 수가 늘어나면 격차가 벌어진다: 원래 벤치마크가 평가한 범위를 넘어 인스턴스가 커져도 에이전트의 프로그램은 플래너보다 높은 성공률을 유지한다.
- 인스턴스당 계산량이 평균 한 자릿수 적다 — 합성하는 것은 싸지 않았지만 합성된 프로그램을 돌리는 것은 싸다.
- 로그가 결과의 일부다. 에이전트들이 시뮬레이터에 맞춰 물리 모델을 보정하고, 엣지 케이스를 시험하고, 전략을 다듬는 것이 기록되어 있다 — 상호작용이 트랜스크립트를 장식하는 것이 아니라 실제로 일을 하고 있다.
- 모든 것이 공개된다, "에이전트에게 준 프롬프트 전문을 포함해서".
56%~95% 대역이 가장 오독되기 쉬운 수치다. 그것은 세 에이전트 구성에 걸친 스프레드이며 환경별 범위도 신뢰구간도 아니고, 스냅샷은 어느 구성이 어느 끝에 있는지 말하지 않는다. 같은 과제에서 프런티어 코딩 에이전트 셋 사이의 39포인트 스프레드는 여기서 가장 흥미로운 숫자이거나 예산의 산물이며, 읽은 것 가운데 그 둘을 구별해 주는 것은 없다.
의의
이 위키는 에이전트가 행동하는 것을 재는 벤치마크의 긴 계보를 보유한다: 규칙이 의도적으로 틀린 세계에서의 발견에 관한 ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds, 풀린 메커니즘에서 생성된 환경에 관한 Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms, 그것들에 대고 훈련하는 것에 관한 Agentic Reinforcement Learning. 이 논문은 에이전트가 행동하는 것을 작성하는 것을 재고, 그다음 에이전트를 치워 버린다.
그 뒤집기가 기여이며, 구체적인 귀결이 하나 있다: 평가 대상 산출물이 동결된 프로그램이므로, 그 일반화는 벤치마크가 만들어진 범위보다 큰 인스턴스에서 측정될 수 있고 에이전트의 추론 비용은 결과에 전혀 나타나지 않는다. 인스턴스당 한 자릿수 계산 절감은 에이전트의 속성이 아니라 프로그램의 속성이며 — 그래서 일회성 합성 예산이 영구적인 실행 시점 이점을 사 준다.
이것은 또한 R&D Automation Index 의 질문에 반대 방향에서 도달한다. 그 페이지가 추적하는 주장들은 벤치마크 위의 점수다. 이것은 수작업 산출물이 존재하는 분야에서 에이전트가 그것을 능가한 사례이며, 98,000 에피소드에 걸쳐, 공개된 코드로 이루어졌다. 비교 대상은 이 두 벤치마크에서 실천된 인간의 TAMP 엔지니어링이고 TAMP 연구 전반이 아니며, 논문 자신의 표현 — "강력한 베이스라인" — 은 헤드라인 산수가 유도하는 것보다 좁다.
여기 이름이 나온 세 모델 모두 이 위키에 페이지가 있다 — Claude Opus 5, GPT-5.6 Sol (and Terra, Luna), Astra (2026-09-03 에 GPT-6 Astra 로 출시). 특정 프런티어 모델 버전을 명시하는 제3자 평가는 이 위키의 논문 집합에서 드물고, 조용히 낡아 가는 종류의 수치다: 결과가 움직일 세 모델 버전에 고정되어 있는데, 논문은 그중 어느 것이 무엇을 기록했는지 말하지 않는다.
열린 질문
- 어느 구성이 56% 이고 어느 것이 95% 인가? 명시되지 않았다. 그것 없이는 대역을 어떤 모델에도 귀속시킬 수 없고, 이 정도로 넓은 스프레드는 그 자체가 결과다.
- 합성 예산은 얼마였나? "고정"이라고만 명시되고 값은 없다. 계산 절감은 실행 시점의 인스턴스당 절감이며, 합성 비용은 그것이 대체한 인간 엔지니어링과 한 번도 비교되지 않는다.
- 왜 28개 중 16개인가? 플래너가 존재하는 것은 16개 환경이므로 헤드라인 비교는 스위트의 57% 를 덮는다. 나머지 12개에서 에이전트가 무엇을 기록했고 무엇에 대비되었는지는 스냅샷에 없다.
- 실제 로봇에서도 되는가? 모든 환경이 시뮬레이션이다. "물리 모델 보정"은 시뮬레이터의 물리에 대고 하는 보정이다.
- 소속 — 위와 같이 저자 일곱 중 여섯의 기관이 여기서 확인되지 않는다.
인용
arXiv 2609.30233 — Coding Agents for
Generalized Task and Motion Planning Problems, 2026-09-24.
HuggingFace Daily Papers, 2026-09-28, 11 upvotes — 그 커뮤니티의 인기 신호이며
품질이나 중요도 순위가 아니다
(source).
프로젝트 페이지 agenticgentamp.github.io (검색 2회; 가져오지 않음 —
github.io 는 이 샌드박스에서 시도하지 않았다).