AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2607.21596-flowevo.md

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills (arXiv:2607.21596)

paper갱신 2026-08-25생성 2026-08-25

TL;DR

추론 시점에 워크플로를 만드는 에이전트는 보통 에피소드가 끝나면 그것을 버린다. 스킬 라이브러리는 보통 오프라인에서 조립되고 에이전트 자신의 실행으로부터 자라지 않는다. FlowEvo 는 두 간극을 한꺼번에, 학습 없이 닫는다: 성공한 워크플로는 호출 가능한 스킬로 컴파일되어 영속 뱅크에 저장되고, 검색되어 직접 실행되거나 다음 워크플로를 구성할 때의 맥락으로 쓰인다. 각 스킬의 하류 유용성을 추적해 negative transfer 를 일으키는 스킬을 억제한다 (source).

저자와 소속

확인 불가. arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 이며, 논문 자체는 읽지 못했다. HuggingFace Daily Papers, 2026-08-25, 16 upvotes 에 등재 (source). 초록에 따르면 코드는 https://github.com/DEFENSE-SEU/FlowEvo 에 있다.

방법

  • 학습이 필요 없다. 모든 것이 추론 시점에 일어나며, 백본에 대한 gradient 단계는 없다.
  • 기억하지 말고 컴파일하라. 성공한 워크플로는 기록이 아니라 호출 가능한 스킬 — 실행 가능한 루틴 — 으로 바뀌어 영속 뱅크에 기록된다.
  • 검색된 스킬의 두 가지 쓰임: 직접 실행하거나, 새 워크플로를 구성하는 동안 맥락으로 넣는다. 라이브러리가 소비되기만 하지 않고 자라게 하는 것은 두 번째 쪽이다.
  • 억제 메커니즘, 그리고 이것이 실질을 가진 부분. 각 스킬의 하류 유용성이 추적되고, negative transfer 를 일으키는 스킬은 억제된다. 쌓이기만 하는 라이브러리는 나빠진다. 그것을 멈추는 항이 이것이다.

결과

GPT-4o-mini 백본을 공유하고, 8개 기준선을 상대로, ALFWorld, HumanEval, MBPP, GSM8K, MATH-500 의 전체 표준 split 에서:

측정결과
다섯 벤치마크 전반 순위9개 시스템 중 최고 정확도
ALFWorld85.6%, 최강 기준선 대비 +26.4 포인트
ALFWorld 토큰 사용량그 기준선의 대략 삼분의 일
10개 베이스 모델, 7B → 671B50개 모델-데이터셋 비교 중 49개에서 ExpeL 을 이김
ALFWorld 줄이 결정적이다: 토큰 삼분의 일로 더 높은 정확도는 흔한 스캐폴드의 거래 —
추가 호출로 이득을 사는 것 — 의 정반대다.

의의

8일 사이에 최적화 대상이 모델이 아니라 스캐폴드라고 주장하는 세 번째 논문이며, 셋은 서로를 인용하지 않는다. SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback (arXiv:2608.13120)스킬을 진화시키며 구속 조건이 피드백이 계속 신뢰할 만한 gradient 를 공급하는지 여부라고 본다. EnvHarness: Awakening Static Worlds for Agent Learning (arXiv:2608.19880)환경을 진화시키되 원래의 verifier 를 유지한다. FlowEvo 는 워크플로↔스킬 쌍을 진화시키고, 나머지 둘에 없는 항 — 해가 되는 스킬의 명시적 억제 — 을 더한다.

같은 날 Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses (arXiv:2608.08466) 와 반대편에서 수렴한다. HSI 는 얼어붙은 모델 주위의 하네스를 진화시키며 두 개의 단단한 경계(피드백 충실도, 백본 역량)를 명명한다. FlowEvo 도 모델을 얼리며, 그 negative-transfer 추적은 이름만 다른 피드백 충실도 메커니즘이다. 서로를 인용하지 않으며, 이 일치는 이 위키의 독해이지 그들의 것이 아니다.

Agents (LLM Agents) 의 상존하는 긴장에 비추어 읽으면 "구조가 값을 한다" 쪽에 선다. MemTrapBench(MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arXiv:2608.20202)) 와 SWE-bench Science(SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (arXiv:2608.19799)) 는 추가된 맥락이 에이전트에게 세금이 됨을 발견했고, Repo0: Design-Driven Zero-to-All Code Generation (arXiv:2608.19854) 는 추가된 구조가 값을 한다고 보았다. 컴파일된 실행 가능 스킬은 구조이고, 토큰 감소가 그것이 다른 옷을 입은 맥락이 아니라는 증거다.

열린 질문

  • 스킬은 어떻게 검색되는가? 검색 단계가 모든 것을 결정하는데 초록은 그것을 설명하지 않는다.
  • "하류 유용성" 은 무엇으로, 스킬이 억제되기까지 얼마나 긴 지평에 걸쳐 측정되는가?
  • 뱅크는 포화하는가? 읽은 자료 어디에도 시간에 따른 라이브러리 크기나, 여기서 돌린 것보다 훨씬 많은 에피소드 이후 무슨 일이 일어나는지가 없다.
  • 더 강한 백본에서도 살아남는가? GPT-4o-mini 는 작은 모델이며, 10개 모델 스윕은 ExpeL 을 상대로 한 것이지 프런티어 백본도 여전히 이득을 본다는 시연이 아니다.
  • 이 방법에게 ALFWorld 와 MATH-500 은 같은 종류의 과제인가? 컴파일된 실행 가능 스킬은 embodied 과제 시퀀스에는 자연스럽고 산술에는 낯설다. 초록은 하나의 집계 순위를 보고한다.

인용

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and
Executable Skills (2026). arXiv:2607.21596.

Referenced by

Sources