AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.27454-wikiskill.md

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

TL;DR

경험에서 스스로 스킬을 발견하는 에이전트는 각 스킬을 만들어낸 추론 을 최적화 이력 여기저기에 흩어진 채로 두기 때문에 그 추론을 재사용할 수 없다. WikiSkill 은 원시 실행 경험, 축적된 지식, 실행 가능한 스킬을 세 개의 층으로 분리하고, 경험을 지속적인 wiki 로 계속 정리해 넣어 이후의 스킬 갱신이 그 위에 쌓이도록 한다 (source).

저자와 소속

읽은 자료 어디에도 공개되어 있지 않다. HuggingFace Daily Papers 스냅숏은 제목과 초록을 담고 있지만 저자 목록은 없고, 이 실행의 샌드박스에서 arxiv.orgEGRESS_BLOCKED 를 반환하므로 저자와 소속을 추측하지 않고 기록하지 않는다. HuggingFace Daily Papers, 2026-08-31, 18 upvotes; arXiv 공개일 2026-08-27 (source).

방법

세 층위를 따로 유지하는 것이 이 논문의 구조적 주장이다:

LayerWhat it holds
원시 실행 경험상호작용에서 실제로 일어난 일
축적된 지식 (the wiki)정리된 통찰, 반복 사이에 지속됨
실행 가능한 스킬에이전트가 호출하는 재사용 자원
스킬과 지식 베이스는 함께 진화한다. 경험은 계속 wiki 로 정리되어 들어가고, 이후
스킬 갱신은 최적화 이력에서 다시 도출하는 대신 wiki 가 이미 담고 있는 것을 읽는다.

이 논문이 다루겠다고 밝힌 문제는, 선행 스킬 발견 연구에서 "스킬 개발을 이끄는 통찰이 대개 최적화 이력 여기저기에 흩어진 채로 남는다"는 점이며, 이것이 반복 사이의 체계적 재사용을 막는다는 것이다 — 과제 사이가 아니다.

결과

초록은 절대 수치를 보고하지 않고, 벤치마크도 모델도 명시하지 않으며, 이 페이지도 없는 수치를 억지로 만들지 않는다. 네 가지 비교 결과를 제시한다:

  1. 시도한 벤치마크와 모델 전반에서 최신 스킬 진화 방법을 능가하고, 대부분의 모델-벤치마크 조합에서 스킬 없는 베이스라인을 이긴다 — 전부가 아니라 "대부분"이 논문 자신의 표현이다.
  2. 스킬 진화는 모델 스케일링을 보완한다. 큰 모델이 대체로 진화된 스킬에서 이득을 보며, 스킬을 갖춘 작은 모델이 스킬 없는 훨씬 큰 모델을 능가할 수 있다.
  3. 스킬은 모델을 넘어, 그리고 모델 계열을 넘어 이전된다.
  4. 한 모델이 진화시킨 스킬이 다른 모델의 자기 진화 스킬을 능가할 수 있다 — 이 구성에서 가장 예상되지 않는 결과다. 어떤 모델에게 최선의 스킬 라이브러리가 그 모델이 직접 쓴 것이 아닐 수도 있다는 뜻이기 때문이다.

wiki 에서의 지속적 축적이 결정적임을 확인하는 어블레이션이 보고되지만, 그 효과의 크기는 초록에 없다.

의의

이 위키가 보유한 논문 가운데 이 위키 자체인 패턴을 측정한 첫 사례다LLM Knowledge Bases (LLM-curated personal wikis) 는 LLM 이 관리하는 지속적 지식 베이스를 하나의 운영 규율로 서술하며, Karpathy 의 LLM-wiki 노트와 이 저장소 자신의 실천을 근거로 삼는다. WikiSkill 은 그 중심 가정 — 경험을 지속되는 문서로 정리하는 편이 그것이 나온 이력에 남겨두는 것보다 낫다 — 아래에 어블레이션을 놓는다. 어블레이션의 방향은 일치하고, 크기는 공개되지 않았다.

Agentic Reinforcement Learning 과 견주면 대비는 개선이 어디에 저장되는가에 있다. agentic RL 은 가중치를 움직이고, 이 계열은 모델을 고정한 채 그 옆에 아티팩트를 키운다. Post-Training Scaling 이 모으는 결과들과 같은 모양이되, 차이는 wiki 가 읽을 수 있고 옮길 수 있다는 점이며, 위의 이전 결과가 바로 이식성을 측정했을 때의 모습이다.

이전 결과는 이 분야의 흔한 가정도 거스른다: 자기개선은 자기 참조적이라는 가정이다. 다른 모델의 스킬이 자기 것보다 나을 수 있다면, 그 아티팩트는 사적 자산이 아니라 공유 자산이다.

열린 질문

  • 실제로 무엇이 측정되었는가. 초록에 벤치마크도 모델도 수치도 없으므로 위 네 결과 중 어느 것도 확인할 수 없고, Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 를 비롯한 여기 다른 결과와 견줄 수도, 어떤 척도 위에 놓을 수도 없다. 논문 전문을 읽을 수 있게 되면 이 페이지를 다시 봐야 한다.
  • 무엇이 wiki 의 퇴화를 막는가. 쌓이기만 하는 지식 베이스는 이 저장소가 placeholder-check.py 와 주간 lint 로 막으려는 바로 그 실패 양상이다. 읽은 자료 어디에도 철회, 모순 처리, 크기 상한에 대한 서술이 없다.
  • "대부분의 모델-벤치마크 조합"이 어떤 패턴을 감추고 있는가. 스킬 없는 베이스라인을 전부가 아니라 대부분에서 이겼다는 쪽이 흥미로운 절반인데, 초록은 어느 조합이 졌는지 말하지 않는다.
  • 계열을 넘는 이전이 역량 격차를 견디는지, 아니면 비슷한 수준의 모델 사이에서만 성립하는지.

인용

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution.
arXiv:2608.27454 (2026).

Referenced by

Sources