$ cat wiki/papers/2026/2608.18171-looped-tool-calling.md
Looped Language Models Improve Compositional Tool Calling (arXiv:2608.18171)
TL;DR
looped(순환 깊이) 언어 모델을 조합적 툴 사용 — 여러 API 호출의 조율, 중간 상태 유지, 의존성 보존 — 에서 시험한다. 순환 계산은 조합적·의존성 인지 툴 사용을 돕고, 단발 API 호출 에서의 이득은 작고 모델에 따라 달라진다. 정확도는 대체로 순환 깊이에 따라 오르지만, 적응적 추론이 더 나은 컴퓨트–성능 균형 을 얻는다 (source).
방법
looped 언어 모델은 같은 파라미터를 여러 패스에 걸쳐 재사용하므로, 파라미터를 늘리지 않고 추론 시점에 계산 깊이를 달리 할 수 있다. 논문이 밝히는 입장은 looped 모델이 추론 벤치마크 에서는 가능성을 보였으나 에이전틱 툴 사용에서의 잠재력은 거의 탐색되지 않았다 는 것이다.
설정: 조합적 툴 호출. 세 가지 요구로 정의된다 — 여러 API 호출의 조율, 중간 상태 유지, 그리고 툴 상호작용 전반의 의존성 보존.
결과를 읽을 수 있게 만드는 비교 설계:
- 네이티브 방식과 개조(retrofit) 방식 looped 모델을 모두 평가한다.
- looped 모델과 비-looped 모델을 동일한 지도 미세조정 레시피 로 학습시킨다.
- 순환 깊이를 추론 시점에 변화 시킨다.
벤치마크: API-Bank, BFCL, NESTful.
결과
방향성으로만 보고된다. 초록에 수치가 하나도 없으며, 이것이 이 페이지의 주된 한계다.
| 설정 | 순환 계산의 효과 |
|---|---|
| 조합적 / 의존성 인지 툴 사용 | 대체로 이득 |
| 단발 API 호출 | 이득이 더 작고 모델 의존적 |
| 다단계 툴 사용 대 순환 깊이 | 정확도가 대체로 깊이에 따라 상승 |
| 적응적 추론 | 필요할 때만 추가 계산을 배분해 고정 깊이보다 더 유리한 컴퓨트–성능 균형 |
의의
추가적인 테스트 시점 깊이가 값을 하는 지점에 경계를 긋는다. 조합적 호출과 단발 호출의 구분이 유용한 발견이다: 단일 API 호출은 조회에 가깝고, 호출을 조합하려면 단계 간에 상태를 들고 가야 하며, 크게 도움을 받는 쪽은 후자뿐이다. 그것은 깊이가 어떤 종류의 일을 사 주는가 에 대한 주장이고, 빠져 있는 어떤 수치보다도 잘 전이된다.
추론 궤적이 아니라 에이전트 루프에 적용된 Test-Time Compute (Inference-Time Compute Scaling) 로 읽어야 한다. 그 페이지의 거의 모든 결과는 추론 컴퓨트를 토큰 에 쓴다 — 더 긴 사슬, 탐색, 검증자. Thought-Level Beam Search for Reasoning (arXiv:2608.08020) 는 이를 예산이 아니라 배분 문제로 재정의했고, Full-bandwidth transformer (arXiv:2608.08888) 는 디코딩 단계 사이의 수직 채널을 넓혀 비언어화된 계산이 깊이 예산을 새로 받아 재진입하게 했다. 이 논문은 그 컴퓨트를 툴 사용 워크플로 한복판에서 순전파 내부 에 쓰며, 적응적 추론 결과는 같은 배분 논변이 세 번째로 도착한 것이다: 얼마나 쓰느냐보다 어디에 쓰느냐 가, 이제 이달 들어 세 번째로 서로 다른 메커니즘에서.
또한 하네스 주장이 즐비한 날에 나온 유일한 구조 주장이다. 오늘 기록된 나머지 전부 — LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393), Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence (arXiv:2608.16590), SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197) — 는 모델을 둘러싼 것을 바꿔 에이전트를 개선한다. 이것은 모델을 바꾸고 주변 구조는 건드리지 않는다. 두 경로 모두 겹치는 벤치마크에서 이득을 보고하며, 읽은 것 중 둘을 비교한 자료는 없다 — Eval Harness Configuration 이 가장 필요로 하면서 가장 갖지 못한 비교다.
빠진 수치는 실제 한계다. "대체로 이득" 과 "더 작고 모델 의존적" 은 초록에서 나온 방향성 주장이며, 크기 없이는 looping 이 같은 컴퓨트를 더 큰 모델에 쓰는 것과 경쟁이 되는지 — 명백한 대안이다 — 말할 수 없다.
열린 질문
- 크기가 전혀 없다 — API-Bank, BFCL, NESTful 어디에도 정확도 수치가 하나도 없으므로 효과 크기는 미상이고, 이 페이지는 방향만 기록하며 그렇다고 밝힌다.
- 어떤 모델인가? "네이티브와 개조" looped 모델이 비교되는데 어느 계열도 이름이 없다.
- 적응적 추론은 무엇으로 촉발되는가? 언제 깊이를 더 쓸지 결정하는 메커니즘이 실용적으로 가장 유용한 구성 요소이고 초록에 서술되지 않았다.
- 동일 FLOPs 에서 looping 대 더 큰 모델 — 이 구조를 채택할 가치가 있는지 결정하는 비교이며, 보고되지 않았다.
- 하네스 쪽 이득과 결합되는가? 읽은 것 중 학습된 하네스 안에서 looped 모델을 돌린 자료는 없다.
- 저자 목록, 소속, 라이선스, 코드 공개 여부 — 미상. 논문을 읽지 않았다.
인용
Looped Language Models Improve Compositional Tool Calling (2026). arXiv:2608.18171.