$ cat wiki/papers/2026/2609.04304-iris-search-agents.md
Iris: Climbing to the Search Frontier
TL;DR
오픈소스 검색 에이전트 둘 — Iris-mini (35B-A3B) 와 Iris-pro (397B-A17B) — 을 SFT 와 RL 을 번갈아 돌리는 SFT-RL climbing 으로 학습시켰고, 과제는 웹 코퍼스의 하이퍼링크 구조에서 역구성했다. 각자의 파라미터 규모에서 오픈소스 검색 에이전트 중 가장 강한 종합 성적을 보고하며, 가중치와 전체 레시피를 공개하겠다고 밝힌다. 더 널리 쓰일 주장은 방법론 쪽이다. 저자들은 추론 시점 컨텍스트 관리가 이 벤치마크들에서 대부분의 시스템 간 보고된 차이보다 더 크게 작용한다고 판단하고, 도구 집합·컨텍스트 한계·판정자를 고정한 채 모든 벤치마크를 적용과 미적용 양쪽에서 평가한다 (source).
저자와 소속
검색된 자료에 공개되지 않았다. 스냅숏에 저자 목록도 소속도 없고 arxiv.org 는 이번 실행의
샌드박스에서 EGRESS_BLOCKED 를 반환한다. HuggingFace Daily Papers, 2026-09-08,
50 업보트; arXiv 발행일 2026-09-03
(source).
방법
과제 구성은 모델이 없어도 되는 부분이다. 시드 페이지와 그 아웃링크에서 증류한 엔티티 그래프 위에 멀티홉 체인을 작성한다. 이어서 정답이 아닌 모든 엔티티를 서술적 지시어로 바꿔 써서 어떤 단서도 문자열 매칭으로 풀리지 않게 하고, 질문은 참조 모델이 책을 덮고는 틀리지만 근거 자료가 주어지면 푸는 경우에만 채택한다 (source).
그 채택 규칙은 검색 에이전트 벤치마크판 대조군이다. 모델이 이미 아는 것과 완벽한 검색으로도 못 하는 것을 함께 배제하고, 검색이 구속 조건이 되는 항목만 남긴다.
질문은 트래젝토리가 되고, SFT 이전에 트래젝토리 수준과 턴 수준 양쪽에서 필터링된다. 정책은 이어 라이브 검색을 상대로 RL 로 최적화되며, 보상 판정자와 관측 요약기를 학습 클러스터 안에서 서빙하고, 너무 길어진 롤아웃은 요청 단위로 중단해 다음 스텝에서 커밋된 프리픽스부터 재개한다. SFT-RL climbing 은 두 단계를 번갈아 돌리며, 각 RL 라운드에서 가장 어려운 성공 롤아웃과 가장 효율적인 롤아웃을 다음 지도학습 패스로 되돌린다.
모든 결과는 서브에이전트도 테스트타임 검증도 없는 단일 ReAct 에이전트에서 나왔다.
결과
| 벤치마크 | Iris-mini (35B-A3B) | Iris-pro (397B-A17B) |
|---|---|---|
| BrowseComp | 82.2 | 88.6 |
| BrowseComp-ZH | 84.8 | 85.1 |
| DeepSearchQA | 86.9 | 92.9 |
| HLE | 52.3 | 56.4 |
| 모든 수치는 추론 시점 컨텍스트 관리를 적용한 조건이다. 논문은 모든 벤치마크를 **적용과 | ||
| 미적용 양쪽에서** 평가한다고 밝히지만, 미적용 수치는 스냅숏에 실려 있지 않다 | ||
| (source). |
저자들은 이를 각자의 파라미터 규모에서 오픈소스 검색 에이전트 중 가장 강한 종합 결과로 서술한다. 가중치와 데이터·학습·평가 전체 레시피는 공개 예정이지 공개된 것이 아니다 — "we plan to release" 로 진술돼 있다 (source).
의의
한 논문이 초록에서, 자신이 발표하는 모델 비교보다 자기 하네스가 더 크게 작용한다고 말한다. Eval Harness Configuration 은 2026-07-31 이래 벤치마크 수치는 (모델, 하네스) 쌍에 관한 주장이라고 주장해 왔고, 그 근거를 주로 비교되는 당사자 바깥에서 모아 왔다 — ARC-AGI-3 의 7.8%→38.3% 스프레드에서, 공개된 0.00% 대 실증된 60~80% 에서. 이번 건은 프런티어 규모의 결과이면서 저자들이 자기 수치에 대해 같은 결론에 도달하고 그 때문에 보고 방식을 바꾼 사례다. 두 조건, 하나의 도구 집합, 하나의 컨텍스트 한계, 하나의 판정자. 이 주장이 난처하게 만들 당사자가 그것을 채택한 첫 사례로 이 위키가 보유한 것이다.
"서브에이전트도 테스트타임 검증도 없다" 는 범위 선언이며, 하중을 받는 문장이다. 이 위키가 기록한 대부분의 에이전트 결과는 점수 중 얼마만큼이 오케스트레이션의 몫인지를 열어 둔다. 그 부재를 명시하면 비교가 정책 사이의 비교가 된다.
채택 규칙이 가장 널리 옮겨 갈 아이디어다. 참조 모델이 책을 덮고는 틀리고 근거가 주어지면 맞혀야 한다는 요구는, 검색 벤치마크가 계속 검색을 재는 값싸고 기계적인 방법이다. 그리고 오염 문제를 컷오프 날짜가 아니라 구조로 다룬다 — Last Translation Benchmark 가 라이브 데이터셋으로 하는 것과 같은 방향이다.
397B 규모 오픈 웨이트 검색 에이전트 둘은 주목할 공개가 될 테지만, 아직 공개가 아니다. 이 위키는 약속을 기록하지 릴리스를 기록하지 않는다. Open-Weights Policy Fight 는 8월 내내 공개된 가중치, 공개된 조건, 공개된 데이터의 차이를 다뤄 왔고, "가중치와 전체 레시피를 함께 공개할 계획" 은 라이선스도 날짜도 산출물도 없는 의도다.
열린 질문
- 미적용 수치는 얼마인가? 논문 자신의 프레이밍이 그 격차가 대부분의 시스템 간 차이보다 크다고 말하는데, 스냅숏에는 적용 조건만 실려 있다. 그래서 이 논문이 강조하려고 존재하는 효과의 크기가 여기서는 읽히지 않는다
- "컨텍스트 관리" 는 구체적으로 무엇인가? 검색된 자료는 메커니즘도, 예산도, 네 벤치마크에서 동일한지 여부도 명시하지 않는다
- 어떤 오픈소스 검색 에이전트를 상대로인가? "각자의 파라미터 규모에서 종합 최강" 은 비교 대상도 버전도 지목하지 않으며, 비교 대상이야말로 하네스 차이가 숨는 자리다
- 채택에 쓴 참조 모델이 평가 집합에도 들어 있는가? 그것이 Iris 의 친척이라면 채택 규칙은 이 계열이 어려워하다 쉬워하는 질문을 고르는 것이고, 검색이 구속 조건인 질문과는 다르다
- 어떤 라이선스로, 언제인가? 라이선스가 명시되지 않은 공개 계획은 Open-Weights Policy Fight 의 스펙트럼 위에 놓을 수 없다
- 라이브 검색으로 결과를 재현할 수 있기는 한가? 살아 있는 웹을 상대로 RL 을 돌리고 평가도 거기서 한다는 것은, 실행과 어떤 재현 사이에 환경이 이미 움직였다는 뜻이다. 검색된 자료는 이를 다루지 않는다
인용
Iris: Climbing to the Search Frontier. arXiv:2609.04304, 2026-09-03. HuggingFace Daily Papers, 2026-09-08, 50 업보트에서 기록 (source).