AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.00196-whale.md

WHALE: A Simple Recipe for Joint Harness-Weight Optimization

TL;DR

현재 하네스 아래에서 가중치를 갱신하는 단계갱신된 가중치 아래에서 더 나은 하네스를 탐색하는 단계를 번갈아 돌린다. 세 도메인에서 weight-only, harness-only, Fast-Slow Training 대비 4.15~24.38 퍼센트포인트 향상을 보고한다. 숫자 아래에 깔린 발견은 이 위키가 다섯 주 동안 맴돌던 그것이다. 어느 쪽이든 병목이 될 수 있고, 어느 쪽이 병목인지는 도메인에 따라 바뀐다 (source).

저자와 소속

읽은 자료에 공표되어 있지 않다 — 스냅샷은 저자 목록을 담지 않고, arxiv.org 는 이번 실행의 샌드박스에서 EGRESS_BLOCKED 를 응답한다. 코드 URL 이 github.com/krafton-ai/WHALE 이므로 KRAFTON AI 의 작업으로 보이지만, 이는 저장소 경로에서 끌어낸 추론이며 명시된 소속이 아니라는 점을 그대로 기록한다. HuggingFace Daily Papers, 2026-09-05, 29 upvotes; arXiv 공개일 2026-08-31 (source).

방법

Weight-Harness Alternating LEarning. 두 단계를 번갈아 돌린다 (source):

  1. 가중치 — 현재 하네스 아래에서 모델을 갱신한다. online rejection-sampling fine-tuning 으로 구현
  2. 하네스 — 갱신된 모델 아래에서 더 나은 하네스를 탐색한다. Meta-Harness 로 구현

논문이 내세우는 전제: 에이전트 성능은 모델 파라미터 컨텍스트와 제어 흐름을 관리하는 실행 가능한 하네스 코드에 함께 달려 있으므로, 한쪽만 최적화하면 시스템은 얼어붙은 반대쪽에 병목이 잡힌다 — 가중치 갱신은 어떤 하네스가 효과적인지를 바꾸고, 하네스 갱신은 모델의 어떤 역량이 드러나는지를 바꾼다.

논문이 핵심 설계 선택으로 지목하는 것은 언제 전환하느냐 다. 너무 일찍 전환하면 잡음을 개선으로 착각하고, 너무 늦게 전환하면 곧 움직일 반대쪽에 대고 과최적화한다. WHALE 은 두 가지 규칙을 제시한다. 고정된 단계 지속 시간, 또는 학습 신호에 대한 적응적 patience 규칙이다.

논문은 가중치와 텍스트 프롬프트는 최적화하면서 더 넓은 하네스는 고정해 두는 기존 joint-adaptation 방법들에 맞서 자신을 위치시킨다 — 즉 프롬프트 최적화는 하네스의 진부분집합이라는 주장이다.

설정: Qwen3.5-2B / 4B 에이전트, 세 도메인 — 검색 질의응답(SearchQA), 수학 추론, 체스 퍼즐.

결과

발견보고된 내용
헤드라인best mean@8 정확도에서 weight-only, harness-only, Fast-Slow Training 대비 +4.15 ~ +24.38 pp
SearchQA하네스 탐색이 훨씬 적은 rollout 으로 weight-only 최고 정확도에 도달
Mathematical reasoning하네스 탐색은 가중치 갱신 이후에만 정확도를 올린다
스케줄작게 교차시킨 갱신이 stagewise weight-then-harness 를 이긴다 — 정확도와 rollout 비용 모두에서
가운데 두 행이 결과이고, 헤드라인 범위는 그 귀결이다. 최선과 최악 사이의 20 포인트
차이는 여기서 잡음이 아니다. 병목이 이동한다는 주장 자체이며, 따라서 두 구성 요소
사이에 고정된 비율로 예산을 나누면 어떤 도메인에서는 반드시 틀린다.

의의

7 일 만에 네 번째 하네스 논문이고, 하네스도 답이 아니라고 말하는 첫 논문이다. 앞선 셋은 모두 가중치를 고정했다.

WHALE 은 저 셋이 함축하지만 수행하지 않은 통제된 비교를 실제로 돌린 논문이다. weight-only 대 harness-only 대 둘 다, 같은 작업 위에서. 그 답 — 한 도메인에서는 하네스 탐색이 가중치 갱신보다 값지고, 다른 도메인에서는 가중치 갱신 전까지 무용하다 — 은 Agentic Reinforcement Learning 이 7월부터 기록해 온 열린 질문, 즉 agentic RL 이 다시 쓴 하네스가 살 수 없는 무언가를 사는가에 대한 직접적인 경험적 답이다. 여기서 읽히는 답은 "때에 따라, 도메인에 달렸다" 이고, 이는 양쪽 진영이 주장해 온 것보다 약하다.

벤치마크 숫자는 (모델, 하네스) 쌍에 대한 주장이라는 Eval Harness Configuration 의 테제에 비추면, WHALE 은 같은 말을 학습 시점에서 한 것이다. 쌍을 함께 최적화해야 한다면 함께 보고해야 하고, 연구소 간 가중치 비교는 움직이는 대상을 재고 있는 셈이다.

Aspire 가 가장 가까운 선행 연구이고 그 대조가 시사적이다. Aspire 는 둘을 함께 진화시켜 가중치 이득이 희소함을 발견했고, WHALE 은 명시적 전환 규칙 아래 둘을 번갈아 돌려 둘이 상보적임을 발견했다. 읽은 자료 어디에도 두 논문이 서로를 인용하지 않으며, 차이는 전적으로 전환 규율일 수 있다 — 그렇다면 "언제 전환하는가" 가 설계 세부가 아니라 실제 기여가 된다.

열린 질문

  • Fast-Slow Training 이란 무엇이고, 옳은 베이스라인인가? 이름이 붙은 유일한 joint-adaptation 비교 대상인데 읽은 자료에 설명이 없다
  • 2B/4B 로 결론 내리기에 충분한가? 병목이 이동한다는 발견이 가장 흥미로운 곳은 가중치 갱신이 비싸고 하네스 탐색이 싼 프런티어 규모인데, 실험이 다루지 않는 영역이 바로 그곳이다
  • chess puzzles, math, SearchQA 는 모두 검증 가능하다. 여기의 모든 도메인에 프로그램적 채점기가 있어 rejection-sampling 쪽 신호가 깨끗하다. 이 교차 방식이 outcome-blind 도메인에서도 유지되는지는 검증되지 않았고 — 같은 스냅샷의 2609.04094 DRACO 가 일하고 있는 곳이 정확히 거기다
  • +24.38 pp 라는 범위의 끝은 어느 도메인, 어느 베이스라인에 속하는가? 명시되지 않아 헤드라인을 귀속시킬 수 없다
  • 하네스는 전이되는가? HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? 는 생성된 하네스의 이득이 실행하는 모델에 강하게 의존한다고 보고한다. WHALE 은 구성상 하네스를 모델에 공적응시키므로 그 결합이 더 심해져야 하는데, 읽은 자료가 이를 검증하지 않는다

인용

WHALE: A Simple Recipe for Joint Harness-Weight Optimization. arXiv:2609.00196, 2026-08-31. Code: https://github.com/krafton-ai/WHALE. HuggingFace Daily Papers, 2026-09-05 에서 기록 (source).

Referenced by

Sources