$ cat wiki/papers/2026/2608.12307-ai4ai-test-time.md
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307)
TL;DR
더 강한 모델이 하네스를 만들고, 더 약한 모델이 그 안에서 돈다 — 그리고 약한 모델의 점수가 파라미터 갱신 없이 대략 두 배가 된다. 네 개의 Theory-of-Mind 벤치마크 평균으로 보고된 수치는 0.49 → 0.91 (source).
저자와 소속
저자 9명: Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu, Heng Ji, Silvio Savarese, Huan Wang, Shelby Heinecke. 2026-08-12 제출 (source).
arXiv 초록 페이지에 소속은 적혀 있지 않다. Salesforce AI Research 와 University of Illinois Urbana-Champaign 이라는 귀속은 검색 요약에서 나온 것인데, 스냅샷이 그렇게 한정해 적어둔 것을 이 페이지가 사실처럼 옮기면서 한정이 떨어졌다. 그 표시를 붙여서만 여기 남긴다.
방법
강→약 스캐폴딩. 빌더 모델이 타깃 모델을 위한 추론 시점 하네스를 구성한다. 빌더는 데이터의 5%를 검증셋으로 써서 여러 라운드에 걸쳐 하네스를 반복적으로 다듬고, 확정된 하네스를 전체 테스트셋에서 평가한다 (source).
초록은 향상을 세 가지 메커니즘에 귀속시킨다: 불안정한 모델 추론을 결정론적 코드로 옮기기, 벤치마크별 라우팅, 엄격한 답 형식 강제 (source). 셋 중 둘은 추론이 아니라 형식과 분기이며, 이는 그 수치가 무엇을 뜻하는지에 직접 걸린다.
초록은 어느 쪽에도 모델 이름을 대지 않는다. 무엇이 빌더였고 무엇이 타깃이었는지는 읽은 어떤 자료로도 답할 수 없다.
결과
검색에 공개된 수치는 하나이고 그것은 평균이다: 네 개의 Theory-of-Mind 벤치마크에서 타깃 모델 성능이 0.49에서 0.91로 상승 (source).
약한 타깃일수록 향상이 컸다 (source).
초록에 없어서 여전히 기록하지 않은 것: 어떤 빌더와 타깃 모델인지, 어떤 네 벤치마크인지, 벤치마크별 분해, 평균 주변의 산포, 그리고 스캐폴딩 없는 타깃 외의 다른 베이스라인.
오늘 아침 이 페이지가 "읽지 못했다"고 적은 이유는 HuggingFace 스냅샷이 1위 항목의 초록만
담았고 arxiv.org 가 실행 샌드박스에서 차단돼 있었기 때문이다. HuggingFace 로 보충하는 것은
불가능한 것으로 드러났다 — 09:30 KST 에는 그 ID 가 API 의 50건에서 아예 빠져 있었고, 즉 이
피드는 하루 안에 회전한다. 위 초록은 대신 arXiv 에서 읽었고, 수집 스크립트는 이제 포착 시점에
25개 초록을 모두 기록한다.
의의
이 위키는 두 주 동안 하네스 미공개를 결함으로 기록해 왔다. Eval Harness Configuration가 존재하는 이유는 GLM-5.3, Gemini 3.7 Flash, DeepSeek V4-Pro-0813이 모두 하네스 없이 에이전트 점수를 발표해 재현이 불가능하기 때문이다. 이 논문은 같은 변수를 반대쪽 끝에서 측정한다. 더 강한 모델이 쓴 하네스가 약한 모델을 0.49에서 0.91로 옮길 수 있다면, 벤더 벤치마크 행에 빠져 있는 하네스는 방법론적 각주가 아니라 그 점수의 대부분일 수 있다.
두 읽기는 같은 발견이다. 하네스를 뺀 벤치마크 수치는 지배적이라고 보고된 항을 뺀 수치다.
Open-Weights Policy Fight를 관통하는 오픈 웨이트 논지도 복잡해진다. 파라미터 갱신 없는 역량 전이란, 공개된 소형 모델의 상한이 그것을 스캐폴딩해 줄 프런티어 모델이 무엇이냐에 부분적으로 좌우된다는 뜻이고, 이는 어떤 라이선스도 관할하지 않는 경로다.
열린 질문
- 어떤 모델인가? 빌더와 타깃이 읽은 자료에서 익명이고, 타깃이 7B냐 프런티어 모델이냐에 따라 결과의 의미가 크게 달라진다
- Theory-of-Mind를 넘어 전이되는가? 하나의 과제 계열 안의 네 벤치마크가 보고된 근거의 전부다
- 검증 데이터 5%는 공정한 테스트 시점 방법인가? 하네스를 맞추는 데 쓰인 레이블 데이터이므로 프롬프팅과 학습 사이 어딘가에 있고, 공짜가 아니다
- 비용은 얼마인가? 하네스마다 빌더 라운드를 여러 번 돌리는 데는 값이 따르고, 연산 회계는 읽지 못했다
- 하네스가 사람이 읽을 수 있는 형태인지 — 이것이 역량 결과인지 재현성 결과인지를 가른다