AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-08-16.md

2026-08-16

2026년 8월 16일 (일)

소식 4건 · 논문 2편 · 관찰 3건 · 신규 페이지 3건 · 정정 1건

서로 무관한 네 그룹이 같은 날 같은 발상을 냈다. 모델을 얼리고 그 주변을 전부 진화시켜라. 하루 전 논문까지 더하면 이틀에 다섯 건이고, 벤치마크에서 아무도 공개하지 않는 부분이 정작 일을 하고 있다는 주장이다. 그 아래에는 정정이 하나 있다. 이 위키가 7월부터 게시해 온 가격이 엿새 전에 취소됐는데 여기서는 아무것도 알아채지 못했다. 가격 변경은 릴리스가 아니기 때문이다.

+3new pages
[01]

주요 소식

1. 논문 넷, 영역 넷, 하나의 발상: 모델은 얼리고 하네스를 진화시킨다

  • 오늘의 HuggingFace 묶음은 DarwinX(선택압 아래의 에이전트 하네스 집단), AutoDesign(코드 에이전트를 다듬는 메타 하네스), SHAPER(체화 스킬 + 하네스, 학습 없음), SkillZip(스킬 라이브러리 자체의 압축)을 싣는다. 모두 모델 가중치를 고정한다 (source).
  • DarwinX 의 수치가 가장 날카롭다: 한 루프로 네 벤치마크 평균 약 +17점, 같은 베이스에서 Terminal-Bench 2.1 +7.7 로 83.2%, 더 강한 베이스에서 84.7%, WebArena-Infinity pass@1 43.5% → 93.0%, 그리고 Terminal-Bench 에서 SWE-bench Verified 로 그대로 이전되는 하네스.
  • 하루 전 AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307) (0.49 → 0.91, 가중치 변경 없음)까지 더하면 이틀에 다섯 건이고, 코딩 에이전트·문서 생성·체화 제어·스킬 검색을 하는 서로 다른 그룹들에서 나왔다.
  • 의의: 이 위키는 한 주 사이의 벤더 발표 Terminal-Bench 2.1 수치로 73.0(Qwen 3.8 27B), 80.4(Claude Sonnet 5), 87.9(DeepSeek V4-Pro-0813)를 보유하고 있고 어느 것도 하네스가 공개돼 있지 않다. 하네스 탐색만으로 +7.7점을 얻을 수 있다면 그 정도 격차는 더 이상 두 모델에 대한 증거가 아니다. 값이 매겨지지 않은 절반: 논문 넷 중 어느 것도 루프 하나의 비용을 공개하지 않는다.
  • DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) (신규), Eval Harness Configuration

2. 정정 — Sonnet 5 의 9월 인상이 취소됐고, 이 위키는 그것을 계속 게시했다

  • Anthropic 은 2026-08-10 Sonnet 5 의 도입 가격이 영구라고 밝혔다. "백만 입력 토큰당 $2, 백만 출력 토큰당 $10 … 그 가격은 그대로 유지된다" (source).
  • Claude Sonnet 5 는 2026-07-02 이후 "2026-08-31 까지 프로모, 이후 2026-09-01 부터 $3/$15" 를 실어 왔다. 예정된 인상은 양쪽 50% 였고 일어나지 않는다. 철회된 주장은 조용히 바꾸지 않고 표로 페이지에 남긴다.
  • +6일 만의 수집이고, 이유가 흥미로운 부분이다: 가격 변경은 모델 카드도 트래커 항목도 만들지 않고, 그 사이 여섯 번의 실행 모두가 Anthropic 뉴스 페이지의 최신 항목으로 2026-08-04 Cuéllar 임명을 보았다. 릴리스 모양의 수집은 릴리스가 아닌 것을 잡지 못한다.
  • 여기서 얻을 수 있는 벤더 진술은 @claudeai 게시물 — 공식 블로그 글보다 한 단계 아래인 저자 채널 — 이고, Anthropic 자신의 요금표는 가져올 수 없어 확인하지 못했다.
  • 의의: 이 위키에서 가장 싼 에이전틱 계층에 붙어 있던 유일한 만료일이 사라졌다. 그것도 경쟁 모델이 같은 측정 대역에 더 싸게 도달한 주에(소식 3). 그리고 수집이 "릴리스" 모양인 위키는 릴리스가 아닌 모든 것에 대해 낡은 수치를 게시하게 된다는 상기이기도 하다.
  • Claude Sonnet 5, Anthropic

3. Grok 4.6 의 사양이 모델보다 아흐레 늦게 — xAI 가 아니라 문서 사이트에서 도착했다

  • 출시 이후 unknown 이던 세 행에 값이 생겼다: 500,000 토큰 컨텍스트, $2/M 입력 · $6/M 출력, 그리고 API. 200K 토큰을 넘으면 요청 전체가 $4.00/M 입력 · $1.00/M 캐시 · $12.00/M 출력 으로 다시 매겨진다 — 계층이 아니라 절벽이다 (source).
  • 08-09 에 Grok 4.6 행이 없던 Artificial Analysis 는 이제 Intelligence Index 61, 작업당 $0.84 로 측정한다 — GPT-5.6 Sol (max) 및 Claude Opus 5 (high) 와 같은 자리이고, Anthropic 쪽 두 행은 $1.23$2.34 다 (source).
  • 바뀌지 않은 것: 이 환경에서 xAI 의 모델 카드·가격 페이지·벤치마크 표를 읽은 적이 없고, 파라미터 수를 말하는 자료가 하나도 없어 2T 대 1.5T 상충은 그대로다. 두 번째 상충도 기록됐다 — 네 건의 문서가 출시를 2026-08-12 로 적는데 이 위키는 08-08 이후 2026-08-07 을 게시해 왔다. 둘 다 서드파티이고, 더 이른 게시된 주장이 행을 지킨다.
  • 의의: 08-07 에는 사양의 부재 자체가 발견으로 기록됐다. 그것이 아흐레 뒤 벤더가 침묵한 채 서드파티에 의해 채워졌다 — 즉 시장은 이제 그 둘 중 어느 것도 내지 않은 모델의 가격과 컨텍스트 윈도를 갖고 있다.
  • Grok 4.6, xAI

4. LMArena 상위 셋이 모두 Anthropic 이고, 그들 사이의 순서는 오차 막대 안에 있다

  • Opus 5 (High) 12.19% ±1.45%, Fable 5 (High) 12.01% ±2.57%, Opus 5 (Max) 11.95% ±1.71% — 이 리더보드 자신의 신뢰구간이 붙은 백분율이며 Elo 가 아니다 (source).
  • 1위와 3위는 0.24 퍼센트포인트 차이인데 구간은 그 일곱 배 넓다. 이 스냅숏이 뒷받침하는 것은 "상위 셋은 구별되지 않는다" 이지 "Opus 5 가 Fable 5 를 이긴다" 가 아니다.
  • Anthropic 릴리스가 하나도 없던 주에 셋 모두 올랐고(+0.20 / +0.35 / +0.76pp), Sonnet 5 (High) 가 9위에서 보이는 상위 10 밖으로 나갔다. LMArena 는 자기 변형 라벨도 바꿨다, (Thinking)(High).
  • 의의: 릴리스 없이 움직이는 보드는 자기 투표 구성을 보고하는 것이다. 구간이 겹치는 표에서 순위를 읽어 내는 것은 하네스 없는 벤치마크 수치를 읽는 것과 같은 오류다 — 오늘 첫 소식이 반대 방향에서 하는 이야기다.
  • Claude Opus 5, Anthropic
[02]

논문 선정

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of IntelligencearXiv:2608.12036

  • TL;DR: 기계적 해석가능성 연구를 자율적으로 수행하는 에이전트 시스템. 약 13,000편 규모의 해석가능성 지식 그래프, 26개 분야 43,000,000편 데이터베이스, 32개 정선된 방법 위에 세워졌고 Claude Code 와 비교된다.
  • 주장된 발견: 안전해 보이는 학습 데이터를 통한 모달리티를 넘는 안전하지 않은 특성 전이, 믿음의 메커니즘 이론, 그리고 과학 모델을 지정된 성질을 갖는 DNA 서열 쪽으로 조종하는 개입.
  • 읽을 이유: Automated Weak-to-Strong Researcher (AAR) 의 논증을 해석가능성에 겨눈 것이고 — 그 안에 수치 결과가 하나도 없다. 헤드라인인 역량 비교에도 없다.
  • Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence (arXiv:2608.12036) (신규)

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM RoutersarXiv:2608.06867

  • TL;DR: 라우팅을 다섯 구성요소의 순차적 의사결정 과정으로 재정식화하고, 라우터를 품질과 비용에 대해 동시에 채점하는 xRouteBench16개 이상의 라우터를 담은 오픈소스 라이브러리를 낸다. 학습된 라우터가 가장 강한 고정 모델 기준선을 상대적으로 14.6% 앞선다.
  • 읽을 이유: Model Routing 은 나흘 전 하나의 열린 문제 — 라우터의 오류율을 아무도 공개하지 않는다 — 를 중심으로 만들어졌다. 이것이 이 분야의 첫 벤치마크인데 여전히 그것을 재지 않는다. 품질과 비용은 둘 다 결과이기 때문이다. 안전 라우팅 과제도 없는데, 그쪽이 실제 결과를 낳는 절반이다.
  • LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers (arXiv:2608.06867) (신규)
[03]

관찰

  • Grok 4.7 이 2026-08-22 무렵 예정 — Musk 가 07-25 에 확인한 케이던스다. Grok 4.6 은 이제 1차 모델 카드 없이 아흐레를 보냈고, 확인할 것은 날짜가 아니라 4.7 이 카드와 함께 오는지다.
  • GLM-5.3 의 가중치가 2026-08-28 무렵 돌아올 예정Open-Weights Policy Fight 에서 산출물이 아니라 약속인 첫 항목이다.
  • Hugging Face 의 State of Open Models: Summer 2026 Observations 가 이틀째 prefetch 원장에 있고 여전히 수집되지 않았다: 호스트가 차단돼 있고 표적 검색은 인접 자료만 돌려주었다. 후보는 URL 을 담지 본문을 담지 않는다. 수집되지 않은 Alignment Science 글 셋과 함께 오늘 lint 로 넘긴다.
[04]

위키 신규

셋 모두 논문 페이지이므로 이번 실행에서 사용자 검토가 필요한 것은 없다 — 신규 엔티티·개념·인물 페이지는 만들어지지 않았다.

[05]

업데이트

  • Qwen 3.8 Max / Alibaba / Qwen AI Lab / Open-Weights Policy Fight: Artificial Analysis 가 Qwen3.8 의 형태를 처음으로 싣고 같은 점수를 준다 — Max 58(1M 컨텍스트, 작업당 $1.13), 공개 2.4T A95B 58(984k, 작업당 $1.09). 세 주 동안 Alibaba 의 예고-후-공개 순서의 조건 을 추적하면서도, 넘겨받은 산출물이 팔던 산출물과 같은지는 말할 수 없었다. 같은 것이다. 984k 대 1M 차이는 공개 가중치를 서빙하는 쪽의 속성이지 가중치의 속성이 아니다.
  • Eval Harness Configuration: DarwinX 옆에 AutoDesign / SHAPER / SkillZip 군집을 더하고, 이 위키 자신의 Terminal-Bench 행들에 대한 귀결을 적었다.
  • Mechanistic Interpretability: Mechanist 를 더하고, 자동 시스템이 발견한 메커니즘 이론에도 독립적인 확인이 필요하다는 점을 함께 적었다.
  • Model Routing: 첫 주요 논문. 두 번째 열린 문제를 추가했다 — 안전 라우팅을 다루는 벤치마크가 없다.