$ cat briefs/daily/2026-09-16.md
2026-09-16
2026년 9월 16일 (수)
2 스토리 · 2 논문 픽 · 3 관찰 · 신규 페이지 5
**일요일에 Demis Hassabis 는 Anthropic 의 평가자 제안에 대해 정작 필요한 것은 업계 전체의 표준 기구라고 답했고, 그 대화에 있던 누구도 그런 기구가 작년 12 월부터 돌아가고 있었다는 말을 하지 않았다.** 그 기구에는 회원 명단도, 출범일도, 발행된 표준도 있다 — 독립 제 3 자 평가의 최소 운영 조건을 규정한 AEF-1 이고, 그 핵심 조항은 Amodei 의 에세이에 있는 조항과 거의 한 글자씩 겹친다. 별개로 Google DeepMind 가 음성 모델 두 개를 냈는데, 그중 일반 공급되는 쪽은 벤치마크 수치를 하나도 내놓지 않았다. 논문들은 같은 루프의 양 끝을 잰다 — 에이전트가 지금 일의 얼마를 하고 있는지, 그리고 계속 시키는 것의 수익이 어디서 마이너스로 돌아서는지.
주요 소식
1. 일요일에 pacing 논쟁이 요구한 표준 기구는 이미 아홉 달 전부터 있었고, 표준도 이미 발행한 뒤였다 (1.86 — 점수 순서를 벗어나 먼저 싣는다. 스토리 2 아래의 설명을 볼 것)
- AI Evaluator Forum (AEF) — 독립 평가 기관들의 컨소시엄. 2025 년 12 월 결성, 2025-12-04 에 NeurIPS25 와 같은 장소에서 출범. 창립 회원에 Transluce, METR, RAND, SecureBio 가 포함된다 (source)
- 첫 산출물이 AEF-1 — "Minimum Operating Conditions for Independent Third Party AI Evaluations" 다. 자발적 표준이고, 목적은 제 3 자 평가가 독립성·접근·투명성 을 보장하는 조건 아래 수행되게 하는 것이며, 평가자가 "그 기준선 운영 조건을 어떻게 충족했는지 입증 하는 데" 쓸 수 있는 것으로 설명된다
- 무엇을 요구한다고 보고되는가 — 1 패스짜리 요약 두 건이고, 어떤 패스도 조항 원문을 가져오지 못했으므로 요약으로 기록한다: 평가 대상 특성을 평가하기에 충분한 기술적 접근, system prompt·학습 과정 정보·기존 내부 평가 결과·시스템 취약점 정보 에 대한 접근, 그리고 방법과 결과에 대한 편집권, 이해충돌 제거, 지식재산 보호 조항
- 왜 중요한가: Frontier Pacing 은 2026-09-06 이래 기구 없는 형태 를, 2026-09-13 이래 형태 없는 기구 를 들고 있었다. 이것이 둘 다인 첫 대상이고 — 누가 묶이는지를 뒤집는다. Amodei 의 1 단계는 랩이 주는 권한이고 준 랩이 거둬갈 수 있다. AEF-1 은 평가자가 하는 공개이고, 어떤 랩도 거둬갈 수 없지만 어떤 랩도 받아들일 의무가 없다. 둘 다 회사를 무엇에도 묶지 않는다
- 이빨이 박힌 조항에서의 겹침은 말해둘 만큼 가깝다. 에세이 쪽은 Anthropic 의 편집 통제 없이 핵심 발견을 공개할 권리, AEF-1 쪽은 방법과 결과에 대한 편집권 이다. 나흘과 컨소시엄 하나를 사이에 두고, 읽은 자료 중 어느 쪽도 다른 쪽을 인용한다고 보고하지 않는다
- 확립되지 않은 것, 그리고 거기에 헤드라인이 포함된다. 이것을 떠오르게 한 항목은 xAI, OpenAI, Anthropic 이 모두 AEF-1 에 공동 서명했다 고 단언한다. 네 패스가 같은 헤드라인을 물어왔고, 어느 패스도 독립적으로 뒷받침하지 못했으며, 서명자 명단도 서명 날짜도 세 랩 중 누구의 AEF-1 관련 발언도 나오지 않았다. 직접 물은 패스는 Amodei 에세이 에 대한 답변만 돌려줬다 — 나흘 앞선 다른 대상이고, 같은 이름 셋이 등장한다. 그 밖에 확립되지 않은 것: 이것이 Hassabis 가 말한 기구인지 (Google DeepMind 는 보고된 두 창립 회원 명단 어디에도 없다), 발효일이나 판본 날짜, 집행 수단·감사·등록부
- 1 차 자료 읽기는 불가 —
aievaluatorforum.org와www.aef.one모두EGRESS_BLOCKED이고, 둘 다 이 저장소 목록에 새로 오른다 - → Frontier Pacing · AI Evaluator Forum (AEF) · Google DeepMind
2. Google DeepMind 가 음성 모델 두 개를 냈고, 수치가 있는 쪽은 유료 추론 모델뿐이다 (1.93)
- 2026-09-15, Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — Gemini API, Google AI Studio, Search Live 를 통해 "오늘부터" 순차 공개, 기업용은 Gemini Enterprise 경유 (source)
- 두 모델에 공통으로 명시된 것: 대화 도중 97 개 언어 사이 전환, 말을 이어가면서 백그라운드로 tool call 과 API 요청 실행, 시각 입력의 준실시간 처리
- Gemini 3.8 Live Extended Thinking 은 Artificial Analysis Speech to Speech Quality Index 에서 82.6% 로 선두이고, GPT-Live-1 "Astra (Medium)" 의 81.5%, Grok Voice Think Fast 2.0 "(High)" 의 81.3% 를 앞선다. 입력 오디오 시간당 $3.50 으로 각각 $5.83, $4.80 보다 싸다
- Gemini 3.8 Live — 일반 공급되는 저비용 쪽 — 은 어떤 종류의 수치도 공개되지 않았다
- 왜 중요한가: 벤치마크 세 행 중 둘은 추론 강도 수식어를 달고 있고 1 위 행에는 없다. 즉 1.1 포인트 차이가 셋이 같은 강도에서 돌았다는 진술 없이 발행됐다. 정확히 Eval Harness Configuration 이 존재하는 이유이고, 보름 사이 Gemini 출시 중 두 번째로 확인하기 가장 어려운 수치가 유통되는 경우다
- 가격이 오디오 시간당이라는 점에 결과가 따른다.
scripts/spec-check.py는Pricing을 토큰당 카탈로그에 되짚어 읽으므로, 오디오 시간 요율은 검증할 수 없는 칸이다 — Gemini Omni 1.1 Flash 가 초당 영상 가격으로 안고 있는 것과 같은 사각지대다 - 확립되지 않은 것: 두 모델 모두 토큰당 가격, context window, 최대 출력, API 모델 id 가 없다. 백만 토큰당 가격을 직접 물은 패스는 Gemini 3.8 Flash 수치를 돌려주며 그렇다고 밝혔고, 그 수치는 열사흘 전에 나온 다른 모델의 것이다. 1 차 자료 읽기는 불가 —
deepmind.google과blog.google모두EGRESS_BLOCKED이고, 발표의 URL·제목·날짜는state/prefetch.json을 거친 DeepMind RSS 에서 왔다 - 스토리 1 보다 점수가 높은데 두 번째로 싣는다. 1.2 × 1.3 × Google DeepMind 1.3, 이미 두터운 영역이라 −0.1 — 대 1.2 × 1.3 × 1.0 에 신규 엔티티 페이지 +0.3. AEF-1 이 앞서는 이유는 7 월부터 쌓아온 페이지의 열린 문제를 전진시키기 때문이고, 음성 모델 출시는 더 일상적인 사건이기 때문이다. 두 점수를 모두 보이고 역전을 명시한다 — 09-04, 09-06, 09-14, 09-15 와 같다
- → Gemini 3.8 Live · Gemini 3.8 Live Extended Thinking · Google DeepMind
논문 픽
두 픽 모두 1.85 이고 동점은 실제다 — 각각 base 1.3 × agents 1.5, −0.1 이며 interests.md 에 둘을 가를 행이 없다. 보름 사이 네 번째로 기록되는 점수 충돌이고, 09-09·09-11·09-12·09-15 와 마찬가지로 실행 도중 가중치를 고치지 않았다.
When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis — arXiv 2609.15309 (1.85)
- TL;DR: 토큰 예산마다 그때까지 찾은 최선의 해를 추적하고, 과제 내 순위를 Bradley-Terry 로 묶어 Elo 로 집계한 뒤, Elo 가 log 컴퓨트에 선형 으로 자라는 독립 샘플링 과 견준다. 네 개의 범용 에이전트, 네 개의 개방형 벤치마크, 최대 100M 토큰 세션에서 에이전트는 처음엔 기준선보다 빠르게 토큰을 Elo 로 바꾸다가 한계 이득이 줄고 결국 기준선 아래로 떨어진다. 그 교차점을 scaling inflection point 라 부른다
- 읽어야 할 이유: 진단만이 아니라 처방이다. 100M 토큰 을 그 지점 크기의 병렬 세션으로 쪼개자 FrontierCS Polyomino Packing 에서 긴 세션 하나 대비 +264 Elo, 짧은 세션 열 개 대비 +355 Elo 를 얻었다
- 감쇠하는 쪽은 스캐폴드 이고, 그래서 Agents (LLM Agents) 에도 Test-Time Compute (Inference-Time Compute Scaling) 만큼이나 얹힌다. 고쳐 쓰고 탐색하고 언제 멈출지 정하는 에이전트가 결국 샘플링해서 최선을 고르는 쪽보다 못해진다는 것이다. 공유된 AtCoder Heuristic Contest 과제에서 최상위 인간 참가자들은 초선형 으로 향상한다 — 같은 과제 위의 다른 모양 곡선이고, 계속 위로 휘는 쪽은 인간이다
- 네 에이전트도 네 벤치마크도 지명되지 않았고, 어느 쪽에도 inflection 값이 발행되지 않았으며, +264 / +355 쌍은 과제 하나 에서 나왔다
- → When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis (신규)
Atria Dawn: The Dawn of Agentic Superintelligence — arXiv 2609.15818 (1.85)
- TL;DR: Verifiable Experience Pipeline — 실행 가능한 환경과 외부에서 검증된 결과 에 연결된 도구 매개 상호작용 — 으로 학습한 에이전트형 파운데이션 모델. 16 개 벤치마크, 그중 다섯 개에서 보고된 최고 점수, 나머지는 "경쟁력 있음". 함께 실린 것은 자체 개발 과정의 참가자 56 명, 과제 기록 769 건 에 대한 분석이다: 완료된 AI 보조 과제의 약 3 분의 1 이 AI 없이는 불가능 했다고 평가됐고, 에이전트가 "자주 방법을 제안하고 수정을 구현" 하는 한편 인간은 "대부분의 최종 결정을 보유" 한다
- 읽어야 할 이유: Frontier Pacing 이 가진 같은 모양의 유일한 수치는 OpenAI 의 인간 작업일당 에이전트 작업일 3.1 이고, 그것은 산출이 붙지 않고 방법론도 공개되지 않은 투입 측정이다. 이것은 산출 쪽이고 분모가 명시돼 있다 — 그리고 자기 연구다: 평가한 사람들이 평가 대상을 만들었고, 대조군도 블라인드 조건도 외부 재현도 읽은 자료에 없다
- 초지능을 제목에 단 논문이 인간 감독을 요청하며 끝난다. 진보는 "발견의 역량과 의미 있는 인간 감독의 역량을 함께" 밀어야 하며 "계속되는 개발의 위험과 방향에 대한 책임 있는 인간 권한을 보존" 해야 한다는 것이다. "대부분의 최종 결정" 은 수치가 아니고, AI Control Roadmap 이 계속 도달하는 바로 그 구멍이다
- 랩도 저자도 가중치도 라이선스도 파라미터 수도 벤치마크 목록도 공개되지 않았다 — 핵심 증거가 자기 팀에 대한 내부 노동 연구인 논문에서 소속 누락은 형식이 아니라 실질 문제다
- → Atria Dawn: The Dawn of Agentic Superintelligence (신규)
관찰
- 3 단계에 회담 날짜가 생겼을 수 있는데 이 위키에는 기록이 없다. 중국의 AI 안전 입장을 다룬 Trivium China 항목을 쫓다가 2026-09-04 Reuters 보도 가 떠올랐다 — 미국과 중국이 9 월 중순 AI 안전 대화 를 준비 중이고, 미국 대표단은 재무장관 Scott Bessent 가 이끌며, 2026 년 5 월 Trump–Xi 정상회담 의 후속이라는 것이다. Frontier Pacing 은 3 단계 — 권위주의 정부와의 협상 — 를 채택자 없음 으로 기록하고 있고, 예정된 양자 대화는 이 논증이 가져본 것 중 상대방에 가장 가깝다. 열렸는지, 무엇이 논의됐는지, pacing 이 의제였는지 어느 것도 읽은 자료가 확립하지 않으므로 어떤 페이지도 바꾸지 않았다. Bessent 는 AI Governance 에 7 월 distillation 제재 맥락으로만 등장한다
- 자기개선 논문 세 편이 25 개짜리 스냅샷 하나에 들어왔다. RSI 가 감속의 첫 번째 이유로 지목된 주에 말이다. 오늘의 두 번째 픽 외에
2609.14858Dream-RSI — 과거 발견 트리로 만든 replay 시뮬레이터를 통한 자기개선 탐색 — 과2609.15364RSIAgent — 얼어붙은 메모리로 Kimi K3 와 GLM-5.3 가 OSWorld-v2 와 Agent's Last Exam 에서 GPT-6 를 앞선다고 주장 — 이 있다. 둘 다 페이지를 주지 않았고, wikilink 대신 스냅샷 인용으로 달아 존재하지 않는 페이지로 가는 링크를 만들지 않았다. 읽은 자료 중 어느 것도 셋을 pacing 논증에 연결하지 않는다 — 군집 자체가 관찰이다 - 최저가 추론이라는 주장이 재판매였다고 보고됐고, 이 저장소에는 정확히 그 문제를 전제한 스크립트가 있다. r/LocalLLaMA 스레드 (prefetch #41, 2026-09-15) 는 세계에서 가장 싼 추론 제공자를 표방한 CrofAI 가 OpenRouter 래퍼 로 드러났다고 전한다.
CLAUDE.md는spec-check가 카탈로그 헤드라인이 아니라 1 차 제공자 엔드포인트 와 비교하는 이유를 이미 적어 뒀다 — GLM-5.2 하나만 해도 입력 기준 $0.72 에서 $2.31 사이 33 개 제공자 가 서빙한다. 단일 스레드 출처라 어떤 페이지도 바꾸지 않았고, Model Routing 에 표시만 해 둔다
위키 신규
오늘 생성. 검토 요청.
- AI Evaluator Forum (AEF) (신규 — 엔티티 페이지, 검토 권장)
- Gemini 3.8 Live (신규)
- Gemini 3.8 Live Extended Thinking (신규)
- When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis (신규)
- Atria Dawn: The Dawn of Agentic Superintelligence (신규)
+0.3 은 정확히 한 번 적용됐고, 브리프는 어디서 멈췄는지 밝힌다. AI Evaluator Forum (AEF) 은 진짜 신규 엔티티다. 모델 페이지 두 개는 엔티티도 개념도 아니므로 "신규 엔티티/개념 페이지 필요" 조정이 닿지 않는다 — interests.md 가 뒷받침하는 문자 그대로의 독해이고, 09-11 과 09-15 실행이 한 독해와 같다.
업데이트
- Frontier Pacing — Forum 과 AEF-1 에 대한 새 섹션, 열린 문제 1 전진 (포럼과 기구가 이제 존재하고, 둘 다 2·3 단계의 답은 아니다), 그리고 세 랩이 표준에 공동 서명했는지를 다루는 새
## 상충 보고항목 - Google DeepMind — Live 모델 둘을 모델과 제품에 추가. 더해서, 자사 답변이 가리킨 표준 기구가 12 월부터 존재했고 DeepMind 는 어느 창립 회원 명단에도 없다는 최근 활동 항목
- Agents (LLM Agents) — 논문 두 편 모두 주요 논문 · 사건에 추가
- Test-Time Compute (Inference-Time Compute Scaling) — Elo-per-token 을 주요 논문에 추가. 또 하나의 스케일링 결과가 아니라 이 페이지가 갖는 첫 정지점이다
index.md— 새 줄 다섯