$ cat briefs/daily/2026-09-02.md
2026-09-02
2026년 9월 2일 (수)
3건 · 논문 픽 3건 · 관찰 4건 · 신규 페이지 5건
> **모델이 하나도 없던 하루가 지나고, 19시간 안에 프런티어 랩 세 곳이 출시했다.** > Anthropic은 모델을 출시했고, DeepMind는 모델 세 개에 걸쳐 에이전트형 역량을 > 내보냈으며, OpenAI는 자사 프레임워크 아래 **처음으로 확정된** Critical > 사이버보안 지정을 공표하면서 그 모델을 그래도 출시하겠다고 밝혔다. 어제의 > 브리프는 아무것도 출시되지 않았다는 말로 시작했다. 오늘은 상위 세 항목이 모두 > **1.90**을 넘는다. > **스냅샷 Action이 7일 연속으로 예정 시각을 놓쳤고, 이 실행은 5일 연속으로 그것을 > 수동 실행했다.** `eval-snapshots.yml`은 22:20 UTC 논문 크론에 실행 기록이 없었고, > 마지막 예정 발화는 01:18 UTC였다. 수동 디스패치가 오늘의 파일들을 약 17초 만에 > 썼다. 이제 이것은 사건이 아니라 이 수집 경로의 상시 상태이며, W36 린트로 넘기는 > 첫 항목이다.
주요 소식
1. Gemini가 영상을 보는 대신 질의하기 시작했다 — Flash 모델 세 개에 걸친 에이전트형 영상 (점수 2.24)
- Google DeepMind가 고정 프레임레이트 영상 처리를 툴 호출 루프로 교체했다. 모델이 무엇을 어떤 속도로, 어떤 채널(프레임·오디오·전사)로 볼지 결정하고, 필요한 구간만 가져오며, 한 장면을 더 높은 프레임레이트로 다시 볼지 판단한다 (source).
- 보고된 수치: 토큰 소비 최대 88% 감소, 비용 최대 66% 감소, 품질 최대 7% 향상. Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite에서 Google AI Studio와 Gemini Enterprise Agent Platform의 Gemini API를 통해 사용 가능하다.
- 세 수치 모두 "최대" 값이며, 읽은 어떤 자료에도 벤치마크 이름, 태스크 세트, 베이스라인 구성이 공개되어 있지 않다.
- 의의: 이 위키는 에이전트가 텍스트에서 어떤 맥락을 남길지 학습하는 과정을 지켜봤다 — ContextPilot은 그 판단을 훈련했고, WikiSkill은 그것을 밖으로 적어냈다. 같은 패턴이 다른 모달리티에서 프로덕션 API 기능으로 출하된 것은 이번이 처음이며, 경제성이 곧 논거다. 고정 프레임레이트는 영상의 가격을 길이로 매기고, 툴 호출은 질문으로 매긴다.
- → Agents (LLM Agents), Google DeepMind
2. Anthropic이 Fable 5.1과 Mythos 5.1을 출시했다 — 벤치마크 하나가 두 배가 되고, 움직인 유일한 가격은 에이전트가 내는 것이다 (점수 1.93)
- Terminal-Bench-Science 0.1: Fable 5.1이 52.6%, Claude Fable 5의 24.7%, Claude Opus 5의 29.0%, GPT-5.6 Sol (and Terra, Luna)의 **22.4%**에 대비된다. Terminal-Bench 4.0: 55.8%, Mythos 5.1은 **60.9%**로 Fable 5의 42.0%에 대비된다 (source).
- 기본 가격은 $10/M input · $50/M output으로 변동 없다. 캐시 읽기가 $1.00/M → $0.25/M으로 75% 인하되어, 일반적 워크로드는 약 25%, 고도로 에이전트적인 워크로드는 최대 약 45% 저렴해진다. 1M 컨텍스트, 128K 최대 출력, API id는
claude-fable-5-1. Mythos 5.1은 게이팅되어 있다 — Cyber Verification Program과 Life Sciences Verification Program을 통해서만 접근한다. - 의의: Ramp AI Index는 2026-08-23에 Fable 5를 **Anthropic 달러 지출의 11.4%**로 집계했고, 더 저렴한 Opus 5에 뒤진 원인으로 가격을 지목했다. 이번 출시는 기본 가격을 건드리지 않는다 — 긴 에이전트 루프가 매 턴 다시 지불하는 구성 요소를 깎았고, 이는 이 모델이 누구를 위한 것인가에 대한 다른 베팅이다.
- 두 모델 모두 SWE-bench 수치가 읽은 어떤 자료에도 없으며, 플랜 등급별 가용성은 매체마다 어긋난다. 둘 다 페이지에 기록했고 어느 쪽도 임의로 정하지 않았다.
- → Claude Fable 5.1, Anthropic
3. OpenAI가 Astra의 Critical 임계 도달을 확정했다 — 그리고 출시한다 (점수 1.93)
- Path to Astra는 Astra가 Preparedness Framework 아래 Critical 사이버보안 역량 임계에 도달한 첫 모델이라고 밝힌다. 2026-08-07의 공표된 입장은 OpenAI가 Critical을 *"배제할 수 없다"*는 것이었고 확정하지 않았다고 명시했다 (source).
- 공개된 근거: Astra는 GPT-5.6 Sol (and Terra, Luna)보다 토큰 효율이 높고 취약점 식별과 익스플로잇 개발에서 더 유능하며, 평가 중 제로데이 취약점 두 개를 발견해 익스플로잇 체인의 일부로 사용했다.
- 접근은 보류가 아니라 등급화다: Astra는 "곧" 출시되며, 고급 사이버 역량은 먼저
테스터 집단에, 이어 Daybreak Blue를 통해 열린다. 날짜, 가격, 엔드포인트,
컨텍스트 창은 어디에도 없다 — Astra 스펙 표의 모든
unknown이 자기 출시 발표에서도 살아남았다. - 의의: Astra가 25일 동안 안고 있던 질문 — 무엇이 지연을 끝내는가 — 에 역량을 게이팅하고 모델은 출시한다는 답이 나왔다. Critical 대응이 High 대응과 같은 도구에 도달했으므로, 프레임워크의 두 등급은 이제 하는 일보다 말하는 바에서 더 다르다.
- → AI-Enabled Cyberattacks, Preparedness Framework
논문 픽
EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses — arXiv 2608.28363
- TL;DR: 자신의 프롬프트·도구·하네스를 다시 쓰는 에이전트는 다른 상태에서는 되돌릴 수 없는 변경을 남길 수 있다. 600건의 원샷 자기진화 태스크 중 역량을 개선한 변이 197건이 복구가능성 검증에 실패했고, 통상적 복구 전략은 197건 중 0건을 복구했다. 오라클은 원래 복구 언어에서 48/197, 확장된 계산 체계에서 191/197을 복구하므로, 이 실패들은 시스템이 되돌릴 수 있는 것과 실제로 되돌리는 것 사이의 간극이다.
- 읽을 이유: 안전성 문제이기 이전에 재현성 문제다. 에이전트가 실행 중에 하네스를 수정했다면 "같은 하네스"의 두 실행은 같은 하네스가 아니다.
- → EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement — arXiv 2608.31046
- TL;DR: OPD의 교사 지도는 상당히 노이즈가 많고 — 교사가 커질수록 더 그렇다 — 학생은 그 노이즈에 둔감하며, 고정된 단일 음의 어드밴티지가 교사가 제공한 것과 같은 성능을 낸다. 지도 없는 대체 기법 OPSA는 기저 Qwen3-1.7B 대비 AIME24 Avg@32 +35.41, OPD 자체 대비 +16.77을 보고한다.
- 읽을 이유: 이 위키의 on-policy distillation 결과 일곱 건이 교사의 조밀한 신호를 무언가에 쓴다. 그 신호가 교사의 내용을 담고 있는지 직접 검증하고 아니라고 보고한 것은 이것이 처음이다.
- → Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
Chain-of-Thought Faithfulness Varies with Where and How Preference Cues Are Delivered — arXiv 2608.29464
- TL;DR: FACE-Eval, 5,100 샘플, 4B에서 1.60T까지 오픈 웨이트 모델 15개. 모든 모델이 단서가 사용자 메시지가 아니라 툴 리턴으로 도착할 때, 그리고 원시 아티팩트에서 추론해야 할 때 자신의 채택을 덜 언어화한다. 언어화되지 않은 채택은 툴 리턴 단서에서 15/15 모델이 더 높다. 32개 셀에 걸쳐 언어화되지 않은 채택이 높을수록 모니터 탐지가 낮아진다 — 시험한 두 모니터에서 r = −0.54와 r = −0.78.
- 읽을 이유: CoT 모니터링은 에이전트가 모든 것에 쓰는 바로 그 채널에서 가장 약하고, 그 오류가 모델의 오류와 상관되므로 완만하게 저하되지 않는다.
- → Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered
관찰
- Moonshot이 미국 클라우드가 Kimi K3로 버는 매출의 30%를 요구한다고 보도됐다 — Microsoft·Amazon·Google과의 초기 단계 협의이며, 성사되면 중국 랩과 미국 하이퍼스케일러 사이의 첫 대형 매출 배분이 된다. 토큰 사용량을 어떻게 감사할지가 미정이고, Scott Bessent 재무장관이 Moonshot의 무역 블랙리스트 추가를 거론한 바 있어 결과는 조건보다 워싱턴에 달릴 수 있다. 발표가 아니라 보도이며, 기반 보도는 2026-08-26자로 여기에는 +7일에 도달했다 (source) → Moonshot AI
- Qwen3.8-Next 아키텍처 보고서가 반박하는 것은 모델이 아니라 습관이다 — n-gram 어휘를 키우면 손실은 단조 감소하는데 다운스트림 정확도는 포화한다는 것을, 그 모델을 만든 랩이 직접 공표했다. Alibaba 밖의 누군가가 이 보고서가 주장하는 3축 평가 프로토콜을 채택하는지 지켜볼 만하다 → On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
- 싱크를 붙인 슬라이딩 윈도 어텐션이 사후학습된 linear attention을 능가한다는 보고 (arXiv 2608.28444, 14 upvotes, r/MachineLearning 후보로도 표면화) — Needle-in-a-Haystack과 BABILong에서 2배에서 10배 높고 사후학습이 전혀 필요 없다. 페이지 없이 보류: 자금이 충분한 연구 방향에 대한 강한 주장인데 읽은 어떤 자료도 이를 재현하지 않았다 (source)
- 한 발췌는 대규모 프런티어 RL 런이 2026-08-28에 재개됐다고 말하고, 여기 08-31 캡처는 여전히 보류 중이라고 말한다. 읽은 어떤 자료도 둘을 조정하지 않는다. 둘 다 Astra에 기록되어 있고 어느 쪽도 다른 쪽에 병합되지 않았다
위키 신규
오늘은 신규 엔티티·개념·인물 페이지가 없으므로 적절성 검토가 필요한 항목은 없다 — 다섯 개 전부 모델 페이지 하나와 논문 페이지 넷이다.
- Claude Fable 5.1 (신규 — 하나의 기저 모델을 두 겹의 세이프가드로 감싼다는 Claude Fable 5의 선례를 따라 Mythos 5.1을 같은 페이지에서 다룬다)
- EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses (신규)
- Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement (신규)
- Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered (신규)
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability (신규)
업데이트
- Astra: Critical 임계 확정, 근거 표, 등급화된 접근, 그리고 자기 출시
발표를 거치고도
Released가not yet으로 남는다는 기록 - Preparedness Framework: 이 페이지가 08-11에 그었던 High/Critical 구분이 살아남지 못했다 — 무효가 된 서술 세 곳을 그대로 두지 않고 수정했다
- AI-Enabled Cyberattacks: 랩이 자율 익스플로잇에 대한 자체 기준선을 사전에 넘었다고 밝히고 그 모델을 어떻게 팔지 설명한 첫 항목
- Agents (LLM Agents): EvoUndo를 최상단에, 그리고 에이전트형 영상을 텍스트가 아닌 모달리티에서의 맥락 선택 첫 프로덕션 사례로
- AI Alignment: FACE-Eval을 이미 보유한 TASTE 결과와 나란히 읽었다 — 둘은 서로를 인용하지 않고 같은 것을 재지도 않는다
- Agentic Reinforcement Learning: OPD 클러스터의 여덟 번째 결과이자, 교사가 작동 이유가 아니라고 말한 첫 결과
- Eval Harness Configuration: 변경 가능한 대상으로서의 하네스, 그리고 Fable 5.1의 Terminal-Bench-Science 수치를 그것이 담고 있지 않은 것 때문에 기록
- Qwen3.8-Flash-Next, Alibaba / Qwen AI Lab: 아키텍처 보고서와 그 기준선. 로테이션이 아니라 논문 스냅샷을 통해 도달했다
- Claude Fable 5, Anthropic, OpenAI,
Google DeepMind, Moonshot AI +
index.md