$ cat briefs/daily/2026-09-03.md
2026-09-03
2026년 9월 3일 (목)
3 소식 · 3 논문 픽 · 3 관찰 항목 · 5 신규 페이지
> **닷새 사이에 세 연구소가 같은 역량을 이유로 공개를 제한했는데, 제한한 대상이 셋 다 > 달랐다.** Z.ai 는 라이선스 조건을 붙였고, OpenAI 는 역량을 보류했고, Google 은 접근을 > 보류했다. 방아쇠 — 자율 취약점 발견 — 에 대한 수렴은 이미 기록돼 있었다. 처방에 대한 > 분기가 새로운 것이고, 그쪽이 더 쓸모 있는 절반이다. > **Google 자신의 출시 표가 두 코딩 벤치마크를 9.2점 대 1.2점으로 갈랐다.** > Terminal-Bench 2.1 은 81.6% → 90.8% 로 갔고 SWE-bench Pro 는 60.4% → 61.6% 로 갔다. > 한 출시, 한 모델에서. 한쪽은 에이전트가 과제를 끝내는 것을 채점하고 다른 쪽은 패치를 > 채점한다. 이 위키는 그 차이를 다섯 주 동안 연구소들을 가로질러 논증해 왔는데, 오늘 > 한 벤더가 그것을 단일 표 안에 공개했다. > **스냅샷 Action 이 여드레 연속으로 자기 슬롯을 놓쳤다.** 22:20 UTC 논문 cron 에서 > 아무 실행도 발화하지 않았다. 이 실행에서 수동 디스패치해 오늘 세 파일을 모두 썼다. > 여섯 번째 수동 디스패치이며, 상시화된 인테이크 결함으로 W36 lint 에 넘긴다.
주요 소식
1. Gemini 3.8 Flash — 20일 뒤, 동일한 스펙 표와 한 군데서만 움직인 벤치마크 컬럼 (점수 1.93)
- 2026-09-02 출시. 컨텍스트 창 1,048,576, 최대 출력 65,536, $0.75/M 입력 · $3.75/M 출력 도입가 2026-12-31 까지, 그 뒤 $1.50 · $7.50,
gemini-3.8-flash로 정식 출시. 이 중 어느 것도 20일 앞선 Gemini 3.7 Flash 와 다르지 않다 (source). - Terminal-Bench 2.1 81.6% → 90.8%, DeepSWE v1.1 73.7%, SWE-bench Pro 60.4% → 61.6%. 43일 사이 Flash 세 번, 그중 어느 것도 용량 수치나 가격을 바꾸지 않았다.
- 입증 강도는 행마다 다르고 페이지가 그것을 밝힌다.
deepmind.google과blog.google은 여기서 모두 차단돼 있어 이 출시는 WebSearch 세 패스로 포착됐다. Terminal-Bench 와 DeepSWE 는 두 패스가 일치하고, SWE-bench Pro 의 숫자는 한 패스에서 나왔으며 나머지 둘은 방향만 뒷받침했다. - 왜 중요한가: 에이전트가 과제를 끝까지 수행하는 것을 채점하는 벤치마크에서 9.2점, 패치를 채점하는 벤치마크에서 1.2점은, 코딩의 하네스 쪽 절반을 움직이고 다른 절반은 건드리지 않은 출시다 — 이 위키의 핵심 평가 논증이 한 벤더 자신의 비교 안에서 공개된, 지금까지 가장 선명한 사례다.
- → Gemini 3.8 Flash · Eval Harness Configuration
2. 세 연구소, 하나의 방아쇠, 세 가지 다른 게이트 — 그리고 외부에서 검증 가능한 것은 하나뿐 (점수 1.93)
- 2026-08-28 GLM-5.3 은 아무것도 보류하지 않고 라이선스 조건을 붙인다. 매출 100억 달러 기준선 위에서는 보안 심사. 2026-09-01 Astra 는 역량을 보류한다. 2026-09-02 Gemini 3.8 Flash Cyber 는 접근을 보류한다 — 승인 목록, 셀프서브 API 없음, 공개 가격 없음 (source).
- Fairwind 의 명시된 자격은 신뢰받는 정부·국가 사이버 당국, 핵심 인프라 운영자, 소프트웨어 유지보수자다. 승인 기준은 공개되지 않았다 — "신뢰받는"과 "승인된"이 명시된 기준의 전부다.
- Cyber 모델은 CyberGym 점수를 공개하지 않았고, Gemini 3.5 Flash Cyber 를 능가한다는 주장만 했다 — 그 3.5 는 6주 앞서 Chrome V8 취약점 55 / 47 / 36 을 공개했다. 비교가 제시된 방향으로는 검증될 수 없다 (source).
- 왜 중요한가: 라이선스는 문서이고 가중치는 내려받을 수 있으니 Z.ai 의 게이트는 누구나 감사할 수 있다. 모델 안에 보류된 역량과 비공개 승인 목록은 그렇지 않다. 세 연구소가 무엇이 위험한지에는 동의했고 그에 대해 무엇을 할지에는 완전히 갈렸는데, 그것이 거버넌스 체제가 아직 규칙을 갖기 전의 모습이다.
- → AI-Enabled Cyberattacks · Gemini 3.8 Flash Cyber
3. Qwen3.8-Max-0902 — 날짜 스냅샷으로 나온 코딩 향상, 가격 그대로에 버전 번호도 없이 (점수 1.20)
- 2026-09-01 22:00 ET 라이브. 코딩과 Cowork 형 과제 사후 학습, 아키텍처 변경 없음. 2.4T 파라미터, 1M 컨텍스트, 그리고 베이스 모델과 모든 가격이 동일 (source).
- Code Arena: WebDev 에서 1,691점으로 1위 데뷔, Claude Opus 5 를 앞섰다.
- 여기서 "Opus 5 를 이겼다" 는 프레이밍은 싣지 않는다. 한 패스는 격차를 3점으로 주는데, 베이스 모델 자신의 예비 Arena 구간이 ±18 로 그 격차보다 넓다. 같은 패스의 헤드라인은 이 모델이 전반적으로는 "여전히 Opus 5 뒤" 라고 말한다.
- 왜 중요한가: 이틀 사이 두 번째 연구소가 코딩 향상을 가격 그대로의 사후 학습 패스로 내놓았고 — Alibaba 는 새 버전 번호조차 달지 않았으니, 이 출시는 스냅샷 날짜를 지켜보는 사람에게만 읽힌다.
- → Qwen 3.8 Max · Alibaba / Qwen AI Lab
논문 픽
AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling — arXiv 2608.26623 (점수 1.75)
- TL;DR: 여섯 워크플로 DAG 위상과 세 난이도 단계에 걸친 3,808 인스턴스, 20B 부터 프런티어 규모까지 여섯 judge, 정답 유무 쌍으로 실행. 정답이 없는 어려운 질의에서 여섯 모두가 규모와 무관하게 77–82% 정합도 대역으로 수렴한다.
- 정답 노출은 GPT-5.4 (1.5 pp) 와 Gemini-2.5-Pro (3.9 pp) 의 정합도를 낮춘다. Chain-of-thought 와 온도는 미미하고, 루브릭은 최대 +6.5 pp 를 주지만 judge–생성기 쌍에 걸쳐 일반화되지 않는다.
- 읽을 이유: 모두가 고정점으로 취급하는 하네스 구성 요소에 단단한 천장을 씌운다. 어려운 과제에서 에이전트 결과가 LLM judge 로 채점된다면, 두 시스템 사이의 보고된 격차가 judge 자신의 오차보다 작을 수 있다.
- → AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling
Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement — arXiv 2609.01481 (점수 1.75)
- TL;DR: 기존 세 하네스 — Codex/GPT-5.5, OpenCode/DeepSeek-V4-Pro, Pi/MiniMax-M3 — 위에 얹은 계획–코딩–테스트 루프가 셋 모두를 개선한다. 3회 반복 이후 평균 상대 +52.25%, 최대 82.86%, 그리고 70회 이상 반복의 다일간 빌드.
- 절대 점수가 공개되지 않아 상대 향상을 다른 어떤 시스템에도 위치시킬 수 없고, 게임 시연에는 베이스라인도 사람 평가도 없다.
- 읽을 이유: 모델을 고정한 채 하네스 위의 층만 바뀌는데 셋 다 개선된다 — 보고된 에이전트 역량 중 얼마나가 스캐폴드에 사는지에 대한 또 하나의 측정이다. 위의 픽과 함께 읽으라. 이 논문의 세 벤치마크가 산출물을 어떻게 채점하는지는 어디에도 없으므로, 52.25% 가 AgentJudgeBench 의 대역 위에 있는지 안에 있는지는 판정되지 않는다.
- → Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement
SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers — arXiv 2609.01343 (점수 1.49)
- TL;DR: Looped Transformer 결과는 보통 모델 크기를 고정해 비교하는데, 그러면 루프 모델에 추가 FLOPs 가 간다. SMELT 는 토큰당 FLOPs, 비임베딩 파라미터, KV 캐시를 맞추고 — 그래도 우위가 살아남는다. 컴퓨트 최적 프런티어에서 학습 FLOPs 의 6.8–18.0% 절약, 54B 까지 네 크기에 걸쳐 별도의 Chinchilla 형 법칙으로 적합.
- 스케일링 결과를 읽는 방식에 반하는 두 발견: 다운스트림 이득이 검증 손실의 예측을 넘어서고 (Code 에서 가장 크다), 샘플 길이와 인컨텍스트 예시에 따라 커진다.
- 읽을 이유: 앞선 프런티어가 잘못된 대조군에 대고 측정됐다고 논증하면서 대조군을 고친 뒤에도 효과를 그대로 보고하는 드문 스케일링 논문이다.
- → SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
관찰
- Moonshot, 미국 클라우드 대기업에 수익 배분을 요구 — Trivium China, 2026-09-01. 가중치 0.7 의 사업 모델 기사이고
triviumchina.com은 여기서 차단돼 헤드라인만 읽혔다. 페이지는 쓰지 않았다. 중국 연구소가 추론이 아니라 유통에 가격을 매기는 첫 신호라서 지켜볼 만하다. - Alignment Science 인덱스를 읽지 못했고, 이를 "공개된 것이 없음" 이 아니라 미확인으로 기록한다.
alignment.anthropic.com은EGRESS_BLOCKED로 응답하고, 표적 검색은 이미 포착한 네 건보다 새로운 글을 드러내지 않았다. 놓친 두 글이 +73일과 +38일 늦었던 바로 그 소스이므로, 그에 대한 확인 불가 자체가 신호다. eval-snapshots.yml이 여드레째 자기 일정으로 발화하지 않았다. 여섯 번째 연속 수동 디스패치. 디스패치가 작동하므로 잃은 것은 없지만, 누군가 기억할 때만 도는 예정된 점검은 예정된 것이 아니다.
위키 신규
오늘은 새 엔티티·개념·인물 페이지가 없다 — 사용자 검토가 필요한 항목이 없다.
- Gemini 3.8 Flash (신규 — 모델 페이지)
- Gemini 3.8 Flash Cyber (신규 — 모델 페이지)
- AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling (신규 — 논문 페이지)
- Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement (신규 — 논문 페이지)
- SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers (신규 — 논문 페이지)
업데이트
- Google DeepMind: 최근 활동 두 건 — 3.8 Flash 한 쌍과 Fairwind Program. 두 모델 모두 모델과 제품에 추가
- AI-Enabled Cyberattacks: 세 연구소 게이팅 비교로 시작하는 새
## 현재 수준 (2026-09-03), 타임라인 한 행 - Eval Harness Configuration: 새 날짜 섹션 — judge 천장, 9.2 대 1.2 분기, 그리고 Terminal-Bench 버전 위생 규칙
- Agents (LLM Agents): 새 현재 수준 항목 둘과 주요 논문 두 행
- Qwen 3.8 Max 과 Alibaba / Qwen AI Lab: 0902 스냅샷, 두 Terminal-Bench 세대를 분리해서
- Post-Training Scaling: 주요 논문에 SMELT 추가
- Gemini 3.7 Flash, Gemini 3.5 Flash Cyber: 후속 모델 링크