$ cat wiki/trends/2026-W33.md
주간 종합 — W33 (2026-08-10 → 2026-08-16)
2026년 8월 16일 종합 · 8월 10일 월요일부터 8월 16일 일요일까지 · Weekly Synthesis — W32 (2026-08-03 → 2026-08-09) ← → 다음 주
기간
역량이 가중치로 도착하기를 그친 주. 이번 주 릴리스 중 넷은 명시적으로 같은 모델을 더 세게 사후 학습한 것이었고, 일요일에는 서로 무관한 연구 그룹 넷이 같은 주장의 가장 강한 판본을 내놓았다: 가중치는 아예 그대로 두고 하네스를 진화시켜라. 발표를 파라미터 수에 쓰는 분야가, 파라미터 수가 변수가 아니었음을 실증하는 데 한 주를 썼다.
주목할 출시
- Gemini 3.7 Flash (2026-08-13) — 3.6 Flash 로부터 23일 만의 GA 이고 용량 수치가 전부 동일하다: 1M 컨텍스트, 64K 출력, 2026년 3월 컷오프. 움직인 것은 벤치마크 칼럼이다 — AutomationBench 17.0% → 30.4%, DeepSWE 48.6% → 65.3%. Logan Kilpatrick 은 이를 규모가 아니라 약 3주에 걸친 알고리즘 개선으로 돌린다. 가격은 2026-12-31 까지 도입가 $0.75/M · $3.75/M, 이후 $1.50/M · $7.50/M 로 환원된다.
- DeepSeek V4-Pro-0813 (2026-08-13) — V4-Pro 가 날짜 붙은 빌드로 프리뷰를 벗어난다. 벤더 발표 Terminal Bench 2.1 72.1 → 87.9, DeepSWE 12.8 → 62.7, 그리고 하네스는 공개되지 않았다. 독립적으로 산출된 유일한 수치인 Artificial Analysis 지수는 한 점 움직여 53 이다.
- GLM-5.3 (2026-08-14) — Z.ai 는 GLM-5.2 의 베이스를 그대로 재사용했고 모든 이득이 사후 학습에서 나왔다고 밝힌다. Terminal-Bench 3.0 4.6 → 28.3, CyberGym 84.5%, Agents' Last Exam CLI 28.5 대 GPT-5.6 Sol 의 28.6. "가장 강력한 오픈 웨이트 코딩 모델" 로 홍보되지만 가중치는 안전성 평가 뒤로 약 2주 뒤로 명시돼 있다.
- Qwen 3.8 27B (2026-08-14) — 예고한 날짜보다 나흘 늦게 출시. 27.78B 덴스, Apache 2.0, 262,144 토큰 컨텍스트. SWE-MM 행은 Claude Code 하네스 에서 측정됐고 Claude Opus 4.7 시스템 카드 부록 8.3 을 인용한다 — 중국 랩이 경쟁사의 하네스를 문서 번호까지 들어 지목한 것이고, 이번 주 어느 릴리스가 어느 수치에 대해 공개한 것보다 많은 하네스 정보다.
- Qwen 3.8 Max 오픈 웨이트 (2026-08-12) — 처음으로 Max 급 Qwen 이 열렸고,
이름은
Qwen3.8-2.4T-A95B, 비공개 프리뷰로부터 24일 만이다. - Muse Glimmer (2026-08-10) — Meta 는 학생 을 Apache 2.0 으로 내고 교사는 닫아 두었다.
- GPT-5.6-Cyber (2026-08-10) — 이중 용도 작업에 덜 거절하도록 학습된 보안 모델. Daybreak Red 티어 한정, 가격 미공개, 시스템 카드 없음.
- Grok 4.6 — 이번 주 자체 릴리스는 없었지만 사양이 마침내 읽을 수 있게 됐다: 500K 컨텍스트, $2/$6 per M, 그리고 작업당 $0.84 에 61 인 Artificial Analysis 지수. 전부 출시 아흐레 뒤 서드파티에서 온 것이다.
부상하는 주제
1. 가중치가 아니라 하네스
이번 주 가장 뚜렷한 신호는 아무도 조율하지 않은 수렴이다. 2026-08-15 AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307) 은 빌더가 쓴 추론 하네스가 더 약한 모델의 Theory-of-Mind 평균을 파라미터 갱신 없이 0.49 → 0.91 로 옮겼다고 보고했다. 2026-08-16 에는 넷이 한꺼번에 도착했다 — DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) (선택압 아래의 하네스 집단, 평균 약 +17점, Terminal-Bench 2.1 84.7%), AutoDesign (메타 하네스 최적화, PosterBench 54.99 → 67.39), SHAPER (체화, 학습 없음), SkillZip (스킬 라이브러리 3.46배 압축에서 +12.2점). 코딩 에이전트, 문서 생성, 체화 제어, 검색 — 네 영역, 하나의 구조, 내내 얼린 모델.
이를 릴리스 옆에 놓아 보라. GLM-5.3 은 GLM-5.2 의 베이스에 사후 학습을 더한 것이다. Gemini 3.7 Flash 는 3.6 Flash 의 용량에 더 나은 벤치마크 칼럼이다. DeepSeek 은 새 모델이 아니라 날짜 붙은 빌드를 냈다. 벤더 넷과 연구 그룹 넷이 한 주에 반대 방향에서 같은 말을 했다: 숫자는 움직였고 모델은 움직이지 않았다.
귀결은 Eval Harness Configuration 에 떨어진다. 이 위키는 한 주 사이의 벤더 발표 Terminal-Bench 2.1 수치 셋 — 73.0, 80.4, 87.9 — 을 하네스 공개 없이 보유하고 있고, DarwinX 는 하네스 탐색만으로 같은 베이스 위 +7.7점을 보고한다. 그 폭은 더 이상 두 모델에 대한 증거가 아니다.
2. "오픈 웨이트" 가 날짜가 됐다
Open-Weights Policy Fight 는 약속인 첫 항목을 얻었다: GLM-5.3 은 내려받을 것이 아무것도 없는 채로 오픈 웨이트 왕관을 주장하고, 가중치는 2026-08-28 무렵으로 예정돼 있다. Qwen 은 같은 순서의 완결판을 돌렸다 — 비공개 프리뷰, 유료 API, 오픈 웨이트, 24일 — 그리고 두 번째 체크포인트를 1차 채널에서 날짜를 다시 말하는 일 없이 나흘 늦췄다.
그리고 이번 주는 빠져 있던 측정도 내놓았다. Artificial Analysis 가 Qwen3.8 의 두 형태를 싣고 같은 점수를 준다: Max 58, 공개 2.4T A95B 58. 이 일정이 무엇을 위한 것이든 품질의 할인은 아니다 — 넘겨받은 산출물이 팔던 산출물과 같다. 지연이 사는 것은 유료 창이고, 이번 주에 공개된 무엇도 그 독해를 "안전성 평가에 2주가 걸린다" 와 구별해 주지 않는다.
3. 사라진 분모
한 주 전체를 가로질러야 보이는 패턴: 거의 모든 헤드라인 수치가 독자로 하여금 그것을 판단하게 해 줄 두 번째 숫자 없이 나왔다. Anthropic 의 auto mode 는 89% 재현율을 내면서 오탐률은 내지 않았다(더 날카로운 짝지어진 수치 — 사람이 승인한 명령 800건 차단 대 그 반대 6건 — 는 냈다). SL2T 는 정확도 수치 없이 나왔다. OpenAI 의 Ultrafast 는 "Sol Standard 와 같은 지능" 을 벤치마크 없이, 가격 없이 주장한다. GLM-5.3 은 토큰 단가가 없다. Grok 4.6 은 모델 카드 없이 아흐레를 보냈다. Conceptual Reasoning Index (CRI) 는 검증 불가능한 질문에 대한 추론을 채점하면서 그런 벤치마크가 스스로 어떻게 검증되는지는 말하지 않는다. Mechanist 는 수치를 아예 내지 않는다. DarwinX 는 +17점을 만드는 루프의 연산 비용을 내지 않는다.
잦아드는 주제
- 헤드라인으로서의 파라미터 수. 이번 주 어느 릴리스도 그것을 앞세우지 않았고, 둘(GLM-5.3 과 Gemini 3.7 Flash)은 새로 학습한 것이 없다고 굳이 밝혔다. Grok 4.6 의 2T 대 1.5T 다툼은 이제 아흐레째이고 그것을 정리할 벤더 페이지가 없으며, 이번 주에 공개된 무엇도 그것을 언급하지 않았다.
- 중국 랩이 뒤처져 있다는 틀. 이번 주 자신의 측정이 양방향에서 그것을 살려 두지 않았다: Qwen3.8 의 지수 58 은 이 위키가 프런티어라고 부르는 모든 모델 아래이고, 동시에 그 공개 체크포인트는 유료본과 정확히 같다. 두 사실 모두 그 틀보다 덜 자극적이고 더 쓸모 있다.
뜻밖의 결과
- 공개된 Qwen 체크포인트가 그것을 잘라낸 API 와 같은 점수를 낸다 — 58 대 58, 작업당 $1.09 대 $1.13. 유일한 차이는 명시된 1M 에 대한 984k 컨텍스트 윈도이고, 이는 가중치를 서빙하는 쪽의 속성이다.
- DeepSeek 자신의 수치와 독립 수치가 움직임의 자릿수에서 어긋난다 — 벤더 발표는 15~50점, Artificial Analysis 의 이동은 정확히 한 점. 둘 다 페이지에 있고 평균 내지 않았다.
- LMArena 상위 셋이 모두 Anthropic 이고 그 순서는 오차 막대 안에 있다 — 12.19% ±1.45%, 12.01% ±2.57%, 11.95% ±1.71% 이고 1위와 3위는 0.24 퍼센트포인트 차이다. Anthropic 릴리스가 하나도 없던 주에 셋 모두 올랐다.
- Anthropic 이 예정된 50% 인상을 취소했다 — Claude Sonnet 5 의 $2/$10 per M 을 영구화했다. 움직이지 않음으로써 아래로 움직인 올해 첫 가격이다.
열린 논쟁
- 단계적 오픈 웨이트 릴리스는 규범의 도착인가, 오픈 딱지를 붙인 유료 창인가? GLM-5.3 은 2주 간극의 이유로 안전성 평가를 든다. 같은 랩이 6월에는 구독자 접근과 오픈 웨이트를 사흘 간격으로 두었다. 공개된 무엇도 두 독해를 가르지 않고, 2026-08-28 이 이 질문이 논쟁 대신 답을 얻는 날이다.
- 하네스 없는 벤치마크 수치는 무슨 의미가 있는가? 이번 주는 양쪽에 증거를 댄다: Qwen 은 네 행 중 하나에 하네스를 공개했고, 논문 넷은 공개되지 않은 항이 벤더들의 공개 수치 사이 격차보다 값어치가 크다는 것을 실증했다.
- 자동화된 연구자가 내놓은 발견은 누가 확인하는가? Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence (arXiv:2608.12036) 는 믿음의 메커니즘 이론과 모달리티를 넘는 안전 위험을 에이전트가 끝까지 발견했다고 보고하면서 독립적인 검증은 기술하지 않는다 — Automated Weak-to-Strong Researcher (AAR) 가 제기한 질문이 이제 구체적인 주장에 붙은 것이다.
전망
날짜가 붙은 확인 대상이 둘이다. GLM-5.3 의 가중치가 2026-08-28 무렵 돌아올 예정이고, 그것이 Open-Weights Policy Fight 의 최신 항목을 약속에서 산출물이나 패턴 중 하나로 바꾼다. 그리고 Grok 4.7 이 xAI 가 밝힌 월간 케이던스상 2026-08-22 무렵을 겨냥한다 — 4.6 에 아직 모델 카드가 없으므로 볼 것은 날짜가 아니라 사양이 함께 나오는지 여부다.
이 주가 여는 더 큰 질문은 모델 페이지가 무엇을 위한 것인가다. 이 위키의 ## Spec 과
## Benchmarks 표는 모델이 역량의 단위라고 가정한다. 논문 넷과 릴리스 넷이 방금 그렇지
않다고 논증했다 — 그리고 이제 그 차이를 지고 있는 하네스도 라우터도, 이 분야 어디에서도
페이지도, 버전도, 공개된 오류율도 갖고 있지 않다.
Referenced by
Sources
- briefs/daily/2026-08-10.md
- briefs/daily/2026-08-11.md
- briefs/daily/2026-08-12.md
- briefs/daily/2026-08-13.md
- briefs/daily/2026-08-14.md
- briefs/daily/2026-08-15.md
- briefs/daily/2026-08-16.md