$ cat wiki/trends/2026-09.md
2026년 9월 — 월간 다이제스트
기간
2026-09-01 ~ 2026-09-30, Weekly Synthesis — W36 (2026-08-31 → 2026-09-06), Weekly Synthesis — W37 (2026-09-07 → 2026-09-13), Weekly Synthesis — W38 (2026-09-14 → 2026-09-20), 2026-W39 주간 종합에 더해 W40에 속하는 그달 마지막 사흘의 일일 기록을 함께 읽었다.
이것은 덜어내는 문서다. 9월에 일일 브리프의 머리를 차지했던 것 대부분은 아래에 없다.
주목할 출시
프런티어 모델 여섯 개가 나왔고 그중 어느 둘도 공통 벤치마크로 이어지지 않는다. GPT-6 Astra(09-03)는 $10/M · $50/M 에 1,050,000 토큰 컨텍스트; Claude Opus 5.5(09-22)는 $4/M · $20/M; GPT-6 Sol과 GPT-6 Luna가 같은 날; Grok 4.7(09-21)은 전작 1.5T에 대해 2.1T 파라미터; Claude Sonnet 5.5(09-28); 그리고 GPT-6.1 Sol(09-29). Anthropic은 Opus 5.5 출시 표에서 SWE-bench를 뺐다. OpenAI는 가격을 두 번에 걸쳐 절반으로 내리면서 벤치마크 하나를 근거로 내놓았다. Astra의 수치는 Opus 5.5의 수치와 나란히 놓이지 않고, 그달 말에 GPT-6.1 Sol은 그 앞 엿새 동안 나온 어떤 모델과도 벤치마크를 공유하지 않았다.
오픈 웨이트의 선두가 프런티어 연구소들의 손을 떠났다. MiMo-V2.6-Pro (Xiaomi, 09-22)가 오픈 웨이트 종합 지표의 최상단을 차지했고 — 총 1.02T / 활성 42B, MIT, RL 스택과 학습 환경까지 함께 — 그 연구소는 휴대폰 제조사다. Institute of Foundation Models (IFM)은 0.9B부터 375B까지 여섯 모델을 학습 데이터와 함께 공개했다(09-03). Ant Group (inclusionAI / AntLing)은 MIT 라이선스 두 건을 냈고, 이 위키가 어떤 중국 모델에 대해서도 보유한 가장 관대한 조건이다. 셋 다 한 주 전에는 이곳에 페이지가 없었다.
그리고 한 출시는 10월에도 여전히 조건을 정하고 있다: GLM-5.3, 9월은 조용했고 측정은 29일에 도착했다.
부상하는 주제
1 — 도구를 쥔 쪽이 측정되는 쪽이다. 이것은 네 연구소가 자기 작업을 자기가 채점한다는 W38의 관찰로 시작했다. 그달이 끝날 때 그것은 이 분야의 중심적인 방법론 문제가 되었고, 가장 날카로운 사례가 9월을 닫은 것이다: Z.ai 자신의 모델 카드는 GLM-5.3의 ExploitBench를 54.4, GLM-5.2를 24.4 로 적고, Anthropic의 독립 측정은 GLM-5.3을 12%, GLM-5.2를 거의 0 으로 적는다. 순위는 양쪽 측정에서 살아남고 크기는 다섯 배 차이가 난다. Z.ai는 자기 harness를 명시하고, 여기서 팔 물건이 없는 쪽인 Anthropic은 명시하지 않는다. Eval Harness Configuration 참조 — 그곳에서 이 문제는 이제 비교 가능성이 아니라 계수 가능성의 문제다. 하나의 벤치마크 이름 아래 두 개의 참인 행이 있고, 어떤 자동화된 것도 그 충돌을 볼 수 없다.
2 — 격리는 세 연구소의 이야기이기를 그쳤고, 평가에 관한 이야기이기도 그쳤다. 9월은 일곱 번째 사건, 그것도 아무도 공개하지 않은 첫 사건과, 1월로 거슬러 올라가는 네 번째 Anthropic 위반으로 열렸다. 그달 중순에는 외주 업체가 수행한 평가가 외부 회사 세 곳에 닿았다. 28일에는 개념이 세 갈래로 갈라졌다 — Eval Environment Containment는 평가받는 모델의 쓰기 표면을 가두고, Agent Runtime Containment는 실행 중인 에이전트를 커널에서 가두며, Safety Cases는 학습 실행을 논증된 주장으로서 가둔다. 그달은 OpenAI가, 사용자가 로그아웃한 뒤에도 계속 일하고 각자 클라우드 컴퓨터와 브라우저를 가지며 사이버 부문 Critical로 분류된 모델 위에서 돌아가는 에이전트를 출하하면서 닫혔다.
3 — 가격이 제품 주장이 되었고, 그 주장들은 두 번 읽어야 한다. Opus 5.5의 판매 문구는 비용 약 40% 절감이었다. Sonnet 5.5의 "up to 30% less" 는 요율이 아니라 소비 토큰에 관한 것이었다. GPT-6.1 Sol의 "one-fifth of the price" 는 정확하다 — 다른 모델인 Astra에 대해 그렇고, 동시에 이레 전 GPT-6 Sol과 동일하다. 같은 주에 소비자 요금제는 반대로 움직였다: $200로 살 수 있는 것이 절반이 되었다. 이것이 그달에서 가장 일관된 패턴이며, 헤드라인만으로는 가장 잘못 읽힐 것이다.
4 — 증류가 증거 없는 이름 붙은 고발이 되었다. 10일에 Alibaba / Qwen AI Lab를 겨냥한
GTG-16005 — 1억 5,100만 건의 교환, 세 세대의 Qwen을 학습시켰다는 기록. 30일에
Moonshot AI을 겨냥한 OpenAI — 최대 프롬프트 16,000건, 사용자 15,000명 초과, 그리고
아무것도 깨뜨리지 않은 기법: 암호화된 추론을 한 대화에서 복사해 두 번째 모델 인스턴스에 전사를
맡겼다. 두 고발은 네 자릿수 규모 차이가 나고, 어떤 전이가 완료되었는지에 대해 서로 다르며,
어느 고발자도 증거를 공개하지 않았다. Adversarial Distillation 참조.
잦아드는 주제
- 파라미터 수를 헤드라인으로 쓰는 것. Grok 4.7의 2.1T는 그달에서 가장 큰 숫자였고 가장 적게 논의되었다. MiMo의 1.02T가 중요했던 것은 라이선스 때문이다.
- 프런티어 연구소의 오픈 웨이트 독점 — 더는 다투어지지 않고, 그냥 끝났다.
- 역량 이야기로서의 에이전트 코딩. 이제 가격 이야기다.
조용해진 주장
- 수학 벤치마크에 관한 필즈상 수상자 25인의 서한(09-11)은 공개된 점수의 한 부류 전체가 잘못 겨냥되었다고 주장했음에도 09-14 이후 언급되지 않았다.
- 2억 3,000만 URL 법률 색인을 판매하는 구성인 Astra for Law(09-17)는 09-19 이후 다시 나오지 않았다.
- DeepMind Institute(09-16) — 에세이 넷, 디렉터 셋 — 은 지나가는 언급 두 번을 남기고 이후 산출물이 없다.
뜻밖의 결과
- 내려받을 수 있는 모델이 Anthropic의 가장 사이버 역량이 높은 시스템과 두 점 차이에 이르렀고, 그 안전장치는 $4,400에 벗겨졌다. GLM-5.3은 410회 중 50회 종단 익스플로잇을 개발하며 Claude Mythos Preview의 410회 중 56회에 대비되는데, 시험된 다른 모든 모델은 거의 0이었다. 하루 동안, 제한된 사람의 주의만으로, 알려지지 않은 브라우저 취약점을 찾아 드라이브바이 파일 읽기로 엮었다. abliteration은 한 번도 시도해 본 적 없는 팀에게 2,200 GPU 시간이 들었다.
- 모두가 요구하던 표준 기구는 아홉 달 전부터 있었다. AI Evaluator Forum (AEF)은 2025년 12월에 설립되어 이미 AEF-1을 발표한 상태였고, 그러는 동안 속도 조절 논쟁은 대체 누가 프런티어 연구소를 검토할 수 있느냐를 묻고 있었다.
- 26%는 그 헤드라인들보다 작은 주장이다. AI가 자기 AI 연구를 얼마나 하는지에 대한 Anthropic의 첫 공개 수치 — "AI가 주도" 수준에서 26%, 최상위 수준에서는 없음 — 는 그달 내내 이곳에서 가장 많이 인용된 숫자로 살아남았고, 어디서나 그것이 말하는 것보다 큰 것으로 보도되었다.
열린 논쟁
- 4개월 지체가 무엇을 뜻하는가. NIST의 평가 기구는 가장 역량 높은 오픈 웨이트 사이버 모델을 미국 프런티어보다 약 4개월 뒤로 두었다. 안전장치가 있는 4개월 역량 지체와 없는 4개월 지체는 같은 대상이 아니며, Frontier Pacing은 전자만 측정해 왔다.
- 명세가 시스템에 이유로 닿아야 하는가 기제로 닿아야 하는가. Anthropic의 중간학습 연구는 규칙 뒤의 가치를 설명하는 것이 가장 잘 일반화된다고 본다. 9월의 어떤 멀티에이전트 결과는 실행 가능한 바인딩으로서의 규칙이 문서로서의 같은 규칙을 6.5점 앞선다고 본다. 둘 다 같은 질문에 대한 2026년의 결과다.
- 자기개선이 잦아들었는가. W38은 그것을 사그라지는 헤드라인으로 기록했다. 이후 일일 기록 여덟 건에 등장했고 가장 최근은 29일이므로, 잦아든 것은 연구가 아니라 보도였다.
전망
그달의 미결 사안은 증거다. 두 연구소가 자기들만 볼 수 있는 숫자로 경쟁사를 절도로 고발했고, 한 연구소가 경쟁사 모델을 측정해 그 경쟁사 자신의 카드와 다섯 배 차이로 어긋났고, 정부 포털이 공개된 평가 없이 상용 모델 두 개 위에서 가동되었고, 이 위키에서 가장 많이 인용된 숫자는 자기 보고다. 9월은 이곳의 어느 달보다 많은 측정을 만들어 냈고, 그중 발표하는 당사자 외부에서 확인할 수 있는 것은 더 적었다.
지켜볼 것은 도구가 도착하는지다: 아무도 발동시키지 않은 표준을 가진 평가자 포럼, 대화 기록을 신뢰할 필요가 없는 산출물 검증 벤치마크, 그리고 주장에 출처가 있는지가 아니라 옳은 출처가 있는지를 묻는 검증 방법.
Sources
- ai-trend-notifier-wiki/trends/2026-W36.md
- ai-trend-notifier-wiki/trends/2026-W37.md
- ai-trend-notifier-wiki/trends/2026-W38.md
- ai-trend-notifier-wiki/trends/2026-W39.md
- ai-trend-notifier-wiki/log.md