AI Trend Notifier
EN한
← wiki

$ cat wiki/trends/2026-W39.md

주간 종합 — W39 (2026-09-21 → 2026-09-27)

기간

2026-09-21 ~ 2026-09-27.

주 중반 24시간 안에 프런티어 모델 세 개가 출시되었고 그중 어느 둘도 공통 벤치마크를 공개하지 않았다. 나머지 한 주가 다른 형태로 계속 되풀이한 사실이 그것이다: 모델이 무엇인지는 사기 쉬워지고 비교하기 어려워졌다.

한 주의 다른 절반은 누가 검사할 자격을 갖는가에 관한 것이었다. 랩이 embedded auditor 를 들이자는 에세이가 월요일에 연방 반독점 소장이 되고, 수요일에 안전보장이사회 브리핑이 되고, 금요일까지 미국 주지사 세 명의 행정명령 조항이 되었다 — 제안에서 법안 초안까지 엿새로, Frontier Pacing 이 기록한 가장 빠른 채택이다. 그사이 그중 무엇이든 가려낼 계측기들은 계속 숫자 없이 도착했다.

주목할 출시

프런티어 모델 셋, 하루, 공유 벤치마크 없음.

  • Claude Opus 5.5 — Anthropic, 2026-09-22. claude-opus-5-5, 입력 $4/M · 출력 $20/M, 캐시 읽기 $0.20/M, 1M 컨텍스트, 128K 최대 출력, 대부분의 작업에서 Claude Fable 5.1 수준을 Opus 5 대비 약 40% 낮은 비용으로 낸다고 진술된다. 홍보 전체가 가격이고, 그렇게 하면서 출시 표에서 SWE-bench 를 뺐다. 대신 공개된 것: Terminal-Bench 4.0, FrontierCode, CursorBench.
  • GPT-6 Sol 과 GPT-6 Luna — OpenAI, 2026-09-22. 가격을 두 번에 걸쳐 반으로 접었고, 그것을 정당화하려 벤치마크 정확히 하나 (DeepSWE v1.1) 를 내놓았다. Luna 는 Artificial Analysis 캡처에서 Cost per Task $0.0045 에 이른다 — 269행 표에서 가장 싼 수치다.
  • MiMo-V2.6-Pro — Xiaomi, 2026-09-22. Artificial Analysis 종합에서 최고 오픈 웨이트 모델이 이제 휴대폰 제조사의 것이고, 학습 환경까지 함께 출시되었다. 그 종합에만 보고되며 벤더 벤치마크 표가 따라오지 않는다.
  • Grok 4.7 — xAI, 2026-09-21. 2.1T 파라미터, Grok 4.6 의 1.5T 대비. 500K 컨텍스트, 200K 이하에서는 이전 모델과 같은 가격.

그리고 한 주 안에 라이선스 둘이 반대 방향으로 움직였다. Qwen-Image-2.1 (2026-09-20) 은 이 위키가 기록한 첫 Alibaba / Qwen AI Lab 비상업 조건 출시이고, Ming-Image-0.1-Design (2026-09-22) 과 Ling-3.0-tiny 은 둘 다 MIT 로, 월요일에는 여기 페이지도 없던 랩 Ant Group (inclusionAI / AntLing) 의 것이다. 같은 모달리티, 이틀 차이, 반대 방향이므로 Alibaba 의 변화를 설명하는 것은 관할권이 아니다.

부상하는 주제

1. embedded auditor 가 제안에서 벗어났다

Embedded Evaluation 은 두 달 동안 이 기제를 랩이 자기 자신에 대해 제안하는 것으로 보유해 왔다. 이레 만에 그것은 상대방, 법정, 법안 초안을 얻었다.

  • 2026-09-18: 반독점 집단소송 Buist v. Anthropic PBC, No. 3:26-cv-10693 (N.D. Cal.) — Amodei 자신의 pacing 에세이가 증거이며, 그가 그것을 발표한 엿새 뒤 제기되었다.
  • 2026-09-23: Amodei 가 그 계획을 UN 안전보장이사회 제10228차 회의로 가져간다. 반독점 면제가 필요한 부분을 두고 소송을 당한 닷새 뒤다.
  • 2026-09-18 ~ 09-22: California EO N-9-26, Illinois EO 2026-07, Oregon EO No. 26-26. California 는 Government Operations Agency 에 2026-11-16 까지 주법이 최대 개발사의 랩 안에 독립 감사인을 상주시켜야 하는지, 그리고 보고 대상 사건에 통제 상실을 포함하도록 확대해야 하는지 권고하도록 한다.
  • 2026-09-16: OpenAI 가 자기가 평가받는 방식에 관한 원칙을 공개하고 평가자를 지명하지 않는다. 그 일을 할 기구는 아홉 달 전부터 있었다 — AI Evaluator Forum (AEF) 이고, 그 AEF-1 은 Frontier Pacing 이 보유한 첫 문서화된 표준이다.

kill switch 는 반대로 움직이며 그것이 이 주의 가장 날카로운 거버넌스 세부다. 그것은 주 행정명령 둘에는 있고 이 위키가 보유한 어느 랩 제안에도 없다 — 그리고 정부가 부과하는 차단은 반독점 면제를 필요로 하지 않는데, 바로 그것이 Buist 가 다투는 지점이다.

2. 모두가 단언해 온 것에 대한 벤치마크가 도착했고, 부족하게 돌아왔다

이번 주 계측기 네 개가 시스템이 자기 행동으로부터 배울 수 있는지를 측정한다. 그중 어느 것도 그것을 신뢰성 있게 하는 시스템을 보고하지 않는다.

  • ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds — 규칙이 친숙한 지식과 충돌하여 회상이 탐색을 대체할 수 없는 실행 가능한 낯선 세계; 각각 결함 있는 매뉴얼을 동반한다. 10개 시스템 가운데 가장 강한 것들은 낯선 규칙을 실제로 획득하고 — 탐색을 계속하면 정체하거나 앞선 이득을 되돌릴 수 있다.
  • 2609.27490 WhatWorkedBench — 그리고 그 결과가 불편한 쪽이다: 에이전트 자신의 관측에 맞춘 Gaussian process 가 실험 효과를 에이전트보다 더 잘 회복한다, 0.632 → 0.698. 정보는 에이전트가 직접 수집한 증거 안에 있었다.
  • HappyWorld-Bench — world model 을 시각 품질이 아니라 개입 하의 상태 일관성으로 평가한다. 공간 시스템은 배치 정확도 최대 70.14% 와 편집 실행 73.33% 에 이르고, 영상 시스템은 긴 롤아웃에서 일관성을 잃는다.
  • R&D Automation Index 는 AI 가 수행한 R&D 의 표준 수치로 AL4 에서 26% 를 보유한다. 이 넷은 그 수치가 전제하는 단계를 측정한다.

3. 프로비넌스가 나흘 안에 셋으로 갈라졌다

이번 주에 모두 캡처된 실시간 생성 영상 모델 셋, 서로 다른 세 답:

모델프로비넌스
Gemini 3.8 Live생성된 모든 프레임에 SynthID — 이름이 있고 공개된 방식
Muse Realtime Avatar모든 출력에 AI 워터마크, 기제는 이름 없음
GWM Worlds 2어떤 종류도 없음
Runway 행이 붙들 만한 쪽이다: **길이 제한 없이 실시간으로 조종되는 포토리얼 영상과
오디오**를 내보내면서, 다른 둘이 역량에서 따라가려는 바로 그 모델이다.
Content Provenance (AI output marking) 는 이제 공개 정도와 반대로 달리는 역량 기울기를 갖는다.

4. 에이전트 논문들이 미리 결정하는 구성 요소를 지우기 시작했다

이레 동안 논문 다섯 편이 각각 증거가 도착하기 전에 확정하도록 만들어진 무언가를 제거했다: Harness-Zero: Harness Distillation via Agent-as-Harness (스캐폴드), Agensh: Scaling Organizational Intelligence to 1,024 Agents (오케스트레이터), Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents (쓰기 시점 메모리 큐레이션), Agent-Editing World Model: Rethinking World Modeling for LLM Agents (도구 응답 예측), Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms (풀린 기제에서 환경을 생성함으로써 손으로 쓰인 보상).

그리고 반례가 하나 나왔고, 그래서 이것은 추세가 아니라 논쟁이다. SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue 은 발화자 귀속은 쓰기 시점에 만들어야 한다고 논증한다. 뒤섞인 전사에서 나중에 복원할 수 없기 때문이다. JitMem 과 하루 차이로 발표되었고, 어느 쪽도 서로를 인용하지 않는다.

잦아드는 주제

  • 벤더 간 벤치마크 비교. 하루에 플래그십 셋이 공유 점수 없이 나온 것은 타이밍의 우연이 아니다. 이 위키가 할 수 있는 모든 비교가 구조적 — 가격, 라이선스, 컨텍스트, 가용성 — 이고 숫자가 아니었던 두 번째 연속 주다.
  • 대표 수치로서의 파라미터 수. Grok 4.7 의 2.1T 와 Qwen 의 5–10T 로드맵 모두 7.9B 모델의 라이선스보다 적은 주목을 받으며 지나갔다.
  • 오픈 웨이트에 대한 프런티어 랩의 독점. 이번 주 최고 오픈 웨이트 종합 점수는 휴대폰 제조사의 것이고, 가장 관대한 라이선스는 결제 회사의 연구 조직의 것이다.

뜻밖의 결과

  • 한 벤더 자신의 코딩 도구가 사용자의 리포지터리를 자격증명까지 포함해 업로드하고 있었다 — 그리고 이 위키는 다섯 주 전에 같은 도구를 Z.ai 의 보안 제품으로 기록했다.
  • 이번 주 프런티어 가격 인하를 얻는 가장 값싼 방법은 벤치마크를 더 적게 공개하는 것이었다. Anthropic 과 OpenAI 모두 가격을 내리면서 출시 표를 줄였고, Anthropic 은 업계에서 가장 많이 인용되는 코딩 벤치마크를 자기 발표에서 뺐다.
  • 공개 사후 학습 레시피가 베이스 모델의 랩 자신을 이긴다고 주장한다 — Rufus-Air: An Open LLM Post-Training Recipe, GLM-4.5-Air-Base 위의 여덟 직렬 단계, 새 사람 주석도 증류 교사도 없이 — 그리고 어떤 수치도 공개하지 않는다.
  • DNA 를 21시간 읽은 950개 에이전트가 아무도 특성을 밝히지 않았던 효소 시스템을 내놓았다. Anthropic 의 ART 발견은 산출이 점수가 아니라 데이터베이스 안의 물리적 대상인, 이 위키가 보유한 유일한 자율 연구 주장이다 — 그리고 발견된 것의 기능은 알려지지 않았고, Anthropic 이 그렇게 명시한다.
  • 프런티어 어텐션 레시피가 활성 1.3B 파라미터에 이르렀다. Ling-3.0-tiny 의 하이브리드 KDA + MLA 스택은 이전까지 프런티어 규모에서만 검증되었다고 진술되며, 2026-08-06 이후 MIT 로 다운로드 가능한 상태로 그 위에 만들어진 것이 아무것도 없다.

열린 논쟁

  • 에이전트는 쿼리가 도착하기 전에 무엇이든 유도해야 하는가? JitMem 은 아니라고 하고 SpeakerMem-R1 은 일부는 그래야 한다고 한다. 둘은 서로 다른 정보에 대해 옳고, 어느 것이 어느 쪽인지 아무도 적어 두지 않았다.
  • 누가 감사인을 고르는가? OpenAI 는 규칙을 공개하고 평가자를 지명하지 않았고, Anthropic 은 Accenture 를 지명하고 상대방에 대한 같은 날 반박을 받았고, 두 주가 대신 고르자고 제안하며, 아홉 달 된 컨소시엄이 이미 표준을 써 두었다. 답이 넷, 기제는 없다.
  • 이번 달 "오픈 웨이트" 는 무엇을 뜻하는가? 이번 주 그것은 MIT, 비상업 연구 라이선스, 그리고 — 읽지 못한 라이선스가 사실이라면 — 유럽연합, 영국, 대한민국을 제외하는 조건에 모두 쓰였다.
  • 리더보드 종합은 벤치마크인가? 이번 주 출시 셋은 이 위키에 오직 Artificial Analysis Intelligence Index 행으로만 알려져 있고, 그중 둘은 의미가 HTML 에 없는 발행자의 별표를 달고 있다.
  • world model 이란 무엇인가? World Models 는 양립하지 않는 두 의미를 보유한다. HappyWorld-Bench 는 둘을 모두 평가한다 — 세 개의 독립 트랙에서, 즉 공유된 하네스이고 아직 공유된 지표는 아니다.

전망

  • 2026-11-16 이 붙들어야 할 날짜다: kill switch 와 embedded auditor 에 관한 California Government Operations Agency 권고. Illinois AI Cabinet 임명은 "앞으로 몇 주 안" 이고 의회는 11월 말에 복귀한다.
  • Buist v. Anthropic PBC 는 에세이를 중심 증거물로 삼아 진행된다. 이제 조율에 관한 논리를 발표하는 랩은 살아 있는 사건 기록에 쓰는 것이다.
  • 벤치마크 가뭄은 나아지기 전에 더 나빠질 것으로 본다. 이번 주 새 평가 계측기 넷이 도착했고 어느 것도 지명된 시스템의 점수를 보고하지 않는다 — ExplorationBench 는 10개 시스템 중 어느 것도, HappyWorld-Bench 는 31개 중 어느 것도 지명하지 않는다.
  • Ling-3.0-tiny 위에 무엇이 만들어지는지 주시할 것. MIT, 52일, 엣지 규모의 프런티어 어텐션, 파생물 0. Ternary Bonsai 2 27B 는 누군가 들여다볼 때 관대한 라이선스가 무엇을 가능케 하는지의 선례다.
  • Gemini 4 는 미출시로 남아 있고, 그 랩의 SVP 가 2026년 말보다 "much earlier" 를 희망한다고 보도되었으나 달은 지명되지 않았다.

Sources

  • briefs/daily/2026-09-21.md
  • briefs/daily/2026-09-22.md
  • briefs/daily/2026-09-23.md
  • briefs/daily/2026-09-24.md
  • briefs/daily/2026-09-25.md
  • briefs/daily/2026-09-26.md
  • briefs/daily/2026-09-27.md