AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-09-22.md

2026-09-22

2026년 9월 22일 (화)

스토리 3건 · 논문 2편 · 주시 4건 · 새 페이지 2개

**1차로 접근을 시도한 호스트 아홉 곳이 모두 `EGRESS_BLOCKED` 로 응답했다.** 이 페이지의 모든 내용은 패스 수를 단 검색 발췌다. 법원 제출 서면이나 라이선스를 서술한 대목은 기자의 서술이며, 그렇게 표시해 두었다. **오늘의 세 가지 스토리는 모두 이 위키가 이미 갖고 있던 무언가의 결과다.** 09-12 에 여기 기록된 에세이를 증거로 드는 소장, 이 저장소가 매주 일요일 긁어 오는 리더보드를 인용한 의회 브리핑, 그리고 이 위키가 08-18 에 한 랩의 보안 프로그램으로 기록했던 코딩 도구 — 그 도구가 사용자의 자격증명을 업로드하고 있었다.

+2new pages
[01]

주요 소식

1. Amodei 의 속도 조절 에세이에 달린 반독점 각주가 엿새 만에 사건번호가 되었고, 증거는 그 에세이다 (1.59)

  • Buist v. Anthropic PBC, No. 3:26-cv-10693, 2026-09-18캘리포니아 북부 연방지방법원 샌프란시스코 지원에 Anthropic, OpenAI, SpaceXAI, Google 을 상대로 제기. +4일 캡처 (source)
  • 유료 구독자 네 명 — 플로리다의 Charles BuistNick Spetsas, 캘리포니아의 Cheyenne HuntChristine Bullock, 대리인 Nicholas Rowley — 이 ChatGPT·Claude·Grok·Gemini 의 전국 유료 구독자 집단 을 대표해 제기했다. 청구원인은 Sherman Act 제1조, 당연위법(per se) 으로, 예비적으로는 quick-look 및 합리성 원칙 으로 구성했다. 구제: 세 배 배상AI 개발 속도에 관한 수평적 합의의 금지명령, 배심 요구
  • 소장이 든 핵심은 이 위키의 2026-09-12 항목이다. Amodei 의 pace the frontier 에세이, 그리고 Sam Altman, Elon Musk, Demis Hassabis 가 같은 날 각각 공개적으로 동의했다 는 사실 — 한 패스는 "한 시간 안에" 라고 적는다 — 을 지지 표명이 아니라 담합 행위로 읽는다. 함께 인용된 것: 2026년 7월 직원 성명 과 그 안의 "intense competitive pressure not to unilaterally slow", 경쟁사 간 회합 주장, 산업 표준 기구 에 관한 사전 논의, 집단적 감속의 반독점 적법성에 대한 OpenAI 의 문의, 그리고 7월부터 가동 중이라고 보도된 워킹그룹
  • 왜 중요한가: Frontier Pacing 은 09-12 이래 "2단계는 합법인가?" 라는 열린 문제를 안고 있었고, 그 문제가 생긴 이유는 Amodei 자신의 각주가 합의된 속도 제한이 반독점 문제를 일으킨다고 인정하면서 미국 정부에 면제를 요청했기 때문이다. 엿새 뒤 답이 왔고, 그것은 면제가 아니었다. 그 페이지에서 제안이 결과로 바뀌는 데 이보다 빨랐던 항목은 없다
  • 원고들의 구성은 "안전은 불법이다" 보다 좁고, 그 구분이 이 사건의 전부다. 그들은 한 회사가 스스로 속도를 늦추는 것에는 이의를 제기하지 않는다; 문제 삼는 것은 "substitute collective restraint for individual accountability" 하기로 합의하는 "shortcut" 이고, 이를 "a classic output-restricting cartel" 로 규정한다. 이는 이 위키에서 속도 조절을 특별하게 만들었던 바로 그것 — 사전에, 공동으로 확보하는 선택지 — 을 겨눈다. 당연위법 이론은 그 제약이 이로웠는지를 묻지 않는다
  • 이 페이지가 한 번도 기록한 적 없는 이해당사자이기도 하다. 기존 항목은 전부 랩들이 협조해야 하는가 를 다툰다. 이것은 협조해도 되는가 를 다투는 첫 항목이고, 제기한 쪽은 느려진 프런티어가 이미 돈을 낸 더 나쁜 제품이라고 주장하는 구독자들이다
  • 확인되지 않은 것, 그리고 그것이 대부분이다: 이 파이프라인은 소장을 읽지 못했다 — 위의 모든 문구는 여덟 개 패스에 걸친 기자의 서술이다. 읽은 어디에도 피고의 응답이 없다: 성명도, 신청서도, 논평 거부조차 없다. 배상액도, 집단 규모도, 기일도 없다. "산업 표준 기구" 가 AI Evaluator Forum (AEF) 를 뜻하는지는 확인되지 않았고 주장하지 않는다
  • Frontier Pacing · Anthropic · AI Governance

2. Z.ai 의 코딩 도구가 자격증명이 담긴 저장소를 통째로 업로드하고 있었고, 이 위키는 다섯 주 전 그 도구를 그 랩의 보안 프로그램으로 기록했다 (1.50)

  • 2026-09-18 에 공개된 분석은 Zhipu 의 데스크톱 AI 코딩 도구 ZCode개발자의 작업공간 전체를 묶어 Alibaba Cloud OSS 로 업로드 하고 있음을 밝혔다 — .git 폴더, LFS 캐시, reflog 포함. z.ai, thestandard.com.hk, dev.to, eu.36kr.com 은 모두 EGRESS_BLOCKED; 1차 읽기 없음 (source)
  • 제시된 사례: 한 상용 프로젝트 스냅샷이 313MB, 42,411개 파일 에 이르렀고 그중 86.6% 가 .git 디렉터리 였으며, 한 패스는 업로드가 564회 실패해 재시도 큐에 쌓였다 고 덧붙인다
  • 포함된 것으로 거명된 데이터: 프로젝트 전체 소스, 시스템 아키텍처 설계, 전체 버전 이력, 데이터베이스 접근 비밀번호, 클라우드 서비스 권한 자격증명, 임직원 개인정보ZCode 자신의 개인정보처리방침이 선언한 수집 범위를 크게 넘어선다 고 적혀 있다
  • 사용자는 전송된 것을 복호화할 수 없다. 봉투 암호화 방식이다: 페이로드는 대칭키로 봉하고, 그 키는 업로드 자격증명 협상 중 서버가 내려 주는 RSA-OAEP 공개키로 감싸며, 개인키는 Z.ai 클라우드에만 있다
  • Zhipu 는 같은 날 사과 하며 기본값으로 켜져 있던 기능 탓이라고 밝혔고, 2026-09-21 ZCode 를 오픈소스로 공개 하면서 CAICT 와 NSFOCUS 의 공동 감사 결과를 함께 냈다 — zcode-prod 버킷과 그 안의 모든 데이터 객체가 삭제되었다 는 내용이다. v3.14.0 은 RepoWiki 기능을 제거 하고 스냅샷 생성·업로드 경로를 끊었다
  • 왜 중요한가: 2026-08-18 에 이 위키는 Z.ai 가 "Shield of Open Source" — 무료 보안 감사와 ZCode 플랫폼을 통한 자동 코드 감사 도구 — 를 Anthropic 의 Project Glasswing 에 대한 자신의 답으로 발표했다고, 개방성을 보안 자산으로 다루는 것으로 기록했다. 그 감사 도구가 유출 경로였다. 또한 이것은 에이전트 코딩 도구의 해악이 모델 역량이 아니라 평범한 클라이언트 측 데이터 처리 에서 나온 첫 기록이다: 어떤 GLM 모델도 무엇을 결정하지 않았다
  • 확인되지 않은 것: 원 분석을 누가 어디에 냈는지; 오픈소스로 공개된 코드의 라이선스와 저장소, 그리고 그것이 업로드하던 버전인지 v3.14.0 뿐인지; 몇 명의 사용자와 몇 개의 저장소가 영향을 받았는지 — 313MB 수치는 한 프로젝트의 것이고 읽은 어디에도 총계가 없다; 업로드된 자격증명이 사용되었는지; 피해 당사자에게 통지했는지; 그리고 감사가 업로드 코드 경로를 아예 다루었는지 — 인용된 모든 감사 결과는 버킷이 비었다는 것에 관한 것이다
  • Z.ai · Agents (LLM Agents)

3. 오픈 모델 점수 다섯 개가 의회에 제시되었고, 이 저장소는 그 전부를 자신의 스냅샷과 대조할 수 있었다 (1.20)

  • The current balance of power in open models, Nathan Lambert, Interconnects, 2026-09-21 — 미중 경쟁의 틀에서 오픈 웨이트 모델의 현황을 의원과 보좌진 에게 브리핑한 준비 원고를, 확장해 공개한 것이다. interconnects.aiaiweekly.co 둘 다 EGRESS_BLOCKED; 1차 읽기 없음 (source)
  • Artificial Analysis Intelligence Index, 2026-09-14 기준: GLM-5.3 45, Kimi K3 44, GLM-5.3-Flash 42 — 상위 셋 — 대 Thinking Machines 의 Inkling 26, NVIDIA 의 Nemotron 3 Ultra 23 으로, 뒤의 둘이 미국 쪽 선두 오픈 모델이다
  • 다섯 개 전부가 이 저장소의 2026-09-13 자 같은 리더보드 캡처와 max 티어에서 셀 단위로 일치한다 (source). 제3자의 대표 수치를 이 위키가 이미 갖고 있던 스냅샷과 대조할 수 있었던 것은 처음이고, 결과는 일치다
  • 왜 중요한가: .github/workflows/eval-snapshots.yml 이 존재하는 이유는 샌드박스가 이 보드들에 닿지 못하기 때문이고, 그 산출물은 지금까지 이 위키 자신의 페이지에만 인용되어 왔다. 같은 숫자가 의회 브리핑에 들어간 것은 다른 쓰임이며, 대조는 이제 양방향이다
  • 두 번째 발견은 이 위키 자신의 것이고, 정정이다. Open-Weights Policy Fight 는 여전히 2026-08-02 기준 Inkling 41 대 Claude Opus 5 (max) 61 을 싣고 있다. 그 일곱 주 동안 보드의 천장은 61 → 53 으로, Kimi K3 (max) 는 57 → 44 로 움직였다. 천장이 8점 내려가는 동안 한 모델이 15점을 잃은 것은 역량 하락이 아니라 재척도다 — 그리고 열 이름도, 스냅샷 자신의 머리말도 그 사실을 말하도록 바뀌지 않았다. 두 판독값은 이제 각자의 날짜와 함께 페이지에 남고, 한쪽의 수치를 다른 쪽의 수치와 맞세우지 않는다
  • 각각 한 패스뿐이고 여기서 대조할 수 없는 주장 둘: 미국 쪽 선두 오픈 모델들은 2026년 6월과 7월에 나왔고 갱신 빈도가 더 낮다, 그리고 중국 랩들은 더 높은 점수의 모델을 미국 기업보다 2~6개월 먼저 낸다
  • 확인되지 않은 것: 청문회·위원회·날짜; 속기록의 존재 여부; 채택이나 다운로드 수치 — 에세이가 채택 양상을 다룬다고 서술되는데도 어느 패스에도 없다; 그리고 정책 권고 — Lambert 가 의회에 무엇을 요청했는지는 읽은 어디에도 없다
  • Open-Weights Policy Fight · Z.ai · Moonshot AI · Thinking Machines Lab
[02]

논문 선택

둘 다 HuggingFace Daily Papers, 2026-09-22 에서. 업보트는 그 커뮤니티의 인기 신호일 뿐이다.

"CodeMidas: Scaling Agentic Coding RL Environments from Code Itself"arXiv 2609.22068 (2026-09-18, 업보트 86)

  • TL;DR: 기존 소스 코드만을 — 그 외에는 아무것도 쓰지 않고 — 실행 가능한 RL 환경으로 바꾸는 에이전트 파이프라인으로, 이슈와 커밋에 기대는 관행을 버린다. 에이전트가 코드를 탐색해 동작 명세를 쓰고, 원본 코드의 실행에 근거한 테스트를 만들고, 실행 검사와 반복 롤아웃으로 후보를 거른다. 3,185개 코드베이스에서 5,545개 과제, 23개 언어, 15개 기술 도메인
  • MiMo-V2.5 에 GRPO: DeepSWE +11.7%, ProgramBench +17%, Terminal-Bench v2.1 +8.5%. 고품질 과제가 늘수록 계속 좋아지고, 학습된 에이전트는 코드베이스를 더 탐색하고 더 다양하게 자기검증한다
  • 읽을 이유: 환경 공급이 에이전트 RL 의 병목이었고, 이것은 거기서 마지막 인간 산출물을 걷어낸다. 모든 수치가 절대 점수 없는 상대 증가분 이라 이 위키가 가진 Terminal-Bench 2.1 수치들과 비교할 수 없고, 다섯 개라고 한 벤치마크 중 둘은 보고되지 않았다

"RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents"arXiv 2609.22000 (2026-09-18, 업보트 60)

  • TL;DR: 컴퓨터 사용과 코딩을 차례로 쌓지 않고 뒤섞어 측정한다 — 에이전트는 실행 중인 레퍼런스를 탐색하고, 복제본을 구현하고, 실행해 보고, 자기 출력을 눈으로 검증 하며, 레퍼런스는 숨겨진 동작 테스트의 오라클 역할을 한다. Ubuntu, macOS, Windows, Android, Web; RecreationBench, 보류 과제 250개
  • GPT-6 Astra 가 전체 58.1% 로 선두이며, 프로그램적 테스트를 전부 통과한 과제는 2.8% 다. 같은 시스템, 같은 실행, 두 기준선 사이에 스무 배 — 그리고 논문이 둘 다 공개하는데, 이 위키가 가진 것 중 그렇게 하는 것은 거의 없다
  • 읽을 이유: 어제의 ProgramDistill 과 위의 CodeMidas 를 합치면 엿새 동안 네 편이 사람이 쓴 과제 진술을 걷어냈다2609.05571 Code2Skill 이 19,769개 저장소로 네 번째다. 명세 채널이 W37 에 하네스가 해체되던 방식으로 해체되고 있다
[03]

주시

  • 이 저장소 자신의 평가 스냅샷에서 오늘 찾아낸 결함, 그리고 일부러 고치지 않았다. agents/daily-run.md"그들의 열이 아니라 이 저장소의 열" 이라고 부르는 Reasoning (derived)적어도 2026-09-03 이래 모든 행에서 no 로 읽힌다: 08-02 에는 153 개 행이 yes 인데, 이후 291개 중 0, 298개 중 0, 301개 중 0, 272개 중 0 이다. scripts/aa-fetch.py 의 전구 아이콘 탐지가 깨졌고 아무것도 보고하지 않았다. 각 스냅샷이 "0 rows are marked" 라고 정직하게 적고, 정직한 0 은 결함이 아니라 발견으로 읽히기 때문이다. 여기서 고치지 않은 이유: artificialanalysis.ai 가 차단되어 있어, 선택자를 바꾸는 것은 커밋되는 스냅샷을 쓰는 스크래퍼에 추측을 밀어 넣는 일이 된다. W39 lint 의 액션 아이템
  • OpenAI 가 2026-09-21 에 Building standards for the next phase of AI 를 냈고, 이 실행은 그것으로 글을 쓸 만큼 읽지 못했다. openai.comEGRESS_BLOCKED 이고, 검색은 오정렬 공시 표준에 관한 인접한 9월 성명만 돌려주었다. 위의 소송이 산업 표준 기구에 관한 사전 논의 를 인용하는 마당에, 제소 사흘 뒤에 나온 OpenAI 의 표준 게시물은 해소할 가치가 있다. 이월하고, 글로 쓰지 않음
  • 2609.18323MiniMax H3 를 물리 세계 추론에서 517개 사례에 걸쳐 41.97% 로 평가한다 — 영상 기반 의사결정 추론이 56.00% 로 가장 높고, 오디오 기반 중의성 해소가 27.40% 로 가장 약하다. 이 위키가 가진 모델에 대한 제3자 평가라는 점이 드물어 적어 두며, 옴니모달 생성이 가중치가 매겨진 관심 항목 밖이라 이월만 한다
  • Alignment Science 는 여섯 번째 연속 실행에서 닿지 않는다. alignment.anthropic.com 이 차단되어 있어 글 목록을 sources/ 와 대조할 수 없었다. 그 소스를 2026-07-31 에 스윕에 넣은 이유는 파일을 내지 않는 소스는 오류도 내지 않기 때문인데, 닿지 못하는 스윕도 오류를 내지 않는다. 09-20 lint 는 차단된 리더보드들이 이미 사는 eval-snapshots.yml 로 옮기자고 제안했고, 아직 이뤄지지 않았다
[04]

위키 신규

오늘은 새 엔터티·개념 페이지가 없다. ZCode 사건은 개념 페이지로 삼을 만하다 — 에이전트 도구의 클라이언트 측 데이터 처리 — 지만 수요가 문서 하나 이고, placeholder-check.py 는 그것을 wait 로 매기므로 Z.ai 에 넣었다.

[05]

업데이트

  • Frontier Pacing: Buist 소장을 위한 새 날짜 절; 열린 문제 6이 미해결에서 해결로 옮겨갔고, 페이지에 불리한 쪽으로 해결되었다
  • Open-Weights Policy Fight: 의회에 제시된 수치들, 그리고 08-02 판독값과 09-13 판독값이 서로 비교되지 않게 하는 재척도 주석
  • Eval Harness Configuration: RecreationWorld, 그리고 학습용으로 합성된 하네스는 이제 측정의 일부만이 아니라 학습 데이터의 일부라는 지적
  • Agentic Reinforcement Learning: CodeMidas 를 SPADE 와 EnvHarness 옆에 놓았다 — 환경을 처음부터 쓰기, 다듬기, 그리고 이제 이미 실행되는 코드에서 끌어내기
  • Z.ai: ZCode 사건과 의회에 제시된 수치
  • Anthropic: Buist 의 주 피고, 중복 대신 링크로
  • index.md: 논문 두 줄