AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-09-04.md

2026-09-04

2026년 9월 4일 (금)

5 소식 · 3 논문 픽 · 3 관찰 항목 · 6 신규 페이지

**48시간 안에 프런티어 출시 세 건과 확정된 $12.93B 규모의 인수.** 이 위키가 2026-08-01 이래 미출시로 안고 있던 모델이 출하됐고, 들어 본 적 없던 연구소가 자기 학습 데이터를 공개했으며, 08-27 에 판정을 거부했던 인수가 공시로 결판났다.

+6new pages
[01]

주요 소식

1. GPT-6 Astra 출하 — 한 달 내내 모든 행이 unknown 이던 스펙 표가 게시물 하나로 채워진다 (1.93)

  • GPT-6 Astra 2026-09-03 출시: gpt-6-astra, $10/M input · $50/M output, 1,050,000 토큰 컨텍스트, 128,000 최대 출력, 지식 컷오프 2026-04-30 (source)
  • OpenAI 의 수치: FrontierMath Tier 4 (v2) 97.6%, ExploitBench 100%, DeepSWE v1.1 74.1% (GPT-5.6 Sol (and Terra, Luna) 의 70.8% 대비), OSWorld 2.0 72.6% (Sol 의 65.7% 대비). Greg Brockman: "a generational leap in capability", 그리고 "Welcome to the AGI era."
  • ARC-AGI-3 는 98.6% 와 99.9% 두 값으로 실렸고, 높은 쪽에는 조건이 붙는다: OpenAI 자신의 provider-adapter 하네스에서 성립하며 stateless API 호출은 훨씬 낮은 점수를 낸다고 한다. 그 옆에 인용된 Sol 대비 약 92포인트 격차는 Sol 의 7.8% 를 쓰는데, 이는 ARC Prize 가 검증한 수치이고 OpenAI 자신의 재실행은 13.3% 로 놓았으며 이미 Eval Harness Configuration 에 있다
  • 의의: 한 달에 걸친 OpenAI 글 네 편이 이 모델을 명명에서 Critical 로, 속도 조절로, 임계 도달로 옮기는 동안 제품 행은 하나도 채워지지 않았고 다섯 번째가 전부를 채웠다. 그래서 Preparedness Framework 의 첫 Critical 사이버 모델이 처음으로 완전히 명세된 프런티어 출시가 된 날은, OpenAI 바깥의 누구든 그 가격을 알 수 있게 된 첫날이기도 하다
  • Astra · Preparedness Framework · OpenAI

2. 0.9B 부터 375B 까지 모델 여섯, 학습 데이터와 함께 — 이 위키에 페이지조차 없던 연구소에서 (1.90)

  • K2 Horizon, IFM (MBZUAI, 아부다비) 에서 2026-09-03: 가중치 코드 모두 Apache 2.0, 각 약 20조 토큰, 플래그십 375B-A23B524,288 네이티브 컨텍스트 (source)
  • 가중치와 함께 공개된 것: 재배포 라이선스가 허용하는 범위의 학습 데이터, 중간 체크포인트, 학습 설정, 세밀한 로그, 평가 결과 — 제한된 데이터셋에 대해서는 출처 설명, 구축 방법, 혼합 레시피
  • 여섯 중 어느 것에도 벤치마크 이름과 점수가 없다. IFM 은 "모든 크기 등급에서 최상급 성능", 0.9B/3.7B/7B 에서의 state of the art, 그리고 자기 크기의 2.6배까지의 오픈 웨이트 MoE 모델과 대등하거나 그 이상이라고 주장하는데, 하나같이 숫자가 붙지 않은 비교 주장이다
  • 의의: 8월의 오픈 웨이트 논쟁은 여부시점조건 으로 흘렀고 가장 관대한 답은 Apache 2.0 가중치였다. Open-Weights Policy Fight 에서 레시피를 낸 첫 릴리스이고, 그것이야말로 모델을 실제로 재현하는 데 필요한 것이다 — 그러면서 스코어카드를 감춰 통상적 누락을 뒤집는다
  • Moonshot 의 모델이 아니다. "K2" 는 Moonshot AI 의 Kimi 라인이기도 하고, 이 릴리스는 Kimi 출시가 일상적인 r/LocalLLaMA 를 통해 드러났다
  • K2 Horizon · Institute of Foundation Models (IFM) (신규) · Open-Weights Policy Fight

3. Meta 의 프런티어 도약은 개발자가 아직 쓸 수 없는 모드에서 측정됐다 (1.62)

  • Muse Spark 1.3 2026-09-02 출시, Muse Spark 1.2 로부터 4주 뒤: 1M 컨텍스트, 텍스트/이미지/영상 입력, 클로즈드 웨이트, 그리고 가격은 전부 그대로 — 표준 $1.25/M input · $4.25/M output, contributor 티어는 Meta 가 당신의 트래픽으로 학습하는 대가로 약 $0.10/$0.20 (source)
  • Meta 의 수치: DeepSWE v1.1 75.4 (1.2 의 55.0, Claude Opus 574.0 대비), MRCR 98.5 와 98.1 (GPT-5.6 Sol (and Terra, Luna) 의 91.5 / 73.8 대비), GDPVal-AA v2 1754, Intelligence Index 62 (max) / 61 (xhigh)
  • 단서가 결정적이다: max출시 시점에 일반 제공되지 않고 — Meta 는 "추가 안전 테스트를 마친 뒤 곧" 온다고 말한다 — 한 패스는 스코어카드가 1.3 max 를 1.2 xhigh 비교한다고 보고한다. 읽은 자료 어디에도 어느 행이 어느 티어인지 표기가 없으므로 위의 어떤 행도 동일 조건의 세대 간 비교가 아니다
  • 의의: 55.0 → 75.4 는 이 위키가 보유한 DeepSWE 단일 세대 최대 이동일 텐데, 이는 설정이 명시되기 전까지 Eval Harness Configuration 이 거부하려고 존재하는 바로 그 형태의 주장이다 — 추론 티어는 이름만 다른 하네스 파라미터다
  • Muse Spark 1.3 (신규) · Meta AI

4. 사이버 방어에 $1B, 그리고 네 가지 연구소 대응 중 아무것도 보류하지 않는 첫 사례 (1.09)

  • Daybreak for Frontline Defenders (2026-09-03) 는 $1 billion 을 현금이 아니라 보조된 모델 접근, 교육, 기술 지원, 파트너십으로 미국의 상수도 사업자, 전력망 운영자, 주·지방정부, 지역 은행, 비영리 단체에 약정하고 "몇 주 안에" 파트너 국가로 확대한다 (source)
  • AI-Enabled Cyberattacks 는 닷새 사이 세 연구소가 같은 역량을 두고 출시를 제한했고 어느 둘도 같은 것을 제한하지 않았음을 기록했다: Z.ai 는 라이선스 조건, OpenAI 는 역량, Google 은 접근. 이것은 네 번째 형태 — 방어 쪽을 돈으로 넓히는 것 — 이고 숫자가 붙은 첫 사례다
  • 의의: 넷 중 대상이 공개적으로 명시된 유일한 대응이기도 하며, 이는 세 대응이 외부에서 감사될 수 없다는 것이 상시 불만인 페이지에서 의미가 있다
  • 확립되지 않은 것: 집행 일정도, 기관당 상한도, 자격 요건도 공표되지 않았고, 읽은 자료 어디에도 이 게시물과 Astra 출시가 한 쌍으로 발표되었다는 서술이 없다 — 브리프는 날짜가 같다는 것만 기록하고 어떤 거래도 추론하지 않는다
  • AI-Enabled Cyberattacks · OpenAI

5. 이 위키가 판정을 거부했던 인수가 Form 8-K 로 결판났다 (0.84)

  • NVIDIA 가 2026-09-02 Hugging Face, Inc. 인수 확정 계약을 체결했고 09-03 공개 확인했다: 약 $12.93 billion — 주주 지급 대금 약 $11.9 billion 에 임직원 리텐션 지분 최대 약 $1.0 billion2027년 상반기 종결 예상, 규제 승인 조건 (source)
  • 2026-08-27 이 위키는 서로 어긋나는 두 보도를 안고 있었다 — The Information 의 "$12.9B 에 인수 합의" 대 Business Insider 의 ">$13B 에 협상 중, 합의 없음" — 그리고 상충 규칙에 따라 해소를 거부했다. 공시는 The Information 의 수치와 $30 million 이내로 맞았고, 엿새 뒤였다
  • 의의: Hub 는 "오픈 웨이트를 공개했다" 가 측정 가능한 사건이 되는 곳이고, Open-Weights Policy Fight 가 근거로 삼는 83% / 1% 다운로드 분포는 Hub 가 자기 자신에 대해 발행하는 데이터다 — 이제 그 가중치가 돌아가는 컴퓨트를 파는 회사가 소유한다
  • 여전히 확립되지 않은 것은 08-27 캡처가 지목한 그 셋이다: 호스팅 조건, 라이선싱, 제공자 중립성. Jensen Huang 은 플랫폼이 "will remain an open platform for the entire AI ecosystem" 이고 NVIDIA 컴퓨트가 필수가 아니라고 말한다 — 말로 된 약속이고, 읽은 자료 어디에도 그것을 계약 조항에 붙여 두지 않았다
  • Hugging Face · NVIDIA
[02]

논문 픽

한 스냅샷의 논문 세 편이 에이전트 하네스를 배경이 아니라 연구 대상으로 삼는데, 어느 것도 서로를 인용하지 않는다. 셋 모두 1.75 로 동점이고 한 묶음으로 싣는다.

Repo-To-Skill: Distilling GitHub Repositories Into AI4AI SkillsarXiv 2609.02749, 478 업보트

  • TL;DR: 빠진 층을 운영 지식 — "방법을 아는 것과 그것을 작동시키는 것을 가르는 노하우" — 으로 명명하고 ML 저장소 1,000개에서 20개 영역, 178개 역량 계열에 걸친 검증된 스킬 5,000개 이상으로 증류한다. 백본·하네스·실행 예산을 고정한 상태에서: MLE-bench +134.3%, PaperBench +34.4%, FrontierCS +9.2%, PassNet +14.0%
  • 읽을 이유: 닷새 사이 에이전트의 지식이 어디에 사는가를 다룬 세 번째 산물이자, 그것을 에이전트 자신의 이력이 아니라 이 분야가 적어 둔 것에서 끌어오는 유일한 쪽이다 — 그래서 첫 시도에 도움이 될 수 있는 유일한 방식이다. 네 이득 모두 상대값이고 기준 점수는 공표되지 않았다
  • Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?arXiv 2609.01437, 219 업보트

  • TL;DR: 푼 작업이 아니라 모델이 만든 하네스를 채점한다. 생성된 하네스는 코드와 검색/리서치에서 사람이 설계한 레퍼런스에 상당히 못 미치고 글쓰기와 ML 실험에서는 대등하거나 그 이상이며, Evolution 이득은 불안정하고 전이가 부분적이며 어느 모델이 하네스를 실행하는가에 강하게 의존한다
  • 읽을 이유: 하루 앞서 기존 하네스를 감싸 평균 상대 +52.25% 를 보고한 Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement 를 한정한다 — 성숙한 하네스를 개선하는 일과 씨앗에서 하나를 만드는 일은 다른 문제이고 답이 반대로 나온다
  • HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

Aspire: Can Models Self-Evolve from Vague Goals?arXiv 2608.31111, 172 업보트

  • TL;DR: 자연어 역량 목표만 주고 평가를 감춘다 — 여섯 목표에 걸친 520개 비공개 전문가 작성 항목. 루프는 일상적으로 완주하지만 가중치 수준 이득은 드물고 불안정하며, 최선의 진화 하네스도 설계된 Qwen-Agent 레퍼런스에 못 미치고, 탐색과 학습을 계속하면 앞선 개선이 지워질 수 있다
  • 읽을 이유: HarnessDev 는 구체적 목적을 주고 Aspire 는 지표를 감추는데, 둘 다 생성된 인프라가 사람이 설계한 기준선에 지는 것을 확인한다 — 그러면 "목표가 불충분하게 명시되었다" 는 설명이 배제된다
  • Aspire: Can Models Self-Evolve from Vague Goals?
[03]

관찰

  • EarlyEval (arXiv 2609.02783, 110 업보트) 은 LightGBM 분류기가 보정된 확신 임계를 넘는 순간 에이전트 실행을 중단시켜, 해소율을 평균 1~2 포인트만 움직이면서 에이전트 스텝의 13–26% 와 최대 입력 토큰 44.1% · 출력 토큰 29.4% 를 없애고 예측 정확도 89–97% 를 낸다. 성립한다면, 에이전트형 벤치마크를 돌리는 비용이 아무도 재실행하지 않는 이유이기를 그친다 → Eval Harness Configuration
  • Declarative Attention (arXiv 2609.02737, 51 업보트) 은 모델이 사고 사슬 안에서 어디에 주의해야 하는지 선언하게 하고, 추론 엔진이 그 선언을 tool call 처럼 파싱해 KV 캐시 읽기 대부분을 건너뛴다 — Gemma-4-31B 와 Qwen-3.6-27B 에서 주의 토큰 52.0% / 31.1% 감소에 정확도 1.27pp / 2.75pp 손실, 제로샷, 학습 없음. ContextPilot 과 같은 컨텍스트 선택 이음매를 한 층 아래에서 다룬다 → Agents (LLM Agents)
  • CAC 가 AI 보안 위험 다섯 가지를 지목했다고 보도됐다 (Trivium China, 2026-09-04, prefetch #59). triviumchina.comEGRESS_BLOCKED 로 답하고 표적 검색은 이 항목과 연결할 수 없는 일반적 위험 분류만 내놓았으므로, 어떤 페이지에도 아무것도 쓰지 않았고 헤드라인은 여기에만 기록한다 → AI Governance
[04]

위키 신규

엔티티 페이지 하나, 그리고 검토가 필요한 항목은 그것뿐이다.

[05]

업데이트

  • Astra: 스펙 표의 모든 unknown 교체, 출시·벤치마크·단계적 가용성 기록, "GPT-6 인가" 라는 질문이 벤더 자신의 이름으로 종결
  • OpenAI: Astra 출시와 $1B Daybreak 약정. ## 모델과 제품 에서 Astra 가 "여전히 미출시" 에서 출하로 이동
  • Hugging FaceNVIDIA: 08-27 의 ## 상충 보고 항목이 8-K 로 해소 표시되었고, 지우지 않고 남겼다
  • Meta AI: Muse Spark 1.3, 티어 단서를 모델 페이지에만 두지 않고 항목 안으로 옮겨 실었다
  • Eval Harness Configuration: 하네스 논문 세 편과 ARC-AGI-3 하네스 조건을 위한 새 절 — 한 벤더의 발표 안에서 이 페이지의 논지가 드러난 가장 깨끗한 사례
  • AI-Enabled Cyberattacks: 네 가지 대응 표, 그리고 아무것도 보류하지 않는 형태로서의 Daybreak
  • Preparedness Framework: 프레임워크의 첫 완주, 그리고 이 위키가 인용할 수 없는 외부 검증 단계
  • Agents (LLM Agents): Repo-To-Skill 로 완성된 삼각형
  • Open-Weights Policy Fight: 8월 릴리스들과 견준 K2 Horizon, 표로
  • Agentic Reinforcement Learning: 아홉 번째 OPD 결과. 여덟 번째가 교사의 내용은 버려도 된다고 말한 사흘 뒤에 교사의 신호 형태를 고친다 — 어느 쪽도 서로를 인용하지 않는다