AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-09-24.md

2026-09-24

2026년 9월 24일 (목)

스토리 5건 · 논문 2편 · 주시 4건 · 새 페이지 6개

**오늘 캡처한 여섯 건 중 넷은 이 위키가 이미 보유한 페이지의 결과이고, 하나는 이 파이프라인이 두 번이나 미출시라고 보고한 모델이다.** Grok 4.7은 2026-09-21에 출하됐는데, 09-22와 09-23 실행이 둘 다 그렇지 않다고 적었다. OpenAI의 평가 원칙은 나흘 앞서 [[concepts/embedded-evaluation]]이 만들어진 계기가 된 그 메커니즘에 답한다. 중국 규제 당국은 Anthropic의 09-10 위협 보고서를 근거로 조사에 착수했다. 그리고 두 편의 논문이 [[models/jev]]를 측정했다 — [[entities/typesafe]] 페이지가 독립 측정이 존재하지 않는다고 기록한 지 아흐레 만에. **`www.anthropic.com`이 두 번째 실행 연속으로 1차 응답했고**, 그래서 아래 효소 관련 소식은 쓰인 그대로 읽은 것이다. 나머지 아홉 호스트 중 여덟이 `EGRESS_BLOCKED`를 반환한다 — `openai.com`, `deepmind.google`, `x.ai`, `triviumchina.com`, `techcrunch.com`, `alignment.anthropic.com`과 두 개의 업계 매체 — 그래서 여기 나머지 소식은 모두 발행자 자체 피드가 정체를 고정한 검색 발췌다.

+6new pages
[01]

주요 소식

1. Grok 4.7은 사흘 전에 출하됐고, 이 파이프라인은 그렇지 않다고 두 번 말했다 (1.20 — 점수가 아니라 interests.md의 "새 프런티어 모델 발표" 추적 신호에 따라 맨 앞에 놓임)

  • Grok 4.7, 2026-09-21 출시: Grok 4.6의 1.5T에 대비해 2.1T 파라미터, 500K 컨텍스트, 네 단계 effort에 기본값 high (source)
  • 가격은 움직이지 않았다: 200K 이하 프롬프트에서 $2/M input · $0.50/M cached · $6/M output으로 Grok 4.6과 동일하고, 그 임계값 위에서는 두 배가 된다. Grok API, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare에서 사용 가능
  • 벤더 벤치마크: CursorBench 4.0 40.4% → 46.3%, EEBench 53.0% → 64.0%, Harvey Legal Agent Benchmark 15.8% → 19.6% — 마지막 항목은 **GPT-5.6 Sol 2.5%**와 **Fable 5.1 6.7%**를 상대로 보고됐다
  • 세 번째로 만료된 창에서 9일, 첫 창에서 서른 날 만에 도착해, 이 위키가 2026-08-22부터 세어 온 지연을 끝냈다
  • 왜 중요한가: 비교 대상은 GPT-5.6 Sol과 Fable 5.1이고 둘 다 다음 날 대체됐으므로 이 출시를 09-22 물결과 잇는 수치가 하나도 없다 — 그리고 분야 전체가 20% 미만을 기록하는 벤치마크에서의 7.8배는 순서가 아니라 폭이다
  • 놓친 것은 우리 쪽이고 원인이 있다: xAI는 피드를 발행하지 않으므로 state/prefetch.json에 들어오지 않고, 랩 이름을 건 로테이션 질의는 아무것도 돌려주지 않았으며, 이 출시는 버전 이름을 건 질의로만 떠올랐다 — 09-20 이후 그 패턴의 세 번째 사례다
  • 확립되지 않은 것: 최대 출력 없음, 라이선스 없음, 모델 카드 없음, 안전성 평가 없음, 독립적 측정 없음 — 그리고 Musk가 09-11에 지목한 RL 길이 페널티 결함이 고쳐졌는지 여부. 명시된 "더 긴 RL 패스"는 그 진단과 인접하지만 그에 대한 수정으로 제시되지 않았다
  • Grok 4.7 · xAI · Eval Harness Configuration

2. OpenAI가 자신이 평가받는 규칙을 발행했다 — 그리고 평가자는 아무도 지명하지 않았다 (1.59 — 오늘 가장 높은 점수의 스토리)

  • Priorities and principles for effective third party assessments, 2026-09-22, OpenAI 자신은 이를 **"프런티어의 속도를 조절하려는 노력의 일부"**로 규정한다 (source)
  • 네 가지 우선 영역: 학습부터 내부 사용, 릴리스까지 검토되는 안전성 논증; 핵심 안전장치가 현실적 조건에서 버티는지; 화학·생물 위험, 사이버 공격, AI 자기개선에 대한 Preparedness Framework 역량 평가가 "주장하는 바를 실제로 측정하는지"; 정렬 실패 사건에 대한 독립적 조사
  • 일곱 가지 원칙, 그중 상호 합의된 범위에 대한 사전 등록된 주장, 직접 접근이 실무적으로 어려우면 지정된 회사 담당자로 대체되는 비례적 접근, 그리고 시정 시간이 주어지는 실행 가능한 발견
  • 외부 안전 전문가와의 협업을 이끄는 Lama Ahmad는 회사가 이전에 제삼자를 출시 직전에 들였다고 말한다
  • 왜 중요한가: 나흘 앞선 Anthropic의 Accenture 계약은 상대방과 가격과 범위를 공개된 기준 없이 밝혔다. OpenAI는 상대방도, 가격도, 자금 조달 방식도, 시작일도 없이 기준을 발행했다. 작동하는 합의의 두 절반이 이제 서로 다른 두 회사에 존재하고, 어느 쪽도 상대를 언급하지 않으며, Anthropic 발표와 같은 날 나온 AI Evaluator Forum 서한을 언급하지도 않는다
  • 확립되지 않은 것: AEF의 세 독립성 기준은 평가자가 누구일 수 있는가를 묻는다. 이 문서는 평가가 어떻게 수행되는가를 다루므로 그중 어느 것도 답하지 않는다. 공표 권리는 두 랩 모두에서 여전히 기록되지 않았다 — "투명성과 기밀성의 균형"은 누가 결정하는지 말하지 않는다. 그리고 이제 이틀 된 GPT-6 Sol과 Luna에 대한 Preparedness Framework 분류는 여전히 없다
  • Embedded Evaluation · OpenAI · AI Evaluator Forum (AEF)

3. 950개의 Claude 에이전트가 21시간 동안 DNA를 읽고, 아무도 규명한 적 없는 효소 시스템을 들고 돌아왔다 (1.30 — 조직 가중치만 적용. interests.md에 AI-for-science 항목이 없고, 만들어 넣지 않았다)

  • ART — "array-associated reverse transcriptases" — 주로 박테리오파지에서 발견되며 reverse transcriptase, 그 옆의 파트너 유전자, **"일정한 간격으로 반복되는 긴 DNA 반복 서열 배열"**로 이루어진다. 이름이 온 CRISPR 유사 구조다. 1차 출처로 읽음 (source)
  • 방법: 약 950개의 Claude 에이전트, 21시간, 210 million 토큰을 DNA 서열 데이터베이스에 투입했다. 사람이 준 지시는 최초 프롬프트뿐이었다. Feng Zhang(MIT, Broad Institute)의 지지 발언이 인용된다
  • 함께: Claude Science30개가 넘는 오픈소스 생체분자 모델을 4주 이내에 최적화해 대략 4× 속도 향상을 냈고, 15개 표적 중 14개에 Adaptyv Bio와 Twist Bioscience 습식 실험실에서 검증된 바인더가 설계됐으며, 5,000개 이상의 설계를 Adaptyv의 자동화 실험실에 올리는 대회에 최대 $1M의 Claude 크레딧이 걸렸다
  • 왜 중요한가: 이 위키가 보유한 자율 연구 주장은 모두 점수다 — AL4에서 26%인 R&D Automation Index, harness 논문들, Frontier Pacing의 RSI 논쟁. 이것은 산출물이 데이터베이스 안의 물리적 대상인 첫 사례이고, 따라서 다른 어느 것도 갖지 못한 경로로 확인 가능하다
  • 확립되지 않은 것, 그리고 그쪽이 중요한 절반: ART의 기능은 알려져 있지 않고 Anthropic도 그렇게 말한다. CRISPR와의 구조적 유사성은 기능 주장이 아니다. 동료 심사 없음, 에이전트에 대한 모델 버전 없음, 에이전트·시간·토큰 수치는 Anthropic 자신의 것이다. 유일한 실험 결과는 그 배열이 서로 구별되는 짧은 RNA들의 집합으로 발현된다는 것이다
  • Anthropic · R&D Automation Index

4. 미국 랩의 위협 텔레메트리가 중국 규제 당국의 조사가 됐다 — 그리고 혐의는 반대 방향으로 간다 (1.20)

  • 중국 국가인터넷정보판공실DeepSeekMoonshot AI를 조사 중인 것으로 보도됐다. Anthropic이 두 랩 모두 사용자 요청을 Claude로 은밀히 우회시켰다고 주장한 건이다 (source)
  • 이 위키가 09-10에 확보하지 못했던 물량이 이제 보도에 등장한다: Moonshot은 5–7월에 걸쳐 23 million 건 이상의 교환, DeepSeek은 7월 14일 구간에 12.1 million 건으로, 랩 일곱 곳을 지목한 154페이지 보고서 기준이다
  • 규제 당국은 중국의 경찰·군·국가 연계 민감 데이터가 미국 시스템에 도달했는지를 살피고 있다. 인용된 사례는 Anthropic이 PLA 소속 가능성이 높다고 평가한 사용자가 Kimi에게 청두의 경찰 카메라 수백 대에 걸쳐 한 인물을 추적하게 한 건으로, 요청과 영상이 사용자에게 알리지 않은 채 Claude로 넘어간 것으로 주장된다
  • 당국자들이 두 회사를 방문해 임원과 직원을 조사했다. 조사는 진행 중이고, 2026-09-22 기준 처벌 결정도 제재 발표도 없다
  • 왜 중요한가: Anthropic은 미국 모델로부터 가져간 가치를 주장했다. 이번 조사는 미국 시스템으로 간 데이터에 관한 것이다. 같은 행위가 두 관할에서 정반대의 두 고발을 떠받치고 있으며, 증거를 제공한 쪽은 읽은 범위에서 어느 규제 당국도 검증하지 않은 상업적 경쟁자다
  • 확립되지 않은 것: CAC의 성명, 통지, 법적 문서가 없다 — 조사는 보도됐을 뿐 공표되지 않았다. 어느 규정인지 명시되지 않았고, 두 랩 모두 대응이 없으며, 지목된 나머지 다섯 랩은 조사 대상으로 보도되지 않았다
  • AI Governance · DeepSeek · Moonshot AI

5. Google이 음성 모델 두 개와 130개 언어를 내놓았고, 확인할 수 있는 수치는 하나도 없다 (1.20)

  • Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS, 2026-09-23 발표, 둘 다 같은 날 Gemini API와 Google AI Studio에서 롤아웃됐다 (source)
  • 두 모델 모두 문서화된 사양: 텍스트 입력 8,192 토큰, 130개 지원 언어, 보이스 디자인과 복제, 생성된 모든 클립에 붙는 SynthID 워터마크
  • Flash TTS는 창작 연출과 캐릭터 디자인에, Flash-Lite는 더빙, 대량 오디오, 음성 에이전트에 자리매김한다 — 이 위키에서 Google 음성 모델이 미디어 제작이 아니라 에이전트 스택을 겨냥한 첫 사례다
  • 왜 중요한가: 이 위키가 모델 하나당 페이지 하나를 쓰기 때문에 두 페이지가 존재하고, 그 결과는 두 페이지 모두에 기록된다 — 공개된 사양이 동일하므로 둘을 가르는 것은 Google이 무엇을 위한 것이라고 말하는지뿐이다
  • 확립되지 않은 것: 두 모델 어느 쪽도 가격이 없어서, 분리를 정당화하는 비용 효율 주장이 근거 없이 남는다. 어떤 종류의 벤치마크, MOS 점수, 청취 선호도 수치도 없어서 "가장 표현력 있다"가 품질 주장의 전부다. 지연 시간도, 처리량도, 보이스 수도, 라이선스도 없다 — 그리고 보이스 복제가 역량으로 명시되면서 SynthID 외에 동의나 초상 보호 장치는 없다
  • Gemini 3.8 Flash TTS · Gemini 3.8 Flash-Lite TTS · Google DeepMind
[02]

논문 선택

"JEV-as-a-Judge: Accept When Confident, Escalate When Unsure" — arXiv 2609.26550 (1.65 — 오늘의 최고 점수)

  • TL;DR: 결정 전용 판정자를 16개의 생성형·보상 모델 판정자와 블라인드 인간 판정 아래 비교해, 일반적 선호와 근거 기반 사실성에서 가장 강한 비교 대상과 세 퍼센트포인트 이내에 들면서 비용은 **그 비교 대상 요금의 0.36%**였다. 격차가 낮은 확신도 결정에 집중돼 있어서, 확신 있는 판정은 받아들이고 불확실한 것은 올리는 동결 캐스케이드비교 대상 정확도의 99%를 유지한다
  • 읽을 이유: 이 위키가 보유한, 벤더의 것이 아닌 첫 Jev 평가이며 — 벤더의 두 주장을 갈라놓는다. 정확도 수치는 외부 harness를 통과하며 같은 3포인트를 유지한다. 비용 배수는 그렇지 않다: 요금의 0.36%는 **~278×**로, TypeSafe의 **~4,000×**에 대해 같은 단위를 재고 있지 않은 두 수치 사이의 14× 간극이다
  • 단서는 이 결과가 걸려 있는 낱말 그 자체다: 어느 스냅샷 항목에도 저자 목록이나 소속이 없으므로, 독립성은 확립되지 않았고 주장하지 않는다
  • JEV-as-a-Judge: Accept When Confident, Escalate When Unsure · 짝이 되는 Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents는 에이전트 메모리 안에서 다섯 개의 라우팅 결정을 자기회귀 모델에서 떼어낸다: LoCoMo 0.777, 상대 +11.0%, 구축 158 s6.6×, 지연 0.93 s−36.7%

"The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks" — arXiv 2609.25804 (1.65)

  • TL;DR: Taste-Bench는 에이전트가 끝냈는지를 재기를 그치고 실행 안의 결정 분기점을 재기 시작한다 — 같은 과제에 대한 병렬 시도와 한 궤적 안의 우회로에서 사람의 주석 없이 자동으로 채굴한다. 최고 프런티어 모델이 **59.7%**를 맞힌다
  • 읽을 이유: 추론 예산을 늘려도 정확도가 오르지 않으며, 이는 Test-Time Compute (Inference-Time Compute Scaling)가 근 일 년 추적해 온 방향에 대한 부정 결과다. 그리고 taste는 증류된다: 결과를 본 교사가 보지 못한 학생을 학습시켜 held-out SWE-bench Pro의 성공률을 높인다
  • 확립되지 않은 것: 59.7%가 어느 모델인지 명시되지 않았고, harness는 전혀 이름이 없으며, 증류 결과에는 수치가 붙지 않는다 — 방향성뿐이다. 결정 근거가 궤적 뒤쪽에 나타나는 분기점이 훨씬 어렵다고 보고되지만, 읽은 범위에서 나쁜 taste와 답할 수 없는 질문을 가르는 것이 없다
  • The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
[03]

주시

  • alignment.anthropic.com이 일곱 번째 실행 연속으로 닿지 않는다. 기사 목록을 여전히 sources/에 대조할 수 없다. 검색은 이미 보유한 항목만 돌려준다 — 이 위키가 24번 인용한 출처인데 일주일째 아무것도 가져오지 못하고 있다
  • Reasoning (derived)가 2026-09-03 이후 모든 Artificial Analysis 스냅샷의 모든 행에서 no를 읽고 있다. 08-02에는 153개 행이 yes였다. 09-22에 발견됐고 여전히 고치지 않았으며, 그것은 의도적이다: 해당 호스트가 이 샌드박스에서 차단돼 있어, 셀렉터 변경은 커밋되는 스냅샷을 쓰는 스크레이퍼에 추측을 밀어 넣는 일이 된다. W39 lint에 조치 항목으로 넘긴다
  • MiniMax M3 Pro가 열세 번째 실행 연속으로 유보됐다 — 발표도, API 문자열도, 모델 카드도, 기술 보고서도 없다. 한 패스는 여전히 "2026년 3분기 목표"로 적고 있고, 3분기는 엿새 뒤에 끝난다
  • 마크다운 표 셀 안의 위키링크가 오늘 조용히 실패했다. […](/ko/wiki/concepts/preparedness-framework)는 표 안에서 렌더링되려면 파이프를 이스케이프해야 하는데, 그 이스케이프가 링크 대상을 concepts/preparedness-framework\로 만든다 — 링크로는 계속 렌더링되면서 그래프에서는 간선이 사라진다. 브리프 이전 스윕이 잡아 복구했다. 페이지가 멀쩡해 보이기 때문에 주시할 가치가 있다
[04]

위키 신규

[05]

업데이트

  • TypeSafe AIJev: 독립 측정이 존재하지 않는다고 기록한 ## 전략적 위치 문장이 이제 아흐레가 됐고 부분적으로 답을 얻었다. **4,000× 대 278×**의 비용 불일치에 대한 ## 상충 보고 항목이 추가됐다
  • Embedded Evaluation: ## 현재 수준이 2026-09-24로 올라갔고 이제 공유하는 요소가 하나도 없는 두 랩의 두 문서를 싣는다. 새 열린 문제도 추가됐다 — 닷새 안의 세 발행물이 한 질문을 다루면서 어느 하나도 다른 하나를 인용하지 않는다
  • Eval Harness Configuration: 09-22 물결을 아우르는 첫 교차 벤더 점수에 대한 새 항목이며, 그 벤더 중 하나가 발행했다. 일을 하는 부분은 리더보드가 아니라 공개된 데이터의 재현 가능성이다
  • Model Routing: 라우팅이 시스템 안으로 들어갔다 — 값싼 모델 자신의 불확실성으로 라우팅되는 캐스케이드, 그리고 에이전트 메모리의 임계 경로에서 떼어낸 다섯 개의 제어 결정
  • AI Governance: ## 현재 수준이 2026-09-24로 올라갔고, 이전에 기록된 적 없는 메커니즘이 들어갔다 — 민간 기업의 위협 텔레메트리가 외국 기업에 대한 국가 조사의 증거 기반이 되는 것
  • xAI, OpenAI, Anthropic, DeepSeek, Moonshot AI, Google DeepMind, index.md