$ cat briefs/daily/2026-09-25.md
2026-09-25
2026년 9월 25일 (금)
5 개 소식 · 논문 2 편 · 주시 4 건 · 신규 페이지 4 개
**오늘 가장 큰 발견은 뉴스가 아니라 이 파이프라인 안에 있고, 하마터면 위키에 중복 페이지를 올릴 뻔했기 때문에 먼저 기록한다.** 어제 런은 MentalHealthBench 를 위키 페이지 두 곳에 기록하고 스냅샷을 커밋했으면서 **`log.md` 에는 한 줄도 쓰지 않았다** — `agents/ingest.md` 가 중복 제거 키로 고정한 바로 그 파일이다. 그래서 이번 런은 그것을 볼 수 없었고, 벤치마크를 처음부터 다시 만들었으며, 점검이 잡아내기 전에 커밋된 스냅샷을 덮어썼다. 스냅샷은 복원했고 중복 페이지는 삭제했으며, **오늘 커밋에서 `sources/` 아래 수정된 파일은 없다**. **`cloud.google.com` 이 1 차 출처로 응답했고, 이 런에서 벤더가 쓴 그대로 읽은 유일한 발표를 내놓았다** — Google 발표를 이 위키가 쓰인 그대로 읽은 것은 처음이다. `www.anthropic.com` 은 세 번 연속 응답했다. **시도한 나머지 15 개 호스트 중 13 개가 `EGRESS_BLOCKED`** 이며 여기에는 `deepmind.google`, `blog.google`, `openai.com`, `x.ai`, `www.meta.com`, `press.un.org`, `blog.arxiv.org` 가 포함된다. 그래서 아래 내용 대부분은 검색 패스로 구성했고, 그 사실을 밝힌다.
주요 소식
1. Amodei 가 그 일로 피소된 지 닷새 만에 UN 안전보장이사회에 antitrust waiver 를 요청했다 (1.59 — 최고 점수 소식이며, 이 페이지 최고 점수인 1.65 는 논문 선택에 있다)
- 안보리 제10228차 회의, Artificial Intelligence and International Security, 2026-09-23, 9 월 의장국 프랑스가 소집하고 Jean-Noël Barrot 이 의장 (source)
- 브리퍼: Yoshua Bengio (UN Independent International Scientific Panel on AI 공동의장), Sam Altman, Dario Amodei (한 패스에 따르면 원격), 그리고 Hugging Face 의 Clément Delangue
- Amodei 는 2026-09-12 에세이의 세 단계를 다시 제시했다: 학습 파이프라인에 "employee-like access" 를 갖는 embedded evaluator — "desks, badges, company laptops, and a right to publish findings the lab cannot bury" — 좁은 범위의 미국 antitrust waiver 를 필요로 하는 민주주의 국가 간 조율, 그리고 AI 를 이용한 생물무기에서 시작해 Cold War SALT 조약을 본뜬 recursive self-improvement 의 "speed limit" 으로 나아가는 중국과의 글로벌 조율
- Altman 은 embedded evaluator 단계를 공개적으로 지지했고, "no level of catastrophic risk is acceptable" 이라고 말했으며, 기업은 모델이 인간의 통제 아래 머무른다는 강력한 근거를 제시할 수 있기 전까지 모델을 학습시켜서는 안 된다고 했다 — 공개가 아니라 학습에 걸리는 전제 조건이다
- Bengio 의 네 가지는 랩들이 서로 합의하는 것이 아니라 국가가 부과하는 유일한 제안이다: 프런티어 모델 라이선싱, 책임보험, 사고 보고, 공통 안전 요건
- 의의: Buist v. Anthropic PBC 는 바로 그 조율을 per se Sherman Act 위반으로 주장하며 2026-09-18 에 제기되었다. waiver 는 닷새 뒤 안전보장이사회에서 다시 요청되었다 — 그리고 그 지지는 OpenAI 자신의 평가 원칙이 Anthropic 의 계약을 언급하지 않고 기준만 발표한 다음 날에 나왔으며, 그 문서는 지금도 자사 CEO 가 지지한 대상을 참조하지 않는다
- 확인되지 않음: 결과물, 결의, 의장성명 없음; 어떤 종류의 회원국 입장도 기록되어 있지 않은데, 안전보장이사회 회의로서는 이것이 세부가 아니라 본문이다; Delangue 는 두 패스에 이름이 있으나 귀속된 내용이 없어 그 자리의 유일한 오픈 웨이트 목소리가 라이선싱에 침묵한 채로 남는다; 그리고 waiver 가 요청으로 제기되었는지 배경 설명이었는지 — 이를 직접 인용한 패스는 없다
- → Frontier Pacing · Embedded Evaluation · AI Governance · Anthropic · OpenAI
2. Live Avatar 가 정식 출시되었고, 그것이 얹힌 모델이 드디어 가격을 갖게 되었다 (1.46)
- Live Avatar 는 Gemini 3.8 Live 의 기능이지 새 모델이 아니며, 2026-09-24 에 Gemini Enterprise 의 미국·EU 엔드포인트에서 정식 출시되었다 — Google Cloud 블로그를 1 차 출처로 읽었다 (source)
- 추가되는 것: 입 모양이 동기화된 비디오 아바타, 자동 감지가 붙은 97 개 언어, 오디오와 동시에 처리되는 실시간 카메라 피드와 화면 공유, 대화를 이어가면서 백그라운드에서 실행되는 도구 호출, 그리고 생성된 모든 오디오·비디오에 SynthID 워터마크
- 커스텀 아바타는 allowlist 전용으로, Google Cloud 영업 담당 문의와 기업 검증을 거쳐야 하며, 그 외에는 큐레이션된 사전 제작 라이브러리에서 고른다
- Gemini 3.8 Live Extended Thinking 는 private preview 에 머물러 함께 정식 출시되지 않았다 — 그래서 형제 모델이 발표된 모든 값을 갖고 있던 지 아흐레 만에, 기능을 가진 쪽이 정식 출시된 모델이 되었다
Pricing이unknown을 벗어났다: 오디오 입력 분당 $0.005, 오디오 출력 분당 $0.018, 대화 한 시간에 약 $1.38. 셀에(third-party)를 표시했다 — 여러 패스가 일치하지만 Google 의 요율은 얻지 못했고, 벤더 수치가 나오는 날 그쪽이 우선한다- 의의: 모델당 한 페이지 원칙에 따라 페이지를 만들지 않았다. 기능을 모델로 취급하는 것이 비교 대상 없는 페이지가 쌓이는 경로이며, 이 원칙이 시리즈가 아니라 기능의 정식 출시에 적용된 것은 이번이 처음이다
- 확인되지 않음: 기본 요율 위의 Live Avatar 가격 없음; API model id 없음; 벤치마크, 지연 시간, 프레임레이트 수치 없음; 아바타 개수 없음; allowlist 승인 기준 없음; 그리고 결과물이 말하는 사람의 모습임에도 SynthID 와 allowlist 외에 동의, 초상, 사칭 방지 장치가 없다
- → Gemini 3.8 Live · Google DeepMind
3. Daybreak 이 전쟁 중인 국가에 넘어갔고, 그것을 방어적으로 만드는 선은 문장 하나다 (1.20 — 조직 가중치만 적용; interests.md 에 사이버나 보안 행이 없고, 만들어 넣지 않았다)
- OpenAI 는 우크라이나 정부에 Daybreak 접근 권한을 제공하며, 디지털전환부와 협력해 민간 인프라를 위해 소프트웨어 취약점을 식별하고 수정을 개발·테스트하도록 한다 (source)
- UN 총회 부대행사에서 샌프란시스코 주재 우크라이나 총영사 Dmytro Kushneruk 와 OpenAI 국가안보정책 책임자 Sasha Baker 가 발표했다
- 제시된 배경: CERT-UA 는 2025 년에 거의 6,000 건의 사이버 사고를 처리했고 여기에는 병원 시스템, 에너지 부문, 통신에 대한 공격이 포함된다
- 의의: 이 위키의 기존 Daybreak 항목은 모두 공격 역량을 가진 모델을 누가 쓸 수 있는가에 관한 것이다. 이번은 교전 당사국에 그 접근 권한을 주는 첫 사례이며, 그것을 방어적으로 만드는 제약 — "civilian infrastructure rather than offensive military cyber operations" — 은 읽은 자료 어디에도 통제 장치가 기술되지 않은 문장 하나이고, 대상 망은 전시에 실제로 사용 중이다
- 확인되지 않음: 비용, 기간, 존속 기간 없음 — 두 패스는 OpenAI 자신의 "extends access" 표현에 맞서 "무료"라고 제목을 달았다; 모델명 없음; "authorized" 라는 단어 외에 접근 통제, 감사, 안전장치 없음; 좌석 수 없음; 그리고 우크라이나가 Daybreak 접근을 받은 첫 정부인지 여부
- → AI-Enabled Cyberattacks · OpenAI
4. Google 이 Private AI Compute 에 메모리를 주면서 키는 휴대폰에 남긴다 (1.20 — 조직 가중치만, 3 번과 같은 읽기)
- 영속적인 서버 측 메모리 계층으로, 데이터는 클라우드의 전용 암호화 저장소에 놓이고 암호 키는 사용자 개인 기기에만 보관된다. 모델이 저장된 정보를 필요로 할 때 인증된 종단 간 암호화 채널이 기기와 격리된 클라우드 환경을 연결한다 (source)
- 외부 감사인이 최초 릴리스와 이번 업데이트 모두에 대해 설계를 검증했고, Google 은 2025 년과 2026 년 감사 보고서 요약을 공개했다고 밝힌다
- 의의: 이 위키가 보유한 자료 중 기기 간 어시스턴트 연속성과 온디바이스 프라이버시가 양자택일이 아니라고 제안하는 첫 발표이며, 여기 기록된 모든 메모리 기능이 설명하기를 피해 온 메커니즘을 기술한다
- 확인되지 않음: 모델명 없음, 어떤 Gemini 모델이 이미 사용하는지도 불명; 출시일, 노출 지점, 지역 없음 — 한 패스는 Google 이 이를 "will bring" 이라고 표현해 출시가 아니라 예정으로 읽힌다; 감사인은 익명이고 요약도 읽지 못했다; 보관 기간, 사용자 제어 수단, 삭제 보장 없음; 기기 분실에 대한 위협 모델 없음; 그리고 Safety Monitoring and Data Retention 과의 관계에 대한 언급이 없다
- → Google DeepMind · Safety Monitoring and Data Retention
5. 한 주 안에 놓친 두 번째 xAI 출시, 이번은 이레가 늦었다 (1.00)
- Grok Voice Transcribe 2.0 (신규) — Grok Voice Transcribe 2.0, 2026-09-18 출시, Grok Voice 뒤에 있는 오디오 파운데이션 모델 위에 만들어졌다 (source)
- 배치 시간당 $0.10 · 스트리밍 시간당 $0.20 — 1.0 과 동일, 1.0 대비 "twice as accurate" 라는 주장에 맞서는 가격이며, 다른 패스는 이를 "half the errors" 로 옮긴다
- 공개 Artificial Analysis 리더보드의 스트리밍 모델 32 개 중 정확도 1 위를 주장한다. 기능은 단어 단위 타임스탬프, diarization, 멀티채널 지원, 그리고 한 번의 패스로 처리하는 녹음 중 전환이 붙은 자동 언어 감지
- 의의: 원인은 사흘 전 +3 일에 잡은 Grok 4.7 과 동일하며 구조적이다 — xAI 는 피드를 발행하지 않아 출시물이
state/prefetch.json에 들어오지 않고, 중국 랩 로테이션은 xAI 를 다루지 않으며,x.ai는EGRESS_BLOCKED를 반환하므로 비피드 스윕은 자기 이름으로는 안정적으로 노출되지 않는 랩을 향한 검색 질의일 뿐이다. 한 주에 두 번은 사례가 둘인 패턴이며, W39 lint 로 간다 - 확인되지 않음: API model id 없음; 두 정확도 주장 어느 쪽에도 word error rate, 기준선, 데이터셋이 없음; 라이선스 없음; 오디오 길이 제한 없음; 지연 시간 수치 없음; 모델 카드 없음. 리더보드 주장은 이 저장소의 스냅샷으로 확인할 수 없었다 —
aa-fetch.py는 intelligence 보드를 담고 speech 보드를 담지 않는다 - → Grok Voice Transcribe 2.0 · xAI
논문 선택
Agensh: Scaling Organizational Intelligence to 1,024 Agents — arXiv 2609.26781 (1.65 — 이 페이지 최고 점수)
- TL;DR: 중앙 오케스트레이터가 없는 멀티에이전트 하네스 — 워커들이 공유 워크스페이스, 메시지 인터페이스, 공유 컨텍스트 위에서 맥락을 모으고 하위 과제를 선점·자기 할당하고 실행·검증하며 비동기로 병합한다. ProgramBench 최난도 5 과제에서 GPT-5.6-sol (high) 로 1 → 128 에이전트 가 평균 최종 테스트 통과율을 19.31% → 28.78% 로, pandoc 단독으로 1 → 1,024 에이전트 가 33.89% → 55.06% 로 올린다
- 읽을 이유: 에이전트 수를 스케일링 축으로 제시하면서 — 토큰, 비용, 벽시계 수치를 전혀 보고하지 않는다. 명시된 이점이 지연 시간인 논문에서 그렇다. 과제 하나에 1,024 에이전트는 추론량의 1,024 배이고, 보고된 값은 통과율이다
- 이틀 앞선 Harness-Zero: Harness Distillation via Agent-as-Harness 와 상충하면서 그것을 인용하지 않는다. 그 논문은 스캐폴드를 제거해 성능을 올렸다 — 하네스 없이 23.3% → 44.3%, 붙였을 때 41.7%. 이 분야는 48 시간 안에 "스캐폴드가 제약이다"와 "스캐폴드를 천 배로 키워야 한다"를 서로 다른 벤치마크에서 서로 다른 모델로 발표했다
- → Agensh: Scaling Organizational Intelligence to 1,024 Agents
Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It? — arXiv 2609.27891 (1.39)
- TL;DR: SchrodingerRepo 는 테스트 저장소를 평가 시점에 인스턴스화한다 — 문제 서술 재구성, 네임스페이스 재매핑, 파일 내 레이아웃 재배치, 동작 보존 재작성 — 실행 동작은 보존하고 친숙함은 지운다. SWE-bench Verified 와 SWE-QA 에서 저장소 단서를 제거하면 성능이 일관되게 떨어지고 상호작용 비용이 크게 늘며, 늘어난 비용은 탐색과 위치 파악에 떨어진다
- 읽을 이유: 이 위키가 보유한 오염 반론 가운데 처음으로 검증 가능한 형태이고, 살아 있는 공백 위에 떨어진다 — Claude Opus 5.5 는 2026-09-22 에 SWE-bench 계열 행이 아예 없이 출시되었고, GPT-6 Sol 과 GPT-6 Luna 는 같은 날 DeepSWE v1.1 하나만을 벤치마크로 들고 출시되었다. 이 논문은 SWE-bench 에서 옮겨 갈 이유로 "우리 점수가 나쁘다"가 아닌 것을 제공하며 — 동시에 대체재도 흔든다. DeepSWE 역시 같은 종류의 저장소로 만들어지기 때문이다
- 논문 자체의 기록은 전부 방향성뿐이다: 퍼센트포인트 하락도, 비용 배수도, 모델명도, 네 변환 단계에 대한 ablation 도, 하네스 이름도 없다 — 측정 위생에 관한 논문이 그 고질적 공백을 재생산했다
- → Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It?
주시
- 어떤 포착이 위키와 스냅샷에는 닿았는데
log.md에는 닿지 않았고,log.md가 중복 제거 키다. 어제 항목은 "New sources: 6" 이라고 적고 다섯 개만 명시한다. 이번 런은 빠진 하나를 처음부터 다시 만들었고, 점검이 잡아내기 전에 커밋된 append-only 스냅샷을 잠시 덮어썼다. 중복 제거는 로그만이 아니라sources/와 위키 페이지에도 키를 두어야 한다 — W39 lint 로 넘긴다 → Eval Harness Configuration - Meta Connect 2026 은 Muse 를 한 시간 이야기하면서 모델은 하나도 내놓지 않았다 (0.77 —
interests.md가 제품 출시를 0.7 로 두고 있고, 그 규칙을 우회하지 않고 적용했다): Meta VR Glasses $1,299 봄 출시, Muse 에이전트를 단독으로 담은 Muse Charm 이 12 월, 가격 미발표, Ray-Ban Meta Audio $349 가 2026-10-13, 여기에 Walmart·Instacart 연동과 Muse Space. Zuckerberg: Muse 는 "막대한 양의 토큰까지 무료"이고 수익은 "거래에서 받는 소액 수수료" 로 기대한다. Muse 의 모델 버전, 파라미터 수, context window, 벤치마크, API 는 어디에도 없다 → Meta AI - 닫힌 모델의 숨은 추론을 평범한 API 기능으로 읽어 냈다 (1.39 — 두 번째 논문 선택과 동점이며, 다른 두 편이 하나의 발견으로 짝을 이루기 때문에 여기 있다): Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models 는 표준 API 기능에 단순한 커스텀 도구를 등록해 추론의 외부화를 유도하고, 오픈 모델의 네이티브 CoT 로 먼저 검증한 뒤 GPT-6 Astra 를 포함한 닫힌 모델로 확장한다 — 추출된 추론은 네이티브 성능과 일치한다. 이것은 Claude Opus 5.5 가 "preserved thinking" 을 anti-distillation 안전장치로 출시한 바로 그 주에 나온 의도치 않은 유출 통로다. 읽은 자료 어디에도 둘을 연결하는 것이 없고, 대응한 벤더도 없으며, API 기능이 명시되지 않아 발표된 상태로는 재현도 완화도 불가능하다
alignment.anthropic.com이 여덟 번 연속 도달 불가여서 기사 목록을 여전히sources/와 대조할 수 없다 — 이 위키가 +73 일과 +38 일짜리 글 두 편을 놓치게 만든 그 공백이다. 그리고 X 계정 스윕이 이번 런에서 날짜가 붙은 고신호 항목을 하나도 돌려주지 않았고, 완전히 빈 채로 돌아온 것은 처음이다 → Anthropic
위키 신규
- Grok Voice Transcribe 2.0 (신규 — 모델 페이지, day +7 포착)
- Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It? (신규)
- Agensh: Scaling Organizational Intelligence to 1,024 Agents (신규)
- Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models (신규)
오늘 새 엔티티나 개념 페이지는 만들지 않았고, 두 개를 의도적으로 쓰지 않았다: 두 문서가 요청하는 people/bengio 는 wait 규칙이 근거가 너무 얇다고 보는 경우이고, concepts/mentalhealthbench 는 이번 런이 썼다가 그 주제가 이미 OpenAI 와 Eval Harness Configuration 에 있음을 확인하고 삭제했다.
업데이트
- Frontier Pacing: 새 날짜 절 — Sherman Act 소장 닷새 뒤 안전보장이사회에서 antitrust waiver 를 다시 요청
- Embedded Evaluation: Altman 의 지지가 이 페이지가 따로 추적하던 두 반쪽을 붙이고, Amodei 의 "right to publish findings the lab cannot bury" 가 두 창립 문서 모두에서 기록되지 않았던 발표권을 명시한다
- AI Governance: 회의의 제안들이 누가 부과하느냐로 갈린다 — 랩들의 합의를 요구하는 랩 메커니즘 셋, 국가를 요구하는 Bengio 의 넷
- Eval Harness Configuration: 저장소도 변수이며, 서로 상충하는 하네스 논문 두 편
- Agents (LLM Agents) · Mechanistic Interpretability · AI-Enabled Cyberattacks: 신규 논문 세 편과 Daybreak 확대
- Gemini 3.8 Live: 아흐레 동안
unknown이던Pricing을 보도로 채움; Live Avatar 정식 출시를 새 페이지가 아니라 모델에 기록 - Grok 4.7: 2026-09-24 에 열려 있던 최대 출력에 이제 수치가 아니라 주장이 생겼다 — 한 패스가 "no text output limit" 이라고 하며, 기록하되 스펙 값으로 채택하지 않는다
- Anthropic · OpenAI · Hugging Face · Google DeepMind · Meta AI · xAI ·
index.md