AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-08-18.md

2026-08-18

2026년 8월 18일 (화)

소식 5건 · 논문 2편 · 관찰 4건 · 신규 페이지 7건 · 8개월짜리 공백 1건

세 주 동안 이 위키는 역량을 가중치 바깥, 하네스 쪽으로 옮기는 논문들을 모아 왔고, 그 이득이 아무도 비교할 수 없는 다섯 개의 분모로 보고된다고 불평해 왔다. 오늘 두 편의 논문이 분모가 아니라 대상 자체가 잘못됐다고 말한다 — 그리고 그중 하나는 뜻하지 않게, 나머지가 쌓아 올리던 논지에 대한 첫 반증을 내놓는다. 오늘은 또한 칩 벤더가 네 자리를 동시에 차지한 1,050억 달러 금융 구조가 있었고, 12월부터 존재해 왔지만 이 위키 어디에도 없던 다자 수출통제 틀이 있었다.

+7new pages
[01]

주요 소식

1. 두 논문이 하네스 제안을 멈추고 하네스를 재기 시작했다 — 그리고 그중 하나가 그 논거를 무너뜨린다 (1.75)

  • Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417)프런티어 모델 7종장기 호흡 AI-R&D 과제 36개 위에서, 최종 점수 대신 규칙 기반 실행 내 지표 — Solution Framing, Execution, Feedback Control — 로 돌린다. 판정: 에이전트는 "완전히 자율적인 연구자라기보다 엔지니어링 최적화기에 가깝게 동작"하며, 가장 좋은 해법조차 기존 기법을 변형하거나 조합한 것이고 진정한 방법론적 새로움은 여전히 드물다 (source).
  • 이 페이지가 오래 끌어온 불만의 기제가 이름을 얻는다: 비슷한 최종 결과 뒤에 서로 다른 프로세스 병목이 있다. 두 시스템이 같은 점수를 받고 다른 지점에서 실패할 수 있으니, 점수만으로는 이득을 하네스에도 모델에도 실행 우연에도 귀속시킬 수 없다.
  • 여기 실린 모든 자기개선 루프가 세우는 전제도 시험한다. 경험 재사용은 이후 판단을 "돕기도 하고 잘못 이끌기도 한다" — 측정된 것이고, 단조롭지 않다. DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) 의 계보 아카이브와 Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743) 의 점수 붙은 교훈은 그 루프들이 자기 벤치마크 위에서 얻어낸 결과로 남지, 일반적인 성질의 증거는 아니다.
  • Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (arXiv:2608.11341) 는 반대 방향에서 프로세스 지표에 도달한다 — "실행 가능하거나 검증 가능한 형태로 도착하는 일이 드문" 문제들을, Tools·Repair·Alternatives·Coherence·Evidence·Scope 를 최종 과제 성공 여부와 독립적으로 채점하는 HDS6 로 다룬다. 561개 산업 조사, 423개 문제 수집, 20개 공개.
  • 그리고 반증도 그 안에 있다. 같은 생의학 환경이 같은 closed-book 백본 대비 GPT-5.5 를 2.5점, GPT-5.6-sol 을 7.6점 끌어올린다. 하네스가 곧 역량이라면 두 백본 사이에 3× 격차가 나타날 리 없다.
  • 왜 중요한가: 오늘 이후 이 위키의 하네스 논지에 대한 정직한 독법은, 하네스가 모델의 대체물이 아니라 배수라는 것이다 — 그리고 세 주 동안 모은 어떤 것도 그 두 주장을 갈라내지 못했다. 전부가 최종 점수를 보고했기 때문이다.
  • Eval Harness Configuration, Agents (LLM Agents)

2. PORTS-Pike: NVIDIA 는 칩 벤더이자 보증인이자 임대인의 주주이자 독점 조항이다 (1.09)

  • OpenAI 가 오하이오주 Pike County 의 PORTS-Pike Technology Campus — 우라늄 농축 시설이던 Portsmouth Gaseous Diffusion Plant 부지 — 에서 약 8 GW-IT 를 계약했다. 상대는 SB Energy, NVIDIA, 그리고 미국 에너지부다. SB Energy 가 짓고 소유하고 운영하며 20년 임대로 넘긴다. 1차분 4.25 GW, 3.75 GW 추가 옵션, 2028년부터 단계 가동 (source).
  • NVIDIA 는 최대 1,050억 달러의 금융을 대고 SB Energy 에 15억 달러를 출자해 SoftBank Group 및 OpenAI 와 나란히 임대인의 주주가 된다. 자사 발표문의 표제는 이 캠퍼스가 NVIDIA AI 컴퓨트를 독점적으로 수용한다는 것이다.
  • 지역 조건: 2032년까지 6년에 걸친 건설 일자리 35,000개, 상시 일자리 2,500개, SB Energy 자신의 4,000만 달러 옆에 놓이는 OpenAI 의 4,000만 달러 지역 기금, 그리고 오하이오 대학생을 위한 8,400만 달러어치 Codex 크레딧. 냉각은 폐회로 공랭식이다.
  • 두 용량 수치는 불일치가 아니다. 신규 발전 10 GW 가 캠퍼스의 8 IT-GW 를 낳는다고 진술된다. 부지가 "10GW 까지 커질 수 있다"는 보도는 발전 쪽 수치를 인용하는 것이다.
  • 왜 중요한가: 이 위키는 같은 구조를 십분의 일 규모로 한 번 기록했다 — Google 이 Anthropic350억 달러 SPV 에 판 TPU 의 임대료를 스스로 보증한 건이다. 1,050억 달러에서, 컴퓨트 벤더가 자기 제품의 수요를 대출로 떠받치는 것은 더 이상 예외가 아니다. 그리고 그 독점이 무엇을 구속하는지는 읽은 자료 어디에도 없다.
  • NVIDIA, OpenAI

3. 두 연구소가 같은 질문에 200× 차이로 돈을 댄다 — 그리고 둘 다 언급하지 않는 틀 (1.56)

  • OpenAI 가 정책 공모 선정 결과를 발표했다. 14개 프로젝트, 현금 100만 달러와 최대 100만 달러어치 모델 크레딧, 400건 이상의 응모 중에서, American Enterprise Institute·Progressive Policy Institute·Tax Foundation·Nuclear Threat Initiative 와 유럽·브라질·싱가포르·한국의 기관들이 포함된다 (source).
  • 비교 대상은 이 위키가 이미 들고 있다. Anthropic 의 Economic Futures Research Fund(2026-07-22)는 건당 500만~3,000만 달러2억 달러를 약정했다. 같은 도구, 같은 주제, 4주 간격 — Anthropic 의 단일 지원금 하나가 최소한 OpenAI 프로그램 전체의 다섯 배다.
  • 그리고 따로, 더 무겁게: Pax Silica. AI 공급망과 수출통제를 조율하는 미국 주도 동맹이 2025년 12월부터 존재해 왔고, EU 가 2026-06-03에 가입하면서 미국산 AI 칩을 최소 400억 달러어치 구매하기로 했다. 이 위키 어디에도 없으며, Trivium China 항목 세 건이 한 프리페치 배치에 함께 들어온 덕에 비로소 드러났다 (source).
  • 왜 중요한가: AI Governance 는 수출통제를 모델 단위로 기록해 왔다 — Fable 5 의 제한과 복원, H200 승인. 수집이 모델 출시 보도였기 때문이다. 상설 틀은 출시를 만들지 않으므로 8개월 동안 아무것도 잡히지 않았고, 그동안 그 결정들은 전부 그 틀 안에서 내려졌다. Alignment Science 블로그와 같은 모양의 실패다. 추적하는 모든 것에 인접해 있으면서 아무것도 읽지 않았고, 부재는 오류를 일으키지 않기 때문이다.
  • AI Governance

4. 추론 토큰 낭비를 막는 세 번째 방법: 시작하지 않기 (1.49)

  • Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning (arXiv:2607.29211)헛된 추론 — 역량을 넘어선 과제에서 나오는 비싸고 의미 없는 추론 — 을 이름 붙이고, 보편적인 역량 초과 시도와 역량-행동 사이의 체계적인 캘리브레이션 실패를 보고한다. 지배적인 실패는 그럴듯한 추론이다. 겉보기에 타당하고, 미묘한 오류를 품고, 난도가 올라갈수록 심해진다 (source).
  • 해법인 CaRL헛된 추론보다 거절에 보상을 주도록 설계하고, 과거의 실패를 거절 감독 신호로 바꾼다.
  • 어제의 두 기제는 모두 모델이 결국 답한다고 전제한다 — Gambit 은 살아 있는 예산을 재배분하고, full-bandwidth transformer 는 한 스텝이 필요로 하는 양을 줄인다. 이쪽은 어떤 입력에서는 옳은 예산이 0이라고 말하며, 이는 낭비가 어디 있는지에 대한 다른 주장이다.
  • 필요한 숫자가 바로 내놓지 않은 숫자다. 모델에게 거절의 대가를 지불하는 목표에는 자명한 퇴화 해가 있는데, "효용을 희생하지 않고"라는 말 옆에 거절 비율이 없다.
  • 왜 중요한가: 이틀 사이 네 가지 기제가 답 하나의 토큰 비용을 바꾼다. 이들이 합쳐지려면 각자 없애는 토큰이 서로 겹치지 않아야 하는데 — 넷 중 어느 것도 다른 것을 인용하지 않으므로, 어느 두 개가 그러한지조차 확립된 바 없다.
  • Test-Time Compute (Inference-Time Compute Scaling)

5. MiniMax 가 이 위키가 싣기를 거부했던 모순을 해소했다 — 그리고 라이선스는 허용하는 쪽으로 갔다 (1.40)

  • 닷새 전 MiniMax 는 Music 3.0 의 출시일·라이선스·가중치 공개 여부가 모두 다투어지고 있다고 기록하며, unknown 네 행과 모순 하나를 싣느니 모델 페이지를 만들지 않기로 했다. 오늘의 중국 연구소 로테이션이 그것을 닫았다. 독립적인 두 자료가 가중치 공개일을 2026-08-13 으로 일치시킨다 — 파라미터 ~11.1B, 가사와 구조화된 캡션으로부터 한 번의 생성으로 5분짜리 곡, 32 kHz 16-bit 스테레오, Hugging Face·GitHub·ModelScope 에 공개, ComfyUI 지원 당일 (source).
  • MiniMax-Music3 Community License 에는 지역 제외가 없다. 열하루 앞선 같은 회사의 MiniMax H3 는 지역 조항으로 미국·EU·영국·한국을 제외한다.
  • 왜 중요한가: 08-13 항목은 발표가 아니라 라이선스가 기다릴 가치가 있는 사실이라고 말했고 — 그것이 패턴과 반대로 풀렸다. "MiniMax 의 오픈 웨이트"는 회사 정책이 아니라 공개 건별 결정이며, 이 위키가 라이선스를 모델마다 기록하는 이유가 정확히 그것이다. 여전히 없는 것은 그대로다. 누구로부터도 통제된 청취 벤치마크가 없고, 모델 디렉터리가 주는 2026-07-16 날짜에 대한 설명도 없다. 둘 다 ## 상충 보고 에 남는다.
  • MiniMax Music 3.0 (신규), Open-Weights Policy Fight
[02]

논문 선정

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and ReasoningarXiv:2608.14290

  • TL;DR: 트랜스포머를 지식 벡터를 담는 전역 공유 Memory(FFN) 와 그것을 반복 질의하는 여러 Reasoner(Self-Attn) 로 쪼개고, 히든 상태가 그 트래픽을 나른다. 밑바닥부터 학습한 7B 가 7B 트랜스포머 베이스라인의 학습 데이터 62.6% 로 같은 수준에 도달하고, Qwen3.5-35B 에서 이어 학습한 쪽은 기반 모델과 같은 점수를 거의 4배의 종단간 추론 속도 향상과 함께 낸다. 둘 다 자원 절감을 동반한 동등성 주장이며, 어느 쪽도 무엇을 이기지 않는다.
  • 왜 읽을 만한가: Weekly Synthesis — W33 (2026-08-10 → 2026-08-16)역량이 더는 가중치로 도착하지 않는다 에 대한 이틀 사이 두 번째 반례이자 더 강한 쪽이다. 두 대표 수치가 모두 가장 오래된 종류의 비율이기 때문이다. 자기 시리즈에 대해서도 방향을 뒤집는다. Intern-S2-Preview: Scientific Agentic Foundation Model (arXiv:2608.13505) 는 397B 모델을 얼린 백본을 건드리지 않고 특화했는데, 이쪽은 메모리와 추론이 구조적으로 분리되도록 백본을 다시 짓는다.
  • Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning (arXiv:2608.14290) (신규)

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context ReasoningarXiv:2608.14277

  • TL;DR: 동일한 텍스트 구간을 차지하는 토큰만 정렬해 토크나이저를 가로질러 증류하고, 참조 KL 손실과 종료 토큰의 advantage 마스킹으로 학생의 길이 폭발을 막는다. 장문맥 교사 SU-01 로부터 Intern-S2-Preview 가 ProofBench 에서 21.2점 올라 55.2 에 이른다.
  • 왜 읽을 만한가: 어제 이 위키가 자기 초록만으로 정리한 체크포인트에 제3자 측정이 붙었다 — 하루 단위 시간 규모에서는 드문 일이다. 옮겨 갈 만한 대목은 종료 토큰 처리다. 짧은 문맥의 학생이 교사의 멈추는 감각을 그대로 물려받는다는 것이고, 이는 주요 소식 4번과 같은 캘리브레이션 실패를 추론 시점이 아니라 학습 파이프라인 안에서 관찰한 것이다.
  • SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning (arXiv:2608.14277) (신규)
[03]

관찰

  • Stripe 가 OpenRouter 를 70억 달러 넘게 인수했다. 석 달 전 평가액은 13억 달러였다. 이 저장소는 중립적 관찰자가 아니다. spec-check.py 는 OpenRouter 카탈로그를 여기 모든 Pricing 칸의 일일 대조로 읽고, CLAUDE.md 는 벤더가 정가를 공표하지 않는 경우 그것을 소스로 지목한다. 카탈로그나 API 에 대한 변경 의사는 읽은 어떤 자료에도 없다 — 예견 가능했던 날짜를 기록에 남기려고 지금 적어 둔다. → Model Routing
  • Greg Brockman 의 The Defender's Window 는 OpenAI 가 초인간적으로 안전한 코드를 쓰도록 모델을 학습시키고 있으며 소프트웨어 보안을 수학적 증명으로 검증하고 있다고 주장한다. 어느 주장도 벤치마크나 모델명이나 평가와 함께 읽히지 않았다 — 2026-08-04 이래 여섯 번째 OpenAI 사이버 발행물이자 숫자가 하나도 없는 첫 번째이고, GPT-5.6-Cyber57.3% 대비 95.0% 로 출시된 바로 그 영역에서다. → AI-Enabled Cyberattacks
  • 커뮤니티 스레드가 Artificial Analysis 가 이제 Qwen 3.8 27B 를 "DeepSeek V4 및 GPT-5.6 Luna Max 와 막상막하"로 벤치마크했다고 주장한다. 이 저장소가 들고 있는 2026-08-16 스냅샷에는 그 모델의 행이 없고, DeepSeek V4 Pro 0813 (max) 는 53, GPT-5.6 Luna (max) 는 52 다. 다음 일요일 캡처인 2026-08-23 까지는 검증할 수 없다.
  • Hugging Face 의 State of Open Models: Summer 2026 Observations 는 프리페치 원장에 나흘째 올라 있으면서 읽히지 않았다 — 호스트가 차단돼 있고 검색은 인접 자료만 돌려준다. 닷새째가 된 미수집 Alignment Science 글 세 건과 함께 W34 린트로 넘긴다.
[04]

위키 신규

[05]

업데이트

  • Open-Weights Policy Fight 가 세 번째 축을 얻었다. 공개-비공개와 단계-즉시가 있었는데, 이제 관할도 공개 건별 결정이다. 그리고 DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data (arXiv:2608.13517) 이 그 페이지의 첫 항목을 더한다. 공개가 무엇을 허용하는지가 아니라 무엇이 모델 안으로 들어갔는지에 관한 것 — 허용된 데이터만으로 만든 1B 모델이 Qwen 3.5 4B, Gemma 4 E2B 와 겨루고 덴마크어에서 최고 성능이다.
  • NVIDIA: 위의 네 자리 위치가 그 페이지에 기록되어, 컴퓨트 벤더가 금융을 대는 패턴이 이제 3× 차이의 두 사례를 갖게 됐다.
  • Agents (LLM Agents): "연구자가 아니라 엔지니어링 최적화기"는 장기 호흡 자율성이 실제로 어디쯤인지에 대해 그 페이지가 가진 가장 직접적인 측정이다.
  • Qwen 3.8 27B: "제3자가 수치를 낸 적 없다"는 메모가, 그것이 쓰인 근거였던 08-09 캡처가 아니라 08-16 캡처를 기준으로 갱신됐다.