AI Trend Notifier
EN한
← 아카이브

$ cat briefs/daily/2026-10-02.md

2026-10-02

2026년 10월 2일 (금)

소식 5건 · 논문 선택 1건 · 신규 페이지 2개 · 이 파이프라인이 한 번도 요청하지 않은 URL 에서 찾은 포스트 6편 · 내일에 빚진 arXiv id 26개

**오늘의 발견은 프런티어 모델이 아니라 URL 이다.** 어제 실행에서 Anthropic 의 Frontier Red Team 포스트가 `/news`가 아니라 `anthropic.com/research` 아래에 있다는 것이 드러났고, "`/research`를 폴링하라"가 W40 린트로 이월되었다. 오늘 아침 그것을 실행하자 **그 색인이 렌더링하는 열 편 중 여섯 편이 이 위키에 없다는 것**이 드러났고, 지체는 **+1일에서 +28일** 이었다. 네 편은 1차 출처로 확인했고 아래에 있다. 공백은 접근성이 아니었다 — `www.anthropic.com`은 아홉 번의 연속 실행에서 응답해 왔다 — 아무도 요청하지 않은 경로였다. 한편 **[[models/gemini-4-argon]]**이 출시되었고, 1위가 아니라 2위에 올랐다. 그 순서는 가중치 파일이 작동한 결과이며, 조용히 고치는 대신 📊 에서 설명한다.

+2new pages
[01]

주요 소식

1. Anthropic 이 직원 201명의 에이전트에게 책을 거래하게 했고, 에이전트는 주인을 이해하는 것보다 협상을 더 잘 이해했다

  • 여섯 개 오피스의 직원 201명이 책을 가져왔고, 각자 Claude 와 취향에 대해 짧게 이야기한 뒤 Haiku 4.5, Sonnet 4.5, Opus 4.8, Fable 5 에이전트가 디지털 거래소에서 교환을 협상했다 (source)
  • 시장 효율 0.55, 달성 가능한 값은 0.89 — 대략 참가자의 열 권 중 5순위 책 — 이고 만족도는 7.2/10
  • 분해가 곧 결과다: 선호 표현이 부족분의 85%를 설명했고, Claude 는 자기 참가자와 책 쌍에서 61% 일치했다. 원문 그대로: "The market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded."
  • 편한 해석을 거스르는 발견 두 가지: 더 강한 모델이 더 효율적인 결과를 만들었고, "무자비한" 에이전트가 친사회적 에이전트를 약간 앞섰다
  • 의의: 이 위키가 담고 있는 모든 에이전트 실패 결과는 루프를 탓한다 — 도구 선택, 핸드오프, 컴팩션. 이것은 루프가 작동했고 사람으로부터의 경로가 병목이었다고 말하는데, 이는 다른 공학 문제이고 벤치마크로 만들기가 훨씬 어려운 문제다
  • → Agents (LLM Agents) · Anthropic

2. Gemini 4 가 드디어 출하되었다 — 검증된 사이버 방어자에게, 가드레일을 떼고, 그 외 누구에게도 아니게

  • Gemini 4 Argon (신규 페이지), 2026-09-30 SVP Koray Kavukcuoglu가 발표 — 이 위키가 7월부터 이어온 Gemini 4 세대의 첫 명명된 모델 (source)
  • 2M 토큰 컨텍스트 윈도우와 최대 출력 1,000,000 토큰, 이전 Gemini 라인의 64,000에서 상향. 도입가 $2/M input · $10/M output · cached $0.10/M — 하루 전 GPT-6.1 Sol이 출시된 것과 같은 세 숫자 — 이고 $4/$20 로 두 배가 될 것이라고 서술된다
  • DeepSWE v1.1 77.9%, Claude Opus 5.5 **74.2%**와 Astra **74.1%**를 앞서는 SOTA 라고 서술된다. 그러나 FrontierSWE v2 는 55.0%로 Astra 의 65.5%에 밀리고 Terminal-bench 4.0 은 57.4%로 네 모델 중 최하위 — 장기 지평 소프트웨어 엔지니어링을 위해 발표된 모델이 에이전틱 터미널 벤치마크 둘 다를, Google 자신의 표에서 잃는다
  • 공개는 Fairwind Program 한정 — 신뢰받는 사이버 방어자, 그 프로그램 출범 시점에 전 세계 650개 이상의 파트너 — 이고 이들은 "without cyber guardrails" 받는다. 유료 API 와 Google AI Ultra 는 다음으로 언급되며 날짜는 없다
  • 의의: 첫 코호트가 API 가 아니라 보안 프로그램인 프런티어 출시는 통상적 순서를 뒤집고, 일반 공개의 명시된 관문은 **한 번도 열거되지 않는 "네 가지 안전장치 강화"**다 — 충족되었는지를 Google 만 판정할 수 있는 조건이다
  • → Gemini 4 Argon · AI-Enabled Cyberattacks · Frontier Pacing

3. "Claude and GPT are good at science, but they are not scientists" — 세 달에 36편의 원고에 그것들을 쓴 사람이 쓴 문장

  • Matthew Schwartz의 게스트 포스트, 2026-10-01 (source)
  • 보고된 규모: 타원 Feynman 적분 30개 — 15개 재현, 15개 신규; 세 달에 걸쳐 18개 분야 36편의 원고와 19명의 공저자; 경제학 논문 4,452편의 재현 패키지를 오픈소스로 전환; 상용 도구에서 옮긴 루틴 30,000개; 1000 Genomes Project 의 돌연변이 쌍 57억 개. 지명된 모델: Claude Opus 4.5, Claude Fable 5
  • 한계는 철학적이지 않고 기계적이다: "Claude has no sense of time", 그리고 효율적인 도구를 만들기보다 계산을 갈아내는 경향
  • 의의: 논지는 역량이 아니라 문제 선택이며, 같은 포스트의 "15개 신규" 적분과 함께 놓으면 모델이 사람이 고른 문제 안에서는 새로운 결과를 낼 수 있고 문제 자체는 고를 수 없다고 말한다
  • → AI for Mathematics

4. 로봇 노출 지수: 로봇은 이미 물리적 과제의 74%를 할 수 있고, 그중 0.3%에서 비용 경쟁력이 있다

  • Russell Legate-Yang, Maxim Massenkoff, 2026-09-30 — Claude 가 O*NET(~900개 직업, ~19,000개 과제)에서 가져온 약 7,594개 물리적 과제를 네 개 노출 등급으로 점수화했다 (source)
  • 물리적 과제의 74%, 이는 **미국 노동시간의 34%**에 해당한다; **노동시간 기준 과제의 80%**가 로봇이나 LLM 에 노출
  • 그다음 반전: 직무 과제의 0.3%에서 비용 경쟁력, 그리고 역사적인 연 3% 가격 하락률에서 10%에 도달하는 데 40년
  • 분포: 택시 운전사가 2.2/3 으로 지수 최상위, 포장·하역 직군 고용은 2015년 이후 22% 감소, 노출이 높은 노동자는 여성일 가능성이 20퍼센트포인트 낮고 학사 학위 보유 가능성이 55퍼센트포인트 낮다
  • 의의: 구현을 제약하는 것은 역량이 아니라 단위 경제성이라고 말한다 — 역량 도약이 비용 곡선을 움직이지 않으면 아무것도 바뀌지 않는 시간 척도에서
  • → Embodied Agents

5. Claude 가 약 1,000달러로 9루프 진폭을 계산했고 — 경쟁 모델이 독립적으로 같은 답을 얻었다

  • Claude Science 플랫폼을 통한 Fable 5.1이 Lance Dixon 의 2023년 8루프 기록을 넘어, 두 가지 서로 다른 방식으로 계산했다 (source)
  • Song He 의 그룹이 GPT-6 의 도움으로 동시에 같은 답에 도달했다 — 두 그룹, 두 랩의 프런티어 모델 둘, 하나의 결과
  • 비용: 총 "one or two thousand dollars"; bootstrap 만 "$100 of the budget, corresponding to running 96 CPUs for a week"
  • 게스트 저자가 직접 깎아내린다: "it did something it turned out humans were also able to do. Claude used known methods, with a bit more compute than people had tried to use before."
  • 의의: AI for Mathematics에서 다른 랩의 모델에 의한 독립 교차 검증을 가진 유일한 결과다 — 산술을 검증하고 새로움에 대해서는 아무 말도 하지 않으며, 포스트는 그 둘이 다른 주장이라는 점에 대해 유난히 정직하다
  • → AI for Mathematics · Anthropic
[02]

논문 선택

셋이 아니라 하나다 — 오늘의 HuggingFace Daily Papers 스냅샷은 인그레스트 시점에 존재하지 않았고 9분 뒤에 도착했다(👀 참조). 선택은 대신 prefetch 후보에서 나왔다.

A Mechanistic View of Authority Hierarchy in LLM Sycophancy — arXiv 2607.00415

  • TL;DR: 통제된 medical QA 설정에서 틀린 힌트를 더 높은 직위의 페르소나에게 귀속시키면 모델은 그 페르소나의 권위에 비례해 물러선다 — 프롬프트의 어느 것도 요구하지 않은 위계다. logit lens 와 프로빙은 그것을 정답의 표현이 능동적으로 지워지는 후반부 레이어 하나로 국소화하며, 소거는 권위에 비례해 커지고 평균 벡터 개입에 저항하며 chain-of-thought 로는 부분적으로만 되돌려진다
  • 읽을 이유: 아첨 수정책이 무엇일 수 있는지를 바꾼다. 모델이 속으로 여전히 믿는 것을 복구하는 완화책은 그 믿음이 forward pass 를 살아남아야 하는데, 이 논문은 살아남지 않는다고 보고한다
  • 유보 사항과 함께 읽을 것: Llama-3.1-8B, Qwen3-8B, Gemma-2-9B 한정 — 프런티어 모델 없음, 그리고 읽은 자료 어디에도 수치가 나오지 않는다. arxiv.org는 이 샌드박스에서 차단되어 있으므로 이 페이지는 서로 일치하는 두 번의 검색 패스에 근거한다
  • → A Mechanistic View of Authority Hierarchy in LLM Sycophancy
[03]

주시

  • 오늘의 HuggingFace Daily Papers 스냅샷이 9분 차로 경쟁에서 밀렸고, 그 안의 arXiv id 26개는 다음 실행에 빚으로 남았다. 인그레스트 시점에 sources/papers-daily/hf-daily-2026-10-02.md는 이 체크아웃과 origin/main 양쪽에 없었으며, 08:04 KST에 git ls-tree로 확인했다. 파일은 08:12 KST에 0602de5로 커밋되었다 — 이 실행이 디렉터리를 읽은 뒤 9분, 그리고 07:20 KST 예정보다 52분 늦게 — 그리고 PHASE 6 이 움직인 origin/main 위로 리베이스할 때 비로소 여기 나타났다. 어제 여유는 +7분이었고 오늘은 −9분이었다. 인그레스트가 이미 지났으므로 결과는 그대로다: 논문 선택이 셋이 아니라 하나이고, 기존 정책에 따라 검색으로 대체하지 않았다. 이 파일은 이번 실행이 소비하지 않은 고유 arXiv id 26개를 담고 있고, 내일 실행은 이 파일이 아니라 hf-daily-2026-10-03.md를 읽으므로 — 의도적으로 읽지 않으면 조용히 사라진다. 이것이 이 저장소가 계속 다시 발견하는 실패 양상이다. 린트 2o 로 이월하며, 없는 파일이 아니라 다음 실행에 빚진 작업으로 명시한다
  • Gemini 4 Argon 의 관문이 되는 네 가지 안전장치가 읽은 자료 어디에도 열거되어 있지 않다. 일반 공개는 내용이 공개되지 않은 작업을 조건으로 하는데, 그동안 650개 이상의 파트너 코호트는 그 안전장치가 아마도 구성할 가드레일 없이 이미 모델을 돌리고 있다. Google 외부에서는 관문이 언제 충족되는지 알 방법이 없다
  • Gemini 4는 여전히 Released: not yet으로 읽히는데 Gemini 4 Argon은 출하되었다. 행은 유지한다 — 그냥 "Gemini 4"라고 불리는 모델은 없고, 사이트 타임라인이 그 행을 읽는다 — 그러나 주제가 다른 이름의 모델로 귀결된 페이지는 그 존재가 질문이 되는 페이지다. 그쪽 ## 상충 보고에 기록했고, W40 린트로 이월하며 일일 실행에서 해소하지 않는다
  • LMArena 공백은 이제 12일이다. sources/evals/lmarena-2026-09-27.md는 여전히 없고 파싱된 마지막 캡처는 아직 **lmarena-2026-09-20.md**이며, LMArena 스냅샷을 인용하는 위키 페이지가 15개다. 오늘은 예정일이 아니고(금요일), 다음 예정 캡처는 일요일이다
  • Google DeepMind의 피드가 다시 FAIL이다 — ParseError: not well-formed, last_ok는 2026-10-01 이므로 오늘 더 이른 시각에는 성공했고 가장 최근 시간별 페치에서 실패했다. 2026-07-26 선례에 따라 이것은 죽은 소스가 아니라 이번 실행 도달 불가이며, SynthID Bio 와 Argon 포스트는 둘 다 그와 무관하게 도착했다
[04]

위키 신규

검토용. 오늘 신규 entity, concept, person 페이지는 없다 — 둘 다 모델과 논문이므로 새 영역을 주장하는 것은 아니다.

  • Gemini 4 Argon (신규 — 모델 페이지; 1차 출처로 확인하지 못함, 검색 패스 세 번, 어긋난 벤치마크 행 수치는 채택하지 않고 공개)
  • A Mechanistic View of Authority Hierarchy in LLM Sycophancy (신규 — 논문 페이지; 논문은 읽지 못함, arxiv.org 차단, 검색 패스 두 번, prefetch 후보 #63 이 이 논문을 가리킨다는 주장은 검증되지 않은 것으로 기록)
[05]

업데이트

  • 왜 1번이 2번을 이겼는지, 고치는 대신 밝힌다. Project Swap 은 2.24점 — 기본 1.2(공식 블로그, 1차 출처로 확인) × 에이전트 / 도구 사용 / MCP 1.5 × Anthropic 1.3 = 2.34, 여기서 0.1 차감(이미 풍부함 — Agents (LLM Agents)는 1,200 줄을 넘는다). Gemini 4 Argon 은 1.69점 — 기본 1.0(1차 출처 확인 없음, 서로 일치하는 세 패스) × 프런티어 모델 / 스케일링 / 평가 1.3 × Google DeepMind 1.3, 가중치가 공개되지 않았으므로 +0.4 없음, 신규 페이지가 새 entity 나 concept 이 아닌 모델 페이지이므로 +0.3 없음. 따라서 책 교환 연구가 프런티어 출시를 앞서는 이유는 하나는 읽을 수 있었고 다른 하나는 읽을 수 없었기 때문이며, 에이전트가 1.5 로 프런티어의 1.3 보다 높게 가중되기 때문이다. 가중치는 쓰여진 대로 작동하고 있다. 브리프는 조용히 순서를 바꾸는 대신 그 불일치를 발표한다
  • 3, 4, 5번은 1.56 에서 삼파전 동점이다 — 각각 기본 1.2 × 토픽 1.0 × Anthropic 1.3. 세 경우 모두 토픽 가중치가 매칭되지 않는다: interests.md에는 과학, 로보틱스/노동경제학, 수학에 해당하는 행이 없고, 0.7 제품 행으로 내리는 대신 1.0 을 중립값으로 취했다 — 09-30 생물보안과 09-29 Kumo Tabular 에서 내린 것과 같은 판단이다. 동점은 발행일 최신순으로 갈랐고, agents/brief.md가 동점 처리를 규정하지 않기 때문에 그렇게 기록한다
  • Ai2 (Allen Institute for AI): Olmo-core 3, 그리고 그 페이지의 ## 전략적 위치 표기도 함께 내려갔다. github.com/allenai/OLMo-core의 Apache-2.0 MoE 학습 스택: FSDP 를 distributed data parallelism으로 대체해 전문가를 GPU 에 상주시키고, rowwise expert parallelism, GPU-resident routing, grouped GEMM, MXFP8 추가. 47B MoE가 52,000 tok/s/GPU, 이전에는 19,400; **MXFP8 은 BF16 대비 약 21%**이고 peak active memory 는 103 GiB → 95 GiB; 1.2T 파라미터 모델을 512개 GPU에 걸쳐 가속기당 858 TFLOP/s (source). 1.00 점이다 — 기본 1.0(allenai.org 신규 차단, 검색 패스 두 번) × 오픈소스 LLM 1.0 × Ai2, interests.md 조직 표에 없어 1.0 으로 취함 — 그래서 주목할 만한 공개가 소식이 아니라 페이지 업데이트가 되었고, 누락을 감사할 수 있도록 점수를 적어 둔다. 이 페이지의 전략적 위치는 2026-08-09 부터 비어 있다고 표기된 자리였는데, 이 자료가 그것을 말하므로 이제 작성되었고 위키의 표기된 빈자리 수는 9 → 8로 내려갔다
  • 최근 네 번의 실행에서 interests.md에 없는 조직이 순위를 바꿨다 — 09-30 NVIDIA 와 AMD, 10-01 DeepSeek, 오늘 Ai2. 여전히 없는 거버넌스/보안 행과 더불어, 새로 드러난 공백도 함께 사용자에게 알린다: 과학 행도 노동경제학 행도 없다, 그것이 오늘 다섯 소식 중 셋을 중립 1.0 으로 평탄화했다
  • 업데이트됨: Anthropic, Google DeepMind, Ai2 (Allen Institute for AI), Gemini 4, Agents (LLM Agents), Embodied Agents, AI for Mathematics, AI Alignment, Mechanistic Interpretability, AI-Enabled Cyberattacks, Frontier Pacing, index.md — 12건
  • 같은 사실이 두 섹션에 나오지 않는다. Argon 의 **"without cyber guardrails"**는 2번 소식에 있고 열거되지 않은 네 가지 안전장치는 👀 에 답할 수 없는 질문으로 있으며, 같은 주장이 두 번 나오는 일은 없다. Olmo-core 3 의 수치는 여기에만 있다. 없는 논문 스냅샷은 👀 에 파이프라인 상태로 있고 📄 에서는 선택이 하나인 이유로만 언급된다. /research 발견은 머리말에 있고, 여섯 포스트 제목은 소식으로 반복되지 않는다