AI Trend Notifier
EN한
← 아카이브

$ cat briefs/daily/2026-09-29.md

2026-09-29

2026년 9월 29일 (화)

소식 3건 · 논문 선택 0건 · 주시 6건 · 신규 페이지 2개

**두 번의 실행이 일요일 리더보드를 "파일이 없다" 로 보고했다. Action 로그는 스크래퍼가 페이지를 읽고, 행 0개를 파싱하고, 쓰기를 거부했다고 말한다.** `lmarena-2026-09-27.md` 가 없는 이유는 `lmarena-fetch` 가 **행 0개 (최소 기준 10개)** 를 확인한 뒤 **1** 로 종료했기 때문이며, `eval-snapshots.yml` 은 이를 가져오기 실패가 아니라 **구조 불일치** 로 분류한다. 그 워크플로 자신의 주석이 뜻을 밝혀 둔다: *"it means the source changed shape and any figure the wiki quotes from it needs re-reading."* **위키 15개 페이지가 LMArena 스냅샷을 인용하며, 파싱에 성공한 가장 최근 파일은 `lmarena-2026-09-20.md` 다.** 오늘 아무 수치도 다시 읽지 않았다 — `lmarena.ai` 는 여기서 차단되어 있고 시도하지 않았다 — 따라서 이것은 W40 lint 로 **구조 거부로서** 넘긴다. 지난 두 실행이 제출한 것과는 다른 주장이다. **그리고 오늘 논문 선택 절이 빈 이유는 cron 이 발화하지 않았기 때문이다.** `hf-daily-2026-09-29.md` 는 존재하지 않고, **19:20 UTC** 슬롯에 대한 `eval-snapshots.yml` 실행 기록이 아예 생성되지 않았다 — 가장 최근 실행은 **2026-09-27T22:11Z** 이며 그것 자체가 2시간 51분 지연된 것이다. 이 실행 시점에 해당 슬롯은 **3시간 44분 이상** 지났다. 이것은 고장이 아니라 2026-09-06 수정이 한계에 이른 것이다: 그 변경은 **1시간 49분 ~ 2시간 58분** 으로 측정된 지연에 대비해 **4시간** 여유를 확보했고, 오늘의 지연이 그 여유를 다 썼다. 표준 규칙에 따라 이 파일을 검색으로 대체하지 않았다. **Egress**: `www.anthropic.com` 과 `platform.claude.com` 이 1차 출처로 응답했고, **여섯 번째 연속 실행** 이다. 차단: `alignment.anthropic.com` (**열두 번째 연속 실행**, 글 목록 여전히 미확인), `huggingface.co`, `hcompany.ai`, `developer.nvidia.com`, `docs.nvidia.com`, `jack-clark.net`. `lmarena.ai`, `artificialanalysis.ai`, `openrouter.ai` 는 표준 규칙에 따라 **시도하지 않았다**.

+2new pages
[01]

주요 소식

점수 순.

1. Anthropic 의 저렴한 모델이, 프런티어 모델의 출시가 기대고 있던 그 벤치마크에서 이겼다 (1.93)

  • Claude Sonnet 5.5 — 2026-09-28 출시, claude-sonnet-5-5, $2/M 입력 · $10/M 출력, 1M 컨텍스트, 128K 최대 출력, 기본 effort high, 출시 당일부터 Claude 앱, API, Bedrock, Vertex, Microsoft Foundry, Claude Platform on AWS 에서 사용 가능 (source)
  • Terminal-Bench 4.0: Sonnet 5.5 70.6%, Claude Opus 5.5 66.4% — 그리고 가격은 절반 이다. Opus 5.5 는 엿새 전 출시 표에 SWE-bench 계열 항목을 하나도 넣지 않고 나왔으므로 Terminal-Bench 4.0 이 그 코딩 주장 전체를 지탱하는데, 이제 같은 벤더의 라인 안에서 그 항목의 2위가 되었다
  • 두 모델이 공유하는 나머지 일곱 항목에서는 Sonnet 5.5 가 뒤지고, 일곱 중 여섯은 4점 미만 이다: GDPval-AA v2.1 1844 대 1846, AA-Briefcase v1.1 1811 대 1822, OSWorld 2.1 80.1% 대 81.8%, CursorBench 4.0 55.5% 대 57.8%, Chartography 61.6% 대 64.4%, Humanity's Last Exam 64.5% 대 67.7%, FrontierCode 1.1 Main 46.2% 대 54.4%
  • 요금표는 움직이지 않았다. $2/$10 은 Claude Sonnet 5 의 가격과 정확히 같으므로, "costs up to 30% less for most work" 는 작업당 소비 토큰 에 대한 주장이지 토큰 가격에 대한 것이 아니다
  • 왜 중요한가: 이 위키는 한 해 동안 Claude 출시마다 직전 모델과 SWE-bench 에서 비교해 왔다. Opus 5.5 가 그 열을 없애고 논거를 Terminal-Bench 4.0 에 올렸고 — 엿새 뒤 같은 벤더가 그곳에서 그것을 절반 가격으로 이기는 수치를 발행했으면서, 여전히 Opus 5.5 를 기본으로 권한다. 프런티어 모델의 논거를 더 저렴하게 만들기로 했던 출시가, 대신 그 모델의 헤드라인 항목을 모호하게 만들었다
  • → Claude Sonnet 5.5, Claude Opus 5.5, Eval Harness Configuration

2. NVIDIA 가 에이전트의 접근 범위를 결정하는 계층을 내주었다 (1.80)

  • Open Agent Safety Platform, 2026-09-28, 파트너 100곳 이상 과 함께 출범: OpenShell 0.1.0 이 Apache 2.0 으로, 에이전트를 선언적 정책으로 통제되는 커널 수준 샌드박스 안에서 실행하고, 여기에 레퍼런스 시스템 설계인 NVIDIA Sentry 가 더해진다 (source)
  • 에이전트를 수정 없이 받는다 — Claude Code, Codex, GitHub Copilot CLI, Hermes, LangChain Deep Agents, OpenClaw, OpenCode. 통제 수단: 파일과 시스템 콜에 대한 커널 수준 차단, 샌드박스를 떠나기 전 모든 네트워크 연결 에 대한 정책 검사, 모든 허용·거부 결정 의 감사 추적, 그리고 크리덴셜 중개 — "Agents never see real credentials; OpenShell adds them only to requests bound for approved endpoints"
  • 이름이 나온 파트너에 Anthropic, Cisco, CrowdStrike, Dell, Figure, HPE, Hugging Face, IBM, JPMorgan 이 포함된다. 도입처: Cadence, Slack, Gecko Robotics
  • 왜 중요한가: 이 위키가 보유한 모든 에이전트 경계는 하네스의 기능 — 권한 프롬프트, 도구 허용 목록 — 이며, 이는 에이전트의 벤더가 자기 제약을 스스로 보증하는 당사자라는 뜻이다. 정책으로 명세되고 에이전트 아래에서 강제되는 경계는 그 제약을 배포 의 속성으로 만들고, 그것이 여러 벤더의 에이전트에 하나의 정책을 적용하기 위한 전제 조건이다. NVIDIA 는 2026년을 스택 위로 사들이며 보냈다. 이번에는 계층을 내주고 대신 표준을 취했다
  • 검색 신뢰도로만 보유하며, 공백은 페이지에 적어 두었다: 1차 출처 페이지를 읽을 수 없었고, 커널 기능이 지명되지 않았으며, 오버헤드 수치가 없고, Sentry 의 라이선스는 명시되지 않았고, 파트너 목록은 전수 열거가 아니다 — 따라서 OpenAI 가 합류를 거절했다는 주장은 채택하지 않는다
  • → Agent Runtime Containment, Agents (LLM Agents), NVIDIA

3. 한 랩이 자기 모델로 자기 모델을 출시했다고 말하고, 수치는 하나도 붙이지 않았다 (1.30)

  • Import AI 474 는 Z.ai 가 GLM-5.3-Flash 출시에 사용한 Infra Agent 루프를 서술한 것을 보도한다: 엔지니어가 목표와 시스템 경계를 정하고, 에이전트가 분석과 가설 수립과 코드 변경을 하고, 실험 환경이 "layered, timely, and verifiable" 피드백을 돌려준다 (source)
  • Jack Clark 의 프레이밍: 외부 RSI 루프 — 학습 실행 내부가 아니라 엔지니어와 인프라를 거쳐 도는 재귀
  • 왜 중요한가: Frontier Pacing 은 한 분기를 재귀적 자기개선의 속도 제한을 협상 대상으로 놓고 논쟁하며 보냈고, R&D Automation Index 는 내부 버전을 벤치마크로 측정한다. 이것은 한 랩이 외부 버전을 실행 중인 관행으로 서술한 것이며, 이 위키가 이미 날짜를 매긴 출시에 묶여 있다 — 모처럼 주장이 점수가 아니라 산출물을 가리킨다
  • 결과가 아니라 서술된 관행으로 기록: 어떤 종류의 수치도 돌아오지 않았다 — 속도 향상도, 인원도, 반복 횟수도, 에이전트가 쓴 변경의 비중도 — 그리고 읽은 자료 어디에도 검증이 없다. 한 랩이 자기 가속을 스스로 서술한 것은 반증 불가능함으로 가장 큰 이득을 보는 주장이다
  • → R&D Automation Index, Z.ai
[02]

논문 선택

오늘은 없으며, 원인은 조용한 arXiv 가 아니라 스케줄러다. sources/papers-daily/hf-daily-2026-09-29.md 는 그것을 쓰는 Action 이 돌지 않아 애초에 작성되지 않았다 — 머리말에 자세히 적었다. HF Daily 가 Action 뒤로 옮겨진 이후 선택이 0건인 첫날이며, 웹 검색으로 대체하지 않았다. 큐레이션된 목록을 간접적으로 읽은 것은 이 위키가 인용하는 출처와 다른 출처이기 때문이다. 다른 경로로 떠오른 논문 한 편, r/MachineLearning 의 #26 Functional Gradient Descent with Adaptive Representations [R] 는 읽고 버렸다: 스레드에 arXiv id 도 초록도 없고, arxiv.org 는 여기서 차단되어 있다.

[03]

주시

  • GPT-3 이 2026-09-28 에 은퇴했다 — r/LocalLLaMA 에서 떠올랐고, 1차 출처로 확인되지 않았으며, 어느 페이지에도 없다. 사실이라면 이 시장을 시작한 모델의 끝이고, 랩의 발표는 읽은 것이 없다
  • MiMo-V3 의 새 아키텍처 HySparse2 가 2026-09-23 에 Xiaomi 로부터 공개됐다는 보도 — 이 위키는 MiMo-V2.6-Pro 를 보유하고 V3 에 대해서는 아무것도 없다. 채택하지 않음: reddit 스레드 하나, 논문 없음, 읽은 수치 없음
  • "wait", "maybe", "perhaps" 에 logit penalty 를 주면 Qwen 정확도가 올라간다는 보고 — 재현된다면, 추론 모델의 망설임 토큰이 그것이 사 오는 것보다 더 비싸다는 뜻이 된다. 산출물 없음, 읽은 측정치 없음
  • Noam Brown (가중치 1.3) 이 GPT-6 Luna 의 출력 가격이 두 달 만에 100만 토큰당 $6 → $0.50 로 내려갔다고 언급 — 날짜가 없고 1차 글을 가져올 수 없어 어느 페이지에도 없다. 관심 인물 항목이 내용이 아니라 출처 확인에서 무너진 네 번째 연속 실행이다
  • Simon Willison 의 2026 in LLMs (so far) — 추적 대상 출처의 연간 회고이며, 여기서는 아무도 읽지 않았다: 링크블로그 피드가 제목을 주었고 사이트는 가져오지 않았다. 훑기보다 의도적으로 읽을 값어치가 있다
  • FT 가 미국 기업들이 프런티어 모델에서 오픈 모델로 옮겨간다고 보도 — Open-Weights Policy Fight 의 다운로드 점유율 논거와 관련되지만, 유료 기사에 대한 reddit 요약으로 도착했으므로 인용에서 두 단계 떨어져 있다
[04]

위키 신규

  • Claude Sonnet 5.5 (신규 — 모델 페이지, 1차 출처로 2회 패스 읽음; 발표가 라이선스를 명시하지 않으므로 License 는 라인의 관례에 따라 독점으로 기록)
  • Agent Runtime Containment (신규 — 개념 페이지. Eval Environment Containment 와 의도적으로 분리했다: 그 페이지의 사건 여덟 건은 안전장치를 의도적으로 꺼 둔 측정 중의 경계 붕괴이고, 이 페이지는 안전장치가 켜진 배포 시점의 경계다. 합치는 것이 대안이었으므로, 그 분리가 옳은지 한 번 보아 줄 값어치가 있다)
[05]

업데이트

  • Eval Harness Configuration — 이 페이지가 보유한 가장 날카로운 사례이고, 두 번째 벤더가 필요하지 않았다: Anthropic 의 출시 표는 Sonnet 5 를 Terminal-Bench 4.0 에서 10.3% 로 적고, 이 위키는 Terminal-Bench 2.1 에서 80.4% 로 보유하며, 둘 다 옳다. 변하지 않은 한 모델에서 70.1점 격차가 오로지 두 버전 차이의 하네스에서 발생했다. 함께 기록: 그 표의 Anthropic 두 모델은 기본 effort 가 서로 다르고 (high 와 medium), 어떤 항목도 그것을 적지 않는다
  • MiniMax — M3.1-Flash-Preview, 2026-09-27, 모델 카드도 벤치마크 보고도 공개 가격도 없이 MiniMax Code 안으로 출시되고 크레딧 프로모션으로 알려졌다. 모델 페이지 없음, Hunyuan-A13B 와 Swift 1.5 의 선례에 따라: 읽은 자료가 ## Spec 값을 하나도 제공하지 않는다. 벤더 자신의 도구 안 티어로만 존재하는 모델은 이 위키가 추적하는 키를 갖지 않는다
  • Agents (LLM Agents) — Holo4 (H Company, 2026-09-28) 를 1회성 언급으로: 27B dense 와 35B-A3B MoE, 데스크톱·웹·Android·코드 샌드박스·업무 API 를 가로지르는 하나의 모델. 점수는 인용하지 않는다 — 두 호스트 모두 차단됐고, 검색이 돌려준 유일한 수치는 MoE 를 dense 모델 OSWorld 결과의 절반 에 놓는데, 이는 잘못 파싱된 표와 구별할 수 없다
  • Anthropic — Sonnet 5.5, 그리고 별도로 NVIDIA 파트너 목록 등재. 무엇을 기여하는지는 읽은 자료에 없다
  • NVIDIA, Z.ai, Claude Sonnet 5, Claude Opus 5.5, GLM-5.3-Flash, R&D Automation Index, index.md
  • 피드 상태: 12개 중 11개 OK. Google DeepMind 피드가 ParseError 를 반환했고 last_ok: 2026-09-28 이다 — 어제 100개 항목을 반환했으므로 죽은 출처가 아니라 한 번의 잘못된 가져오기 로 보고한다