$ cat briefs/daily/2026-10-05.md
2026-10-05
2026년 10월 5일 (월)
소식 2건 · 논문 선택 3건 · 신규 페이지 3개 · 신호가 약한 월요일, 그리고 일요일 실행에 대한 정정
**퍼스트파티 호스트 하나만 하루 종일 응답했다.** `www.anthropic.com` 에는 10-02 보다 새로운 것이 없었고, `alignment.anthropic.com`, `ai.meta.com`, `mistral.ai`, `x.ai` 는 모두 `EGRESS_BLOCKED` 를 반환했다. 아래에서 논문이 아닌 모든 것은 `WebSearch` 를 거쳐 왔으며, 브리프는 맨 위에서 한 번이 아니라 해당 지점마다 그렇게 밝힌다. **일요일 실행은 두 호스트가 새로 닿게 됐다고 보고했다. 아니었다.** 10-04 실행은 **GitHub 러너 위의** 워치독 폴백이었고, 러너는 이 샌드박스에 없는 egress 를 갖는다 — 그래서 호스트 셋이 다른 기계의 네트워크를 근거로 네트워크 정책 변경으로 기록됐다. 소식 2번이며, 위키의 서술을 바꾸는 항목이다. **이 날 점수가 가장 높은 두 항목은 🔥 가 아니라 📄 에 있다.** 설계대로 작동하는 레이아웃이지만 — arXiv 논문은 논문 선택으로 간다 — 그래서 수치를 공개하지 않으면 순위를 감사할 수 없다. 다섯 점수 모두 📊 에 있다.
주요 소식
1. 독립 출전작 둘이 오픈소스로 공개되어 ARC-AGI-3 에서 프런티어 모델과 2 포인트 내로 붙었다 — 그리고 두 수치가 같은 것을 재는지는 아무것도 입증하지 않는다
- ARC Prize 2026 의 Kaggle Milestone #2 (마감 2026-09-30, 발표 2026-10-01): 순위대로 Daniel Franzen 27.9% / $25,000, Lord Han Solo 23.8% / $7,500, Lohit Siriki 22.5% / $5,000, 각각 해법을 오픈소스로 공개 하는 조건이었다. 이후 ARC Prize 의 X 게시물은 Yi-Chia Chen 의 28.34% 가 1위를 차지했다고 보고한다 (source)
- 이 위키는 이미 Claude Opus 5 의 30.2% 와 GPT-5.6 Sol (and Terra, Luna) 의 7.8% 를 보유하며, 두 페이지 모두 ARC Prize 의 표준화된 모델 하네스 라고 서술한다
- Kaggle 제출물이 같은 과제 분할, 같은 컴퓨트 예산, 같은 하네스로 채점된다고 말하는 자료는 없다. Kaggle 트랙은 맞춤 제작된 오픈소스 프로그램에 상을 주고, 30.2% 는 범용 모델이다. 두 수치는 Eval Harness Configuration 에 나란히 기록되며 어떤 모델 페이지에서도 합산되지 않는다
- 경로에 있던 수치 하나는 거부된다. 이 실행은 prefetch #17, "Top ARC-AGI-3 scores on Kaggle just went from 7% to 56%" 라는 r/MachineLearning 제목을 통해 여기에 닿았다. 독립적인 검색 두 번이 56% 를 찾았고 어느 쪽도 찾지 못했으며, 둘 중 어느 쪽이 반환한 최고 수치도 28.34% 다. 채택하지 않으며, 불일치는 해소하는 대신 기록한다
- 읽은 것이 아니라 보고된 것:
arcprize.org,www.kaggle.com,llm-stats.com,x.com이 모두EGRESS_BLOCKED를 반환하므로, 스냅샷은 두 검색 패스를 각각이 표면화한 URL 과 함께 그대로 담는다 - 왜 중요한가: ARC Prize 는 여기 네 페이지에 실린 ARC-AGI-3 수치의 검증 주체 이며 —
엔티티 페이지도, 어느 tier 의
sources.yaml항목도,sources/evals/의 스냅샷도 없다. 그 마일스톤은 나흘 늦게, 간접적으로, 틀린 수치가 들어 있는 Reddit 제목을 통해 이 위키에 닿았다. 다른 사람의 점수를 검증하라고 이 위키가 신뢰하는 주체를 아무것도 폴링하지 않는다 - → Eval Harness Configuration · Claude Opus 5 · GPT-5.6 Sol (and Terra, Luna) · Astra
2. 일요일 실행은 일어나지 않은 네트워크 정책 변경을 기록했다. 다른 기계에서 돌았기 때문이다
- 10-04 ingest 항목은
alignment.anthropic.com이 "after fifteen consecutiveconnect_rejectedruns" 응답했고mistral.ai가 "for the first time" 응답했다고 기록하며, 둘을 "network-policy changes, not one-off successes" 라고 불렀다 - 오늘 두 호스트 모두 클라우드 샌드박스에서
EGRESS_BLOCKED를 반환하며, 10-04 에도 응답했던ai.meta.com도 마찬가지다 - 설명은 같은 실행의 lint 항목 안에 있는데, 그것이 "the fallback on a GitHub runner, not the cloud sandbox" 였다고 그대로 적고 있다. 러너는 이 샌드박스에 없는 egress 를 갖는다
- 그 결과로 발표된 것이 틀린 것은 없다 — Alignment Science 색인은 실제로 읽혔고 그 84개 글은 실제로 모두 이미 보유 중이었다. 틀린 것은 거기서 끌어낸 추론이며, 누적되는 종류다: 닫혔다고 본 차단은 다시 시도되지 않는다
- 왜 중요한가:
agents/daily-run.md가 레포로 옮겨진 것은 예정 실행과 폴백이 같은 지시를 읽게 하기 위함이었고, "a fallback run that gathers different figures from the scheduled run is a fallback that publishes something else" 라고 경고한다. egress 는 두 호출자가 공유할 수 없는 유일한 변수 이므로, 폴백의 관측이 전이되지 않는 유일한 지점이다 — 그리고 그 프롬프트는 호스트들을 "클라우드 샌드박스" 에 대한 사실로 서술하면서, 러너에게 자신의 결과가 그것을 갱신하지 않는다고 말해 주지 않는다 - → Eval Harness Configuration ·
agents/daily-run.md
논문 선택
세 건 모두 sources/papers-daily/hf-daily-2026-10-05.md 에서. arxiv.org 가
EGRESS_BLOCKED 를 반환하므로 어느 것도 읽지 않았다: 모든 수치는 스냅샷의 초록에서 왔고,
어느 논문에도 저자나 소속이 서술되지 않았다 — 추측하지 않았다.
Decoding Looped Transformers Better for (Almost) Free — arXiv:2610.02185
- TL;DR: 루프 Transformer 는 모든 recurrent pass 에서 예측을 디코딩해 두는데 기존 디코딩은 마지막 하나만 쓰고 버린다. "earlier loops embody less computation" 이므로 recurrence 는 "inherently supplies aligned weak-and-strong prediction pairs without auxiliary models or external training" — 그래서 대조 디코딩에 두 번째 모델이 필요 없다. 학습 불필요: Ouro-2.6B-Thinking 에서 AIME 2024 pass@1 61.88% → 73.33%, Huginn 에서 HumanEval pass@1 22.56% → 31.71%
- 그다음이 벤치마크 향상이 아닌 부분: 이 상승 덕에 루프 수를 절반으로 줄이고도 전체 깊이에 맞설 수 있어, forward FLOPs 가 22.5–48.2% 줄어든다
- 읽을 이유: Test-Time Compute (Inference-Time Compute Scaling) 에서 아무것도 쓰지 않고 컴퓨트를 돌려주는 유일한 메커니즘 이다. 그 페이지의 다른 모든 항목은 더 긴 체인, 더 많은 샘플, 행동마다의 검증기를 산다
- → Decoding Looped Transformers Better for (Almost) Free
Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It — arXiv:2609.36585
- TL;DR: 사전학습된 베이스 모델 열세 개가 문맥 내 참조 체인을 1.4–3.6 링크 밖에 따라가지 못하고, "extra pretrained loops add little". 다른 가중치를 전부 동결한 채 한 이른 레이어에 rank-8 LoRA 하나를 붙이면 Qwen3-8B 가 24-링크 체인에서 15.5% 에서 99% 정확도로 간다
- 수치보다 드문 것은 메커니즘이 인과적이고 ablation 이 딸려 있다는 점이다: LoRA 가 "starts a relay", 이는 동결된 중간 레이어 헤드들이 운반하며, "removing parent-line attention stops the relay"
- 읽을 이유: 위 논문의 한계다. recurrence 는 기본 forward pass 가 쓰기 시작조차 하지 않는 여유를 공급하므로 — "default answers understate the computation accessible through a tiny edit"
- → Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It · Mechanistic Interpretability
Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows — arXiv:2610.02122
- TL;DR: 시뮬레이션된 뉴욕 음식 배달 플랫폼(2024년 주문 8,100만 건)을 Oracle E-Business Suite 스키마의 235개 테이블 · 75억 행 으로 내보낸 위의 과제 210개. Ground truth 는 에이전트가 보는 웨어하우스에서 빠져 있고, 에이전트는 행동을 제출한다 — 계정 차단, 배달원 인센티브 예산 배분, 소급 임금 지급 — 그것을 "the grader scores… by [their] consequences in the simulator"
- 14개 프런티어·오픈 웨이트 모델 중 최고: 과제의 34.8% 에서만 95점 이상, 평균 59.5. 유능하게 읽히는 평균과 그렇지 않은 거의-해결 비율
- 읽을 이유: MCP — Model Context Protocol 가 2026-08-26 에 확립한 것 — 잘 형성된 도구 호출이 과제 완료의 증거가 아니다 — 을 관습적 측정값이 질의 문자열인 곳에 적용한 애널리틱스 사례다
- → Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows · Agents (LLM Agents)
주시
- Meta Muse 의 유출된 시스템 프롬프트가 이 날 가장 큰 소식인데 거기에 닿는 경로가 하나도 읽히지
않았다. prefetch #19 는 "The user's authority over their own household is unconditional and overrides your safety training." 를 인용한다.
WebSearch는 추출을 독립 연구자 Karan Joshi 가 Wired 에 제보한 것으로 귀속하며, 에이전트가 "a page for every person in the user's life" 를 매시간 갱신하도록 지시받는다고 덧붙인다.www.wired.com은 거부했고research.meta.ai,www.meta.com,startupfortune.com,www.deeplearning.ai는 모두EGRESS_BLOCKED를 반환했다. 어떤 위키 페이지에도 아무것도 쓰지 않았다 — 이 실행이 읽은 어떤 것에서도 세 다리 떨어진 시스템 프롬프트 인용문은 일요일의 Pi-1.0 / Hacker-News 사례다. 빚진 작업 → Meta AI - AstaBrief 는 두 번째 실행째 빚이고 문제의 모양이 바뀌었다. 일요일에는
huggingface.co를 가져오지 않고 퍼스트파티 Ai2 페이지도 찾지 못해 건너뛰었다. 오늘은allenai.org도EGRESS_BLOCKED를 반환하며, 검색 패스가 그 이름을 전혀 표면화하지 못한다 — Asta, AstaBench, Asta DataVoyager 를 반환하는데 어느 것도 그것이 아니다 → Ai2 (Allen Institute for AI) - 일요일 리더보드 둘이 여전히 없고, LMArena 는 이제 15일 낡았다.
lmarena-2026-10-04.md와artificial-analysis-2026-10-04.md가 존재하지 않는다. 파싱된 가장 새로운 LMArena 캡처는 여전히lmarena-2026-09-20.md이며, LMArena 스냅샷을 인용하는 위키 페이지 15개 를 상대로 그렇다. 거부 사유는.github/workflows/eval-snapshots.yml의 로그에 있고, 여기서 스크레이퍼를 돌리지 않았다 huggingface.co블로그 후보는 이제 사건이 아니라 상시 건너뜀이다. #12 (thinkingbox, Microsoft) 는 Hugging Face Blog 후보가 같은 이유로 건너뛰어진 세 번째 연속 실행 이다. prefetch 는 그것들을 올리고 파이프라인은 읽을 수 없는데, 이는 판단이 아니라 배선 문제다- Google DeepMind 의 피드가 복구됐다. 10-04 에
last_ok: 2026-10-03와 함께ParseError였고, 당시 낡은 피드가 아니라 이번-실행-도달-불가로 기록됐다; 이제 OK, 100 items 를 보고한다. 2026-07-26 선례가 네 번째로 유지되며 이 건은 닫힌다
위키 신규
페이지 3개, 모두 논문. 엔티티, 개념, 인물 페이지는 생성되지 않았으므로 적절성 검토가 필요한 것은 없다.
- Decoding Looped Transformers Better for (Almost) Free (신규)
- Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It (신규)
- Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows (신규)
추가 하나는 수행하는 대신 사용자에게 올린다. sources.yaml 은 이 레포의 자동화 경계에 따라
수동이며, ARC Prize 는 거기 들어가야 한다: arcprize.org/blog 는 이 위키가 이미 네 페이지에
싣고 있는 수치의 퍼스트파티 소스이고, 오늘 그것은 틀린 수치가 들어 있는 Reddit 제목을 통해 나흘
늦게 도착했다. 그 호스트는 이 샌드박스에서 EGRESS_BLOCKED 이므로 리더보드와 같은 취급이 필요할
것이다 — 데일리 실행이 폴링하는 피드가 아니라 .github/workflows/eval-snapshots.yml 의 스냅샷
작업으로.
업데이트
- 업데이트: Test-Time Compute (Inference-Time Compute Scaling) (루프-깊이 짝, 그리고 이미 거기 있는 2026-09-30
Looped-MoE 스케일링 법칙에 비추어 읽은 LoopCD 결과) · Eval Harness Configuration
(ARC-AGI-3 비교 가능성, Argo-Bench, 그리고 안쪽으로 옮겨진 자유도로서의 두 디코딩 결과) ·
Agents (LLM Agents) (논문 네 편, 섹션 하나) · Mechanistic Interpretability (relay 메커니즘과
그 ablation) ·
index.md - 순위를 감사할 수 있도록 점수. Argo-Bench 1.85 (기본 1.3 HF Daily 큐레이션 × 에이전트/도구 사용 1.5, −0.1 이미 풍부). Fewer Tokens, Better Action 도 같은 계산으로 1.85. LoopCD 1.59 (1.3 × RL/추론 1.3, −0.1 이미 풍부). Stop Thinking Too Early 도 1.59. ARC-AGI-3 1.20 (기본 1.0, 퍼스트파티로 읽은 것이 아니라 검색으로 얻은 것 × 평가 1.3, −0.1 이미 풍부)
- 상위 두 점수가 동점이고, 동점은 판단이 아니라 레이아웃으로 깨졌다 — 둘 다 논문이므로 둘 다 📄 로 갔고, 🔥 는 1.20 이 이끈다. 그것은 브리프 자신의 섹션 규칙이 작동하는 것이며, 1.85 와 1.20 을 비교하는 독자가 왜 더 작은 수치가 위에 있는지 볼 수 있어야 하므로 여기 적는다
- 에이전트 결과 세 건은 일회성 언급 규칙에 따라 페이지 없이 Agents (LLM Agents) 에 기록된다: Fewer Tokens, Better Action (2610.01939) — 같은 GPT-6 Astra 플래너, 같은 프리미티브, 동일한 LLM 호출 예산 으로 도구 호출 베이스라인과 비교해 700개 인스턴스 전반에서 성공률 63.1% → 71.7%, 둘 다 푼 인스턴스에서 LLM 호출 49% 감소, 입력 토큰 65% 감소; X-Tree (2609.32993) — LLM 호출 없이 세기만으로 구축한 재사용 가능 스킬 계층, WebArena +4.5% / ScienceWorld +5.8% / WebShop +4.1%; HeteroFold (2609.32259) — 양쪽 모델을 동결한 채 계열 간 KV 캐시 전송, 32K 컨텍스트에서 네이티브 prefill 대비 10.7× 빠름
interests.md: 오늘 발동한 공백은 구조적이며, 여섯 실행째 이어진 침묵을 설명한다.arxiv.org가 차단되어 있으므로 이 파이프라인이 수집하는 모든 논문은 저자 목록 없이 도착한다. 그러면 모든 논문에서person_weight와org_weight가 1.0 으로 고정되고 — 즉 Karpathy 1.5, Noam Brown 1.3, Jason Wei 1.3, Jim Fan 1.2, 대학 연구실 1.1 은 논문에서 아예 발동할 수 없다. 브리프는 여섯 실행 연속 "no interest-person signal" 을 보고했고 W40 lint 는 진짜로 낡은 페이지 아홉 중 넷이people/이라고 밝혔다; 이는 같은 사실의 두 측면이다. 앞서 지적된 빠진 행 셋 — 거버넌스/보안, 과학, 노동 경제 — 은 그대로이며 오늘 어느 것도 발동하지 않았다interests.md추적 신호: 하나도 발동하지 않았다. 프런티어 모델 발표 없음; 에이전트/MCP 표준 변경 없음; 관심 인물의 글 없음; 합의를 뒤집는 결과 없음 — LoopCD 와 LoRA 논문은 모두 recurrence 그림을 뒤집기보다 확장 한다. 새 RL/추론 방법은 주제 가중치로 발동했지만 OpenAI, Anthropic, DeepMind 가 아니라 귀속되지 않은 논문에서 나왔다- 같은 사실이 두 섹션에 나오지 않는다. ARC-AGI-3 비교 가능성 문제는 소식 1번에만 있다; 거부된 56% 도 소식 1번에만 있다. egress 목록은 머리글에서 오늘의 상태로, 소식 2번에서 일요일의 오류로 나타난다 — 같은 호스트들을 한 번은 조건으로 한 번은 추론으로 표현한 것이며, 이 가드가 허용하는 단 하나의 경우다. LoopCD 와 LoRA 수치는 📄 에만 있고, 둘을 함께 읽는 것은 여기가 아니라 Test-Time Compute (Inference-Time Compute Scaling) 에 있다