AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-09-19.md

2026-09-19

2026년 9월 19일 (토)

스토리 3 · 논문 추천 2 · 주시 항목 4 · 신규 페이지 5

**오늘 브리프에 실린 모든 것이 09-16 또는 09-17 에 공개되었고, 어제 실행은 그 전부를 찾아보았으나 하나도 찾지 못했다.** 그 기록은 Anthropic 뉴스룸 검색이 "2026-09-17 자 Anthropic 공개물이 없다고 보고한다"고 그대로 적고 있다. 쓰인 시점에 그것은 틀렸고, 스윕이 실패해서가 아니다. 실행이 미국 오후의 포스트로부터 약 여섯 시간 뒤에 떴고 검색 인덱스가 따라잡지 못했을 뿐이다. **랩이 공개한 시점과 이 파이프라인이 그것을 볼 수 있는 시점 사이의 지연은 대략 하루이며**, 조용한 날 이 브리프가 찍는 것이 바로 그 스윕의 부정 결과이기 때문에 알아 둘 가치가 있다. 도착한 것들은 서로 무관한 네 항목치고는 유난히 맞물린다. **두 랩이 AI 가 얼마나 빨리 움직이는지를 논할 도구를 24시간 간격으로, 서로 다른 형식으로 공개했다.** 제3자 하나가 남의 모델을 9배 작게 만들어 출하했다. 그리고 별개의 논문 세 편이 에이전트 하네스를 해체했다.

+5new pages
[01]

주요 소식

1. Claude 가 4주 동안 생물학 모델 36개를 다시 썼고, 커널을 짜 본 적 없는 두 사람이 감독했다 (2.24)

  • How Claude is uplifting biomolecular modeling, 2026-09-17, 여기서 포착은 day +2. www.anthropic.comEGRESS_BLOCKED 이므로 모든 수치는 패스 수가 붙은 검색 추출이다 (source)
  • 4주가 채 안 되는 기간에 30종 넘는 오픈소스 모델에 걸쳐 최적화 패키지 36개, 여섯 계열에서 — co-folding 과 구조 예측 14, 유전체학 7, 구조 생성 6, hallucination 3, inverse folding 3, 단백질 언어모델 3. 정밀도 손실을 최소화하며 평균 약 4배 빠르게, 그리고 출력이 동일한 조건에서 거의 2배. 두 충실도 조건 아래의 두 가속치인데, 보도는 대개 앞의 것만 인용한다
  • 감독에 관한 세부가 이 이야기다. 기술 스태프 두 명이 감독했다. 그들은 생체분자 모델링 경험은 있었고 추론 최적화나 커널 엔지니어링 경험은 없었다 — 따라서 산출물이 더 빠르다는 것은 확인할 수 있었고, 어떻게 더 빠르게 만들어졌는지는 확인할 수 없었다
  • 함께 나온 것: 10,000 토큰이 넘는 시스템을 NVIDIA GPU 노드 한 대에 올리는 저메모리 모드, 최적화 코드 전부 오픈소스화, 그리고 Adaptyv Bio 와의 단백질 설계 경진 — 참가자 부담 없이 5,000개 넘는 설계에 대한 웻랩 검증에 공동 후원 $1M, Claude 크레딧 $1M 추가, Modal 의 컴퓨트 $250,000, Twist Bioscience 의 DNA
  • 왜 중요한가: 이 위키가 쥔 모든 에이전틱 코딩 증언은 투입을 보고한다 — Databricks 엔지니어의 ~60% 추가 지출, Yegge 의 월 수천 달러. 이것은 오픈소스화된 산출물을, 명시된 가속치와 함께 보고한다. Agents (LLM Agents) 에서 제3자가 믿고 받아들이는 대신 직접 다시 돌려 볼 수 있는 첫 항목이며 — 아무도 그러지 않았으므로, 4배는 여전히 벤더의 에이전트에 대한 벤더의 숫자다
  • 확립되지 않은 것: 기준 하드웨어 없음, 모델별 가속표 없음, "최소 정밀도" 조건의 정확도 차이 없음, 경진 일정 없음. 한 매체 헤드라인이 다른 어떤 패스도 뒷받침하지 않는 100배 비용 수치를 싣고 있다. 스냅샷에는 있고 어떤 페이지에도 없다
  • Agents (LLM Agents) · Anthropic

2. Anthropic 이 자기 AI R&D 중 얼마를 AI 가 하는지 숫자를 공개했고, 26% 다 (2.23)

  • Measurements for understanding the pace of AI development inside frontier labs, 2026-09-17, Anthropic Institute 경로. 프로토타입 R&D 자동화 지수의 첫 결과와, 측정 두 가지 — 자율 에이전트 감독컴퓨트 배분 — 가 함께이고 둘 다 읽은 자료 안에 수치가 없다 (source)
  • 척도는 AL0–AL5, 한 패스가 Epoch AI 의 것이라 적는다: AL3 는 사람의 밀착 지시 아래 협업하는 AI, AL4주도 — 사람이 감독하는 가운데 "높은 수준의 프롬프트 하나로 작업 대부분을 처음부터 끝까지 완료" — AL5 는 완전 자율
  • 2026년 8월 기준: AI R&D 작업의 26% 가 AL4, 90% 초과가 AL3 이상, AL5 는 없음
  • 어떻게 만들었나: 7월의 매주, 모델 R&D 부서 직원의 20% 를 표본으로; Claude 가 Slack 과 문서를 읽어 그들의 작업을 식별해 약 15,000 개 작업을 만들고; Claude 가 그것을 542 개 범주로 정리
  • 왜 중요한가: Frontier Pacing 은 2026-07-28 이래 입장을 모아 왔다 — 직원 서한, 에세이, 3단계 계획, 표준 — 그리고 점검 가능한 양은 하나도 없었다. Amodei 의 09-12 약속은 공개 권한을 가진 평가자를 회사 안에 두었으나 계약된 평가자도, 계약서도, 개시일도 없었다. 도구도 없었다. 이것이 도구이고, 닷새 뒤에, 다른 랩이 돌려 볼 수 있도록 방법론과 함께 공개되었다
  • 비판은 구조적이고 읽은 자료 어디도 답하지 않는다: Anthropic 이 자기 직원을 표본으로 뽑았고, Claude 가 기록을 읽었고, Claude 가 범주를 세웠고, Anthropic 이 척도를 적용했다. 한 매체의 틀 — "'주도'는 당신이 생각하는 뜻이 아니다" — 은 타당하다: AL4 는 모든 작업에 사람을 남겨 두고 AL5 는 전무하며, 이는 "AI 가 AI 를 만든다"는 헤드라인보다 좁다
  • 드러내 둔 느슨한 끝 둘: 표본은 7월인데 헤드라인은 8월 기준으로 봉합되지 않았고, 시작점은 세 패스의 "2월에 1% 미만" 대 한 헤드라인의 "3월에 1%"
  • R&D Automation Index (신규) · Frontier Pacing

3. 5.9 GB 에 담긴 27B 모델, 그리고 헤드라인의 보존율은 로컬 에이전트 사용자에게 필요한 숫자가 아니다 (1.90)

  • 한 패스가 Caltech 스핀오프라 적는 PrismML2026-09-17Ternary Bonsai 2 27B 를 공개했다: Alibaba 의 Qwen 3.8 27B 를 FP16 그룹별 스케일링과 함께 3진 {−1, 0, +1} 로 양자화, 가중치당 유효 1.76 비트, FP16 의 53.80 GB 대비 5.93 GB, 같은 262,144 토큰 컨텍스트, 텍스트와 이미지 입력, Apache 2.0, GGUF 와 MLX, 16 GB 노트북 또는 24 GB GPU 한 장에서 구동 명시 (source)
  • 헤드라인은 98.2% 보존 — 추론, 수학, 코딩, 지시 따르기, 비전, 에이전틱 tool use 에 걸친 20개 벤치마크에서 부모의 85.4 대비 83.9 종합. 비전 96.3%, 지식과 추론 96.9%
  • 그 묶음 바깥에서는 다른 숫자다. Terminal-Bench 2.1 에서 69.7 대비 52.8 — 약 75%, SWE-bench Verified 도 같은 구간으로 진술되고 수치는 없다
  • 어느 쪽도 틀리지 않았고 서로 충돌하지도 않는다. 다른 질문에 답할 뿐이고, 터미널을 오래 모는 일을 기술하는 쪽이 헤드라인에 없는 쪽이다
  • 왜 중요한가: Alibaba / Qwen AI Lab 페이지는 6월 이래 자기 모델이 허락 없이 가져가지는 일을 기록해 왔다 — 상원 서한, GTG-16005, 1억 5,100만 건의 교환. 이번 것은 같은 가중치가 Alibaba 가 고른 라이선스 아래 허락 위에서 가져가진 것이고, 가져간 쪽이 결과를 공개했다. 이 위키가 쥔 Qwen3.8 27B 의 첫 제3자 에이전틱 측정치가 경쟁사 릴리스 노트 안에서 도착했고 — 거기 적힌 것은 69.7, Qwen 3.8 27B 가 Alibaba 자신의 모델 카드에서 싣고 있는 것은 73.0 이다. 어느 쪽도 하네스를 밝히지 않은 3.3 포인트 불일치, 신규 페이지에 공개하고 봉합하지 않았다
  • 확립되지 않은 것: 가격 없음, 호스팅 엔드포인트 없음, 처리량과 에너지는 둘 다 주장되지만 수치 없음, 그리고 Bonsai 2 에 대한 제3자 평가 전무. 09-18 의 GGUF ~406,000 다운로드는 유통이지 품질이 아니다
  • Ternary Bonsai 2 27B (신규) · PrismML (신규) · Open-Weights Policy Fight
[02]

논문 추천

An Empirical Study of Harness Design for Coding AgentsarXiv 2609.20804

  • TL;DR: 코딩 에이전트의 실행 루프를 고정하고 계획, 행동 공간, 컨텍스트 관리176 개의 짝지어진 설정, 네 모델, SWE-Bench Verified 와 Terminal-Bench 2.1 에 걸쳐 바꾼다 — 하네스를 통짜가 아니라 부품이 있는 물건으로 다루는 이 위키의 첫 연구
  • 발견: 컨텍스트 관리의 이득은 대부분 컨텍스트 오버플로 실패를 막는 것이고, 규칙 기반 생략을 LLM 요약 앞에 두는 것이 이기며, 생략 내용을 복원 가능하게 만드는 것은 "모델이 거의 쓰지 않는 기계 장치를 더할 뿐 정확도 이득을 내지 못한다"; 계획은 약한 모델에게 정확도 버팀목이고 강한 모델에게 비용 절감 수단; bash 를 다루는 모델은 미리 정의된 도구보다 비용에서 앞선다
  • 읽을 이유: Eval Harness Configuration 이 존재하는 이유는 벤치마크 수치가 이름 없는 하네스에서 나오기 때문이다. 이 논문은 그 이름 없는 물건이 무엇을 하는지 측정하고, 하네스는 동일하게 고정해 둘 수 있는 상수가 아니라 그 효과 안에 모델의 강도가 들어 있는 것임을 찾아낸다. 복원 가능한 생략의 부정 결과는 개선만 보상하는 분야라면 아무도 내놓지 않을 부분이다
  • An Empirical Study of Harness Design for Coding Agents

Agora: Git as Shared Memory for Collective AutoResearcharXiv 2609.18094

  • TL;DR: 집단 자율 연구를 Git 커밋의 추가 전용 DAG 로 저장해 모든 주장이 누구나 체크아웃하고 다시 돌릴 수 있는 커밋이 되게 한다. 첫 실행: 13 워커, 거의 12일, 배정 과제 없음, 중앙 계획자 없음, 1,703 건의 기여; 학습 데이터도 그래디언트도 없이 141개 도너 모델로부터 동결된 119.6M 파라미터 attention-SSM 하이브리드를 초기화해 평가기를 3.39 → 1.899 bits per byte 로 움직였다
  • 결과는 실패 없는 165건의 독립 재현과, 15개 계정에 걸친 145개 커밋의 계보를 가진 우승 레시피다
  • 읽을 이유: 자신의 교란 요인을 먼저 보고한다 — 단일 문화에서 끌어낸 실행 중간의 사람 구조 한 번, 이 기록이 확립하는 것과 확립하지 않는 것, 그리고 돌리지 않은 대조 비교. 그렇게 말하는 12일짜리 단일 팔 연구는 그러지 않는 연구보다 쓸모 있다
  • Agora: Git as Shared Memory for Collective AutoResearch
[03]

주시

  • spec-check 충돌 12건, 이제 21일째 — 그리고 09-17 이래 향하던 곳이 내일이다. Action 실행 100 (2026-09-18 07:11 UTC, 예약)은 정의된 exit-2 unreachable 분기가 아니라 충돌 분기를 통해 1 로 종료하므로, 이것은 장애가 아니라 발견이다. 작업 로그는 ok 로 끝나므로 Slack 은 수신하고 있다. 찍힌 여덟 줄은 바이트 단위로 어제의 것이다: 1차 수치의 정확히 절반인 DeepSeek 페이지 둘, 정확히 두 배인 Gemini Flash 페이지 넷과 4배인 하나, 그리고 glm-5-3-flash 컨텍스트 1,048,576 대 1,310,720. 그중 두 계열은 틀린 숫자가 아니라 빠진 티어 라벨로 보인다. 일요일 W38 lint 가 하루 앞이고 그것이 가져간다. spec-check.py 는 여기서 돌리지 않았다 — openrouter.ai 가 이 샌드박스에서 차단되어 있다
  • 2609.20519 (SoL-Pi) 는 읽었고 페이지를 주지 않았다. 구성 요소를 설계하는 대신 auto-research 루프로 발견해 넷을 남긴다 — 행동 실행, 컨텍스트 압축, 관측 처리, 위임 읽기 — 51과제 EdgeBench 에서 비슷한 성능에 토큰 트래픽 44.7~49.0% 감소와 API 비용 약 1/3 감소. 두 번째 메커니즘이 Context Compaction 이고, 그 페이지는 어제 외부 출처가 없는 프롬프트 인젝션 채널이라는 이유로 생겼다. 같은 구성 요소가 동시에 가장 큰 토큰 절감이자 가장 새로운 공격 표면이다. 존재하지 않는 페이지로 가는 링크는 끊어진 링크라는 규칙에 따라 carry
  • Grok 4.7 은 세 번째 만료 창을 넘긴 아홉째 날에도 미출시이고, xAI 의 어떤 페이지도 움직이지 않았다. 최신 보유는 여전히 Grok 4.6 (2026-08-12)
  • 오늘의 중국 랩 로테이션 — Alibaba Qwen 과 MiniMax — 은 아무것도 내놓지 않았고, 그것이 결과다. Alibaba 는 Qwen 3.8-Max (2026-08-03) 와 Qwen 3.8 27B (2026-08-14) 보다 새로운 것이 없다. Qwen 4 는 여전히 발표된 날짜가 없고 9월 창은 여전히 2026-07-20 누출 하나뿐이다. MiniMax 의 M3 Pro 는 발표도, API 문자열도, 모델 카드도, 기술 보고서도 없이 아홉째 연속일로 보류된다. 무언가 출하될 때만 보고하는 로테이션은 아무 일도 없었다아무도 보지 않았다 를 구별하지 못한다
[04]

위키 신규

검토용.

[05]

업데이트

  • Google DeepMind: DeepMind Institute2026-09-16 출범 — 이사 Shane Legg (겸 managing editor), James Manyika, Demis Hassabis — AGI 에 관한 "서로 다른 견해를 드러내기" 위해서이고, 에세이 넷으로 문을 열었다: "The case for reasoning transparency" (Shah, Dragan), "Economic policy for AGI" (Jacobs, Imas), "Principles for a new utopianism" (Cave), 그리고 Hassabis 의 "A framework for frontier AI and the dawning of a new age". 1.09 로 채점되어 주요 소식에서 뺐다: 연구소 출범은 그 위의 어떤 항목도 아닌 product launches (0.7) 에 맞고, 새 페이지에 대한 +0.3 은 적용되지 않는다 — 페이지를 만들지 않았고 자료는 엔티티로 갔다. 거기에 이번 주 pacing 논증의 나머지 반쪽으로 기록했다: 측정은 경쟁하는 측정을 부르고, 논의 대상 랩의 이사가 편집하는 에세이 모음은 초대를 부르며, 원리상 점검 가능한 것은 둘 중 하나뿐이다. 날짜는 충돌이 아니라 해소 — Axios 09-16, TechCrunch 09-17, 그리고 09-16 이 한 패스가 말하는 수요일이었다 (source)
  • DeepSeek V4.1-Flash: 기술 보고서 2609.19969 가 가중치보다 아흐레 늦게 도착했고 그 페이지의 첫 인용 가능한 1차 문서다. 페이지가 결과만 쥐고 있던 메커니즘에 이름을 붙인다 — 890 bytes per token HBM 상주 캐시 뒤의 Compressed Sparse Attention 2 (CSA2) 계층 간 KV 캐시 재사용FP4 KV 캐싱, 그리고 SSD 나 호스트 메모리의 영속 캐시를 V4-Flash 의 약 1/8 로 줄이는 SWA Bounded Replay — 보도가 앞세우지 않은 두 번째 압축이다. 45T 토큰 멀티모달 코퍼스는 이 위키의 어느 DeepSeek 페이지에도 없던 첫 학습 규모 수치다. 890 bytes 와 8B prefill / 16B decode 분할은 09-11 이래 실려 온 단일 패스 수치에서 변하지 않았음이 확인되었다
  • Agents (LLM Agents): 새 ### 둘 — 하네스 논문 세 편 묶음, 그리고 가속치가 아니라 감독 구조로 읽은 생체분자 결과
  • Frontier Pacing: 09-17 과 09-16 에 대한 날짜 섹션 둘. 지수와 Institute 를 페이지가 이미 쥔 산출물 유형들 옆에 놓는다
  • Alibaba / Qwen AI Lab: 그 페이지의 모든 distillation 항목에 대한 허락 있는 짝