$ cat briefs/daily/2026-09-23.md
2026-09-23
2026년 9월 23일 (수)
스토리 3건 · 논문 2편 · 주시 3건 · 새 페이지 7개
**24시간 안에 프런티어 모델 출시가 셋, 그런데 둘씩 짝지어 공유하는 벤치마크가 하나도 없다.** Anthropic은 Terminal-Bench 4.0, FrontierCode, CursorBench를 공개했고, OpenAI는 DeepSWE v1.1 하나만 공개했으며, Xiaomi는 Artificial Analysis 복합 지표로만 보고된다. 따라서 아래의 공급사 간 비교는 모두 구조 — 가격, 라이선스, 가용성 — 에 관한 것이며 점수 비교는 하나도 없다. **`www.anthropic.com`과 `platform.claude.com`이 이번 실행에서 1차로 응답했다.** 09-01과 09-22 실행은 둘 다 Anthropic을 `EGRESS_BLOCKED`로 기록했다. `openai.com`, `thenewstack.io`, `www.digitalapplied.com`은 여전히 차단되어 있어, OpenAI 관련 내용은 OpenAI 자체 피드가 정체를 고정한 검색 발췌다.
주요 소식
1. Anthropic이 내놓은 모델의 핵심은 더 싸다는 것 — 그리고 그러면서 출시 표에서 SWE-bench를 뺐다 (1.69)
- Claude Opus 5.5, 2026-09-22 출시,
claude-opus-5-5: $4/M input · $20/M output, 캐시 읽기 $0.20/M, 1M 컨텍스트, 최대 출력 128K, 적응형 사고 항상 켜짐에 기본 effortmedium, 학습 컷오프 Jun 2026. Claude 앱, Claude Code, API, Bedrock, Vertex, Microsoft Foundry에서 당일 제공 (source) - Anthropic의 주장은 Opus 5보다 약 40% 낮은 비용으로 Fable 5.1 수준의 작업이며, 밝힌 메커니즘은 토큰당 가격이 아니라 작업당 토큰이 더 적고 출력이 30% 이상 빠르다는 것이다. 문서는 이제 대부분의 워크로드를 여기서 시작하라고 말한다
- 출시 표: Terminal-Bench 4.0 66.4% (Fable 5.1 55.8%, Opus 5 52.3%), Terminal-Bench-Science 0.1 58.7% 대 Opus 5의 29.0%, Humanity's Last Exam 67.7%, GDPval-AA v2.1 1846 Elo, AutomationBench 40.0%
- preserved thinking 탑재. API 사용자가 Claude의 추론을 끌어내려고 이전 컨텍스트를 편집하는 것을 막는 증류 방지 장치로, 역량 제한을 대표 기능으로 내세운 것이다
- 왜 중요한가: Anthropic의 지난 1년치 항목은 모든 릴리스를 SWE-bench로 직전 모델과 견줬다. 이번 표에는 SWE-bench 계열 행이 아예 없고, 그래서 같은 날 OpenAI가 공개한 DeepSWE 수치와 비교할 수 없다 — 벤치마크의 갈라짐이 이제 각주가 아니라 본론이다
- 확립되지 않은 것: 어느 행에도 effort 수준이 적혀 있지 않은데 이 모델은
medium, Fable 5.1은high가 기본이다. 40%와 30% 수치는 Anthropic의 것이고 여기서 측정되지 않았다 - → Claude Opus 5.5 · Anthropic · Eval Harness Configuration
2. OpenAI가 GPT-6 가격을 두 모델 모두 반으로 내렸고, 그 근거로 벤치마크 하나를 공개했다 (1.63)
- GPT-6 Sol과 GPT-6 Luna, 2026-09-22 출시, GPT-6 Astra로부터 19일 뒤. 둘 다 1.05M 컨텍스트, 최대 출력 128,000, 추론 설정
none부터max까지 (source) - Sol $2/$10, GPT-5.6 Sol의 $4/$20 대비. Luna $0.10/$0.50, GPT-5.6 Luna의 $0.20/$1.20 대비. 캐시 입력은 90% 할인 — $0.20/M과 $0.01/M
- DeepSWE v1.1이 공개된 기록의 전부다: max effort에서 Sol 68.8%, Luna 66.6%, xhigh의 Claude Fable 5 69.9% 대비. OpenAI는 Sol의 작업당 비용을 Fable 5보다 약 80% 낮다고, Luna는 Opus 5보다 93%, Fable 5보다 96% 낮다고 말한다
- Free와 Go 사용자가 데스크톱 앱에서 Luna를 쓴다 — 무료 등급에 닿은 첫 GPT-6 모델이다. 두 모델 모두 아직 Chat에는 없다
- 왜 중요한가: OpenAI의 Astra 항목은 전부 역량 상한과, 그 출시를 늦춘 Preparedness Framework 처리에 관한 것이었다. 이번은 정반대다 — 상한은 그대로 두고 바닥을 반으로 내렸으며, 가장 싼 등급은 무료로 풀었다
- 확립되지 않은 것: 벤치마크가 하나뿐이므로 두 모델 모두 소프트웨어 엔지니어링 밖으로는 아무 말도 할 수 없다. Sol의
max와 Fable 5의xhigh는 각각 공급사의 최상위 설정이지 같은 설정이 아니다. 그리고 읽은 자료 어디에도 두 모델의 Preparedness Framework 분류가 없다 — OpenAI가 Critical 사이버보안 임계에서 확인한 첫 모델로부터 19일 뒤에 나온 모델로서는 실질적인 공백이다 - → GPT-6 Sol · GPT-6 Luna · OpenAI
3. 세계 최고 오픈 웨이트 모델이 휴대폰 제조사의 것이 됐다 — 학습 환경까지 붙여서 (1.40)
- Xiaomi가 2026-09-22에 MiMo-V2.6-Pro를 공개했다. 총 1.02T / 활성 42B 희소 MoE, 1M 컨텍스트, 옴니모달(텍스트·이미지·비디오·오디오 입력), Hugging Face에 MIT — 함께 MiMo-V2.6-Flash(309B/15B)와 9B 증류 모델 (source)
- RL 스택과 학습 환경도 함께 공개됐다. 이 위키에서 가중치 공개는 일상적이지만, 그것을 만들어 낸 강화학습 환경의 공개는 전례가 없다
- Artificial Analysis Intelligence Index v4.3.2에서 46으로 오픈 웨이트 모델 중 1위, GLM-5.3(45)와 Kimi K3(44)를 앞선다. Latent Space는 Pro 체크포인트를 **"trained for $3M"**으로 내세운다
- 왜 중요한가: 오픈 웨이트 선두는 올해 내내 DeepSeek, Z.ai, Moonshot AI 사이를 오갔는데, 그 어느 페이지에도 언급되지 않는 회사로 넘어갔다 — MIT로, 이 위키가 들고 있는 어떤 프런티어 수치보다 두 자릿수 배 낮다고 주장하는 학습 비용으로
- 확립되지 않았고, 여기서는 그것이 중요하다: 46은 이 저장소 자체 일요일 스냅샷이 아니라 Artificial Analysis 페이지에 대한 서드파티 보도이고 그 스냅샷은 이 릴리스보다 앞선다 — 2026-09-27 수집이 이를 확인해 줄 것이다. 10개 평가 복합 지표에서 1점 차이는 순위가 발견이 되지 못하는 범위 안이다. 공급사 벤치마크 표는 전혀 얻지 못했고, $3M은 성격 규정이지 Xiaomi의 발언이 아니다
- → MiMo-V2.6-Pro · Xiaomi · Open-Weights Policy Fight
논문 선택
오늘의 두 편은 모두 에이전트 하니스에 관한 것이고 같은 HuggingFace Daily Papers 묶음에서 나왔다. 같은 대상을 양끝에서 다루기 때문에 하나가 아니라 둘 다 싣는다.
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses — arXiv 2609.24972
- TL;DR: 스스로 진화하는 하니스는 자기가 진화 대상으로 삼은 과제에 과적합한다 — 분포 밖에서는 이득이 "줄어들거나 아예 사라진다". RRSI는 제안자를 감소 예산으로, 선택자를 비평자와 가지치기로 제약해 분포 내 최대 14.1점, 다섯 개 분포 밖 벤치마크에서 최대 4.7점을 보고하며, 그 하니스는 정책 토큰을 30% 적게 쓴다
- 읽을 이유: Eval Harness Configuration이 걱정하려고 존재하는 바로 그것을 수치로 만든다. 하니스가 자기 대상 분할에서 14.1점의 값어치라면, 하니스가 명시되지 않은 벤치마크 수치는 누군가 손볼 이유가 있었던, 명시되지 않은 인공물을 측정한 것이다
- → RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
Harness-Zero: Harness Distillation via Agent-as-Harness — arXiv 2609.24974
- TL;DR: 특화 하니스의 행동을 가중치 안으로 학습시켜 배포 시점에 떼어낼 수 있게 한다. 하니스를 없앤 상태에서 거시 평균 과제 성공률 **23.3% → 44.3%**로, 하니스를 그대로 붙인 기본 모델의 **41.7%**를 넘는다
- 읽을 이유: 23.3% → 41.7% 격차는 가중치를 바꾸지 않은 채 하니스가 얼마짜리인지를 깔끔하게 측정한다. 증류가 교사를 넘어선다는 주장은 절제 실험 없이 단언되어 있고, 분산이 적히지 않은 2.6점은 확립된 것으로 다루면 안 된다
- → Harness-Zero: Harness Distillation via Agent-as-Harness
주시
- Qwen 4는 이름 넷을 얻었고 그 외에는 아무것도 없다. Apsara 컨퍼런스에서 Alibaba는 Qwen 4 Max, Plus, Flash, 27B를 이름 지었다 — 출시일도, 가격도, 컨텍스트 윈도우도, API id도, 가중치도, 어떤 벤치마크도 없다. 헤드라인의 5–10T 파라미터 수치는 Qwen 4가 아니라 Qwen 4.5와 Qwen 5를 가리킨다; 보도는 둘을 뭉갠다. 모델 페이지를 만들지 않았다 —
unknown행들과 이름 하나로 된 표는 속 빈 스텁이다 → Alibaba / Qwen AI Lab (source) - 공급사 셋, 벤치마크 모음 셋, 하루. Anthropic은 Terminal-Bench 4.0 / FrontierCode / CursorBench, OpenAI는 DeepSWE v1.1, Xiaomi는 AA 복합 지표. 오늘의 세 릴리스 중 어느 둘도 공개된 수치로 비교할 수 없다. 이것이 Eval Harness Configuration이 열린 이유이며, 지금 그 폭이 가장 넓다
- 호스트 하나가 돌아왔다. 이번 실행에서
www.anthropic.com과platform.claude.com이 클라우드 샌드박스에서 정상 응답했다. 09-01과 09-22는 Anthropic을EGRESS_BLOCKED로 기록했다. 상시 정책 목록(lmarena.ai,artificialanalysis.ai,huggingface.co,openrouter.ai)은 그대로이고 여전히 CONNECT에서 거부하므로 한 줄 적어 둔다
위키 신규
검토용 — 오늘 만들어진 새 엔티티·모델 페이지.
- Xiaomi (새 엔티티 — 검토 권장. 릴리스 하나는 전략이 아니므로
주요 인물과전략적 위치는 추측하지 않고 의도적으로 비워 두었다) - Claude Opus 5.5 (신규)
- GPT-6 Sol (신규)
- GPT-6 Luna (신규)
- MiMo-V2.6-Pro (신규)
- RRSI: Regularized Recursive Self-Improvement of Agent Harnesses (신규)
- Harness-Zero: Harness Distillation via Agent-as-Harness (신규)
업데이트
- Anthropic: Opus 5.5를 모델과 제품 및 최근 활동에 추가. 08-31 이후 처음으로
www.anthropic.com을 1차로 읽었다 - OpenAI: GPT-6 Sol과 Luna를 모델과 제품 (2026) 및 최근 활동에 추가
- Alibaba / Qwen AI Lab: Qwen 4 Apsara 명명을 기록하고, 파라미터 수치 오독을 표시하고, 페이지를 만들지 않기로 한 판단을 적었다