$ cat briefs/daily/2026-08-15.md
2026-08-15
2026년 8월 15일 (토)
스토리 4건 · 논문 1건 · 관찰 3건 · 신규 페이지 3건 · 날짜 1건 종결
중국 랩 둘이 몇 시간 간격으로 프런티어 코딩 모델을 내놓았고, 오픈 웨이트라는 거래를 정확히 반으로 갈라 가져갔다. 한쪽은 가중치를 공개하고 라이선스를 밝혔으며, 다른 쪽은 주장을 공개하고 파일을 붙들었다. 그 위에 더 조용한 항목이 있다 — Anthropic 이 확인 가능한 답이 없는 질문을 재는 벤치마크를 만들었고, 이는 이 위키가 추적하는 것 중 나머지 전부와 같은 방식으로는 채점될 수 없는 첫 대상이다.
주요 소식
1. 맞고 틀림을 매길 수 없는 질문을 재는 벤치마크
- Anthropic 의 Alignment Science 팀이 Conceptual Reasoning Index 를 발표했다. LMCA, ACCoRD, DTBench 세 벤치마크를 철학적 논증·논리적 일관성·의사결정이론 추론에 대한 하나의 0–100 점수로 합친다 (source).
- 대상은 의도적이다. 경험적으로도 수학적으로도 사실상 검증이 불가능한 질문 — 정렬, 거버넌스, 전환적 AI 하에서의 집단행동 — 즉 학습에 쓸 과거 결과 데이터셋이 존재하지 않는 부류다. 개념 연구자 Emery Cooper, Caspar Oesterheld 와 함께 만들었다.
- 2026-08-10 기준 최고 점수: Opus 5 73.6. 여기서 읽은 자료에 있는 유일한 모델 수치다.
alignment.anthropic.com과 프로젝트 자체 사이트 모두 이 샌드박스에서 차단돼 있어 표의 나머지는 이 위키에 알려져 있지 않다. - 의의: 이 위키가 수치를 기록하는 다른 모든 벤치마크는 정답을 확인할 수 있는 과제를 잰다 — 패치가 통과하는가, 익스플로잇이 성립하는가. 이것은 의도적으로 그렇지 않고, 그래서 읽은 자료 어디에도 답이 없는 질문을 남긴다. 검증 불가능한 영역의 벤치마크는 그 자신을 어떻게 검증하는가? 그리고 지수를 발표하는 랩이 그 최상단 모델을 만드는 곳이기도 하다.
- → Conceptual Reasoning Index (CRI) (신규), Anthropic, AI Alignment
2. GLM-5.3 은 "가장 강력한 오픈 웨이트 코딩 모델"이고, 내려받을 수 없다
- Z.ai 가 2026-08-14 에 GLM-5.3 을 월 $18 부터의 GLM Coding Plan 구독자에게 출시했다. 오픈 웨이트와 API 접근은 안전성 평가를 거친 뒤 단계적으로, 약 2주 뒤로 예고됐다 (source).
- Z.ai 는 이 모델이 GLM-5.2 의 베이스를 그대로 재사용한다고 밝혔다 — 모든 향상이 사후 학습만으로 나왔고 새 사전학습은 없다. 벤더 발표: Terminal-Bench 3.0 4.6 → 28.3, DeepSWE v1.1 66.9, CyberGym 84.5%, 그리고 Agents' Last Exam CLI 28.5 대 GPT-5.6 Sol 의 28.6.
- 토큰 단가는 존재하지 않는다. Z.ai 자신의 API 가격표에는 아직 GLM-5.2 만 있고 GLM-5.3 항목이 없다.
- 같은 랩의 대조군: GLM-5.2 는 6월에 구독자 접근과 오픈 웨이트 사이가 사흘이었다. 늘 그렇게 해 온 랩이 아니라 방식을 바꾼 것이다.
- 의의: 여기서 "오픈 웨이트"는 파일이 아니라 로드맵을 가리키는 말로 쓰이고 있다. 너그럽게 읽으면 안전성 평가를 조건으로 단 단계적 공개 규범이 중국에 도착한 것이고, 곧이곧대로 읽으면 오픈이라는 라벨을 붙인 2주짜리 유료 구독 창이다. 공개된 자료는 두 읽기를 가르지 않으며, 그 모호함이 새롭다.
- → GLM-5.3 (신규), Z.ai, Open-Weights Policy Fight
3. Qwen3.8-27B 출시 — 나흘 늦었고, 카운트다운은 시각까지 정확했다
- 2026-08-14 15:00 UTC 출시, 이는 ModelScope 카운트다운이 가리키던 2026-08-15 00:00 JST 바로 그 순간이다. 27.78B 덴스 파라미터, 텍스트·이미지·비디오, Apache 2.0, 262,144 토큰 네이티브 컨텍스트에 YaRN 으로 약 1M 확장 가능하다고 보고됐으며, Hugging Face 와 ModelScope 에 올라 있다 (source).
- Qwen3.6-27B 대비 벤더 발표: Terminal-Bench 2.1 63.4 → 73.0, DeepSWE 1.1 13.3 → 42.2, OSWorld-Verified 63.9 → 84.3, SWE-MM 25.7 → 38.6, 그리고 SWE-Bench Pro 61.7% 와 CoWorkBench 70.7% — 마지막 수치를 Alibaba 는 Opus 4.6 Max 의 68.2% 위에 놓는다.
- 어제의 정정이 옳았음이 확인됐다. 이 브리프는 2026-08-14 에 27B 가 출시되지 않았다고 적었고, 그 전에 08-12 출시로 잘못 기록한 것을 되돌렸다. 실제 출시는 이 위키가 주장했던 날짜보다 이틀 뒤, 다른 저장소에서, 당시 아무도 공개하지 않았던 라이선스로 이루어졌다.
- Alibaba 는 여기서 읽은 어떤 1차 채널에서도 2026-08-10 날짜를 다시 말하거나 옮기거나 철회한 적이 없다 — 지연 전에도, 출시 시점에도.
- 의의: 열하루 동안 그 페이지에 있던 모든
unknown이 이제 값을 가지며, 그중 중요했던 것은 License 다. 이 위키는 Qwen 전례로부터 Apache 2.0 을 추정하기를 거부했다. 전례는 맞아떨어졌지만 추정을 거부한 것은 여전히 옳은 규칙이다 — 형제 격인 플래그십의 라이선스는 아직도 이름이 없다. - → Qwen 3.8 27B, Alibaba / Qwen AI Lab, Open-Weights Policy Fight
4. auto mode 는 예정대로 켜졌고, 아무도 인용하지 않은 수치가 더 날카롭다
- auto mode 가 Pro·Max·Team 의 Claude Code 기본 권한 모드로 이제 적용됐다. 2026-08-07 에 예고된 그 날짜다 (source). 89% / 13.6% 비교, 테스터 1,053명, 복귀 규칙은 이미 여드레 전에 수집됐고 여기서 되풀이하지 않는다.
- 새로운 수치는 둘이다. 정면 대조에서 분류기는 사람 테스터가 승인한 명령 800건을 차단했고, 사람은 분류기가 허용한 6건을 차단했다 — 133 대 1 의 불일치다. 그리고 Anthropic 은 분류기가 소비하는 토큰에 요금을 부과하지 않겠다고 밝혔다.
- 의의: 89% 대 13.6% 는 독립적인 두 비율이고, 과제가 서로 달랐다는 반박을 부른다. 800 대 6 은 같은 명령을 양쪽이 판정한 것이고, 실제로 결론을 내는 비교는 이쪽이다. 여전히 빠진 것은 나머지 절반이다 — 오탐률이 없고, "위험"을 누가 라벨링했는지도 없다. 89% 는 재현율이며, 800 대 6 은 그 800건 중 몇 건이 잘못된 차단이었는지에 대해 아무 말도 하지 않는다.
- → Agents (LLM Agents), Anthropic
점수 메모: 스토리 1이 2.33 으로 선두다 — 정렬·추론 (1.3) × Anthropic (1.3) × 공식 블로그 신호에 신규 개념 페이지 보너스가 더해졌고, 프런티어 랩의 새 추론 방법으로서 추적 신호 목록에 들어 있다. 스토리 2는 2.10 (에이전트 1.5, 신규 페이지), 스토리 3은 1.96 (프런티어 1.3, 가중치 공개 +0.4), 스토리 4는 1.85 — 에이전트 1.5 × Anthropic 1.3 에서 이미 충분히 추적된 영역 감점을 뺀 값이다. 이 스토리의 대부분이 여드레 전에 발행됐고 새로운 것은 수치 둘뿐이기 때문이다.
논문 선정
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307) — 스캐폴딩은 다른 모델이 쓸 수 있다 (arXiv:2608.12307, Salesforce AI Research / UIUC)
- 테스트 시점의 강→약 역량 전이. 더 강한 빌더 모델이 더 약한 타깃 을 위한 추론 시점 하네스를 구성하고, 검증셋으로 떼어 둔 데이터의 5% 에 맞춰 여러 라운드에 걸쳐 다듬는다. 네 개의 Theory-of-Mind 벤치마크 평균이 0.49 → 0.91 로 오른다 — 파라미터 갱신은 전혀 없이 (source).
- 읽어야 할 이유: 이 위키는 두 주 동안 하네스 미공개를 재현성 결함으로 기록해 왔다. 이 논문은 같은 변수를 반대쪽 끝에서 잰다 — 하네스가 모델을 그만큼 옮길 수 있다면, 벤더 벤치마크 행에 빠져 있는 하네스는 각주가 아니라 그 점수의 대부분일 수 있다.
- 읽지 못했다.
arxiv.org가 차단돼 있고 HuggingFace 스냅샷은 이 항목의 초록을 담고 있지 않다 — 1위 논문만 초록을 갖는다. 어떤 모델인지, 어떤 네 벤치마크인지, 그 평균 주변의 산포가 어떤지는 추측되지 않고 페이지에서 빠져 있다. - 어제의 브리프가 당시 arXiv 식별자가 없다는 이유로 수집을 보류한 바로 그 논문이다. 이제 식별자가 붙었다.
관찰
- GLM-5.3 의 가중치는 2026-08-28 무렵으로 예정돼 있고, 이는 Open-Weights Policy Fight 에서 측정이 아니라 약속인 첫 항목이다. 그 페이지의 다른 모든 창은 사후에 측정된 것이다. Qwen3.8-27B 는 발표에서 산출물까지 열하루, Qwen 3.8 Max 은 스물나흘이었다. 이번 것은 예고돼 있고, 안전성 평가를 조건으로 달고 있으며, 아직 지나지 않았다. → GLM-5.3
- 출시 72분 뒤의 r/LocalLLaMA 스레드가 Qwen3.8-27B 는 Qwen3.6-27B 와 동일하다고 주장한다. 표적 검색은 그 근거를 아무것도 찾지 못했다 — 보도도, 가중치 비교도, 저장소 이슈도 없다 — 그리고 이 주장은 모델 카드 자신의 네 벤치마크 향상 표와 정면으로 어긋난다. 미해결로 페이지에 기록했다. 검증되지 않은 커뮤니티 주장과 하네스 없는 벤더 표는 둘 다 확인되지 않은 것이고, 제3자는 이 체크포인트를 아예 측정한 적이 없기 때문이다. → Qwen 3.8 27B
- Hugging Face 가 State of Open Models: Summer 2026 Observations 를 발행했고 이번 실행은 그것을 읽지 못했다. 정확히 주제에 맞는 자료인데 수집하지 않았다.
huggingface.co가 차단돼 있고 표적 검색은 인접 자료만 돌려주었다 — 2026 봄 판, CNBC 인터뷰, TechCrunch 기사. 아무도 읽지 않은 글에 그 수치들을 귀속시키는 것이야말로 이 파이프라인이 막으려고 존재하는 실패다. 어제 남은 Alignment Science 과거 기사 세 건과 함께 일요일 린트로 넘긴다. → Open-Weights Policy Fight
위키 신규
- Conceptual Reasoning Index (CRI) (신규 개념 페이지 — 검토 요청) — 이번 실행에서 사용자 검토가 필요한 유일한 신규 페이지다. 기존 페이지 아래 넣지 않고 개념으로 쓴 이유는, 채워 넣기 없이 스키마를 채울 만큼 공개된 재료가 있기 때문이다. 정의, 이름이 붙은 하위 벤치마크 셋, 날짜가 달린 점수, 그리고 장식이 아니라 구체적인 열린 문제 둘.
- GLM-5.3 (신규 모델 페이지) — 스펙 행 집합 전체를 갖췄다.
Context window는 의도적으로unknown이다. Z.ai 는 베이스가 GLM-5.2 의 것이고 그대로라고 말하며 그 모델은 1M 윈도를 갖지만, 베이스 공유는 공개된 사양이 아니고, 형제에서 행을 유추하는 것이야말로unknown이 막으려는 것이다. - AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307) (신규 논문 페이지) — 논문 선정 참조.
업데이트
- Qwen 3.8 27B — 출시됨.
Releasednot yet → 2026-08-14,Context window→ 262,144,License→ Apache 2.0,Availability→ Hugging Face + ModelScope. 날짜 표는 다섯 번째이자 마지막 행을 얻었고 철회된 08-12 주장은 그대로 보인다. 하네스 하나가 공개돼 있고 그것은 경쟁사의 것이다: SWE-MM 은 Claude Code 하네스, SWE-bench Multimodal 공개 dev 분할, Claude Opus 4.7 시스템 카드 부록 8.3 의 수정 사항으로 측정됐다 — 이번 주에 수집된 어떤 릴리스가 어떤 수치에 대해 공개한 것보다 많은 하네스 정보이고, 네 행 중 하나를 덮는다. - Open-Weights Policy Fight — 두 릴리스를 하나의 자연 실험으로 기록했다. 같은 날, 같은 나라, 같은 주장, 정반대의 산출물. 2026-08-12 항목이 남긴 Qwen 라이선스에 대한 열린 질문은 이제 27B 에 대해 답이 나왔고 플래그십에 대해서는 여전히 열려 있다.
- Eval Harness Configuration — Qwen 의 공개와 AI4AI 결과를 함께 기록했고, 이름을 붙일 만한 비교 함정도 넣었다. Terminal-Bench 3.0 (GLM-5.3) 과 Terminal-Bench 2.1 (Qwen, DeepSeek) 은 다른 스위트이고, 한 주에 릴리스가 셋이며, 읽은 자료 어디에도 둘을 잇는 대응이 없다.
- Anthropic — 해결이 아니라 상충으로 기록: Claude for Government 의 베타 출시 날짜가 18일 간격으로 둘이다. 이 위키는 releasebot.io 에서 가져온 2026-07-27 을 보유하고 있으며, 당시 1차 페이지를 확인할 수 없어 ⚠️ 를 달았다. 2026-08-14 자 보도는 베타가 "오늘" 시작한다고 적으며 Anthropic 1차 페이지를 인용한다. 둘 다 유지한다. ⚠️ 표시는 정확히 그것을 위해 붙은 것이었다.
- Z.ai, Alibaba / Qwen AI Lab, Agents (LLM Agents), AI Alignment — 최근 활동, 모델 목록, 상호 링크 갱신.