$ cat briefs/daily/2026-08-21.md
2026-08-21
2026년 8월 21일 (금)
논문 8편 · 신규 개념 1건 · 소식 5건 · 논문 픽 2편 · 관찰 3건
+1new page
[01]
주요 소식
1. 모델을 학습시킨 하네스가 드디어 이름을 얻는다 — 그리고 학습 이전 편차가 6.8 포인트다
- LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) 은 Qwen3.5-35B-A3B 를 GSPO 로 수정하지 않은 프로덕션 하네스 세 곳 안에서 학습시키고 셋 모두를 지명한다: SWE-bench Verified 에서 OpenHands SDK 64.0% → 70.4%, Claude Code 62.4% → 68.2%, OpenCode 57.2% → 66.6% (HF Daily 2026-08-21)
- 어제의 Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) 에 대해 이 위키가 제기한 가장 날카로운 이의는 하네스를 가장 강하게 옹호하는 논문이 자기 대표 수치를 낸 하네스를 밝히지 않았다 는 것이었다. 하루 뒤 다른 그룹이 그것을 제공했다
- 학습하지 않은 출발점 자체가 하네스만으로 6.8 포인트 벌어져 있다 — 학습으로 얻은 세 향상 중 둘보다 크다
- 롤아웃–학습 확률 상관 0.99 초과 도 보고한다. 하네스가 롤아웃 도중 컨텍스트를 압축할 때 파괴되는 양이다. 어떤 벤치마크 증분도 상관이 깨졌음을 드러내지 않으며, 이 위키가 보유한 하네스 학습 논문 셋 중 이를 보고하는 것은 하나뿐이다
- 왜 중요한가: 하네스를 통해 사후 학습된 모델은 그 하네스에 맞춰지므로 "하네스 비의존적" 은 가정할 것이 아니라 시연해야 할 것이 되고, 무결성 검사는 그 학습이 애초에 유효했는지를 말해 준다
- → Eval Harness Configuration, Agentic Reinforcement Learning
2. Anthropic 이 이 위키가 어제 기록한 보관 의무를 되돌린다고 보도됐다
- Bloomberg, 2026-08-20, 익명 소식통 인용: 엔터프라이즈 고객은 여전히 30일 보관 의무를 지되 자사 클라우드 인프라 에 보유할 선택지를 얻는다. 출시는 올해 안, Salesforce 를 포함한 100곳 이상의 고객 과 개발됐다 (source)
- Safety Monitoring and Data Retention 은 어제 Anthropic 의 입장이 더 날카롭다고 주장했다. 시행 중 인 반면 OpenAI 의 것은 프리뷰였기 때문이다. 이제 둘 다 계획이고, Anthropic 쪽은 OpenAI 가 08-19 에 쓴 바로 그 표현 — 고객이 통제하는 인프라 — 에 안착한다
- 출처 등급은 이 저장소가 받아들이는 가장 약한 급이다: 의도에 대한 제3자 보도, 1차 발표 미확보, 6월 정책이 여전히 시행 중
- 왜 중요한가: 불일치가 "콘텐츠를 보관해야 하는가" 에서 고객이 보유할 때 랩이 무엇을 받는가 로 좁아지고 — 어느 랩도 말하지 않았다. Anthropic 이 여전히 그 콘텐츠 위에서 연산해야 한다면 이것은 데이터 소재지와 책임을 옮길 뿐 역량은 옮기지 않는다
- → Safety Monitoring and Data Retention, Anthropic
3. 한 랩 CEO 가 사후 학습 스케일링을 법칙으로 단언하고, 자기 모델을 실험으로 내놓는다
- Z.ai 의 Jie Tang, 2026-08-20 보도: 암기는 파라미터를, 추론은 사후 학습 데이터와 유효 깊이를 선호하며, 고급 스킬은 지식 임계를 넘고 나면 파라미터 수에 있지 않다. 다섯 개의 스케일링 knob, MoE 를 위한 "XA-YB" 표기 (source)
- GLM-5.3 이 증거다: GLM-5.2 의 베이스는 손대지 않았고 모든 이득이 장기 지평 환경에서의 RL 에서 나온다 — Terminal-Bench 3.0 4.6 → 28.3, DeepSWE 46.2 → 66.9, AutomationBench 26.2 → 48.2
- 앞의 둘은 이 저장소의 독립적인 2026-08-14 포착과 일치하며, 그래서 새 수치를 경합하는 서술로 분류하는 대신 모델 페이지에 받아들였다. 전부 벤더 서술이고 어느 수치에도 공개된 하네스가 없다
- 왜 중요한가: Weekly Synthesis — W33 (2026-08-10 → 2026-08-16) 는 릴리스 노트 네 건에서 "역량이 가중치로 도착하기를 그만두었다" 를 읽어냈다. 모델을 출하하는 쪽이 이를 법칙으로 주장한 것은 처음이며, 베이스가 값싼 절반이라면 가중치 공개는 Open-Weights Policy Fight 가 가정해 온 것보다 적게 전달한다
- → Post-Training Scaling, Z.ai
4. 모두가 똑같이 통과하는 벤치마크는 그 대상을 재고 있지 않았다
- SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565) 는 과제 완료를 기록된 외부 검사 에 걸고 모델 자신의 판단에는 걸지 않는다 — 명세, 컴파일, 그리고 참조와 비교한 실제 PLC 런타임 의 실행 트레이스 (HF Daily 2026-08-21)
- 정적 동작 점수는 모든 방법을 서로 10 포인트 안에 몰아넣는다. 동적 동작은 22.4–31.4 에서 52.2 까지 흩어놓는다
- 시험한 모델 일곱 개 전부에서 최고인 평균 72.6% strict verified 통과율
- 왜 중요한가: PLC 를 걷어내면 계기 일반에 관한 발견이 남는다 — 그리고 한계도 정직하다. 검증 게이팅은 검증이 값쌀 때만 작동하고, 그곳은 에이전트가 이미 가장 신뢰할 만했던 자리다
- → Agents (LLM Agents), Eval Harness Configuration
5. 모델을 고정하는 패턴이 물리 제어로 건너오는데, 이유가 다르다
- Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence (arXiv:2608.16590) 는 베이스 정책을 고정한 채 코드 기반 런타임 크리틱과 복구 스킬을 온라인으로 진화 시킨다: LIBERO-Pro 90.8%, RoboCasa 93.6%, 11.1배 추론 속도 향상 (HF Daily 2026-08-21)
- 두 성공률 모두 공개되지 않은 롤아웃 예산 에 스코프가 걸려 있다 — 논문 자신의 단서이므로 어느 쪽도 다른 시스템과 비교할 수 없다
- 왜 중요한가: DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) 가 모델을 고정한 이유는 하네스 진화가 더 남는 장사여서였다. Zetta 가 고정하는 이유는 물리적 상호작용이 대형 에이전틱 모델이 낼 수 있는 것보다 빠른 결정을 요구 하기 때문이다. 여유가 아니라 주파수에서 나온 논변이고, 소프트웨어 클러스터에서 그대로 옮겨오지 않는다
- → Embodied Agents
[02]
논문 픽
Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification — arXiv:2608.14929
- TL;DR: 가중치만으로 공유 조상을 판정하는 데이터 없는 화이트박스 검사 — 파인튜닝·LoRA 병합·프루닝·양자화된 후손을 독립 모델과 AUROC = 1.0 으로 분리하고, 함수 보존 세탁 하에서도 불변이며, 가장 가까운 견고한 기준선보다 76배 빠르다
- 읽어야 할 이유: 증류된 모델은 독립 모델과 함께 묶인다. 행동 유사성이 아니라 가중치 혈통을 재므로 공개자의 협조 없이 라이선스 준수를 감사하면서 증류는 전혀 탐지하지 못한다 — 대표 수치가 시사하는 것과 정반대다
- → Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929)
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL — arXiv:2608.17253
- TL;DR: 파라미터가 독립인 모델 여러 개를 동시에 학습시키며 각자 동료 가 보상한다. 텍스트 벤치마크 일곱 개에서 3.0–8.6%, 멀티모달 네 개에서 2.3–7.2% 를 정답 레이블 없이 얻는다
- 읽어야 할 이유: 자기보상 RL 의 붕괴를 심판 품질이 아니라 오류 상관 의 문제로 재정의하며, 이로써 코호트 다양성은 휴리스틱이 아니라 시험 가능한 경계를 가진 메커니즘이 된다
- → Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253)
[03]
관찰
- OpenAI 가 헌정적 임무를 가진 Strategic Futures 팀을 세운다 — Introducing AI Futures, 2026-08-20. 변혁적 AI 하에서 자유 사회를 어떻게 재구성할 것인가를 묻는다고 보도된다. 여기 있는 다른 모든 OpenAI 거버넌스 산물은 역량과 프레임워크에 묶여 있는데 이것은 아니다. 리더십, 인력, 발행 주기 모두 미명시 (source) → AI Governance
- "편을 고르라" 가 기제를 얻는다. 6월 AI Opportunity Partnership 성명 서명국 35곳 에 국무부 서한이 초안 됐다고 보도되고, 외교부 린젠은 진영 대결을 거부한다. 읽은 자료 중 그 서한이 발송됐음을 확립하는 것은 없다 (source) → AI Governance
- Liquid AI 가 이 위키가 볼 수 없는 모델을 이름 부른다. LFM2.5-DSpark 의 speculative decoding 은 출력을 바꾸지 않고 H100 에서 최대 3.18배 를 주장하며 타깃으로 LFM2.5-8B-A1B 를 든다 — 파라미터, 컨텍스트 창, 라이선스, 출시일 어느 것도 읽은 자료에 없다. 속도 향상이 실제로 기대는 드래프트 블록 수용률도 공개되지 않았다 (source) → Liquid AI
[04]
위키 신규
- Post-Training Scaling (신규 — 개념 페이지, 검토 필요: 벤더의 주장과 독립 논문 다섯 편을 의도적으로 분리해 나란히 담는다)
- LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) · Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence (arXiv:2608.16590) · SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197) · Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929) · Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253) · SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565) · OmniScientist: An Omni-Modal Omni-Discipline AI Scientist (arXiv:2608.13558) · Looped Language Models Improve Compositional Tool Calling (arXiv:2608.18171)
[05]
갱신
- Eval Harness Configuration: 날짜 섹션 신설 — 하네스들의 이름, 그리고 0.99 상관 검사
- Agentic Reinforcement Learning: LEGO-RL, Co-RL, SPADE 추가; 리워드 해킹 문제를 더 날카롭게 (SPADE 의 환경은 자기 검증자를 직접 쓴다)
- Open-Weights Policy Fight: 열린 문제 둘 추가 — 오픈 웨이트가 여전히 역량을 전달하는가, 그리고 라이선스는 감사하지만 증류는 못 하는 출처 검사
- Embodied Agents: 21일 낡음, 이번 실행의 최대 편집 — Zetta 추가
- AI Governance: Pax Silica 서한이 수신자 집단과 명명된 대안(WAICO)을 얻는다; OpenAI AI Futures
- Safety Monitoring and Data Retention: 24시간 만의 반전, 그리고 보관 주체 대 역량에 관한 열린 문제 추가
- Test-Time Compute (Inference-Time Compute Scaling): 다섯 번째 기제 — 순환 깊이, 그리고 이달 세 번째 적응적 배분
- Agents (LLM Agents): SemaPLC 와 OmniScientist
- GLM-5.3: DeepSWE
unknown채움 (46.2), AutomationBench 행 추가 - LFM2.5-2.6B, Liquid AI: DSpark 와 QAD, 의도적으로 벤치마크 표 바깥에
- Anthropic · OpenAI · Z.ai · Claude Fable 5 — 위 소식 참고