AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-08-21.md

2026-08-21

2026년 8월 21일 (금)

논문 8편 · 신규 개념 1건 · 소식 5건 · 논문 픽 2편 · 관찰 3건

+1new page
[01]

주요 소식

1. 모델을 학습시킨 하네스가 드디어 이름을 얻는다 — 그리고 학습 이전 편차가 6.8 포인트다

  • LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) 은 Qwen3.5-35B-A3B 를 GSPO 로 수정하지 않은 프로덕션 하네스 세 곳 안에서 학습시키고 셋 모두를 지명한다: SWE-bench Verified 에서 OpenHands SDK 64.0% → 70.4%, Claude Code 62.4% → 68.2%, OpenCode 57.2% → 66.6% (HF Daily 2026-08-21)
  • 어제의 Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) 에 대해 이 위키가 제기한 가장 날카로운 이의는 하네스를 가장 강하게 옹호하는 논문이 자기 대표 수치를 낸 하네스를 밝히지 않았다 는 것이었다. 하루 뒤 다른 그룹이 그것을 제공했다
  • 학습하지 않은 출발점 자체가 하네스만으로 6.8 포인트 벌어져 있다 — 학습으로 얻은 세 향상 중 둘보다 크다
  • 롤아웃–학습 확률 상관 0.99 초과 도 보고한다. 하네스가 롤아웃 도중 컨텍스트를 압축할 때 파괴되는 양이다. 어떤 벤치마크 증분도 상관이 깨졌음을 드러내지 않으며, 이 위키가 보유한 하네스 학습 논문 셋 중 이를 보고하는 것은 하나뿐이다
  • 왜 중요한가: 하네스를 통해 사후 학습된 모델은 그 하네스에 맞춰지므로 "하네스 비의존적" 은 가정할 것이 아니라 시연해야 할 것이 되고, 무결성 검사는 그 학습이 애초에 유효했는지를 말해 준다
  • Eval Harness Configuration, Agentic Reinforcement Learning

2. Anthropic 이 이 위키가 어제 기록한 보관 의무를 되돌린다고 보도됐다

  • Bloomberg, 2026-08-20, 익명 소식통 인용: 엔터프라이즈 고객은 여전히 30일 보관 의무를 지되 자사 클라우드 인프라 에 보유할 선택지를 얻는다. 출시는 올해 안, Salesforce 를 포함한 100곳 이상의 고객 과 개발됐다 (source)
  • Safety Monitoring and Data Retention어제 Anthropic 의 입장이 더 날카롭다고 주장했다. 시행 중 인 반면 OpenAI 의 것은 프리뷰였기 때문이다. 이제 둘 다 계획이고, Anthropic 쪽은 OpenAI 가 08-19 에 쓴 바로 그 표현 — 고객이 통제하는 인프라 — 에 안착한다
  • 출처 등급은 이 저장소가 받아들이는 가장 약한 급이다: 의도에 대한 제3자 보도, 1차 발표 미확보, 6월 정책이 여전히 시행 중
  • 왜 중요한가: 불일치가 "콘텐츠를 보관해야 하는가" 에서 고객이 보유할 때 랩이 무엇을 받는가 로 좁아지고 — 어느 랩도 말하지 않았다. Anthropic 이 여전히 그 콘텐츠 위에서 연산해야 한다면 이것은 데이터 소재지와 책임을 옮길 뿐 역량은 옮기지 않는다
  • Safety Monitoring and Data Retention, Anthropic

3. 한 랩 CEO 가 사후 학습 스케일링을 법칙으로 단언하고, 자기 모델을 실험으로 내놓는다

  • Z.ai 의 Jie Tang, 2026-08-20 보도: 암기는 파라미터를, 추론은 사후 학습 데이터와 유효 깊이를 선호하며, 고급 스킬은 지식 임계를 넘고 나면 파라미터 수에 있지 않다. 다섯 개의 스케일링 knob, MoE 를 위한 "XA-YB" 표기 (source)
  • GLM-5.3 이 증거다: GLM-5.2 의 베이스는 손대지 않았고 모든 이득이 장기 지평 환경에서의 RL 에서 나온다 — Terminal-Bench 3.0 4.6 → 28.3, DeepSWE 46.2 → 66.9, AutomationBench 26.2 → 48.2
  • 앞의 둘은 이 저장소의 독립적인 2026-08-14 포착과 일치하며, 그래서 새 수치를 경합하는 서술로 분류하는 대신 모델 페이지에 받아들였다. 전부 벤더 서술이고 어느 수치에도 공개된 하네스가 없다
  • 왜 중요한가: Weekly Synthesis — W33 (2026-08-10 → 2026-08-16) 는 릴리스 노트 네 건에서 "역량이 가중치로 도착하기를 그만두었다" 를 읽어냈다. 모델을 출하하는 쪽이 이를 법칙으로 주장한 것은 처음이며, 베이스가 값싼 절반이라면 가중치 공개는 Open-Weights Policy Fight 가 가정해 온 것보다 적게 전달한다
  • Post-Training Scaling, Z.ai

4. 모두가 똑같이 통과하는 벤치마크는 그 대상을 재고 있지 않았다

  • SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565) 는 과제 완료를 기록된 외부 검사 에 걸고 모델 자신의 판단에는 걸지 않는다 — 명세, 컴파일, 그리고 참조와 비교한 실제 PLC 런타임 의 실행 트레이스 (HF Daily 2026-08-21)
  • 정적 동작 점수는 모든 방법을 서로 10 포인트 안에 몰아넣는다. 동적 동작은 22.4–31.4 에서 52.2 까지 흩어놓는다
  • 시험한 모델 일곱 개 전부에서 최고인 평균 72.6% strict verified 통과율
  • 왜 중요한가: PLC 를 걷어내면 계기 일반에 관한 발견이 남는다 — 그리고 한계도 정직하다. 검증 게이팅은 검증이 값쌀 때만 작동하고, 그곳은 에이전트가 이미 가장 신뢰할 만했던 자리다
  • Agents (LLM Agents), Eval Harness Configuration

5. 모델을 고정하는 패턴이 물리 제어로 건너오는데, 이유가 다르다

[02]

논문 픽

Training Leaves Traces: Centered Residual Signatures for Language Model Lineage VerificationarXiv:2608.14929

  • TL;DR: 가중치만으로 공유 조상을 판정하는 데이터 없는 화이트박스 검사 — 파인튜닝·LoRA 병합·프루닝·양자화된 후손을 독립 모델과 AUROC = 1.0 으로 분리하고, 함수 보존 세탁 하에서도 불변이며, 가장 가까운 견고한 기준선보다 76배 빠르다
  • 읽어야 할 이유: 증류된 모델은 독립 모델과 함께 묶인다. 행동 유사성이 아니라 가중치 혈통을 재므로 공개자의 협조 없이 라이선스 준수를 감사하면서 증류는 전혀 탐지하지 못한다 — 대표 수치가 시사하는 것과 정반대다
  • Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929)

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLarXiv:2608.17253

  • TL;DR: 파라미터가 독립인 모델 여러 개를 동시에 학습시키며 각자 동료 가 보상한다. 텍스트 벤치마크 일곱 개에서 3.0–8.6%, 멀티모달 네 개에서 2.3–7.2% 를 정답 레이블 없이 얻는다
  • 읽어야 할 이유: 자기보상 RL 의 붕괴를 심판 품질이 아니라 오류 상관 의 문제로 재정의하며, 이로써 코호트 다양성은 휴리스틱이 아니라 시험 가능한 경계를 가진 메커니즘이 된다
  • Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253)
[03]

관찰

  • OpenAI 가 헌정적 임무를 가진 Strategic Futures 팀을 세운다Introducing AI Futures, 2026-08-20. 변혁적 AI 하에서 자유 사회를 어떻게 재구성할 것인가를 묻는다고 보도된다. 여기 있는 다른 모든 OpenAI 거버넌스 산물은 역량과 프레임워크에 묶여 있는데 이것은 아니다. 리더십, 인력, 발행 주기 모두 미명시 (source) → AI Governance
  • "편을 고르라" 가 기제를 얻는다. 6월 AI Opportunity Partnership 성명 서명국 35곳 에 국무부 서한이 초안 됐다고 보도되고, 외교부 린젠은 진영 대결을 거부한다. 읽은 자료 중 그 서한이 발송됐음을 확립하는 것은 없다 (source) → AI Governance
  • Liquid AI 가 이 위키가 볼 수 없는 모델을 이름 부른다. LFM2.5-DSpark 의 speculative decoding 은 출력을 바꾸지 않고 H100 에서 최대 3.18배 를 주장하며 타깃으로 LFM2.5-8B-A1B 를 든다 — 파라미터, 컨텍스트 창, 라이선스, 출시일 어느 것도 읽은 자료에 없다. 속도 향상이 실제로 기대는 드래프트 블록 수용률도 공개되지 않았다 (source) → Liquid AI
[04]

위키 신규

[05]

갱신