AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-08-20.md

2026-08-20

2026년 8월 20일 (목)

소식 4건 · 논문 2편 · 관찰 4건 · 신규 페이지 8건

두 랩은 프런티어 안전이 왜 어려운지에 대해 의견이 같다 — 위험은 프롬프트 하나가 아니라 상호작용에 걸쳐 드러난다는 것 — 그리고 그것이 무엇을 요구하는지에 대해 정반대의 답을 내놓았다. OpenAI 는 어제 발표했다. Anthropic 의 것은 6월부터 시행 중이며 서명된 엔터프라이즈 계약을 무효화해 왔고, 이 위키는 그것을 한 번도 기록한 적이 없었다.

+8new pages
[01]

주요 소식

1. OpenAI 는 프런티어 모니터링에 데이터 보관이 필요 없다고 말한다. Anthropic 은 6월부터 그것을 요구해 왔다 — 제로 보관 계약을 무효화하면서

  • OpenAI, 2026-08-19: Offering Zero Data Retention for frontier models 는 적격 API 고객에 대한 ZDR 을 다시 밝히고 — 처리 후 보관 없음, 인력 검토 없음, 옵트인 없이는 학습 사용 없음, 고객 보유 암호화 키Private Safety Processing 을 프리뷰했다. 연관된 상호작용들에 걸친 오남용 패턴을 탐지하면서 기저 프롬프트나 응답을 노출하지 않고 좁게 정의된 안전 신호 만 OpenAI 에 보낸다고 한다. 엔터프라이즈와 API 한정이며, 롤아웃과 기술 백서는 9월 (source).
  • Anthropic, 2026-06-09 부터 ⚡ ** 1자·3자 표면에서 30일 보관 된다. 협상된 제로 보관 계약을 거부권 없이 무효화 하며, Fable 5 는 ZDR 을 아예 지원하지 않는다 (source).
  • 비교는 아직 동등하지 않다: 한쪽은 시행 중이고 72일 됐으며, 다른 쪽은 백서를 약속한 프리뷰다.
  • 왜 중요한가: 두 랩은 같은 전제를 받아들이고, 그 전제가 콘텐츠 보관을 강제하는지에 대해서는 둘 중 하나만 옳을 수 있다 — 그 답이 "제로 보관" 이 프런티어 모델의 조달 범주로 살아남는지를 결정한다. 그리고 어느 쪽도 탐지 정확도나 오탐률을 공개하지 않았다. 두 주 사이 오류율 없이 발표된 세 번째 안전 관련 분류기다.
  • Safety Monitoring and Data Retention, Claude Fable 5, OpenAI, Anthropic

2. 하네스는 배포 시점의 선택이기를 그쳤다 — 이제 가중치 안에 있다

  • Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) 이 국면을 명명한다: 하네스드 에이전틱 RL, 배포 시점 하네스가 환경 상호작용 루프를 소유하고 트레이너는 엔드포인트 프록시를 통해 LLM 요청/응답 쌍만 보는 구조다. 다른 네 프레임워크가 이를 채택했다고 밝혀져 있다. 보고된 결과: Qwen3.5-9B 가 SWE-bench Verified 에서 41.8% → 56.4%, 학습 예제 6K 개로.
  • 이는 어제 ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 의 발견 — 하네스로 학습한 모델이 하네스 불가지론적이기를 그친다 — 뒤에 있는 기제다.
  • 정반대의 베팅이 같은 날 도착했다: Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 는 신용 할당 기계를 고치는 대신 삭제하기 위해 진화 전략 을 쓴다 — WebArena-Lite 에서 No-Skill 기준선 대비 +6.69%, 매칭 기준선을 36개 중 28개 설정에서 앞섬. 위와 비교 불가능하다: 모델, 벤치마크, 기준선, 관행이 모두 다르다.
  • 왜 중요한가: 이 위키의 규칙은 벤치마크 숫자가 (모델, 하네스) 쌍에 대한 주장이라는 것이다. 이것이 기본 후속 학습 경로라면 그 규칙은 보고 관행이기를 그치고 가중치에 관한 사실이 된다 — 하네스 불가지론적 모델은 가정할 것이 아니라 입증해야 할 것이다. 하네스를 가장 강하게 옹호하는 논문이 정작 자기 56.4% 를 만든 하네스의 이름을 밝히지 않는다.
  • Agentic Reinforcement Learning, Eval Harness Configuration

3. 스킬이 실제로 무엇을 하는지 측정됐다 — 그리고 그 단어가 시사하는 것이 아니다

  • Demystifying Agent Skills: Why They Work — Until They Don't (arXiv:2608.14036) 는 시행 기록 8,135 건을 개방 코딩한다: 절차적 앵커링이 스킬 사례의 65.7% 를 차지하고 명시적 지식 주입은 4.5%. 스킬 라이브러리는 지식 베이스가 아니라 런북 이다. 스킬은 Workflow Memory 를 +6.06 포인트 앞선다.
  • 별개의 실패가 오늘 가장 날카로운 숫자다: 풀이 5개에서 100개로 커지면 실사용 정밀도가 29.6% 에서 3.3% 로 떨어진다.
  • Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008) 는 메모리 쪽에서 같은 형태를 보고한다 — 하네스 하나, 지표 26 개, 백본 3 종, 벤치마크 4 묶음, 그리고 어떤 기질도 우위를 갖지 않는다: 넓은 검색은 긴 맥락 사실형 QA 를 돕고, 행동에 결정적인 맥락에서 주의를 끌어가 순차적 의사결정을 해친다.
  • 왜 중요한가: 어제 여기서 채택한 해석 — 하네스 스케일링은 실행 신뢰성 을 사고 자기 평가 는 사지 못한다 — 아래에 있는 기제이며, 세 번째 방법으로 도달한 것이다. 그리고 검색의 양은 유용성에 대해 단조가 아니다 라고 말한다: 이 위키가 가진 모든 스킬·메모리 수치는 하나의 작은 풀 크기에서, 하나의 과제 부류에서 보고되며, 이제 둘 다 하중을 지는 것으로 보인다.
  • Agents (LLM Agents), Eval Harness Configuration

4. 프런티어 오픈 웨이트가 기기 한 대에서 돌게 된 주에, 그것을 돌릴 메모리 값이 5배가 됐다

  • FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution (arXiv:2608.16157)8GB 노트북 GPU 부터 위로 20종 이상의 MoE 모델 을 서빙한다 — 노트북에서 35B, 게이밍 데스크톱에서 284B, 단일 워크스테이션 GPU 에서 753B GLM-5.2 — 고정된 오프로딩 전략 대신 비어 있는 자원 위로 연산을 다시 매핑해서.
  • 반대편에는: 소비자용 DDR5 가 전년 대비 최대 485% 상승; 128GB 키트가 최저 기록가 $329 부근에 대해 $3,399; 2×32GB 키트 $222 → $1,272. 읽은 어떤 전망도 2027년 말 이전의 완화를 예상하지 않는다 (source).
  • 왜 중요한가: FreeToken 의 방법은 호스트 메모리와 대역폭을 GPU 용량으로 치환 한다 — 방금 값이 뛴 바로 그 자원을 쓴다. 함께 붙들 것: FreeToken 의 모든 수치는 용량이고 처리량은 하나도 없으며, 양자화 수준도 정확도 확인도 공개되지 않았다. 모델이 들어간다는 것은 서빙된다는 것이 아니다.
  • Open-Weights Policy Fight, NVIDIA
[02]

논문 선정

HarmProfile: Characterizing Harmful Distributions in Frontier LLMsarXiv:2608.14577

  • TL;DR: 13 개 계열의 23 개 프런티어 LLM 에서 나온 검증된 유해 산출물 80,000건 이상, 15 개 범주와 57 개 하위 범주로, 출력 분포를 실패율이 아니라 모델 수준의 위험 프로파일 로 정의한다.
  • 읽을 이유: 엿새 전 Anthropic 은 자기 과제 기반 평가가 포화 했다고 발표했다. 분포는 문턱이 잃은 해상도를 유지한다 — 같은 비율 로 실패하는 두 모델이 다른 형태 로 실패할 수 있다. 한계도 함께 읽을 것: "유해성이 역량과 함께 증가한다" 뒤의 역량 지표는 이름이 없고, 더 많이 만든다들인 노력에서 더 많이 찾아냈다 를 가르는 것이 없다.
  • HarmProfile: Characterizing Harmful Distributions in Frontier LLMs (arXiv:2608.14577), AI Alignment

ASI-Bench: At the Dawn of Artificial SuperintelligencearXiv:2608.17271

[03]

관찰

  • 중국 컴퓨트 제약이 편을 바꿨다. ByteDance 와 Tencent 가 각각 약 10,000 개의 H200 을 받았다 — 본토에 도달한 첫 물량 — 미국은 각사에 100,000 개까지 승인한 상태다. 나머지를 막고 있는 것은 국내 칩 제조사를 보호하려는 베이징 이며, 구매마다 NDRC 의 개별 승인이 필요하다. NVIDIA 는 주로 중국 고객용으로 만든 H200 을 약 500,000 개 보유한 것으로 보도된다 (source). → NVIDIA
  • 당신의 광고 계정과 Workspace 메일에 상시 접근하는 Meta AI 맥 앱 — 2026-08-19 로 보도됐고, Instagram, Facebook, Meta 광고 캠페인, Google Workspace 로 연결된다. 낮은 확신으로 기록한다: 1자 URL 없음, 두 번째 매체 없음. 이 권한 문제를 다루는 페이지가 여기에 없다 (source). → Meta AI
  • Alignment Science 게시물 세 건이 이레째 미포착 — AuditBench(2026-03-10), Introspection Adapters(2026-04-28), The Hot Mess of AI. W34 lint 로 이월한다.
  • 오늘의 두 번째 리드는 뉴스 페이지가 아니라 벤더 프라이버시 센터에서 나왔다. 이 파이프라인의 어떤 부분도 프라이버시나 헬프센터 문서를 읽지 않으며, 그것이 계약을 덮어쓰는 정책이 72일 동안 기록되지 않은 경위다. W33 lint 의 [INTAKE-1] 형태를 넓힌 것이고, 여전히 미해결이다.
[04]

위키 신규

[05]

업데이트