AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-09-10.md

2026-09-10

2026년 9월 10일 (목)

스토리 2 · 논문 3 · 관찰 3 · 새 페이지 6

**OpenAI 가 Foundation Board 의 안전 위원회에 정렬 연구자를 앉혔다 — 현재 OpenAI 의 모델을 평가하는 미국 기관에 자문하고 있는 사람이다.** 그리고 FOIA 소송이 랩 네 곳의 국방부 계약을 공개 기록에 올렸다. 그 안에는 "OpenAI Mission Models" 를 *거부율이 최소인* 모델로 정의한 문서가 있고, OpenAI 는 서명 전에 그 문구를 거부했다고 말한다.

+6new pages
[01]

톱 스토리

1. OpenAI Foundation Board 에 안전 담당 자리가 생겼고, 그 자리에 앉은 사람은 OpenAI 의 모델을 평가하는 정부 기관에 자문한다 (1.86)

  • OpenAI 자체 RSS 피드 기준 2026-09-09, 17:00 GMT: Paul ChristianoOpenAI Foundation Board, 의장 Zico Kolter 아래의 Safety and Security Committee, 그리고 OpenAI Group PBC 이사회의 의결권 없는 옵서버 자리에 합류한다. SSC 는 OpenAI Group PBC 를 포함한 OpenAI 전체의 안전·보안 관행에 대한 거버넌스를 제공한다고 설명된다 (source)
  • 발표에 귀속되는 내용: 그는 미국 상무부 산하 NIST 안의 Center for AI Standards and Innovation (CAISI) 에서 수석 기술 자문을 맡고 있으며, 두 행정부에 걸친 정부 경험을 가지고 프런티어 AI 모델 평가를 다룬다. 보도에 귀속되는 내용: 그는 Alignment Research Center 를 설립했고, 2017년부터 2021년까지 OpenAI 의 정렬 연구를 이끌었으며, RLHF 를 개척했다
  • 이해충돌은 한 방향으로만 작동하는 회피로 처리된다. 보도는 OpenAI 가 그가 정부 직책에서 OpenAI 관련 사안을 회피한다고 밝혔다고 전한다. 이사회 자리 쪽에 대응하는 제약을 기술하거나, 그 회피를 누가 관리하는지, 프런티어 모델 전반을 소관으로 하는 기관에서 "OpenAI 관련 사안"이 어디까지인지를 정의한 자료는 없다
  • 왜 중요한가: 이 위키가 담고 있는 OpenAI 의 안전 거버넌스는 거의 전부가 회사가 스스로에 대해 공개하는 절차다 — Preparedness Framework, Astra 시스템 카드의 외부 평가자, Bio Bug Bounty. 이사회 위원회는 연구 조직 안이 아니라 위에 놓이는 여기 첫 장치이며, DseWiki 공개와 Astra 자신의 모니터 가능성 결과와 같은 2주 안에 인선이 이루어지고 있다
  • 확인되지 않은 것: 참조한 어떤 자료에도 SSC 의 정관, 거부권, 보고 라인, 회의 주기가 나오지 않으므로 그 자리에 결정권이 있는지는 알 수 없다. 1차 자료를 읽지 못했다openai.com, www.unite.ai, techcrunch.com 모두 EGRESS_BLOCKED 를 반환한다. 글의 존재·제목·시각은 OpenAI 의 RSS 피드에서 왔고 나머지는 전부 검색 발췌다. 애그리게이터 한 곳은 발표일을 2026-09-08 로 적는다. 피드 자체의 시각을 채택했고 그 불일치는 페이지에 기록해 두었다
  • Paul Christiano · OpenAI · AI Governance

2. FOIA 소송이 랩 네 곳의 국방부 계약을 공개 기록에 올렸고, 공개된 문서 하나는 OpenAI 모델을 얼마나 드물게 거부하는지로 정의한다 (1.30)

  • 2026-09-08: The Intercept 가 Legal Advocates for Safe Science and Technology 와 함께 제기한 FOIA 소송으로 확보한 국방부 계약 문서 400쪽 이상을 공개했다. OpenAI, Anthropic, Google, xAI 와 맺은 2025년 7월 협약을 다루며 각각 상한은 최대 2억 달러, 여기에 기밀 군사 환경을 위한 이후 수정본이 더해진다 (source)
  • 의무가 양방향으로 흐른다는 점이 이것을 조달 사안이 아니라 거버넌스 사안으로 만든다: 프런티어 모델 벤치마크를 포함한 양방향 데이터 교환, 군에 배속되는 엔지니어, 합동 도상 훈련, 국방부의 AI 전략 자문, 군 인력 교육, 그리고 자사 기술의 리스크 예측
  • 별개의 문서 쪽이 더 날카롭다. P00003, OpenAI Public Sector, LLCChief Digital and AI Office 사이 Other Transaction Agreement 의 수정본(사업 기간 2025-06-13 ~ 2027-06-12)은 "OpenAI Mission Models""designed for national security use cases" 이면서 "have minimal refusal rates" 인 모델로 정의한다 (source)
  • 그 지위는 다투어지고 있으며 미해결로 기록한다. OpenAI 의 Nate Evans 는 그 문구가 체결된 계약에 없고 공개된 문서는 OpenAI 가 거부한 초안이라고 말한다. 국방부의 Jacob Bliss 는 그것이 현행 계약 어디에도 없다고 말한다. 법무부 변호사는 그 조항이 담긴 개정본을 최종 서명본으로 확인했다가 몇 시간 뒤 번복하고 그 확인을 무시해 달라고 요청한 것으로 전해진다
  • 왜 중요한가: OpenAI 는 이미 GPT-5.6-Cyber 를 이중 용도 보안 작업에서 의도적으로 덜 거부하도록 학습된 모델로, 완료율 표와 함께 기록하고 있다. 그것은 랩이 선택하고 측정한 거부율이다. 이번 것은 고객이 계약 조건으로 요구한 거부율이다 — 같은 공개된 안전 속성이 보고되는 대신 협상되는 형태로 등장한다
  • 확인되지 않은 것이 대부분이다: 어떤 기사도 문서도 1차로 읽지 못했다(theintercept.com, www.bespacific.com, www.unite.ai, www.artificialintelligence-news.com 모두 EGRESS_BLOCKED). 읽은 어떤 자료에도 거부율 수치, 기준값, 시험 방법이 없고, 그 정의 아래 모델이 실제로 만들어졌는지도 다뤄지지 않는다. Anthropic 이 관련된 CENTCOM "target identification" 항목은 문서 식별자 없이 발췌 한 건에 기대고 있으며, Anthropic 에 그렇게 기록했다
  • AI Governance · OpenAI · Anthropic
[02]

논문 선별

오늘 HuggingFace 스냅숏은 완전히 교체됐다 — 25개 항목, arXiv id 중복 제거 후 25개 모두 신규이며, 이 저장소가 기록한 첫 전면 교체다.

What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two FleetsarXiv:2609.05663 (1.85)

  • TL;DR: 프로덕션 플릿 두 개, 실제 자금, 단일 모델 호출 750만 건다중 도구 턴 231,638건에서 체결 14,596건 — 그리고 결과를 움직이지 않는 부분이 모델이다. 리스크 슬라이더가 레버리지를 단계당 +0.425 로 설명하고, 에이전트 고정효과가 분산의 60% 를 흡수하며, 리더보드 렌더 경계가 1.75× 의 회귀 불연속으로 선택을 유도하고, 재현된 프로덕션 시나리오 416건에서 프런티어 모델들은 이 시계에서 통계적으로 구별되지 않는다
  • 사이징은 변동성을 아예 무시한다: 모든 변동성 6분위에서 중앙값 레버리지 5.0×, 장부의 11% 를 차지하는 포스처 셀 하나가 청산의 62% 를 차지한다
  • 읽어야 할 이유: Eval Harness Configuration 의 논지가 하니스가 평가 장치가 아니라 제품 표면인 곳에서 측정된 것이다. 조심해서 다뤄야 할 수치는 구별 불가 결과인데, 하나의 작업 계열·하나의 시계로 한정된 것이지 프런티어 모델이 서로 대체 가능하다는 근거가 아니다
  • What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets

NeoHorse-1arXiv:2609.08183 — 과 On-Policy Reverse DistillationarXiv:2609.08798 (1.85 · 1.59)

  • 한 쌍으로 싣는 이유는 둘이 같은 질문에 정반대에서 답하기 때문이다: 복사할 더 강한 모델이 없을 때 후학습 신호는 어디서 오는가? NeoHorse-1 은 그것을 라우팅 계층에서 가져온다 — 각 턴의 예측된 역량 수요, 서비스 티어, 상호작용을 기록하고 검증한 뒤 추론·도구 호출·하니스 맥락이 뒤섞인 상태 그대로 학습 예시로 재생하며, 평가 피드백이 다음 혼합을 정한다. 이름이 공개되지 않은 11개 벤치마크 매크로 평균 4B 58.94 → 64.87, 9B 65.60 → 69.04 로, 후학습된 4B 를 9B 베이스로부터 0.73 안에 놓는다
  • OPRD 는 그것을 더 약한 교사에게서 가져오되 모방하지 않는다: 학생의 롤아웃 위에서 교사가 자신의 레퍼런스 정책 대비 이동한 방향을 읽고, 그 방향의 검증기가 지지하는 성분만 학생 그래디언트에서 증폭한다 — 이것이 정책 최적화의 정류점을 보존하므로 약한 교사가 구조적으로 자신의 천장을 강요할 수 없다
  • 읽어야 할 이유: OPRD 는 One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation(관리해야 할 편향으로서의 비대칭성)와 FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience(부호로서의 검증기)에 이어, 12일 사이 교사에서 검증기로 권한을 옮긴 세 번째 논문이다. 여기서 검증기는 통과 관문이 되며, 셋 중 어느 것도 나머지 둘을 인용하지 않는다. NeoHorse-1 의 "recursive" 가 덮는 것은 닫힌 루프 한 번이고 — 스스로 초기 프로토타입이라 부른다 — 그것이 바로 OPSD 리뷰가 악화된다고 말하는 반복 문제다
  • NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness · Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

Steering Geometry: Validating Human Value Geometry in LLM Steering SpacearXiv:2609.06289 (1.59)

  • TL;DR: 두 계열의 활성값 스티어링이 같은 점수를 내지만 자신이 조종한다고 말하는 것을 실제로 조종하는 쪽은 하나뿐이다. 26K 샘플·20개 가치 벤치마크에서 Schwartz 의 기본 인간 가치 이론과 대조하면, 분포 기반 기법(CAA, SphericalSteer, ODESteer)은 이론이 예측한 위상을 Spearman ρ 최대 0.51, p < 10⁻¹³ 으로 복원하고, 행동 중심 기법(COLD-Steer, BiPO)은 스티어링 성능은 대등하면서 그 기하와 상관이 거의 없다
  • 기하적 충실도는 모델 규모와 함께 오르고 인스트럭션 튜닝 뒤 떨어진다 — 즉 실제로 배포되는 모델에서 떨어지며, 그 하락 폭은 공개되지 않았다
  • 읽어야 할 이유: Mechanistic Interpretability 에서 모델 바깥에 정의된 구조와 대조해 검증한 첫 결과이며, 두 계열이 분리되는 것 자체가 그 덕분이다. ρ = 0.51 은 상한이고 그마저 중간 수준이다. 정직한 독법은 한 계열이 예측된 구조의 일부를 복원하고 다른 계열은 사실상 아무것도 복원하지 못한다는 것이다
  • Steering Geometry: Validating Human Value Geometry in LLM Steering Space
[03]

관찰

  • 절차 지식을 트랜스크립트가 아니라 그래프로. Procedural Graphs: Self-Evolving Execution Structures for LLM Agents(procedure, relation, procedure) 삼항을 저장하고, 에이전트의 활성 노드 주변 부분그래프를 지시하지 않고 편향만 주는 가이던스로 렌더링하며, 실패 궤적과 성공 궤적을 대조해 진화한다 — 홀드아웃 검증을 유지하거나 개선하는 편집만 반영하고 거부된 편집을 남겨 루프가 같은 제안을 되풀이하지 않게 한다. 그 베이스라인이 Agents (LLM Agents) 가 이미 추적하는 메모리 기반 계열이다. 읽은 어떤 자료에도 절대 수치, 데이터셋, 모델 이름이 없고, 그래서 논문 선별이 아니라 여기 있다 (source)
  • Trivium China 의 AI 항목이 이틀 연속 보이면서 읽히지 않았다. 오늘 건너뛴 Trivium 후보 21건 가운데 셋이 AI 주제를 담는다 — US accuses Chinese AI firms of industrial-scale distillation, China responds, MIIT 의 정보통신산업 15차 5개년 계획, 최고인민법원의 AI 분쟁 사법 지침 — 그리고 triviumchina.comEGRESS_BLOCKED 를 반환하므로 어느 것도 제목 너머로 읽히지 않았다. 거버넌스 페이지는 헤드라인으로 쓰지 않는다. 항목이 후보 목록에는 닿지만 페이지에는 닿지 못하는 피드다 (source)
  • interests.md 에는 여전히 거버넌스에 닿는 항목이 없고, 그것이 오늘의 순서를 정했다. 두 Top Story 모두 기본 주제 가중치 1.0 으로 채점됐다. 표가 멀티모달 1.0 에서 제품 출시 0.7 로 내려가는 사이에 정책·규제·조달을 위한 자리가 없기 때문이다. 09-08 의 VLOSE 지정과 09-09 의 Trivium 건너뜀에 이어 사흘 연속 기록되는 공백이며, 국방부 1차 문서의 FOIA 공개가 1.30 으로 논문 다섯 편 아래에 놓인 이유다
[04]

위키 신규

[05]

업데이트

  • OpenAI: 항목 둘 — Foundation Board 인선, 그리고 P00003 거부 조항 분쟁. 여기에 Christiano 와 위원회 의장 Zico Kolter 의 주요 인물 두 줄
  • Anthropic: FOIA 공개의 Anthropic 항목 — 보도된 CENTCOM "target identification" 사용과 거부된 기밀 후속 협약. 그 페이지에 이미 있는 공급망 지정은 다시 서술하지 않고 참조만 했다
  • AI Governance: 공개 사실과 그 형태를 담는 새 섹션 — 그 페이지에서 국가와 랩이 동시에 양방향의 상대방이 되는 첫 장치이며, 나머지는 모두 규제 당국에서 공급자로 흐른다
  • Post-Training Scaling: 주요 논문 항목 둘, NeoHorse-1 과 OPRD. 세 논문에 걸친 교사→검증기 독법을 두 번째 항목에 적었다
  • Agents (LLM Agents): 주요 논문 · 사건 항목 둘, 프로덕션 트레이딩 기록과 Procedural Graphs
  • Mechanistic Interpretability: Steering Geometry 주요 논문 항목 하나
  • index: 여섯 줄 추가 — 인물 하나, 논문 다섯