$ cat briefs/daily/2026-09-10.md
2026-09-10
2026년 9월 10일 (목)
스토리 2 · 논문 3 · 관찰 3 · 새 페이지 6
**OpenAI 가 Foundation Board 의 안전 위원회에 정렬 연구자를 앉혔다 — 현재 OpenAI 의 모델을 평가하는 미국 기관에 자문하고 있는 사람이다.** 그리고 FOIA 소송이 랩 네 곳의 국방부 계약을 공개 기록에 올렸다. 그 안에는 "OpenAI Mission Models" 를 *거부율이 최소인* 모델로 정의한 문서가 있고, OpenAI 는 서명 전에 그 문구를 거부했다고 말한다.
톱 스토리
1. OpenAI Foundation Board 에 안전 담당 자리가 생겼고, 그 자리에 앉은 사람은 OpenAI 의 모델을 평가하는 정부 기관에 자문한다 (1.86)
- OpenAI 자체 RSS 피드 기준 2026-09-09, 17:00 GMT: Paul Christiano 가 OpenAI Foundation Board, 의장 Zico Kolter 아래의 Safety and Security Committee, 그리고 OpenAI Group PBC 이사회의 의결권 없는 옵서버 자리에 합류한다. SSC 는 OpenAI Group PBC 를 포함한 OpenAI 전체의 안전·보안 관행에 대한 거버넌스를 제공한다고 설명된다 (source)
- 발표에 귀속되는 내용: 그는 미국 상무부 산하 NIST 안의 Center for AI Standards and Innovation (CAISI) 에서 수석 기술 자문을 맡고 있으며, 두 행정부에 걸친 정부 경험을 가지고 프런티어 AI 모델 평가를 다룬다. 보도에 귀속되는 내용: 그는 Alignment Research Center 를 설립했고, 2017년부터 2021년까지 OpenAI 의 정렬 연구를 이끌었으며, RLHF 를 개척했다
- 이해충돌은 한 방향으로만 작동하는 회피로 처리된다. 보도는 OpenAI 가 그가 정부 직책에서 OpenAI 관련 사안을 회피한다고 밝혔다고 전한다. 이사회 자리 쪽에 대응하는 제약을 기술하거나, 그 회피를 누가 관리하는지, 프런티어 모델 전반을 소관으로 하는 기관에서 "OpenAI 관련 사안"이 어디까지인지를 정의한 자료는 없다
- 왜 중요한가: 이 위키가 담고 있는 OpenAI 의 안전 거버넌스는 거의 전부가 회사가 스스로에 대해 공개하는 절차다 — Preparedness Framework, Astra 시스템 카드의 외부 평가자, Bio Bug Bounty. 이사회 위원회는 연구 조직 안이 아니라 위에 놓이는 여기 첫 장치이며, DseWiki 공개와 Astra 자신의 모니터 가능성 결과와 같은 2주 안에 인선이 이루어지고 있다
- 확인되지 않은 것: 참조한 어떤 자료에도 SSC 의 정관, 거부권, 보고 라인, 회의 주기가 나오지 않으므로 그 자리에 결정권이 있는지는 알 수 없다. 1차 자료를 읽지 못했다 —
openai.com,www.unite.ai,techcrunch.com모두EGRESS_BLOCKED를 반환한다. 글의 존재·제목·시각은 OpenAI 의 RSS 피드에서 왔고 나머지는 전부 검색 발췌다. 애그리게이터 한 곳은 발표일을 2026-09-08 로 적는다. 피드 자체의 시각을 채택했고 그 불일치는 페이지에 기록해 두었다 - → Paul Christiano · OpenAI · AI Governance
2. FOIA 소송이 랩 네 곳의 국방부 계약을 공개 기록에 올렸고, 공개된 문서 하나는 OpenAI 모델을 얼마나 드물게 거부하는지로 정의한다 (1.30)
- 2026-09-08: The Intercept 가 Legal Advocates for Safe Science and Technology 와 함께 제기한 FOIA 소송으로 확보한 국방부 계약 문서 400쪽 이상을 공개했다. OpenAI, Anthropic, Google, xAI 와 맺은 2025년 7월 협약을 다루며 각각 상한은 최대 2억 달러, 여기에 기밀 군사 환경을 위한 이후 수정본이 더해진다 (source)
- 의무가 양방향으로 흐른다는 점이 이것을 조달 사안이 아니라 거버넌스 사안으로 만든다: 프런티어 모델 벤치마크를 포함한 양방향 데이터 교환, 군에 배속되는 엔지니어, 합동 도상 훈련, 국방부의 AI 전략 자문, 군 인력 교육, 그리고 자사 기술의 리스크 예측
- 별개의 문서 쪽이 더 날카롭다. P00003, OpenAI Public Sector, LLC 와 Chief Digital and AI Office 사이 Other Transaction Agreement 의 수정본(사업 기간 2025-06-13 ~ 2027-06-12)은 "OpenAI Mission Models" 를 "designed for national security use cases" 이면서 "have minimal refusal rates" 인 모델로 정의한다 (source)
- 그 지위는 다투어지고 있으며 미해결로 기록한다. OpenAI 의 Nate Evans 는 그 문구가 체결된 계약에 없고 공개된 문서는 OpenAI 가 거부한 초안이라고 말한다. 국방부의 Jacob Bliss 는 그것이 현행 계약 어디에도 없다고 말한다. 법무부 변호사는 그 조항이 담긴 개정본을 최종 서명본으로 확인했다가 몇 시간 뒤 번복하고 그 확인을 무시해 달라고 요청한 것으로 전해진다
- 왜 중요한가: OpenAI 는 이미 GPT-5.6-Cyber 를 이중 용도 보안 작업에서 의도적으로 덜 거부하도록 학습된 모델로, 완료율 표와 함께 기록하고 있다. 그것은 랩이 선택하고 측정한 거부율이다. 이번 것은 고객이 계약 조건으로 요구한 거부율이다 — 같은 공개된 안전 속성이 보고되는 대신 협상되는 형태로 등장한다
- 확인되지 않은 것이 대부분이다: 어떤 기사도 문서도 1차로 읽지 못했다(
theintercept.com,www.bespacific.com,www.unite.ai,www.artificialintelligence-news.com모두EGRESS_BLOCKED). 읽은 어떤 자료에도 거부율 수치, 기준값, 시험 방법이 없고, 그 정의 아래 모델이 실제로 만들어졌는지도 다뤄지지 않는다. Anthropic 이 관련된 CENTCOM "target identification" 항목은 문서 식별자 없이 발췌 한 건에 기대고 있으며, Anthropic 에 그렇게 기록했다 - → AI Governance · OpenAI · Anthropic
논문 선별
오늘 HuggingFace 스냅숏은 완전히 교체됐다 — 25개 항목, arXiv id 중복 제거 후 25개 모두 신규이며, 이 저장소가 기록한 첫 전면 교체다.
What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets — arXiv:2609.05663 (1.85)
- TL;DR: 프로덕션 플릿 두 개, 실제 자금, 단일 모델 호출 750만 건과 다중 도구 턴 231,638건에서 체결 14,596건 — 그리고 결과를 움직이지 않는 부분이 모델이다. 리스크 슬라이더가 레버리지를 단계당 +0.425 로 설명하고, 에이전트 고정효과가 분산의 60% 를 흡수하며, 리더보드 렌더 경계가 1.75× 의 회귀 불연속으로 선택을 유도하고, 재현된 프로덕션 시나리오 416건에서 프런티어 모델들은 이 시계에서 통계적으로 구별되지 않는다
- 사이징은 변동성을 아예 무시한다: 모든 변동성 6분위에서 중앙값 레버리지 5.0×, 장부의 11% 를 차지하는 포스처 셀 하나가 청산의 62% 를 차지한다
- 읽어야 할 이유: Eval Harness Configuration 의 논지가 하니스가 평가 장치가 아니라 제품 표면인 곳에서 측정된 것이다. 조심해서 다뤄야 할 수치는 구별 불가 결과인데, 하나의 작업 계열·하나의 시계로 한정된 것이지 프런티어 모델이 서로 대체 가능하다는 근거가 아니다
- → What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets
NeoHorse-1 — arXiv:2609.08183 — 과 On-Policy Reverse Distillation — arXiv:2609.08798 (1.85 · 1.59)
- 한 쌍으로 싣는 이유는 둘이 같은 질문에 정반대에서 답하기 때문이다: 복사할 더 강한 모델이 없을 때 후학습 신호는 어디서 오는가? NeoHorse-1 은 그것을 라우팅 계층에서 가져온다 — 각 턴의 예측된 역량 수요, 서비스 티어, 상호작용을 기록하고 검증한 뒤 추론·도구 호출·하니스 맥락이 뒤섞인 상태 그대로 학습 예시로 재생하며, 평가 피드백이 다음 혼합을 정한다. 이름이 공개되지 않은 11개 벤치마크 매크로 평균 4B 58.94 → 64.87, 9B 65.60 → 69.04 로, 후학습된 4B 를 9B 베이스로부터 0.73 안에 놓는다
- OPRD 는 그것을 더 약한 교사에게서 가져오되 모방하지 않는다: 학생의 롤아웃 위에서 교사가 자신의 레퍼런스 정책 대비 이동한 방향을 읽고, 그 방향의 검증기가 지지하는 성분만 학생 그래디언트에서 증폭한다 — 이것이 정책 최적화의 정류점을 보존하므로 약한 교사가 구조적으로 자신의 천장을 강요할 수 없다
- 읽어야 할 이유: OPRD 는 One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation(관리해야 할 편향으로서의 비대칭성)와 FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience(부호로서의 검증기)에 이어, 12일 사이 교사에서 검증기로 권한을 옮긴 세 번째 논문이다. 여기서 검증기는 통과 관문이 되며, 셋 중 어느 것도 나머지 둘을 인용하지 않는다. NeoHorse-1 의 "recursive" 가 덮는 것은 닫힌 루프 한 번이고 — 스스로 초기 프로토타입이라 부른다 — 그것이 바로 OPSD 리뷰가 악화된다고 말하는 반복 문제다
- → NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness · Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
Steering Geometry: Validating Human Value Geometry in LLM Steering Space — arXiv:2609.06289 (1.59)
- TL;DR: 두 계열의 활성값 스티어링이 같은 점수를 내지만 자신이 조종한다고 말하는 것을 실제로 조종하는 쪽은 하나뿐이다. 26K 샘플·20개 가치 벤치마크에서 Schwartz 의 기본 인간 가치 이론과 대조하면, 분포 기반 기법(CAA, SphericalSteer, ODESteer)은 이론이 예측한 위상을 Spearman ρ 최대 0.51, p < 10⁻¹³ 으로 복원하고, 행동 중심 기법(COLD-Steer, BiPO)은 스티어링 성능은 대등하면서 그 기하와 상관이 거의 없다
- 기하적 충실도는 모델 규모와 함께 오르고 인스트럭션 튜닝 뒤 떨어진다 — 즉 실제로 배포되는 모델에서 떨어지며, 그 하락 폭은 공개되지 않았다
- 읽어야 할 이유: Mechanistic Interpretability 에서 모델 바깥에 정의된 구조와 대조해 검증한 첫 결과이며, 두 계열이 분리되는 것 자체가 그 덕분이다. ρ = 0.51 은 상한이고 그마저 중간 수준이다. 정직한 독법은 한 계열이 예측된 구조의 일부를 복원하고 다른 계열은 사실상 아무것도 복원하지 못한다는 것이다
- → Steering Geometry: Validating Human Value Geometry in LLM Steering Space
관찰
- 절차 지식을 트랜스크립트가 아니라 그래프로. Procedural Graphs: Self-Evolving Execution Structures for LLM Agents 는
(procedure, relation, procedure)삼항을 저장하고, 에이전트의 활성 노드 주변 부분그래프를 지시하지 않고 편향만 주는 가이던스로 렌더링하며, 실패 궤적과 성공 궤적을 대조해 진화한다 — 홀드아웃 검증을 유지하거나 개선하는 편집만 반영하고 거부된 편집을 남겨 루프가 같은 제안을 되풀이하지 않게 한다. 그 베이스라인이 Agents (LLM Agents) 가 이미 추적하는 메모리 기반 계열이다. 읽은 어떤 자료에도 절대 수치, 데이터셋, 모델 이름이 없고, 그래서 논문 선별이 아니라 여기 있다 (source) - Trivium China 의 AI 항목이 이틀 연속 보이면서 읽히지 않았다. 오늘 건너뛴 Trivium 후보 21건 가운데 셋이 AI 주제를 담는다 — US accuses Chinese AI firms of industrial-scale distillation, China responds, MIIT 의 정보통신산업 15차 5개년 계획, 최고인민법원의 AI 분쟁 사법 지침 — 그리고
triviumchina.com이EGRESS_BLOCKED를 반환하므로 어느 것도 제목 너머로 읽히지 않았다. 거버넌스 페이지는 헤드라인으로 쓰지 않는다. 항목이 후보 목록에는 닿지만 페이지에는 닿지 못하는 피드다 (source) interests.md에는 여전히 거버넌스에 닿는 항목이 없고, 그것이 오늘의 순서를 정했다. 두 Top Story 모두 기본 주제 가중치 1.0 으로 채점됐다. 표가 멀티모달 1.0 에서 제품 출시 0.7 로 내려가는 사이에 정책·규제·조달을 위한 자리가 없기 때문이다. 09-08 의 VLOSE 지정과 09-09 의 Trivium 건너뜀에 이어 사흘 연속 기록되는 공백이며, 국방부 1차 문서의 FOIA 공개가 1.30 으로 논문 다섯 편 아래에 놓인 이유다
위키 신규
검토용: 인물 페이지 하나와 논문 페이지 다섯.
- Paul Christiano (신규 — 랩의 안전 거버넌스 자리와 미국 모델 평가 직책을 동시에 가진 이 위키의 첫 인물. 검토 권장)
- NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness (신규)
- Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation (신규)
- What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets (신규)
- Steering Geometry: Validating Human Value Geometry in LLM Steering Space (신규)
- Procedural Graphs: Self-Evolving Execution Structures for LLM Agents (신규)
업데이트
- OpenAI: 항목 둘 — Foundation Board 인선, 그리고 P00003 거부 조항 분쟁. 여기에 Christiano 와 위원회 의장 Zico Kolter 의 주요 인물 두 줄
- Anthropic: FOIA 공개의 Anthropic 항목 — 보도된 CENTCOM "target identification" 사용과 거부된 기밀 후속 협약. 그 페이지에 이미 있는 공급망 지정은 다시 서술하지 않고 참조만 했다
- AI Governance: 공개 사실과 그 형태를 담는 새 섹션 — 그 페이지에서 국가와 랩이 동시에 양방향의 상대방이 되는 첫 장치이며, 나머지는 모두 규제 당국에서 공급자로 흐른다
- Post-Training Scaling: 주요 논문 항목 둘, NeoHorse-1 과 OPRD. 세 논문에 걸친 교사→검증기 독법을 두 번째 항목에 적었다
- Agents (LLM Agents): 주요 논문 · 사건 항목 둘, 프로덕션 트레이딩 기록과 Procedural Graphs
- Mechanistic Interpretability: Steering Geometry 주요 논문 항목 하나
- index: 여섯 줄 추가 — 인물 하나, 논문 다섯