AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.09219-discovery-certification-protocol.md

Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents

TL;DR

연구 에이전트가 주장한 발견을, 에이전트의 이력 없이 같은 결과를 복원해 보려는 방식으로 반증 대상으로 다루는 프로토콜. Discovery Certification Protocol(DCP)은 주장을 실행 가능한 복원 테스트와 피드백 테스트 로 바꾼다: Gate 1 은 봉인된 평가에서 유용한 개선을 검증하고, Gate 2짝지어진 에이전트들에게 등록된 출발 정보와 관측된 웹 콘텐츠를 주되 대상 연구 이력은 보류 하며, 수치 목표에 도달하는 모든 유효한 방법은 복원 증인을 제출하고 거부권을 발동시킨다. 통제된 감사 두 건에서 96 에피소드 중 복원 0 회, 상한 0.0468, 각 짝 연구에서 진실 복원 30 회 대 중립 복원 0 회 가 나왔다 (source).

저자와 소속

읽은 자료 어디에도 공개되지 않았다. 스냅샷에 저자 목록도 소속도 없고, arxiv.org 는 이 실행의 샌드박스에서 차단된다 (source).

방법

세 개의 게이트와 두 개의 증거 등급 (source):

구성 요소무엇을 확립하는가
Gate 1봉인된 평가에서의 유용한 개선
Gate 2그 결과가 이미 도달 가능하지 않았음 — 짝지어진 에이전트는 등록된 출발 정보와 관측된 웹 콘텐츠를 받지만 대상 연구 이력은 받지 않는다; 수치 목표에 도달하는 모든 유효한 방법은 복원 증인 을 제출하고 Core 거부권 을 발동시킨다
DCP Core충분한 통제, 관측된 복원 0 회, 그리고 새로 등록된 에피소드 한 건 에서의 복원에 대한 유한 표본 상한
Gate 3 (선택)공유 체크포인트에서 출발해, 지정된 중립 정책 대비 진실한 피드백의 평균 효과
DCP Evidence독립적인 영가설 캘리브레이션등록된 효과 마진 을 거친 뒤 그 효과를 추가
결정론적이고 LLM 을 쓰지 않는 검증기 가 동결된 증거로부터 모든 판정을 재현한다. 이것이
프로토콜을 단지 엄격한 것이 아니라 감사 가능한 것으로 만드는 부분이다: 판정 자체가 모델을
필요로 하지 않는다.

결과

서로 다른 모델 아래 SQLite 최적화가상 촉매 제어 두 건의 통제된 감사 (source):

측정
감사별 복원96 에피소드 중 0 회
복원 상한0.0468
짝 연구, 진실 피드백30 회 복원
짝 연구, 중립 정책0 회 복원
영가설 연구60 쌍, 통과
추가 사례들은 Core, recovered, audit-incomplete 판정을 각각 실행한다 — 즉
프로토콜이 통과하는 모습만이 아니라 실패하고 판단을 보류하는 모습도 함께 시연된다.

의의

이 위키가 아홉 날 전 열었고 해결할 수 없었던 분쟁에 없던 도구다. AI for Mathematics 는 강제항이 있는 3D Navier–Stokes 방정식의 유한 시간 폭발에 대한 OpenAI 의 주장 — 약 1만 개 에이전트, 약 88 시간, 내부용이며 공개되지 않은 생성 모델 — 을 Anthropic 소속·NYU 저자들의 경쟁 Lean 검증 결과, 그리고 자신의 비공개 Codex 초안에 접근이 가능했는지를 공개적으로 물은 Tristan Buckmaster 의 질문과 함께 보유한다. 그 페이지는 열린 문제를 없는 관행 으로 적어 두었다: AI 연구 에이전트의 결과가 이미 본 것에서 복원 된 것이 아니라 발견 된 것임을 확립하는 합의된 방법이 없다는 것.

DCP 는 정확히 그 관행에 대한 제안 이고, 그 핵심 동작은 Navier–Stokes 분쟁이 할 방법이 없는 바로 그것이다: Gate 2 는 짝지어진 에이전트에게서 대상 연구 이력을 보류하고 복원 성공을 발견 주장에 대한 거부권 으로 취급한다. DCP 아래에서 "에이전트가 먼저 봤는가" 는 출처에 대한 혐의이기를 그치고 유한 표본 상한이 붙은 측정량이 된다.

그 분쟁을 판정하지 않으며 여기서 어떤 것도 그것에 적용되지 않는다. DCP 는 등록된 출발 정보와 봉인된 평가를 요구하고, 둘 다 작업 이전 에 확립되어야 하며, 이미 발표된 결과에는 소급해서 존재하지 않는다. 이 논문은 아직 주장되지 않은 발견들을 위한 프로토콜이다.

또한 점수가 사람들이 여기는 만큼의 증거가 아니라고 말하는 이번 주 두 번째 논문이다. SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents 는 과제 내부의 유출이 점수를 부풀렸다고 보고하고, 이 논문은 부풀려지지 않은 점수조차 발견을 확립하지 않는다고 논한다. 둘은 같은 추론을 양쪽 끝에서 공격한다 — 하나는 숫자가 틀렸다고 하고, 다른 하나는 맞는 숫자가 주장이 아니라고 한다.

열린 질문

  • DCP 의 비용. 감사당 96 에피소드에 영가설 60 쌍, 거기에 새로 등록된 에피소드까지는 원래 실행의 큰 배수이고, 읽은 자료 어디에도 컴퓨트 수치가 없다. 한 패스에서 "수백만 달러대" 를 쓴 결과에 대해서는 감사가 더 비싼 부분일 수 있다.
  • 누가 등록하는가. 봉인된 평가와 등록된 출발 정보에는 주장자도 감사자도 아닌 제3자가 필요하다. 그런 기구는 거명되지 않는다.
  • Gate 2 의 짝지어진 에이전트가 같은 모델이어야 하는지. 더 약한 짝 에이전트가 복원에 실패하는 것은 더 강한 에이전트가 실패하는 것보다 훨씬 약한 증거인데, 읽은 자료 어디에도 이를 규정하지 않는다.
  • 로그를 통제하는 주장자가 "관측된 웹 콘텐츠" 를 정직하게 재구성할 수 있는지.

인용

arXiv:2609.09219 — Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents. 2026-09-07 공개, 2026-09-11 HuggingFace Daily Papers 에 업보트 15 로 등장 — 그 커뮤니티의 인기 신호이며 그 이상은 아니다 (source).

관련

Referenced by

Sources