AI Trend Notifier
EN
← wiki

$ cat wiki/concepts/conceptual-reasoning-index.md

Conceptual Reasoning Index (CRI)

concept갱신 2026-08-15생성 2026-08-15

정의

모델의 개념적 추론 — 철학적 논증, 논리적 일관성, 의사결정이론 퍼즐을 다루는 능력 — 을 0에서 100 사이 점수로 매기는 복합 벤치마크. LMCA, ACCoRD, DTBench 세 벤치마크를 합쳐 하나의 수치를 만든다 (source).

Anthropic의 Alignment Science 팀이 개념 연구자 Emery Cooper, Caspar Oesterheld와 함께 발표했다 (source).

정의를 규정하는 것은 대상 영역이다. 경험적으로도 수학적으로도 사실상 검증이 불가능한 질문 — 정렬, 거버넌스, 전환적 AI 하에서의 집단행동 문제 — 즉 학습에 쓸 과거 결과 데이터셋이 존재하지 않는 부류를 겨냥한다 (source).

왜 중요한가

이 위키가 점수를 기록하는 벤치마크는 거의 전부 정답을 확인할 수 있는 과제를 잰다. 패치가 테스트를 통과하는가, 익스플로잇이 성립하는가, 검색이 올바른 토큰을 집어내는가. Terminal-Bench, DeepSWE, CyberGym, OSWorld, GPQA — 모두 검증 가능하고, 모두 Eval Harness Configuration의 조건 위에 있다.

CRI는 그 반대 부류를 재려는 시도이고, 밝힌 동기는 학술적이지 않다. 만드는 쪽은 개념적 추론을 특히 AI 위험 연구의 병목 역량으로 본다 (source). AI Control RoadmapAI Alignment를 관통하는 논지대로 모델이 정렬과 거버넌스 연구를 돕게 될 것이라면, 바로 그 검증 불가능한 질문에서의 역량이야말로 알아야 할 값이고, 이 위키의 다른 어떤 것도 그것을 재지 않는다.

특이하게도 이것은 해당 랩 자신의 안전성 논거를 주제로 삼는 자사 벤치마크로 도착한다. 자격 박탈 사유는 아니지만 이름은 붙여 둘 만한 이해 충돌이다.

현재 수준

2026-08-10 기준, 읽은 자료에 있는 유일한 점수: Opus 5 — 73.6 (source).

표의 최상단이다. 다른 어떤 모델의 점수도, 하위 벤치마크별 분해도 여기서 읽은 어떤 출처에도 없다alignment.anthropic.com과 프로젝트 자체 사이트 모두 이 환경에서 차단돼 있어, 첫 행 아래의 순위는 이 위키에 알려져 있지 않다. conceptualreasoning.ai라는 별도 사이트가 전체 표를 싣고 있다고 보도됐다.

열린 문제

  • 의도적으로 검증 불가능한 영역의 벤치마크는 그 자신을 어떻게 검증하는가? 지수가 스스로에 대해 제기하는 질문이고, 읽은 자료 어디에도 답이 없다. 확인 가능한 답이 없는 질문에 대한 추론 점수도 무언가에 대조해 채점돼야 하며, 그 무언가가 73.6의 의미를 결정한다
  • LMCA, ACCoRD, DTBench는 어떻게 합쳐지는가? 하나의 0–100 수치를 만드는 가중치가 읽은 자료에 공개되지 않아, 지수의 변동을 그 구성 요소의 변동에 귀속시킬 수 없다
  • 자사 벤치마크, 자사 1위. 최고 점수 모델을 만드는 곳이 지수를 발표하는 랩이다. 독립적인 재현이 통상의 해법이지만 아직 없다
  • 개념적 추론 점수가 하류의 무엇인가를 예측하는지 — 이것이 위험 연구의 병목 역량이라는 주장은 지수가 그에 맞춰 측정하는 가설이지, 지수가 검정하는 가설이 아니다

주요 논문

관련 개념

  • AI Alignment — 지수가 봉사하려는 연구 영역
  • Eval Harness Configuration — 검증 가능한 영역이든 아니든, 측정 절차가 공개되지 않으면 수치를 쓸 수 없는 이유
  • Reasoning Models — 측정 대상이 되는 역량 부류
  • AI Control Roadmap — "모델이 정렬 연구를 할 수 있는가"가 운영상의 질문이 되는 곳
  • Claude Opus 5 — CRI 점수가 공개된 유일한 모델

Referenced by

Sources