$ cat wiki/concepts/conceptual-reasoning-index.md
Conceptual Reasoning Index (CRI)
정의
모델의 개념적 추론 — 철학적 논증, 논리적 일관성, 의사결정이론 퍼즐을 다루는 능력 — 을 0에서 100 사이 점수로 매기는 복합 벤치마크. LMCA, ACCoRD, DTBench 세 벤치마크를 합쳐 하나의 수치를 만든다 (source).
Anthropic의 Alignment Science 팀이 개념 연구자 Emery Cooper, Caspar Oesterheld와 함께 발표했다 (source).
정의를 규정하는 것은 대상 영역이다. 경험적으로도 수학적으로도 사실상 검증이 불가능한 질문 — 정렬, 거버넌스, 전환적 AI 하에서의 집단행동 문제 — 즉 학습에 쓸 과거 결과 데이터셋이 존재하지 않는 부류를 겨냥한다 (source).
왜 중요한가
이 위키가 점수를 기록하는 벤치마크는 거의 전부 정답을 확인할 수 있는 과제를 잰다. 패치가 테스트를 통과하는가, 익스플로잇이 성립하는가, 검색이 올바른 토큰을 집어내는가. Terminal-Bench, DeepSWE, CyberGym, OSWorld, GPQA — 모두 검증 가능하고, 모두 Eval Harness Configuration의 조건 위에 있다.
CRI는 그 반대 부류를 재려는 시도이고, 밝힌 동기는 학술적이지 않다. 만드는 쪽은 개념적 추론을 특히 AI 위험 연구의 병목 역량으로 본다 (source). AI Control Roadmap과 AI Alignment를 관통하는 논지대로 모델이 정렬과 거버넌스 연구를 돕게 될 것이라면, 바로 그 검증 불가능한 질문에서의 역량이야말로 알아야 할 값이고, 이 위키의 다른 어떤 것도 그것을 재지 않는다.
특이하게도 이것은 해당 랩 자신의 안전성 논거를 주제로 삼는 자사 벤치마크로 도착한다. 자격 박탈 사유는 아니지만 이름은 붙여 둘 만한 이해 충돌이다.
현재 수준
2026-08-10 기준, 읽은 자료에 있는 유일한 점수: Opus 5 — 73.6 (source).
표의 최상단이다. 다른 어떤 모델의 점수도, 하위 벤치마크별 분해도 여기서 읽은 어떤 출처에도
없다 — alignment.anthropic.com과 프로젝트 자체 사이트 모두 이 환경에서 차단돼 있어, 첫 행
아래의 순위는 이 위키에 알려져 있지 않다. conceptualreasoning.ai라는 별도 사이트가 전체 표를
싣고 있다고 보도됐다.
열린 문제
- 의도적으로 검증 불가능한 영역의 벤치마크는 그 자신을 어떻게 검증하는가? 지수가 스스로에 대해 제기하는 질문이고, 읽은 자료 어디에도 답이 없다. 확인 가능한 답이 없는 질문에 대한 추론 점수도 무언가에 대조해 채점돼야 하며, 그 무언가가 73.6의 의미를 결정한다
- LMCA, ACCoRD, DTBench는 어떻게 합쳐지는가? 하나의 0–100 수치를 만드는 가중치가 읽은 자료에 공개되지 않아, 지수의 변동을 그 구성 요소의 변동에 귀속시킬 수 없다
- 자사 벤치마크, 자사 1위. 최고 점수 모델을 만드는 곳이 지수를 발표하는 랩이다. 독립적인 재현이 통상의 해법이지만 아직 없다
- 개념적 추론 점수가 하류의 무엇인가를 예측하는지 — 이것이 위험 연구의 병목 역량이라는 주장은 지수가 그에 맞춰 측정하는 가설이지, 지수가 검정하는 가설이 아니다
주요 논문
- Introducing the Conceptual Reasoning Index — Anthropic Alignment Science, 2026-08 (source)
- OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution (arXiv:2608.00677) — 같은 문제의 반대 방향: 답은 확인 가능하지만 환경이 고정돼 있지 않은 경우
관련 개념
- AI Alignment — 지수가 봉사하려는 연구 영역
- Eval Harness Configuration — 검증 가능한 영역이든 아니든, 측정 절차가 공개되지 않으면 수치를 쓸 수 없는 이유
- Reasoning Models — 측정 대상이 되는 역량 부류
- AI Control Roadmap — "모델이 정렬 연구를 할 수 있는가"가 운영상의 질문이 되는 곳
- Claude Opus 5 — CRI 점수가 공개된 유일한 모델