AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2609.26637-hidden-cot.md

Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models

TL;DR

표준 API 기능을 통해 등록한 커스텀 도구로 닫힌 프런티어 모델이 중간 추론을 외부화하도록 유도하고, 오픈 모델의 네이티브 chain-of-thought 에 대해 검증한 뒤 GPT-6 Astra 를 포함한 닫힌 모델로 확장한다. 추출된 추론은 네이티브 추론 성능과 일치하고 무추론 기준선을 앞선다. Astra 는 토큰 효율적이고 방향이 잡혀 있다고 기술된다 — 초보적 단계는 내부에서 처리하고 핵심 단계만 밖으로 낸다 (source).

저자와 소속

스냅샷에 명시되지 않음 — 저자 목록도 소속도 없다. arxiv.org 는 이 런의 샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추정하지 않고 unknown 으로 기록한다.

방법

명시된 문제: 프런티어 모델의 역량 향상은 널리 추론 능력 개선으로 귀속되는데, 닫힌 시스템의 원본 CoT 트레이스가 숨겨져 있어 그 귀속을 검증할 수 없다.

기법이 곧 이 논문이다. 표준 API 기능을 통해 단순한 커스텀 도구를 등록하면 모델이 중간 추론을 밖으로 쓴다 — 도구 호출이 숨은 트레이스가 빠져나오는 통로가 된다. 외부화된 트레이스가 진짜 추론이 아니라 사후 합리화일 수 있으므로, 저자들은 네이티브 CoT 를 비교할 수 있는 오픈소스 모델에서 먼저 검증한 뒤 닫힌 프런티어 모델로 확장한다.

평가는 경시 수학, 과학, 코드 생성 전반에 걸친다. 모델은 토큰 효율, 추론 단계 유형, 유도된 추론 트리를 따라 특성화된다.

결과

주장보고 내용
추출된 추론 대 네이티브 추론네이티브 추론 성능과 일치
추출된 추론 대 무추론 기준선크게 앞섬
영역경시 수학, 과학, 코드 생성
모델 간 비교외부화·압축·조직화 방식에 체계적 차이
GPT-6 Astra토큰 효율적이고 방향이 잡힌 추론 — 올바른 궤적을 더 일찍 고르고, 초보적 단계는 내부에서 처리하며, 핵심 추론만 외부화
스냅샷에 수치가 전혀 없다 — 정확도, 토큰 수, 모델 간 비교값 어느 하나도 없다.
"일치한다", "크게 앞선다", "더 일찍" 이 여기서 얻을 수 있는 정량적 기록의
전부다.

의의

기법이 곧 발견이고, 그것은 양쪽으로 작동한다. Mechanistic Interpretability 에게 이것은 벤더의 협조 없이 배포된 닫힌 모델의 중간 추론을 읽는, 이 위키의 첫 기법이다 — 여기 기록된 모든 해석가능성 결과는 가중치나 랩 자신의 공개를 필요로 했다. 신뢰할 만하게 만드는 것은 설계된 검증이다: 추출된 트레이스를 오픈 모델의 네이티브 CoT 에 먼저 대조하는 것은 사후 합리화 반론이 요구하는 바로 그 통제군이며, 논문은 닫힌 모델에 대한 주장을 내놓기 전에 그것을 수행한다.

반대로 읽으면 이것은 평범한 API 기능을 통한 의도치 않은 유출 통로이고, 숨은 트레이스를 읽히는 랩은 OpenAI 다. Anthropic 은 이 논문이 발표되기 사흘 전 Claude Opus 5.5 에 preserved thinking 을 실었고, 이를 anti-distillation 안전장치로 기술했다 — 랩이 자사의 추론 트레이스가 무엇을 노출할지 의도적으로 통제한 것이다. 읽은 자료 어디에도 둘을 연결하는 것은 없고, 이 기법에 대한 벤더의 대응도 어디에도 나타나지 않는다. 같은 양이 같은 주에 양쪽에서 문제가 되고 있어서 기록한다.

특성화 쪽은 추출 쪽보다 약하다. "토큰 효율적이고 방향이 잡힌 추론" 은 한 모델의 스타일에 대한 기술이며, 모델이 학습받지 않은 유도된 조건에서 만들어 낸 트레이스로부터 끌어낸 것이다. 외부화하도록 만들어진 모델이 그렇지 않을 때와 같은 방식으로 추론하는지가 이 결과 전체가 걸린 질문이고, 검증은 그것을 성능에 대해서는 답하지만 구조에 대해서는 답하지 않는다.

Reasoning Models 에게 쓸모 있는 부정적 사실은 전제 자체다: 프런티어 모델의 향상을 추론에 귀속시키는 것은 검증 불가능했고, 이 위키는 올 한 해 사실상 모든 출시 항목에 그 귀속을 기록해 왔다.

열린 질문

  • 어떤 API 기능인가? "표준 API 기능" 과 "단순한 커스텀 도구" 가 서술의 전부다. 그것 없이는 재현도 완화도 불가능하다.
  • 수치가 어디에도 없다. "네이티브 추론 성능과 일치한다" 는 확인되기 전에 수가 필요하다.
  • GPT-6 Astra 외에 어떤 닫힌 모델인가? "including" 은 다른 모델의 존재를 함의하지만 스냅샷에 이름이 없다.
  • 오픈 모델에서의 검증이 이전되는가? 오픈 모델에서 네이티브와 추출이 일치한다는 것은 그곳에서 통로가 충실하다는 뜻이고, 대조할 네이티브 트레이스가 없는 닫힌 모델이야말로 관심 대상이다.
  • 구조적 특성화는 유도의 산물인가? 위 참조.
  • 어떤 벤더가 대응했거나 통로를 닫았는가? 읽은 자료에 그런 서술이 없다.

인용

arXiv 2609.26637, Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models, HuggingFace Daily Papers 2026-09-25, 업보트 7 (snapshot).

Referenced by

Sources