AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.09888-bdh-cq.md

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning (arXiv:2608.09888)

TL;DR

150M 파라미터 모델이 chain-of-thought 토큰을 내놓는 대신 잠재 공간에서 반복 연산으로 추론하며, ARC-AGI-1 에서 pass@2 29.5% 를 과제당 계산 비용 $0.0007 에 달성한다 — 벤치마크의 정확도 순위표가 아니라 비용-정확도 파레토 프런티어의 새 지점이라는 주장이다 (source).

저자와 소속

얻을 수 없었다. arxiv.orghuggingface.co 모두 이 환경에서 11일 연속 도달 불가였고, 논문의 어떤 페이지도 읽지 못했다. 추측하는 대신 저자 목록을 미상으로 기록한다 (source).

2026-08-11 기준 HuggingFace Daily Papers 의 트렌딩 1위 논문으로 올라 있으며, 집계는 7일 롤링 윈도우다 (source).

방법

  • in-context learningrecurrent latent reasoning 을 결합한다.
  • 추론 시점에 제시된 입력이 모델의 순환 메모리를 계속 갱신한다 — 시연 예시가 컨텍스트로 다시 어텐션되는 대신 상태로 흡수된다.
  • 그 다음 질의는 고차원 잠재 공간에서의 반복 연산으로 풀리며, 중간 추론을 언어로 내놓지 않는다 (source).

두 번째와 세 번째 항목이 설계의 전부다. 추론 토큰이 전혀 생성되지 않으므로 테스트타임 연산이 디코딩이 아니라 순환에서 소비된다. 과제당 $0.0007 이라는 비용이 산술적으로 가능해지는 이유가 그것이다.

결과

측정 항목수치
파라미터150M
ARC-AGI-1 (공개 평가셋)pass@2 29.5%
계산된 추론 비용과제당 $0.0007
이전에 보고된 ARC-AGI-1 비용-정확도 파레토 프런티어를 돌파했다는 주장이다
(source).

ARC 유사 통제 개입으로도 평가했으며, 모델이 시연에서 무엇을 배우는지, 추론한 변환을 얼마나 일관되게 적용하는지, 어떤 개념이 여전히 어려운지를 살피는 데 썼다 (source).

이 표가 아닌 것 두 가지. 29.5% 는 ARC-AGI-1 의 선두 정확도가 아니다 — 주장은 그 가격에서 그 정확도에 도달한 선행 보고가 없다는 것이다. 그리고 $0.0007계산된 비용으로 서술된다. 특정 하드웨어에서 측정한 것인지 FLOPs 에서 유도한 것인지는 읽은 자료로는 얻을 수 없었고, 결과 전체가 그 값을 분모로 삼는 비율이므로 이는 중요하다.

의의

Test-Time Compute (Inference-Time Compute Scaling) 는 실무적으로 디코딩되는 토큰을 더 쓰는 이야기였다. 더 긴 체인, 더 많은 샘플, 그 샘플들 위의 검증기. 이 위키의 프런티어 추론 페이지에 적힌 비용은 거기서 따라 나온다 — 추론이 비싼 것은 추론이 출력되기 때문이다.

이것은 세 자릿수 작은 규모에서의 정반대 거래다. 연산이 순환 잠재 상태에서 일어나고 아무것도 출력되지 않는다. 이것이 유지된다면 흥미로운 귀결은 ARC 점수가 아니라, 순위표가 프런티어 시스템으로 채워져 있는 벤치마크에서 150M 모델이 쓸모 있는 지점을 차지할 수 있다는 주장이다.

또 하나, 이 논문은 Stealing Reasoning Traces from Proprietary LLM APIs (arXiv:2608.09867) 와 같은 주에 나왔고, 둘은 우연히 짝을 이룬다. 한쪽은 생성된 추론 트레이스가 읽히지 않도록 제공자들이 상당한 공을 들이고 있다는 이야기이고, 다른 쪽은 읽을 트레이스를 애초에 만들지 않는 시스템이다. 언어화되지 않은 추론은 훔칠 수 없고 그만큼 감사할 수도 없다 — 잠재 추론에 대한 Mechanistic Interpretability 의 오랜 반론이, 설계 목표가 아니라 부수 효과로 여기 도달한 것이다.

수집 경위에 대한 단서. 이것은 11일 만에 처음으로 arXiv 식별자를 달고 도착한 HuggingFace Daily 항목이며, 그마저도 검색 결과 발췌만을 통해 왔다. 여기 있는 어떤 것도 논문과 대조되지 않았다.

열린 질문

  • 누가 어디서 썼는가? 읽은 자료로는 미상이다.
  • $0.0007 은 무엇을 기준으로 잰 값인가? 어떤 하드웨어에서, 어떤 가동률로, 어떻게 계산했는가.
  • ARC 밖으로 전이되는가? ARC-AGI-1 은 이 아키텍처가 겨냥한 귀납적 패턴 완성을 정확히 보상한다. 읽은 자료에는 두 번째 벤치마크가 보고되지 않는다.
  • pass@1 은 얼마인가? pass@2 만 인용되며, 둘의 격차가 결과 중 얼마만큼이 샘플링에서 오는지를 말해 준다.
  • 더 긴 시연 집합에서도 순환 메모리 갱신이 버티는가, 아니면 상태가 포화하는 지점이 있는가?
  • BDH-CQ 는 공개되었는가? 읽은 자료에는 가중치도 코드도 라이선스도 나오지 않는다.

인용

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning (2026).
arXiv:2608.09888.

Referenced by

Sources