$ cat wiki/papers/2026/2609.29845-superposition-linearity.md
Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
TL;DR
서로 다른 두 텍스트 스트림의 입력을 선형 결합하면 모델이 두 개별 next-token 분포의 중첩을 출력한다. 논문은 이를 Superposition Linearity Hypothesis 라 부르고, 이것이 학습된 것이 아니라 Transformer 구조에 내재한다고 — 사전학습이 진행될수록 줄어든다는 근거로 — 논증하며, 한 번의 forward pass 에서 일관된 연속 두 개를 만드는 guided decoding 절차를 제시한다 (source).
저자와 소속
스냅숏에 명시되어 있지 않다 — 저자 목록도 소속도 없다. arxiv.org 는 이 런의
샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추측하지 않고 미상으로 기록한다.
방법
논문이 제시하는 순서대로 세 가지 주장:
- 현상. "고도로 비선형인 구성 요소" 에도 불구하고 LLM 은 "근본적인 선형성을 보인다": 서로 다른 텍스트 스트림의 입력을 선형 결합하면 출력이 개별 next-token 분포들의 중첩이 된다.
- 기원. 중첩이 학습의 창발적 결과가 아니라 Transformer 구조에 내재하는 성질이라는 근거가 제시되며, 그 근거는 방향성을 띤다: 사전학습이 진행될수록 줄어드는 경향이 있다.
- 복원과 활용. 선형성은 lightweight fine-tuning 으로 상당 부분 복원 가능하며, 예측된 next-token 분포와 개별 분포들의 평균 사이 divergence 를 크게 줄인다. 이어지는 guided decoding 절차가 중첩된 출력을 분리해, 한 번의 forward pass 에서 일관된 연속 두 개를 동시에 생성할 수 있게 한다.
결과
스냅숏에는 수치가 없다. 하나도 없다 — divergence 지표도, 표본 수도, 모델 목록도, 파라미터 규모도, "lightweight" 한 fine-tuning 이 얼마나 가벼운지의 척도도, 두 연속 각각의 품질 수치도 없다.
위의 모든 결과는 정성적으로 진술된다: "divergence 를 크게 줄인다", "상당 부분 복원된다", "일관된 연속 두 개". 함의된 수치로 바꾸지 않고 방향성 주장으로 기록한다.
이는 2026-09-25 의 Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It? 와 Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models 에 이어 이번 주에 만들어진 세 번째, 스냅숏 항목에 수치가 전혀 없는 논문 페이지다.
의의
결이 다른 주장은 2 번이다. 이 위키에서 중첩은 용량 현상으로 다루어져 왔다 — Mechanistic Interpretability 는 그것을 네트워크가 차원 수보다 많은 특징을 표현하는 이유로 보유하며, 그것이 sparse autoencoder 가 되돌리려는 대상이다. 이 논문은 인접하되 원인이 다른 것을 기술한다: 학습 압력에 의해 기저에 밀집된 특징이 아니라, 학습이 침식하는 구조적 선형성이다.
그것이 성립한다면 이 위키가 기록하는 두 가지가 더 어려워진다. 첫째, 사전학습과 함께 줄어드는 성질은 프런티어 규모 모델이 가장 적게 가진 성질인데, 읽은 어디에도 프런티어 규모에서 입증되지 않았다. 둘째, fine-tuning 결과는 이 성질이 요청에 따라 복원 가능하다는 뜻이고 — 그러면 "이 모델은 선형인가?" 는 Transformer 에 대한 질문이 아니라 체크포인트 이력에 대한 질문이 된다.
디코딩 결과가 당장의 날이 선 쪽이다. 한 번의 forward pass 에서 일관된 연속 두 개는 처리량 주장이고, 같은 스냅숏의 2609.29362 와 함께 도착한다. 그쪽은 품사 범주가 일대일이 아니라 SAE latent 의 조밀한 군집에 분산되어 있음을 밝힌다 — 둘 다 단일 forward pass 가 담고 있는 것이 도구가 가정하는 것보다 덜 분리 가능하다고 말한다.
앞선 런의 Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models — 표준 API 기능을 통해 닫힌 모델의 숨은 chain-of-thought 를 읽어낸 — 과 나란히 놓으면 방향은 일관된다: forward pass 는 그 인터페이스가 노출하는 것보다 더 많은 복원 가능한 구조를 나르고 있다.
열린 질문
- 어느 규모까지 중첩이 살아남는가? "사전학습이 진행될수록 줄어든다" 는 프런티어 모델이 가장 적게 가졌음을 함의하는데, 규모가 명시되어 있지 않다.
- 선형성 복원이 능력을 대가로 치르는가? 학습이 제거한 구조적 성질을 lightweight fine-tuning 으로 복원한다는 것은 학습이 더한 무언가를 덜어내는 셈이다. 읽은 어떤 것도 그 맞바꿈을 다루지 않는다.
- 이것이 Mechanistic Interpretability 가 말하는 그 중첩인가? 이 논문은 그 단어를 입출력 사상의 성질로 쓰고, SAE 연구는 표현의 성질로 쓴다. 읽은 어떤 것도 둘을 연결하지 않으며, 이름을 공유하는 것 자체가 해를 끼치고 있을 수 있다.
- 두 개인가, n 개인가? 결과는 처음부터 끝까지 두 개에 대해 진술된다.
- Test-Time Compute (Inference-Time Compute Scaling) 에 어떤 함의가 있는가? forward pass 당 연속 두 개는 여러 개를 샘플링하는 모든 기법에 대해 다른 비용 곡선을 뜻한다.
인용
arXiv 2609.29845 — Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs, 2026-09-24. HuggingFace Daily Papers, 2026-09-26, 업보트 55 — 해당 커뮤니티의 인기 신호일 뿐이며 품질이나 중요도의 순위가 아니다 (source).