$ cat wiki/papers/2026/2610.05076-feedback-ttt.md
Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation
TL;DR
모델이 스스로 생성한 텍스트로 업데이트하면 독립적인 인간 텍스트에 대한 예측이 악화될 수 있다. 저자들은 변하는 생성기와 가중치에 유지되는 업데이트 사이의 피드백 고리를 추적하고, 업데이트를 확정하기 전에 독립적 증거를 확인하는 관문을 시험한다. (source)
저자와 소속
저자는 Cheng Luo, Bing Li, Bernard Ghanem이다. 초록 페이지에는 소속이 명시돼 있지 않다. 제출일은 2026-10-04이며, 읽은 범위는 초록과 서지 정보다. (source)
방법
128K-token 스트림에서 125M, 760M, 3B로 표기한 TTT-E2E 구성과 Qwen3-4B의 기존 가중치에 대한 Adam 업데이트를 시험한다. Fixed Generation은 학습 청크를 만드는 모델을 동결한다. Recorded Replay는 품질이 저하된 입력의 효과와 업데이트로 유지되는 손상을 분리한다. 한 번의 업데이트를 쌍대로 비교해 원본 텍스트 적합도와 새로운 실제 텍스트 예측을 대조한다. (source)
결과
Fixed Generation은 125M과 760M에서 손상의 98% 초과를 제거한다. 업데이트는 자신의 원본에 더 잘 맞으면서도 새로운 실제 텍스트는 더 나쁘게 예측할 수 있다. 같은 메커니즘이 실제 텍스트에서는 개선을 만들 수 있으므로, 업데이트 자체가 실패 원인은 아니다. (source)
Settlement는 후보 상태를 확정하기 전에 독립적인 실제 텍스트로 검사한다. 실제 텍스트 적응을 유지하면서 125M과 760M에서 최종 시점의 평균 격차를 각각 0.07, -0.02 nats로 남긴다. 초록은 이 결과를 시험한 모든 모델에 대해 보고하지 않는다. (source)
의의
이는 Test-Time Compute (Inference-Time Compute Scaling)와 인접한 메커니즘에 조건을 단다. 테스트 시점 학습은 가중치를 바꾸지만, 개념 페이지의 핵심 정의는 가중치를 고정한다. 해석: 추론 시점에 연산을 더 쓰는 것과 자체 생성한 업데이트를 유지하는 것은 서로 다른 개입이며, 서로 다른 통제가 필요하다. (source)
열린 질문
초록은 Settlement의 비용이나 프런티어 규모의 성능을 확정하지 않는다. 모든 합성 데이터 학습이 실패한다고 보이지 않으며, 보고된 98% 완화는 명시된 두 구성에 한정된다. (source)
인용
Cheng Luo, Bing Li, Bernard Ghanem. “Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation.” arXiv:2610.05076, 2026. arXiv.