$ cat wiki/papers/2026/2608.14929-training-leaves-traces.md
Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929)
TL;DR
두 모델 체크포인트가 조상을 공유하는지를 가중치만으로 판정하는 데이터 없는 화이트박스 검사다. 파인튜닝·LoRA 병합·프루닝·양자화된 후손을 독립 모델과 AUROC = 1.0 으로 분리하며 — 결정적으로 증류된(distilled) 모델과도 분리한다. 행동 유사성이 아니라 가중치 혈통 을 재기 때문이다 (source).
방법
제시된 배경: 오픈 웨이트 모델은 파인튜닝되고, 양자화되고, 프루닝되고, 병합되며, 그 출처는 대개 문서화되지 않는다. 던지는 질문: 데이터도 추론도 없이 가중치만으로 공유 조상을 드러낼 수 있는가?
논문이 먼저 짚는 장애물: residual 학습은 branch product 에 공유된 identity 정렬 성분 을 만들어내며, 이는 모든 residual 네트워크에 존재한다. 그 구조만으로는 혈통을 입증할 수 없다 — 그런 모델 전부가 공통으로 갖는 것이기 때문이다. 그래서 그 성분을 제거하고 ("centered") residual 블록 전반에서 남는 체크포인트 고유 구조 를 비교해, 독립 체크포인트들에 대해 보정된 대칭 혈통 점수 를 얻는다.
residual-MLP 과 GPT-2 벤치마크에서 평가했고, LLaMA-2 공개 체크포인트 사례 연구를 함께 수행했다.
견고성은 함수 보존 체크포인트 세탁(laundering) 에 대해 시험된다 — 모델의 행동은 유지하면서 가중치를 교란하는 의도적 변환이다.
결과
| 항목 | 수치 |
|---|---|
| 파인튜닝 / LoRA 병합 / 프루닝 / 양자화된 후손을 독립 및 증류 모델과 분리 | AUROC = 1.0 |
| 함수 보존 세탁 하에서 | 점수 불변; 가중치 공간 기준선들은 "마진을 잃거나 실패" |
| 속도 | GPT-2 에서 가장 가까운 견고한 기준선 대비 76배 빠름 |
| 사례 연구 | LLaMA-2 공개 체크포인트 중 관련 3개와 무관 7개 를 정확히 식별 |
| 일반성 | projection-pairing 신호가 여섯 개 언어 모델 계열 및 그 너머에서 나타남 |
의의
AUROC = 1.0 을 주의해서 읽어야 한다. 그 문장이 정반대의 두 일을 동시에 하고 있기 때문이다. 증류된 모델은 점수가 배제하도록 설계된 쪽인 독립 모델과 함께 묶인다. 즉 이 방법은 증류를 탐지하지 못한다. 공유된 가중치를 탐지할 뿐이다. 교사의 출력으로 학습된 학생은 가중치 혈통이 없으므로 무관해 보일 것이고, 이는 방법 자신의 정의상 옳으며 이 위키가 추적해 온 분쟁에는 쓸모가 없다.
그 분쟁은 진행 중이다. Alibaba / Qwen AI Lab 는 25,000 계정, 28.8M 상호작용 규모의 Claude 증류 캠페인 혐의를 받고 있고 (2026년 6월), 2026-07-28 중국 측의 증류 반박은 Open-Weights Policy Fight 에 기록돼 있다. 그 논쟁의 어느 것도 이 논문으로 해결되지 않으며, "모델 혈통에 AUROC = 1.0" 만 본 독자는 정반대 결론에 이를 것이다. 가중치 혈통 과 행동 유사성 의 구분은 논문 자신의 것이고 초록에 명시돼 있으며, 여기서 갖는 의의의 전부다.
대신 이것이 해결하는 것은 라이선스 준수 문제이고, 그쪽이 더 다루기 쉬운 질문이다. 공개된 체크포인트가 실은 라이선스가 걸린 베이스의 파인튜닝인지 여부 — 이 위키가 매주 추적하는 OpenMDW, Apache-2.0, MIT 가중치들 — 는 정확히 가중치 혈통의 문제이고, 이제 공개자의 협조 없이, 추론 없이, 가장 가까운 견고한 대안보다 76배 빠르게 답할 수 있다. 이 용도에서는 AUROC 보다 세탁 결과가 더 중요하다: 출처 검사는 회피가 어려울 때만 의미를 갖는다.
사례 연구는 가장 약한 증거이자 가장 흥미로운 증거다. LLaMA-2 공개 체크포인트 열 개를 정확히 분류했다. 그것은 열 개 항목에 대한 실제 환경 시연이고, AUROC 를 떠받치는 것은 GPT-2 와 residual-MLP 이다. "GPT-2 에서 AUROC = 1.0" 과 "한 계열의 체크포인트 10개" 사이의 간극이 프런티어 규모 주장이 놓여야 할 자리이며, 그 주장은 제기되지 않는다.
열린 질문
- 프런티어 규모에서도 성립하는가? 벤치마크는 residual-MLP 과 GPT-2 이고 사례 연구는 LLaMA-2 다. 읽은 것 중 100B+ MoE 를 시험한 것은 없으며, MoE 라우팅은 "centered residual" 구성이 명시적으로 다루지 않는 구조다.
- 무엇이 세탁으로 간주되는가? "함수 보존" 변환이 시험됐다. 품질을 조금 잃을 각오가 된 공격자는 다른 위협 모델이고 평가되지 않았다.
- 호환 가능한 체크포인트에 한정된다. 비교되는 두 체크포인트가 구조적으로 호환돼야 하므로, 어떤 랩이 형태가 다른 경쟁 모델을 베꼈다고 의심받는 경우는 제외된다.
- 난독화 레시피로 뒤집힐 수 있는가? 공개된 데이터 없는 서명은 공개된 표적이기도 하다.
- 저자 목록, 소속, 라이선스, 코드 공개 여부 — 미상. 논문을 읽지 않았다.
인용
Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (2026). arXiv:2608.14929.