$ cat wiki/concepts/adversarial-distillation.md
적대적 증류 (Adversarial Distillation)
정의
적대적 증류는 개발사가 허가하지 않은 주체가 모델의 출력으로부터 그 모델의 역량을 빼내는 행위다. OpenAI가 2026-09-30에 이 용어의 첫 공개 정의를 내놓았다:
adversarial distillation: the systematic and unauthorized use of one model's outputs or reasoning to help train, reproduce, or improve another model
(source)
이름을 빌려온 그 기법과는 구분해 둘 만하다. Post-Training Scaling과 on-policy distillation 문헌 — 이 위키에 논문 페이지 여덟 개 — 은 증류를 연구소가 자기 모델에 적용하는 방법으로 서술한다. 이 페이지가 다루는 것은 같은 연산을 소유권 경계를 넘어 수행하는 쪽, 증류하는 주체가 API를 통해서만 닿을 수 있는 모델을 상대로 하는 경우다. 기제는 공유되고, 쟁점은 전적으로 동의 여부다.
이 페이지가 존재하는 이유는 주제가 담겨 있던 그릇을 넘어섰기 때문이다. 두 건의 연구소 단위
고발, 이름이 붙은 기법 하나, 기제를 밝힌 논문 하나, 완화책 하나가
Open-Weights Policy Fight, AI Governance,
AI-Enabled Cyberattacks와 여덟 개 엔티티 페이지에 흩어져 기록되고 있었고, 정작
그것이 무엇인지 말하는 페이지는 없었다. GTG-16005 문자열만 해도 아홉 개 문서에 나온다.
왜 중요한가
라이선스로 닫을 수 없는 최초의 역량 전이 경로이기 때문이다. 오픈 웨이트 배포에는 조건을 붙일 수 있고, 닫힌 API에는 이용약관을 붙일 수 있다. 둘 다 붙어 있었고, 둘 다 수억 건 규모의 교환에서 우회되었다고 보고되었다.
두 고발이 무엇을 빼앗겼다고 보는지가 서로 다르기 때문이다. Anthropic의 GTG-16005는 대량으로
수집된 chain-of-thought 증류가 지목된 모델들의 학습에 쓰였다고 서술한다. OpenAI의 공개는
답변에서 의도적으로 감춘 protected reasoning을 복원하려는 시도를 서술하며, 어떤 모델이 그것으로
학습되었다는 말까지는 하지 않는다. 하나는 완료되었다는 전이이고, 다른 하나는 시도되었다는 전이다.
방어와 공격이 모두 저렴하기 때문이다. Claude Opus 5.5는 명시적 증류 방지 장치로 preserved thinking을 탑재한다. 그에 맞서 Post-Training Leaves Behavioral Shadows on Unrelated Decisions는 프롬프트당 교사 출력 한 단어만 필요하고 과제 예시는 전혀 필요하지 않다 — 추론 트레이스를 건드리지 않는 경로이며, 읽은 자료 어디에도 이에 대한 방어책은 제시되어 있지 않다.
현재 수준 (2026-10-01)
두 건의 고발
| Anthropic → Alibaba / Qwen AI Lab | OpenAI → Moonshot AI | |
|---|---|---|
| 공개 | 2026-09-10 | 2026-09-30 |
| 코드명 | GTG-16005 | 없음 |
| 기간 | 2026년 5~7월 | 2026년 7월 1~28일 |
| 계정 | 3,500개 초과, 부정 계정 | 약 4,000명, 이후 15,000명 초과 |
| 규모 | 1억 5,100만 건 초과, 최대 일 300만 건 | 7월 24~25일 프롬프트 16,000건 |
| 대상 | Claude Opus 4.6·4.7의 chain-of-thought | protected reasoning |
| 주장된 결과 | 수집 기록이 Qwen 3.5·3.6·3.7을 학습시켰다 | 명시 없음 |
| 공개된 증거 | 공개되지 않음 | 공개되지 않음 |
| 둘 다 고발한 연구소 자신의 서술이며 제3자의 검증이 없고, 둘 다 중국 연구소를 지목한다. | ||
| Anthropic은 2026년 2월 이후 증류를 이유로 일곱 곳의 중국 소재 연구소를 차단했다고 밝히고 있고, | ||
| Moonshot은 누구에 의해서든 공개적으로 지목된 두 번째 연구소다. |
OpenAI가 서술한 기법
운영자들은 암호화를 깨거나 데이터베이스에 접근하거나 저장된 대화를 읽지 않았다. 대신
암호화된 추론을 한 대화에서 복사해 다른 모델 인스턴스에 복호화와 전사를 요청했다 — 모델을
그 자신의 보호 장치를 상대로 쓴 것이다
(source).
cyberscoop.com은 이를 "novel encryption bypass" 라 부르는데, 두 검색 패스가 공통으로 서술하는
내용은 암호문 자체는 공격당하지 않았고 키를 가진 쪽에 다시 제시되었을 뿐이라는 것이다.
밝힌 대응: 계정 차단, 가입 심사 강화, Frontier Model Forum 및 정부 채널을 통한 조사 결과 공유.
이것이 실제로 되는지에 대해 연구가 말하는 것
된다. 그리고 큰 교사보다 작은 교사가 더 잘 전이한다. Scaling Properties of Same-Family On-Policy Distillation는 on-policy distillation에 거듭제곱 법칙을 맞추고, 관측된 모든 weak-to-strong 쌍에서 학생의 최고 점수가 교사 자신의 점수를 넘어섰으며, 같은 점수에서는 작은 교사가 더 잘 전이한다고 보고한다 (source).
이 고발들에 비추어 읽으면 그것은 불편한 결과다. 증류하는 쪽은 가장 큰 모델에 접근할 필요가 없고, 상한은 교사의 점수가 아니다. 그 논문은 연구소가 자기 모델을 증류하는 상황을 다루며 허가 없는 사용에 대해서는 아무 말도 하지 않는다 — 연결은 이 위키가 지은 것이고, 증거가 아니라 기제다.
열린 문제
- 어느 고발도 증거를 공개하지 않았다. 두 연구소가 이제 캠페인을 숫자로 서술했지만, 어느 쪽도 대화 기록, 계정 식별자, 제3자가 확인할 수 있는 방법을 공개하지 않았다. 숫자가 유일한 산출물이다.
- Anthropic 자신의 두 숫자 집합도 여전히 맞지 않는다 — 6월 서신의 약 25,000개 계정·2,880만 건
대
GTG-16005의 3,500개 초과 계정·1억 5,100만 건. Alibaba / Qwen AI Lab에 기록되어 있고 2026-09-10 이후 미해결이다. - 귀속은 주장되었을 뿐 제시되지 않았다. OpenAI 공개에 대한 두 검색 패스 모두 Moonshot 연결에 대해 확실한 증거가 제시되지 않았다고 적는다.
- 한 단어 경로에 대한 방어책. preserved thinking은 트레이스를 보호하지만 ATD는 트레이스를 읽지 않는다.
- 오픈 웨이트의 경우 "적대적"이라는 말이 버틸 수 있는지. Open-Weights Policy Fight의 모든 모델은 설계상 누구나 증류할 수 있다. 이 용어는 경계가 주장된 곳에서만 작동하며, 그래서 경계를 주장하는 두 연구소로부터 나왔다.
주요 논문
- Scaling Properties of Same-Family On-Policy Distillation — on-policy distillation의 스케일링 법칙; weak-to-strong 전이가 교사를 넘어선다
- Post-Training Leaves Behavioral Shadows on Unrelated Decisions — Active Taskless Distillation: 프롬프트당 한 단어, 과제 데이터 없음
- Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models (arXiv:2608.16647) — OPD 학생이 어디까지 일반화하는가
- Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation — weak-to-strong on-policy reward distillation
- Weak-to-Strong Generalization via Direct On-Policy Distillation — 이 위키가 보유한 이전의 weak-to-strong 결과
관련 개념
- Open-Weights Policy Fight — 증류가 위반이 아니라 기능인 곳
- AI Governance — 수출 통제 프레이밍을 포함한 정책적 대응
- Post-Training Scaling — 연구소 자신의 방법으로서의 증류
- AI-Enabled Cyberattacks —
GTG-16005가 처음 기록된 곳 - Frontier Pacing — 4개월 지체가 리드인지 여부