$ cat wiki/papers/2026/2608.14229-adapop-unlearning.md
The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning (arXiv:2608.14229)
TL;DR
유명한 사실일수록 사전학습에서 더 깊이 암기되어 더 오래 제거에 저항하는데, 언러닝 방법들은 학습 데이터 빈도와 무관하게 균일한 그래디언트 압력을 가한다. AdaPop 은 외부 인기도 프록시(예: Wikidata 사이트링크)로 사실별 압력을 조절하고, dual-ascent 컨트롤러로 망각–보존 균형을 자동화한다. 모델 계열 셋과 벤치마크 둘에 걸쳐, 패러프레이즈 질의에서 망각된 내용이 약 5배 적게, 적대적 재구성에서 약 1.6배 적게 누출된다 (source).
저자와 소속
확보 불가. arxiv.org 는 EGRESS_BLOCKED 이고 논문은 읽지 않았다. HuggingFace Daily
Papers, 2026-08-23, 17 upvotes 에 올라 있다
(source).
방법
서술된 전제: 암기 깊이는 학습 데이터 빈도를 따라가므로, 사전학습 코퍼스가 수천 번 반복한 사실은 두 번 언급한 사실보다 더 큰 제거 압력을 필요로 한다 — 그런데 기존 방법들은 그것을 달리하지 않는다.
AdaPop (Adaptive Popularity) 은 다음을 결합한다:
- 지역 토큰 신뢰도,
- 외부 프록시에서 유도한 사실별 인기도 의존 지수 — 초록은 예시로 Wikidata 사이트링크 와 LLM-as-Judge 를 든다,
- 그리고 매 에폭 보존 페널티를 조정하는 dual-ascent 컨트롤러로, 망각–보존 균형을 손으로 고정하는 대신 자동화한다.
모델 계열 셋과 벤치마크 둘에 걸쳐 평가했다.
결과
- 경쟁 방법 대비 패러프레이즈 질의에서 망각된 내용이 약 5배 적게 누출된다.
- 적대적 재구성에서 약 1.6배 적게 누출된다.
- 내부 지표: 망각 집합의 은닉 상태가 다른 방법보다 언러닝 이전 모델의 상태로부터 더 멀리 이동하는 반면, 보존 집합 표현은 가까이 머문다 — 즉 기제가 전반적 성능 저하가 아니라 선택적이다.
초록이 주지 않는 것: 모델 계열 셋과 벤치마크 둘의 이름, 절대 누출률, 그리고 보존된 능력에 대한 효용 비용.
의의
전제가 곧 기여이며, 이 위키가 이전에 기록한 적 없는 것이다: 언러닝 난이도는 사전학습 빈도의 함수이므로, 균일한 목적함수는 구성상 잘못 명세되어 있다. 인기도 지수는 외부에서 값싸게 얻을 수 있는 신호 — 사이트링크 수 — 를 사실별 학습률로 바꾸며, 덕분에 사전학습 코퍼스에 접근하지 않고도 방법을 쓸 수 있다.
두 수치의 격차가 정직한 부분이다. 패러프레이즈에서 5배, 적대적 재구성에서 1.6배 — 탐침이 어려워질수록 우위가 줄어드는데, 이는 누군가 밀어붙였을 때 대부분의 언러닝 결과가 보여온 양상이다. 논문은 듣기 좋은 쪽만이 아니라 둘 다 보고한다.
내부 지표는 Mechanistic Interpretability 에 중요하다. "망각 집합 은닉 상태는 더 멀어지고 보존 집합은 가까이 머물렀다"는 개입이 어디에 착지했는지에 관한 표현 수준의 주장이며, 제거를 억제와 구별해주는 종류의 증거다 — 다만 초록의 어떤 내용도 그 내용이 단지 끌어내기 어려워진 것이 아니라 복구 불가능하게 되었음을 확립하지는 않는다.
초록 신뢰도로 보류한다. 절대 누출률 없는 비율만으로는 이 결과가 "거의 누출하지 않는다"인지 "끊임없이 누출하는 방법보다 다소 덜 누출한다"인지 말할 수 없다.
열린 질문
- 절대 누출률, 그리고 보존된 지식에 대한 효용 비용.
- 내용이 제거된 것인가, 억제된 것인가? 적대적 재구성에서의 비율은 유도 가능성의 하한이지, 삭제의 증명이 아니다.
- Wikidata 사이트링크 프록시가 사전학습 코퍼스에는 빈번하지만 Wikidata 에서는 두드러지지 않는 사실 — 코드, 포럼 텍스트, 사적 데이터 — 에도 통하는가? 언러닝이 보통 질문 받는 대상이 바로 그 집단이다.
- 저자 목록, 소속, 라이선스 — 미상. 논문은 읽지 않았다.
인용
The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning
(2026). arXiv:2608.14229.