$ cat wiki/papers/2026/2608.16157-freetoken.md
FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution (arXiv:2608.16157)
TL;DR
개인 기기를 작은 GPU 가 아니라 통합된 탄력적 추론 플랫폼 으로 다루는 엣지 네이티브 MoE 서빙 시스템으로, 고정된 오프로딩 전략을 택하기를 거부하고 실제로 비어 있는 자원 위로 연산과 모델 상태를 그때그때 다시 매핑한다. 보고된 도달 범위: 노트북에서 35B 모델, 게이밍 데스크톱에서 284B 모델, 단일 워크스테이션 GPU 에서 753B GLM-5.2 (source).
방법
제시된 전제는 프런티어 오픈 웨이트 모델의 서빙이 여전히 데이터센터 인프라를 가정한다는 것이고, 로컬 AI 의 두 현실이 그 통상적 답을 깨뜨린다는 것이다:
- 에이전트 워크로드는 실행 패턴을 계속 바꾼다 — 한 국면에 맞춘 전략은 다음 국면에서 틀린다.
- 엣지 하드웨어는 기기마다 균형이 다른 이질적 자원을 드러낸다 — 한 기기에 맞춘 전략은 다른 기기에서 틀린다.
대응은 단일 최적화가 아니라 서빙 스택 전체의 공동 설계다: 모델 배치와 로딩, 전문가 상주, CPU–GPU 실행, 에이전트 상태 재사용, 런타임 메모리 관리 — 모두 고정된 오프로딩 계획이 아니라 대역폭 적응 실행 이 이끈다.
결과
| 주장 | 수치 |
|---|---|
| 지원하는 MoE 모델 | 20종 이상 |
| 하드웨어 범위 | 8GB 노트북 GPU → 단일 워크스테이션 GPU |
| 노트북 | 35B 모델 |
| 게이밍 데스크톱 | 284B 모델 |
| 단일 워크스테이션 GPU | 753B — GLM-5.2 |
| 워크로드에는 단일 턴 생성만이 아니라 실제 코딩·도구 사용 에이전트 가 포함된다고 밝혀져 있다. |
초록이 주지 않는 것: 처리량, 지연, 초당 토큰, 양자화 수준, 데이터센터 기준선 대비 정확도 확인, "게이밍 데스크톱" 과 "워크스테이션 GPU" 의 구체적 하드웨어. 위의 모든 수치는 용량 주장이며, 성능 주장은 하나도 없다.
의의
프런티어 오픈 웨이트의 로컬 서빙에 대해 이 위키가 가진 가장 강한 용량 데이터포인트이며, 대상을 하나 명시한다: 단일 워크스테이션 GPU 위의 753B GLM-5.2 — 이 위키에 자체 페이지가 있고 (GLM-5.2) 이 저장소가 매일 제공자 가격대와 대조하는 모델이다. 수십 개 제공자가 상업적으로 서빙하는 모델이 기기 한 대에서 돈다는 것은 Open-Weights Policy Fight 가 추적하는 논증의 구체적 형태이며, 포부가 아니라 역량으로 명시돼 있다.
그러나 같은 주에 경제 조건은 반대로 움직였고, 둘은 같은 페이지에 있어야 한다. 소비자용 DDR5 가격이 전년 대비 최대 485% 올랐고, 128GB 키트가 $3,399 — 최저 기록 가격의 약 10배 — 이며, 읽은 어떤 전망도 2027년 말 이전의 완화를 예상하지 않는다 (source). FreeToken 의 방법은 정확히 호스트 메모리와 대역폭을 GPU 용량으로 치환 하는 것이다. 즉 753B 모델을 집에서 돌릴 수 있게 만드는 기법이, 그것이 쓰는 자원이 희소해진 분기에 도착했다. 어느 쪽 소스도 다른 쪽을 언급하지 않으며, 이 짝짓기는 이 위키의 것이고 그렇게 표시한다.
주장의 부류가 중요하다. 모델이 들어간다는 것과 쓸모 있게 서빙된다는 것은 다르고, 초록은 초당 토큰을 공개하지 않는다. 논문 자신이 겨냥한다고 밝힌 에이전트 워크로드에서는, 대략 대화 속도에 못 미치는 속도라면 용량과 무관하게 긴 구간 루프가 비현실적이 되며, StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089) 은 에이전트 결과가 달러와 시행 횟수 로 인용된다는 사실을 상기시킨다. 이 논문은 둘 다 보고하지 않는다.
열린 질문
- 처리량은 얼마인가? 읽은 자료 어디에도, 세 하드웨어 등급 어느 것에 대해서도 속도 수치가 하나 없다.
- 어느 정밀도에서인가? GPU 하나 위의 753B 모델은 공격적 양자화나 오프로딩, 또는 둘 다를 함의하는데 초록은 어느 쪽도 명시하지 않는다. 같은 묶음의 r/LocalLLaMA prefetch 후보 — "Petition to add a rule for people to add their DAMN quant levels to their posts" — 가 커뮤니티가 똑같은 불만을 제기하는 장면이다.
- 출력 품질은 유지되는가? 같은 가중치의 데이터센터 배치와 비교한 정확도가 공개되지 않았다.
- 등급별로 호스트 RAM 이 얼마나 필요한가? DDR5 가격 이동이 이 결과를 무너뜨리는지를 결정하는 수치인데, 없다.
- 저자, 소속, 라이선스 — 미상. 논문은 읽지 않았다.
인용
FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
(2026). arXiv:2608.16157.