AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.01343-smelt.md

SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

TL;DR

Looped Transformer 는 공유 블록을 반복해 실효 깊이를 얻지만, 기존 연구는 이를 모델 크기를 고정한 채 비교한다 — 그러면 루프 모델에 추가 FLOPs 를 쥐여 준 뒤 그 이득을 아키텍처의 공으로 돌리게 된다. SMELT 는 토큰당 FLOPs, 비임베딩 파라미터, KV 캐시를 모두 맞춘 채 비교를 다시 돌리고, 그래도 우위는 살아남는다. 중간 절반 레이어를 두 번 루프하면 컴퓨트 최적 프런티어에서 학습 FLOPs 의 6.8–18.0% 를 절약하며, 비임베딩 파라미터 54B 까지 네 개 크기에 걸쳐 Chinchilla 형 스케일링 법칙을 아키텍처별로 따로 적합했다 (source).

저자와 소속

읽은 어떤 자료에도 공개되지 않았다. HuggingFace Daily Papers 스냅샷은 제목·초록·업보트 수는 담지만 저자 목록은 담지 않고, arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 로 응답한다. 그래서 저자와 소속은 추측하지 않고 기록하지 않는다. HuggingFace Daily Papers, 2026-09-03, 71 업보트. arXiv 공개일 2026-09-01 (source).

방법

레시피는 약어에 그대로 담겨 있다. Sparse MoE Transformer, 중간 레이어를 Loop Twice.

루프 없는 베이스라인 대비 세 예산을 동일하게 유지한다 (source):

Budget matchedWhy it matters
토큰당 FLOPs기존 연구가 유일하게 풀어 둔 항목
총 비임베딩 파라미터이득이 용량에서 오는 것을 차단
KV 캐시이득이 추론 시 메모리에서 오는 것을 차단
이 배치는 "일련의 ablation" 을 거쳐 도달했고, 논문은 그다음 두 아키텍처를 단일 지점에서
비교하는 대신 아키텍처마다 별도의 Chinchilla 형 스케일링 법칙을 적합한다 — 그래서
주장이 한 설정이 아니라 프런티어에 대한 것이 될 수 있다.

결과

  • 컴퓨트 최적 프런티어에서 학습 FLOPs 의 6.8–18.0% 절약. SMELT 의 손실이 컴퓨트에 따라 더 빠르게 떨어진다
  • 비임베딩 파라미터 54B 까지 네 개 크기에 걸쳐 스케일
  • 우위가 검증 손실이 예측하는 것 이상으로 다운스트림 벤치마크에 전이되며 — Code 에서 가장 크다
  • 샘플 길이와 인컨텍스트 예시 수가 늘수록 우위가 커진다
  • 메커니즘 측면: 두 번째 방문이 어텐션 싱크를 줄이고 질량을 내용 관련 토큰 쪽으로 재배분한다

(source)

초록에는 벤치마크 이름도 벤치마크별 수치도 없으므로, "Code 에서 가장 크다" 는 논문의 표현으로 기록하고 어떤 점수도 인용하지 않는다. 어차피 sources/evals/ 의 무엇으로도 대조할 수 없다.

의의

이것은 더 드문 종류의 스케일링 결과다. 새 프런티어를 주장하는 것이 아니라 앞서 보고된 프런티어가 잘못된 대조군에 대고 측정됐다고 주장하고 — 그런 다음 대조군을 고친 상태에서 효과를 그래도 보고한다. 두 절반이 모두 필요하다. 교란만 알렸다면 비판이고, 절약만 보고했다면 자기가 비판하는 바로 그것이 된다.

발견 중 둘은 헤드라인 백분율보다 흥미롭다.

이득이 검증 손실이 예측하는 것을 넘어선다. 컴퓨트 최적 스케일링 연구는 손실을 역량의 프록시로 삼는 것이 상례다. 여기서는 그 프록시가 아키텍처를 과소평가하고, 하필 코드에서 그렇다. 스케일링 법칙을 다운스트림 역량으로 곧장 읽는 것에 반하는 데이터 포인트이고, 사람들이 잘 확인하지 않는 방향이다 — Post-Training ScalingTest-Time Compute (Inference-Time Compute Scaling) 를 보라.

이득이 샘플 길이와 인컨텍스트 예시 수에 따라 커진다. 우위가 컨텍스트 점유의 함수인 아키텍처는 단일 시퀀스 길이에서 비교될 수 없는데, 그런 비교가 보통 공개되는 방식이다.

어텐션 싱크 설명은 논문이 제시하는 메커니즘 가설이지 분리해 낸 결과가 아니다 — 초록은 그 분석이 이득의 "기저에 있을 수 있다" 고 말한다. 그 유보를 그대로 두고 기록한다.

열린 질문

  • 비임베딩 파라미터 54B 가 적합의 상한이다. 프런티어 MoE 모델은 한 자릿수 크고, 거기서 6.8–18.0% 대역이 유지되는지 좁아지는지야말로 스케일링 법칙이 답해야 할 것이고 54B 까지의 네 점으로는 답할 수 없는 것이다.
  • 중간 절반을 두 번 루프하는 것은 ablation 으로 찾은 하나의 레시피다. 그 최적점이 얼마나 뾰족한지는 읽은 자료에 없다.
  • 결과는 사전학습 컴퓨트에 대한 것이다. 루프 블록이 현재 모델 순위를 결정하는 사후 학습 및 장기 지평 에이전트 체제와 잘 맞물리는지는 다루지 않는다.

인용

arXiv 2609.01343, SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers, 공개일 2026-09-01 — https://arxiv.org/abs/2609.01343 → (snapshot)

Referenced by

Sources