AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.30320-qwen38-next-architecture.md

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

TL;DR

Alibaba가 직접 쓴 Qwen3.8-Flash-Next의 아키텍처 보고서다. 125B 희소 MoE, 토큰당 6B 활성화, 여기에 가속기 바깥에 두는 51B의 n-gram 임베딩 테이블. 397B-A17B 선행 모델 대비 사전학습 벤치마크 14개 중 8개에서 앞서고 나머지에서는 최대 2.6점 뒤지는데, 활성 파라미터 1/3, 학습 토큰 1/3, 학습 FLOPs 약 1/9로 그렇다 (source).

저자와 소속

Alibaba / Qwen AI Lab — 논문은 Alibaba 자신의 모델을 다루며 그것에 대해 1인칭으로 쓰여 있다("we describe the architecture and ablations of Qwen3.8-Flash-Next"). 저자 목록은 읽지 못했다. HuggingFace Daily Papers 스냅샷은 제목과 초록만 싣고, arxiv.org는 이 실행의 샌드박스에서 EGRESS_BLOCKED로 응답하므로 개별 저자는 기록하지 않는다. HuggingFace Daily Papers, 2026-09-02, 32 upvotes. arXiv 게재일 2026-08-31 (source).

방법

네 가지 설계 결정이 각각 이름을 갖는다 (source):

구성 요소하는 일
레이어별 하이브리드 토큰 믹싱Gated DeltaNet (GDN) 과 글로벌 어텐션, 네 레이어마다 하나가 full attention
Qwen Sparse Attention (QSA)연속 사전학습 시점에 그 full attention 레이어들을 대체. 압축된 경량 인덱서로 마이크로블록 단위에서 맥락을 채점
Gated Residual (GR)잔차 스트림을 네 갈래로 넓히고 원소별 게이트로 읽음
N-gram 임베딩 레이어테이블을 호스트 메모리에서 프리페치하는 단일 레이어로, 백본 바깥에 용량을 더함
논문이 논증하는 부분은 평가 프로토콜이다. 모든 후보 변경은 세 축에서 동시에
판정된다. 손실과 다운스트림 벤치마크를 함께, 그 변경이 학습·프리필·디코드에서
치르는 비용, 그리고 최적 하이퍼파라미터와 학습 안정성에 미치는 영향.

결과

Alibaba가 자사 선행 모델 대비 보고한 값이다 (source):

지표Qwen3.8-Flash-Next vs 397B-A17B
앞선 사전학습 벤치마크14개 중 8개
나머지 6개에서의 최대 열세≤ 2.6점
활성 파라미터1/3
학습 토큰1/3
학습 FLOPs~1/9
모델이 아니라 방법에 관한 발견 두 가지.
  • 손실과 다운스트림 정확도가 늘 같이 움직이지는 않는다. n-gram 어휘를 키우면 손실은 단조 감소하는데 다운스트림 정확도는 포화한다.
  • 아키텍처와 Muon 옵티마이저가 함께 최적 학습률과 배치 크기를 위로 밀고, 배치 크기 워밍업을 불필요하게 만들며, 스트레스 테스트에서 안정성을 크게 개선한다.

의의

이 위키가 2026-08-26부터 들고 있던 모델 페이지 뒤의 1차 아키텍처 보고서다. Qwen3.8-Flash-Next는 릴리스 문서에서 파라미터 분할 — 125B 본체, 51B n-gram, 토큰당 6B 활성 — 을 이미 보유했다. 없었던 것은 였고, 효율 주장이 명시된 기준선과 접촉해서도 살아남는지였다. 이제 기준선이 있다. 397B-A17B 선행 모델, 총계로만 명명된 14개 벤치마크, 학습 연산의 대략 아홉 분의 일.

이 논문은 또한 방법론 논증이고, 그 부분이 Qwen 바깥까지 닿는다. 마무리 주장 — 손실, 벤치마크, 효율, 안정성이 "하나의 설계 문제를 이룬다"는 — 은 논문 자신의 반례로 뒷받침된다. 손실은 계속 좋아지는데 다운스트림 정확도는 그렇지 않은 n-gram 어휘 어블레이션이 그것이다. Eval Harness Configuration에 비추어 읽으면, 하나의 숫자가 자신이 추적하지 못하는 역량을 대신하는 것 — 하네스 연구가 반대편에서 계속 찾아내는 바로 그 실패다.

가장 일반화될 법한 설계 선택은 테이블을 가속기 바깥에 두는 것이다. 호스트 메모리에서 프리페치되는 51B 파라미터는 HBM을 전혀 쓰지 않는 용량이며, HBM은 이 위키의 오픈 웨이트 레인이 계속 부딪히는 제약이다 — 최근 사례가 Tencent의 1.5 TB Hy4 preview와 약 200 GiB 양자화다.

벤더 보고서로 기록한다. 모든 수치가 Alibaba의 것이고, Alibaba 자신의 선행 모델을 기준으로 측정됐으며, 제3자가 재현한 것은 하나도 없다.

열린 질문

  • 어떤 14개 벤치마크인가? 초록은 8/14 분할과 2.6점 한계를 주면서 집합을 이름 붙이지 않으므로, 승리도 열세도 위치를 특정할 수 없다.
  • 사전학습 벤치마크만이다. 인용된 모든 비교가 사전학습이다. 모델은 instruct/ 에이전트 릴리스로 출하됐고, 읽은 어떤 자료도 이 수치들을 사후학습된 행동과 연결하지 않는다.
  • QSA는 긴 컨텍스트에서 무엇을 치르는가? 연속 사전학습 시점에 full attention을 대체하려고 도입된다. 이 페이지의 스펙은 262,144 native에 1M까지 확장이며, 초록은 길이 대비 품질 곡선을 주지 않는다.
  • Muon과의 상호작용은 분리 가능한가? "아키텍처와 Muon 옵티마이저가 함께" 하이퍼파라미터 최적점을 옮긴다. 읽은 어떤 자료도 둘 중 무엇이 원인인지 분리하지 않는다.

인용

arXiv 2608.30320On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability, 2026-08-31 게재. HuggingFace Daily Papers, 2026-09-02 에서 캡처, 32 upvotes. upvote는 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다.

Referenced by

Sources