AI Trend Notifier
EN한
← wiki

$ cat wiki/models/qwen-3-8-flash-next.md

Qwen3.8-Flash-Next

model갱신 2026-09-02생성 2026-08-26

스펙

속성값
DeveloperAlibaba / Qwen AI Lab
Released2026-08-26
Announced2026-08-25
Context window262,144 네이티브, 1M 까지 확장 가능
Pricingunknown
Licenseqwen-community-1.0
AvailabilityHugging Face 와 ModelScope, BF16 및 FP8
공개는 카운트다운이 가리킨 날짜에 이루어졌다. 어제 이 페이지는 2026-08-26 23:00
UTC+08:00 을 가리키는 ModelScope 타이머를 두고 Released: not yet 이라고 적혀
있었다. 이제 가중치는 Hugging Face 와 ModelScope 에 BF16 과 FP8 로 올라와 있다
(source).

Pricing 은 unknown 으로 남는다: 토큰당 요금을 인용하는 자료가 없고, 오픈 가중치가 그것을 대신 제공하지도 않는다.

License 는 더 이상 unknown 이 아니며, 그것이 Qwen 3.8 Max 의 공백을 메우지는 않는다. 그 플래그십은 2026-08-12 에 가중치가 나온 이래 라이선스 이름이 unknown 이었다. qwen-community-1.0 은 이 모델의 라이선스이고, 플래그십이 같은 것을 쓴다고 말하는 자료는 없다.

파라미터: 125B 본체 모델 + 51B N-gram 임베딩, 토큰당 6B 활성. 디스크상의 가중치는 "언어 모델, n-gram 임베딩, multi-token prediction 레이어를 합쳐 대략 180B 파라미터"이며, 서빙 문서는 앞의 둘을 합쳐 176B 로 표기한다 (source).

출시일

2026-08-25 발표, 2026-08-26 공개.

오픈 웨이트 멀티모달 MoE 로 포지셔닝되었으며, "다가올 Qwen4 계열을 구동할 차세대 아키텍처" 위에 세워졌고 Qwen4 자체는 아니라고 명시된다 — 전체 계열보다 앞서 아키텍처를 먼저 공개하는 성격 (source).

벤치마크

2026-08-30 기준으로 독립 측정치가 존재하며, 그것은 숫자 하나다. Artificial Analysis 가 Qwen3.8-Flash-Next 를 Intelligence Index 56, 컨텍스트 256k, Cost per Task $0.10 으로 등재했다 — 정확도가 아니라 그들 벤치마크 스위트의 합성 지표이고, 토큰당 가격이 아니라 작업 하나의 측정 비용이다. 이 행은 2026-08-23 캡처에는 없고 2026-08-29 및 2026-08-30 캡처에는 있으므로, 그 사이에 처음 나타났다 (source).

무엇이 해소되고 무엇이 해소되지 않는가. 이 모델을 Alibaba 아닌 누군가가 측정했다는 사실은 해소된다 — 이 페이지가 일어나지 않았다고 적었던 바로 그것이다. 아래 벤더 표의 어느 행도 검증되지는 않는다 — Artificial Analysis 는 SWE-bench Pro 나 JobBench 가 아니라 합성 지표를 공개하므로 — 따라서 아래에서 지적한 19.1 포인트 JobBench 격차는 여전히 Alibaba 바깥의 누구도 읽지 않은 상태다. 56 은 같은 날 공개된 GLM-5.3-Flash (57) 보다 한 점 아래이며, 이제 둘이 함께 등장하는 유일한 척도가 그것이다.

Context window 는 바꿀 필요가 없다: 256k 는 Spec 표에 이미 있는 262,144 에 대한 Artificial Analysis 의 표기다.

아래 벤더 표는 여전히 어느 행도 독립적으로 읽히지 않았다 (source):

BenchmarkQwen3.8-Flash-NextClaude Opus 4.6 Max
SWE-bench Pro62.553.4
SWE-bench Multilingual81.077.5
CoWorkBench73.968.2
JobBench55.736.6
DeepSWE 1.158.7명시 없음
LiveCodeBench v691.9명시 없음
Toolathlon Verified73.5명시 없음
점수 열보다 비교 열을 먼저 읽어라. 짝지어진 행은 전부 Claude Opus 4.6 Max
상대다 — Claude Opus 4.8 보다 마이너 두 버전, Claude Opus 5
보다 세 버전 뒤진 모델이고, 어느 쪽도 표에 없다. 6B 활성 모델이 두 버전 전의
프런티어 모델을 이기는 것은 진짜 결과이지만, 헤드라인 프레이밍이 유도하는 결과는
아니며, Qwen 의 보고는 그 간극을 언급하지 않는다.

JobBench 격차(55.7 대 36.6, 다른 짝 행들은 3.5–9.1 사이)는 어디에든 인용되기 전에 독립적으로 한 번 읽어 보는 것이 가장 필요한 행이다.

활용 사례

무엇을 벤치마킹했는지가 곧 답이다: 공개된 행은 전부 SWE-bench, DeepSWE, LiveCodeBench, CoWorkBench, JobBench, Toolathlon 이며, 곧 에이전트 코딩과 도구 사용이다. 비전 입력은 모델 카드에 명시된 역량이지만 붙은 벤치마크가 없다 (source).

6B 활성 파라미터가 설계의 요점이다 — 팀은 이 구성을 "ultimate cost efficiency" 로 가는 한 걸음으로 설명하고, NVIDIA 는 같은 날 GB300 NVL72 에서의 에이전트 코딩 글을 냈다. 어제 커뮤니티 기대치로 기록했던, 로컬 친화적 아키텍처를 예상한 2026-08-25 의 r/LocalLLaMA 스레드들은 이제 시험해 볼 가중치를 갖게 되었다. 로컬 처리량을 측정한 자료는 없으므로, 그 부분은 여전히 기대치로 남는다 (source).

비교

2026-08-31 — 아키텍처 보고서가 도착했고, 릴리스 문서가 끝내 주지 않은 기준선도 함께 왔다. On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability 는 Alibaba / Qwen AI Lab 가 이 모델에 대해 직접 쓴 설명이다. 397B-A17B 선행 모델 대비 사전학습 벤치마크 14개 중 8개에서 앞서고 나머지에서는 최대 2.6점 뒤지는데, 활성 파라미터 1/3, 학습 토큰 1/3, 학습 FLOPs 약 1/9 로 그렇다. 구성 요소가 명명된다. 네 레이어마다 하나가 full attention 인 형태로 글로벌 어텐션과 하이브리드된 Gated DeltaNet, 그 레이어들은 연속 사전학습 시점에 마이크로블록 단위로 맥락을 채점하는 Qwen Sparse Attention 으로 대체된다. 잔차 스트림을 네 갈래로 넓히는 Gated Residual. 그리고 호스트 메모리에서 프리페치되는 51B n-gram 임베딩 테이블 — 이 페이지의 파라미터 분할에서 용량이 백본 바깥에 앉아 있는 이유다. 14개 벤치마크는 이름이 없고, 모든 비교가 사후학습이 아니라 사전학습이며, 기준선은 Alibaba 자신의 선행 모델이다 (source).

  • Qwen 3.8 Max — 2026-08-03 공개, 가중치 2026-08-12 의 2.4T 파라미터 플래그십. Flash-Next 가 3.8 계열의 작은 형제인지 별도의 아키텍처 분기인지는 확립되지 않았다. "Qwen4 를 미리 보인다"는 서술은 후자를 시사하지만, 그렇게 말하는 자료는 없다.
  • Qwen 3.8 27B — 이 위키가 이미 보유한 3.8 계열의 오픈 웨이트 멤버.
  • GLM-5.3-Flash — 같은 날 공개되었고, 이 날이 실제로 제공하는 비교 대상이다: 비용을 내세운 또 하나의 중국 오픈 웨이트 멀티모달 MoE 로, 이 모델의 176B/6B 활성에 대해 320B/18B 활성, qwen-community-1.0 에 대해 MIT, 262K 네이티브에 대해 1M 컨텍스트. 이제 둘 다 Artificial Analysis Intelligence Index 를 갖는다 — GLM-5.3-Flash 57, Qwen3.8-Flash-Next 56 — 이것이 2026-08-30 기준 둘이 공유하는 유일한 수치다. 벤더 벤치마크 중 둘에 공통된 것은 없으므로, 이 한 점 차이가 비교할 수 있는 전부다 (source).
  • Hy4 preview — 이번 2주의 세 번째 중국 오픈 웨이트 릴리스이자 정반대의 설계 지점: 이 모델의 qwen-community-1.0 하 176B/6B 활성에 대해 Apache 2.0 하 770B/49B 활성. 이 모델은 이제 독립 측정치를 갖지만, 그쪽에는 없다.

벤더 자체 행에 대한 비(非)Alibaba 모델과의 비교는 여전히 한 방향으로만 가능하다: Qwen 의 표가 네 개 벤치마크에서 이 모델을 Claude Opus 4.6 Max 위에 놓는다. 이 위키는 그 모델에 대해 해당 벤치마크의 수치를 하나도 보유하고 있지 않으므로 그 행들은 여기서 검증할 수 없다.

상충 보고

파라미터 수 — 2026-08-27 해소되었고, 애초에 모순이 아니었다. 어제 이 페이지는 서로 맞지 않는 세 수치를 기록했다: 총 125B, 125B 에 51B 의 N-gram 임베딩을 더한 값, 그리고 "공개되지 않음". 공개된 자료가 구성 요소를 명시하고, 그 합이 맞는다: 125B 본체 모델 + 51B N-gram 임베딩 테이블 = 176B, 이는 서빙 문서와 NVIDIA 의 글이 함께 쓰는 수치다. 125B 와 176B 보고는 같은 산출물의 서로 다른 경계 — 트랜스포머와 전체 — 를 말하고 있었고, 세 번째 보고는 단지 공개 이전이었다. 이제 두 수치 모두 경계를 명시한 채 스펙 표에 들어 있다 (source).

지우지 않고 기록으로 남기는 이유는 해소된 뒤에도 교훈이 남기 때문이다: 세 출처가 파라미터 수를 두고 엇갈릴 때 그것은 사실 문제만큼이나 자주 단위 문제이며, 하루 동안 그 행을 비워 두는 데 드는 비용은 없었다.

Referenced by

Sources