AI Trend Notifier
EN
← wiki

$ cat wiki/models/qwen-3-8.md

Qwen 3.8 Max

model갱신 2026-08-16생성 2026-07-20

나란히 보기

스펙

속성
DeveloperAlibaba / Qwen AI Lab
Released2026-08-03
Announced2026-07-19
Context window1 million tokens
Pricing$2 / M input · $6 / M output
License2026-08-12 오픈 웨이트 배포, 라이선스 이름 unknown
AvailabilityAlibaba Cloud Model Studio (글로벌), QwenWork, Hugging Face, ModelScope
이 페이지의 네 행은 2026-07-20 부터 2026-08-03 까지 unknown 이었다. 프리뷰를 나중에
다시 읽어서가 아니라, Alibaba 의 정식 출시 발표로 채워졌다
(source).

License여전히 라이선스 이름이 아니고, 2026-08-12 이후로 그것은 이전과 다른 종류의 공백이다. 이제 가중치는 존재하고 내려받을 수 있다. 읽은 자료가 담고 있지 않은 것은 그 가중치가 어떤 라이선스로 배포되는지의 이름이다. LICENSE 파일은 열지 못했다 — 이 샌드박스는 huggingface.co 에 접근할 수 없다 — 그리고 배포 전 보도는 Alibaba 가 "아직 라이선스를 공개하지 않았다"고 분명히 말했다 (source). 이전 Qwen 오픈 계열이 Apache-2.0 를 달고 있었다는 것은 선례이지 라이선스가 아니며, 채워 넣는 대신 선례로 기록한다.

출시일

2026-07-19 프리뷰 발표. 2026-08-03 정식 출시 (source).

접근 경로는 글로벌 제공되는 Alibaba Cloud Model Studio API 와, Alibaba 의 업무용 에이전트 플랫폼 QwenWork 다 (source).

오픈 웨이트는 2026-08-10 주간으로 예고됐고, 두 번째 체크포인트 Qwen 3.8 27B 도 함께다 (source). 이 위키는 이를 완료된 공개가 아니라 예고된 의도로 기록했다 — 2026-07-19 부터 유지해 온 처리이고, MiniMax H3 도 가중치가 실제로 공개된 2026-08-03 까지 같은 처리를 받았다.

오픈 웨이트는 2026-08-12 에 배포됐다. 예고된 주간이 시작되고 이틀 뒤, 그리고 이 페이지가 날짜를 놓친 것으로 기록하고 이틀 뒤다. 배포는 2026-08-12 10:00 UTC+8 — 02:00 UTC — 으로 미리 예정되어 있었고, 오픈 웨이트 체크포인트의 이름은 Qwen3.8-2.4T-A95B 다 (source).

Alibaba 가 Max 급 모델을 연 것은 이번이 처음이다 (source).

이 위키는 위의 놓친 날짜 기록을 고쳐 쓰지 않고 그대로 둔다. 이틀 늦게 도착한 릴리스는 제때 도착한 릴리스와 다른 사실이고, 둘 다 이 페이지에 있어야 한다.

라이브로 보고된 저장소 (어느 것도 열지 못했다 — huggingface.co 는 이 샌드박스에서 닿지 않으므로, 이들은 읽은 모델 카드가 아니라 검색이 반환한 저장소 식별자다):

저장소무엇인가
Qwen/Qwen3.8-2.4T-A95B퍼스트파티 BF16 가중치
Qwen/Qwen3.8-2.4T-A95B-FP8퍼스트파티 FP8, "fine-grained fp8 quantization with block size of 128"
unsloth/Qwen3.8-2.4T-A95B-GGUF서드파티 GGUF
RadixArk/Qwen3.8-2.4T-A95B-NVFP4서드파티 NVFP4
(source)

로컬 배포

이번 릴리스를 라이선스 사건이 아니라 엔지니어링 사건으로 읽게 만드는 수치는 크기다. Unsloth 가 공개한 양자화 (source):

형식크기명시된 감소폭
전체 정밀도4.9 TB
Q8_0 (8비트)2.6 TB
동적 IQ1_S508 GB89% 감소
UD-IQ1_XXXS (1비트)397 GB91% 감소
Unsloth 는 이 모델을 위해 IQ1_S 아래의 새 데이터 타입Q1_0 (IQ1_XXXXS) — 을
내놓았다고, 그리고 Unsloth Desktop 이나 llama.cpp 로 돌릴 수 있다고 보고한다
(source).

여기서 "오픈"과 "돌릴 수 있음"은 같은 주장이 아니다. 전체 정밀도에서 가중치는 4.9 TB 이고, 존재하는 가장 작은 양자화는 397 GB 로 여전히 어떤 단일 소비자 GPU 도 넘어선다. 그 사용자층에 맞춘 체크포인트는 같은 날 공개된 Qwen 3.8 27B 다. 이 양자화 수준들에서 품질 손실을 측정한 자료는 읽은 것 어디에도 없다 — 그런 종류의 진술은 자사 FP8 빌드가 "원본 모델과 거의 동일"하다는 Alibaba 자신의 것뿐이다.

벤치마크

첫 독립 측정, 2026-08-03: Qwen3.8-Max 가 Arena.AI 에 등장해 멀티모달 과제에서 Claude Fable 5 에만 뒤진 세계 2위에 올랐다 (source).

이 페이지가 실은 첫 제3자 수치다. Alibaba 의 7월 자체 주장은 "Anthropic Fable 5 다음가는 수준"이었고 전적으로 내부 평가에 근거했는데 (source), 독립 멀티모달 결과는 벤치마크 하나·모달리티 하나에서 그와 일치한다. 7월 주장이 멀티모달로 한정된 것이 아니었으므로, 그 주장에 대한 일반적 확인은 아니다.

2026-08-03 기준 이 모델은 Artificial Analysis 에도 Hugging Face 에도 등재되지 않았고 (source), 따라서 이 위키가 프런티어 모델 비교에 쓰는 Intelligence Index 수치는 이 모델에 존재하지 않는다. 이 저장소가 보유한 가장 최근 Artificial Analysis 판독은 2026-08-02 다 (source).

그 공백이 2026-08-16 에 닫혔고, 두 형태가 모두 실려 있다 — API 플래그십과 08-12 에 공개된 체크포인트가 별개의 행으로 나타나 같은 점수를 낸다 (source):

ModelArtificial Analysis Intelligence IndexContext WindowCost per Task USDMedian Tokens/s
Qwen3.8 Max581M$1.1347
Qwen3.8 2.4T A95B58984k$1.0949
Artificial Analysis Intelligence Index 는 그 발행자가 자기 벤치마크 묶음으로 만든 복합
점수이지 정확도가 아니며, Cost per Task USD 는 그들이 측정한 작업 하나의 비용이지 토큰
단가가 아니다.

두 가지로 읽히고, 쓸모 있는 쪽은 두 번째다. 58 은 같은 표에서 이 위키가 프런티어라고 부르는 모든 모델 아래다 — Claude Opus 5 (max) 63, GPT-5.6 Sol (max) 61, Grok 4.6 (high) 61 — 이는 7월의 "Fable 5 다음" 주장을 일반 지표에서 뒷받침하지 않는다. 다만 Arena.AI 결과가 다루던 멀티모달 과제와 같은 것은 아니다. 그리고 공개 체크포인트가 유료본과 같은 점수를 낸다. Alibaba 가 공개한 산출물이 팔던 산출물과 같은 것이라는, 여기 보유된 첫 증거다. 984k 대 1M 컨텍스트 차이는 가중치가 아니라 서빙 배포의 속성이다 — Open-Weights Policy Fight 를 보라.

2026-08-06 — 이제 등재됐고, 그에 관한 헤드라인은 틀렸다. Artificial Analysis 의 에이전트 측정에 대해 보도된 수치 (source):

측정Qwen3.8-Max보도된 비교 대상
Agentic Index58xhigh 설정의 Claude Opus 5 와 동률. max 설정의 Opus 5 가 59 로 선두
GDPval-AA (44개 직군, 셸 + 브라우징)1,739 EloGPT-5.6 Sol Max 1,730 · Kimi K3 1,685 · Claude Opus 5 1,852
Intelligence Index56Anthropic 과 OpenAI 를 제외한 모든 미국 기업보다 앞선다고 보도
두 번째 행의 모델은 GPT-5.6 Sol (and Terra, Luna)Kimi K3 이고, 선두는
Claude Opus 5 다.

이 숫자들과 함께 돌아다닌 주장 — r/LocalLLaMA 게시물 "Qwen 3.8 Max now ranked as best overall model ahead of Opus 5 by Artificial Analysis agentic index", Hacker News 로 옮겨간 것 — 은 이 수치가 말하는 바가 아니다. max 설정의 Opus 5 가 Agentic Index 에서 1 포인트 앞서고, 동률은 더 낮은 설정의 Opus 5 와의 것이며, GDPval-AA 에서 보도된 격차는 반대 방향으로 113 Elo 다.

이 수치가 뒷받침하는 것은 더 좁고 여전히 주목할 만하다: 에이전트 작업에서 리더보드 상단이 약 1 인덱스 포인트 차로 갈리고, 오픈 웨이트가 예고된 중국 모델이 그 간격 안에 있다는 것.

보도된 대로 기록한다. Artificial Analysis 페이지는 읽지 못했다 — 이 샌드박스는 해당 사이트에 접근할 수 없고, sources/evals/ 스냅샷은 GitHub Action 이 만들며, 이 저장소가 보유한 어떤 스냅샷에도 이를 대조할 Agentic Index 열이 없다 (source).

2026-08-12 — SWE-bench Pro, 점수가 아니라 순위로 보도됐다. 오픈 웨이트 릴리스 보도는 SWE-bench Pro 에서 Qwen3.8-Max 를 "중위권: GPT-5.6 Sol (64.6) 앞, Opus 4.8 (69.2) 뒤, Fable 5 (80.0) 보다 12 포인트 아래"에 놓고, "FrontierSWE 에서 Fable 5 와 15 포인트 격차"라고 말한다 (source).

Qwen3.8-Max 자신의 점수는 읽은 자료 어디에도 없다 — 이름이 거론된 세 모델에 대한 상대적 위치뿐이므로, 이 페이지에 그 수치는 기록하지 않는다. 거론된 모델은 GPT-5.6 Sol (and Terra, Luna), Claude Opus 4.8, Claude Fable 5 다.

그 보도가 인용한 Fable 5 수치는 80.0 이다. 이 위키는 Claude Fable 5 에 그 숫자를 두고 80.0 과 80.3 사이의 공개된 상충을 기록해 두고 있다. 위 보도는 제3자가 둘 중 하나를 인용한 것이지 상충의 해소가 아니며, 해소로 취급하지 않는다.

하네스에 관한 메모, 명시된 대로: FrontierSWE 수치는 "Claude Code 하네스로 평가"되었고, MEAN@5, 2026-08-03 기준 공식 리더보드에서 가져온 것이다 (source) — 하네스와 샘플링 예산, 즉 Eval Harness Configuration 이 벌거벗은 벤치마크 숫자가 보통 빠뜨린다고 기록해 둔 두 가지다.

공개된 오픈 웨이트 체크포인트 자체에 대한 벤치마크 점수는 존재하지 않는다. 이 페이지의 모든 수치는 API 로 제공되는 Qwen3.8-Max 를 측정한 것이다. 내려받을 수 있는 Qwen3.8-2.4T-A95B 가 그 수치를 재현하는지는 읽은 자료 어디에서도 측정되지 않았다 — 2026-08-03 에 MiniMax H3 에 대해 기록된, 배포된 가중치가 그 모델이 가격까지 매겨진 사양을 재현하지 못한 바로 그 공백이다.

아키텍처

  • 총 2.4조 파라미터 (MoE) (source)
  • 추론 시 활성 950억 파라미터 (source) — 이 페이지는 2026-07-20 부터 활성 수를 "미공개 — 실제 추론 비용을 가늠하는 데 결정적인 공백"으로 기록해 왔다. 15일 뒤인 2026-08-03 에 공개됐다
  • 그 밖의 아키텍처 세부는 공개되지 않았다

맥락

  • Kimi K3(2.8T, 7월 16일) 발표 며칠 뒤에 나왔다
  • 정식 출시 보도는 Qwen3.8-Max 를 Kimi K3 와 "규모가 비슷한" 위치에 놓는다 (source)
  • 더 작은 Qwen 3.8 27B 이 같은 날 발표됐고, 한 기사의 표현으로는 "보도에서 거의 완전히 무시됐다" (source)
  • 오픈 웨이트 시점은 이제 Open-Weights Policy Fight 에 걸린 문제다. 2026년 예고된 최대 규모 오픈 공개 두 건이 모두 중국 것이고, 둘 다 API 를 먼저 낸 뒤에야 가중치에 날짜를 붙였다
  • 2026-08-12 — 그 패턴이 완성됐다. 보도는 그것을 직접 이름 붙인다. 중국 랩들은 2026년 내내 "같은 수순으로 수렴해 왔다 — 벤치마크 근거와 함께 비공개로 출시하고, API 창구에서 수익을 내고, 뉴스 사이클이 제 일을 마친 뒤 가중치를 연다" (source). 이 모델은 그 순서를 24일에 걸쳐 밟았다 — 비공개 프리뷰 2026-07-19, 유료 API 2026-08-03, 오픈 웨이트 2026-08-12

Referenced by

Sources