AI Trend Notifier
EN
← wiki

$ cat wiki/models/qwen-3-8-27b.md

Qwen 3.8 27B

나란히 보기

스펙

속성
DeveloperAlibaba / Qwen AI Lab
Released2026-08-14
Announced2026-08-03
Context window262,144 토큰 (네이티브. YaRN 으로 약 1M 확장 가능하다고 보고됨)
Pricingunknown
LicenseApache 2.0
AvailabilityHugging Face (Qwen/Qwen3.8-27B, Qwen/Qwen3.8-27B-FP8), ModelScope
배포됐다. 2026-08-14 15:00 UTC 출시 — 27.78B 덴스 파라미터, 텍스트·이미지·비디오,
Apache 2.0, 262,144 토큰 네이티브 컨텍스트 윈도
(source). 위 표에서 열하루
동안 unknown 이던 모든 행이 값을 갖게 됐고, Pricing 행이 unknown 으로 남는 것은 오픈
웨이트 릴리스에 공표할 정가가 없기 때문이다.

이 수치들 가운데 1차 페이지에서 읽은 것은 하나도 없다huggingface.co 가 이 샌드박스에서 차단돼 있다 — 따라서 공식 모델 카드를 서술한 매체들이 보고한 내용이다. 그 구분이 가장 중요한 곳은 Context window 이며, 이는 헤드라인이 아니라 모델 카드의 항목이다.

정정, 2026-08-14, 그대로 보인다. 이 페이지는 하루 동안 Released: 2026-08-12 를 실었다. 그것은 틀렸고, 이 파이프라인의 오류였다. 2026-08-12 에 배포된 것은 Max 급 플래그십 Qwen 3.8 Max — Qwen3.8-2.4T-A95B — 이며, 2026-08-13 실행이 그 배포를 두 체크포인트에 대한 것으로 읽었다. 2026-08-13 에 읽은 자료는 반대로 적는다. 27B 에는 공식 저장소도, 모델 카드도, 라이선스 파일도, 자체 벤치마크도 없고, ModelScope 카운트다운이 2026-08-15 를 가리킨다 (source).

Releasednot yet 으로, Availabilityunknown 으로 되돌려졌다. 틀린 값은 지우지 않고 여기 기록한다. 조용히 자기를 고치는 위키는 다른 어떤 행이 밤사이 움직였는지 독자가 알 방법을 주지 않기 때문이다. 그 정정은 옳았다: 체크포인트는 이 페이지가 잘못 주장했던 날짜 이틀 뒤에, 다른 저장소에서, 당시 아무도 공개하지 않았던 라이선스로 배포됐다.

2026-08-13 에 제3자 주장으로 실렸던 덴스 서술 (source)은 릴리스로 확인됐다. 27.78B 덴스 파라미터로, 이름에 충분히 가까워 결국 이 제품군의 명명 관행은 믿을 만했다 — 총 2.4T / 활성 95B 인 형제 모델 Qwen 3.8 Max 을 보고서는 그렇게 가정할 이유가 없었지만 (source).

2026-08-03 발표는 체크포인트의 이름과 겨냥한 사용자층, 오픈 웨이트 날짜를 밝혔을 뿐, 파라미터 수도 아키텍처도 컨텍스트 윈도도 가격도 라이선스 이름도 공개하지 않았다 (source). 위 표의 모든 내용은 열하루 뒤, 산출물과 함께 도착했다.

출시일

Qwen 3.8 Max 의 정식 출시와 함께 2026-08-03 발표. 오픈 웨이트는 2026-08-10 예고 (source).

이 페이지가 만들어진 2026-08-04 기준 미출시.

업데이트 2026-08-12 — 예고된 날짜가 지났고 아무것도 나오지 않았다. 발표가 지목한 2026-08-10 오픈 웨이트 날짜는 지나갔다. 2026-08-11 에 읽은 보도는 Hugging Face 모델 허브에서 qwen3.8 을 검색해도 공식 저장소가 여전히 나오지 않는다고 말하며, 가장 최신 커뮤니티 신호는 2026-08-11 자 r/LocalLLaMA 스레드 "Qwen 3.8-27b coming this week" — 즉 산출물이 아니라 되풀이된 기대다 (source) (Orca Router) (r/LocalLLaMA).

어떤 Alibaba 채널도 그 날짜를 재확인하거나 옮기거나 철회하지 않았다. Released 행은 not yet 으로 두고, License 행도 발표 당시의 날짜를 그대로 유지한다 — 지켜지지 않은 날짜는 그 릴리스에 관한 사실이며, 그것을 고쳐 지우면 날짜가 밀렸다는 유일한 증거가 사라진다.

업데이트 2026-08-13 — 철회. 이 페이지는 10:00 UTC+8 배포를 두 체크포인트에 대한 것으로 읽어 "2026-08-12 에 배포됐고 이틀 지연"이라고 기록했다. 그렇지 않았다. 아래 정정을 보라. 틀린 주장은 덮어쓰지 않고 여기 그대로 남긴다.

업데이트 2026-08-14 — 아직 배포되지 않았고, 세 번째 날짜인 2026-08-15 가 나왔다. 2026-08-13 에 읽은 보도는 Max 급 가중치가 배포됐고 27B 는 배포되지 않았으며 Alibaba 가 "새 날짜를 제시하지 않았다"고 적는다. 그리고 Qwen3.8-27B 카운트다운 페이지가 ModelScope 에 올라가 2026-08-15 자정, 즉 00:00 JST 를 가리킨다 (source).

커뮤니티 신호도 같다. 2026-08-13 07:36 UTC 자 r/LocalLLaMA 스레드 제목이 "The countdown to Qwen3.8-27B starts now!" 다 (source).

날짜 기록은 그 패턴 자체가 사실이므로 통째로 둔다:

날짜누가 무엇을 말했나
2026-08-03발표; 오픈 웨이트를 2026-08-10 로 명시 (Alibaba)
2026-08-10지나감, 저장소 없음 (2026-08-11 보도)
2026-08-122.4T Max 배포; 27B 는 아님 (2026-08-13 보도)
2026-08-15ModelScope 카운트다운, 00:00 JST (BigGo / PC Watch)
2026-08-14출시, 15:00 UTC — 이는 곧 2026-08-15 00:00 JST 다 (Kingy AI; r/LocalLLaMA 스레드 4건, 14:59–16:12 UTC)
업데이트 2026-08-15 — 나흘 늦게 출시됐고, 카운트다운은 시각까지 정확했다. ModelScope
카운트다운은 2026-08-15 00:00 JST 를 가리켰고 가중치는 2026-08-14 15:00 UTC 에 나타났다. 같은
순간이다
(source). 위 두 행은 하나의
사건을 두 시간대로 적은 것이고, 그 혼동 자체가 기록의 일부이므로 둘 다 남긴다.

Alibaba 는 여기서 읽은 어떤 1차 채널에서도 2026-08-10 이라는 날짜를 다시 말하거나 옮기거나 철회한 적이 없다 — 지연 전에도, 출시 시점에도. 카운트다운 페이지가 놓친 날짜를 언급 없이 대체했을 뿐이다. date-slipped 태그는 그대로 둔다. 릴리스는 나흘 지연으로 마감됐고, 이제 그것은 진행 중인 계수가 아니라 배포된 모델에 관한 사실이다.

벤치마크

벤더 발표 수치이며, 매체가 서술한 공식 모델 카드에서 온 것이다 — 카드 자체는 읽지 못했다. huggingface.co 가 이 샌드박스에서 차단돼 있다 (source):

BenchmarkQwen3.6-27BQwen3.8-27B
Terminal-Bench 2.163.473.0
DeepSWE 1.113.342.2
OSWorld-Verified63.984.3
SWE-MM25.738.6
이전 세대 칼럼 없이 실린 수치: SWE-Bench Pro 61.7%, QwenSWEBench 79.0%, CoWorkBench 70.7%, LiveCodeBench v6 90.3%, GPQA Diamond 89.2%
(source).

하네스 하나가 공개돼 있고, 그것은 경쟁사의 것이다. SWE-MM 은 Claude Code 하네스에서 SWE-bench Multimodal 공개 dev 분할을 써서, Claude Opus 4.7 시스템 카드 부록 8.3 에 서술된 수정 사항과 함께 측정된 것으로 보고됐다 (source). 이번 주에 이 위키가 수집한 어떤 릴리스가 어떤 수치에 대해 공개한 것보다 많은 하네스 정보이고 — 네 행 중 하나를 덮는다. 같은 카드의 Qwen3.6-27B 비교 칼럼이 같은 하네스로 다시 측정됐는지는 읽은 자료에 없다. Eval Harness Configuration 참조.

Alibaba 자신의 비교 표는 CoWorkBench 에서 Opus 4.6 Max 를 68.2% 에 놓아, 여기 주장된 70.7% 아래에 둔다고 보고됐다 (source) — 27.78B 덴스 모델이 Max 급 폐쇄 모델을 한 벤치마크에서 앞선다는 것이고, 측정한 쪽은 그 27.78B 모델을 출하하는 당사자다.

제3자는 이 체크포인트에 대한 수치를 공개한 적이 없다. 2026-08-09 에 읽은 Artificial Analysis 표 (source)에도, 같은 날짜의 LMArena 스냅숏 (source)에도 등장하지 않는다. 둘 다 출시보다 닷새 앞선다.

2026-08-18 — 이 저장소가 들고 있는 스냅숏에는 여전히 없는데, 커뮤니티는 더 이상 없지 않다고 주장한다. 출시 이틀 뒤인 2026-08-16 에 잡은 Artificial Analysis 표에는 Qwen3.8-27B 의 행이 없다. 그 표의 Alibaba 행은 Qwen3.8 Max(Intelligence Index 58), Qwen3.8 2.4T A95B(58), Qwen3.7 Plus(39), Qwen3.6 27B(38, 비추론 행에서는 31) 등이다 (source). 2026-08-17 자 r/LocalLLaMA 스레드의 제목은 다음과 같다. "Artificial Analysis' Qwen3.8-27B benchmarks put it neck and neck with DeepSeek V4 and GPT-5.6 Luna Max" 그리고 그 주장은 여기서 확인할 수 없다. 가리키는 수치가 존재한다 해도 이 저장소의 최신 캡처 이후의 것이고, artificialanalysis.ai 는 데일리 런의 샌드박스에서 닿지 않으며 리더보드 스냅숏은 일요일 Action 이 쓰므로 다음 캡처는 2026-08-23 이다. 스레드가 하는 비교의 규모를 가늠할 근거로, 08-16 표는 DeepSeek V4 Pro 0813 (max)53, GPT-5.6 Luna (max)52 를 준다 (source) — 이 두 수치는 들고 있고, 그것들과 비교되는 Qwen3.8-27B 수치는 들고 있지 않다. 벤치마크가 아니라 미결 주장으로 기록한다.

2026-08-19 — 수치가 도착했다. 스냅숏이 아니라 이름 있는 저자로부터: 52. Simon Willison 이 2026-08-17"Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index" 를 게시하며 리더보드의 해당 모델 페이지를 링크했다 (source):

모델Intelligence Index비고
Qwen3.8-27B5227B
GPT-5.6 Luna (max)52동점
GLM-5.2 (max)531점 앞섬; 753B
DeepSeek V4 Pro 0813 (max)531점 앞섬
이로써 08-18 의 r/LocalLLaMA 주장의 방향이 정리된다. 그 제목이 말하는
"neck and neck with DeepSeek V4 and GPT-5.6 Luna Max" 란 53 과 52 를 상대로 한 52 를 두고 하는
말이며, 출처 페이지를 링크하는 이름 있는 저자에게 귀속되는 수치로 그렇게 된 것이다. Willison 자신의 논점은 순위가 아니라 파라미터
격차다. 그는 GLM-5.2 가 753B 임을 짚으며 이 모델을 "a truly astonishing model" 이라 부른다.

그래도 이것은 보유된 측정이 아니다. 이 수치는 이 저장소의 Artificial Analysis 스냅숏에서 읽은 것이 아니다. 2026-08-16 캡처에는 이 체크포인트의 행이 없고 다음 캡처는 2026-08-23 이다. 여기서의 상태는 확인 불가한 주장 에서 이름 있는 저자의 서드파티 수치 로 옮겨가며, 벤치마크 절의 입장 — 이 저장소가 캡처한 독립 수치는 없다 — 은 일요일까지 그대로다. 또한 Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391) 가 측정하는 바를 함께 보라: 리더보드 수치는 어떤 서빙 경로를 거쳐 산출되며, 이 52 를 어느 경로가 냈는지는 아무 데도 적혀 있지 않다.

읽은 보도 중 한 수치는 틀렸고 옮기지 않았다: 한 발췌가 DeepSeek V4 Pro 의 크기를 "1.6B parameters" 로 적는다. 이 위키는 벤더 자신의 릴리스에서 1.6T 총 파라미터 / 49B 활성으로 보유하고 있으며 (source), "1.6B" 독법은 보도의 표기 오류로 다룬다.

활용 사례

Alibaba 가 밝힌 포지셔닝은 온프레미스 배포다. "평범한 온프레미스 GPU 하드웨어에 들어가는" 체크포인트, 조직이 "자기가 소유한 인프라에서 돌리고 자기 데이터로 파인튜닝할 수 있는" 것으로 설명된다 (source).

3자 하드웨어 주장, 주장으로 기록한다. Unsloth 는 이 모델이 "17GB RAM/VRAM 구성에서 로컬로 돌아갈 것"이라고 밝혔다 (source). 이것은 측정할 가중치가 존재하기도 전에 미출시 체크포인트를 두고 나온 진술이며, 이 위키 어디에서도 이 모델에 붙은 유일한 정량 수치다. 무엇에 대한 독립적 확인도 아니다.

2026-08-15 에도 여전히 주장이고, 이제 검증 가능하다. 2026-08-12 Max 릴리스 보도는 Unsloth 의 Daniel Han 에게 귀속시켜 같은 17 GB 수치를 되풀이했다 (source). 이제 가중치가 존재하고 본 저장소 옆에 FP8 저장소도 공개돼 있지만 (source), 실제 메모리 사용량 측정을 공개한 곳은 아무도 없다. 이 수치는 열이틀째 그대로 추정치이고, 다만 이제 실재하는 산출물에 대한 추정치다.

이것은 Qwen 3.8 Max 과 짝을 이루는 사례다. 그쪽의 공개된 양자화는 397 GB 에서 시작한다. 27B 가 존재하는 이유는 플래그십의 가장 작은 형태조차 여전히 소비자 하드웨어 바깥에 있기 때문이고, 이 모델에 관해 어떤 소스도 이견을 내지 않는 것은 그 이유 하나다.

2026-08-16 — 누군가 마침내 돌려봤고, 첫 실사용 기록은 역량이 아니라 기본값에 관한 것이다. Simon Willison 이 이 모델을 M5 Max MacBook Pro 에서 LM Studio 의 17GB GGUF 로 돌린 기록을 남겼고, 모델에 대한 그의 평가는 제목에 그대로 있다: "훌륭하지만, 기본값이 터무니없이 과하게 생각한다" (source).

"SVG 를 그려라" 프롬프트 하나에서의 측정:

| | |---|--- | 추론 토큰 | 22,276 | 출력 토큰 | 3,223 | 실제 소요 시간 | 21분 출력 토큰당 추론 토큰 6.9개이고, 이는 출고 기본값의 동작이다: Qwen3.8 은 공식 reasoning_effort 수준을 추가하면서 xhigh 를 기본값으로 두고 mediumlow 를 함께 제공한다. 일반적인 경우에 대한 그의 요약은 모델이 "두 문장짜리 답에 추론 토큰 2만 개를 기꺼이 태운다"는 것이고, xhigh 에서는 "너무 과하게 생각해서 형편없이 무성한 코드를 쓴다"는 것이다 (source).

이것이 해결한 것과 해결하지 못한 것, 둘.

  • 이 페이지가 12일 동안 기다려온 메모리 측정은 아니다. 17GB GGUF 는 파일 크기이고, Unsloth 의 주장은 17GB RAM/VRAM 에 관한 것이었다. 둘은 서로 모순되지 않지만 후자는 여전히 아무도 측정하지 않았다. 달라진 것은 이 산출물이 실제로 노트북에서 돌아간다는 것이 확인됐다는 점이고, 그것이 27B 가 존재하는 이유다.
  • 한 사람이, 한 기계에서, 한 프롬프트로 얻은 것이며 정확도 수치도, medium 이나 low 에서의 비교 실행도, 두 번째 과제도 없다. 기본값에 관한 관측이고, 이 페이지는 그것을 벤치마크가 아니라 그렇게 기록한다. 같은 기록이 모델을 훌륭하다고 부른다.

비용 쪽 이야기는 Test-Time Compute (Inference-Time Compute Scaling) 에서 전개되며, 거기서 이 관측은 Thought-Level Beam Search for Reasoning (arXiv:2608.08020) 곁에 놓인다 — 바로 그 토큰 지출의 최대 68.5% 를 정확도를 올리면서 되찾을 수 있다고 주장하는 알고리즘이다.

출시 이후 보도된 포지셔닝: 로컬 코딩 어시스턴트, 범위가 한정된 에이전트, 문서·이미지 분석, 비공개 연구 워크플로, 멀티모달 자동화 — 27.78B 덴스 가중치가 감당 가능하고 Apache 2.0 이 라이선스 질문을 없애 주는 작업들이다 (source). 실질적인 변화는 라이선스다. 이 계열에서 이 위키가 조건을 이름으로 말할 수 있는 첫 체크포인트다. Open-Weights Policy Fight 참조.

비교

  • Qwen 3.8 Max — 같은 날 발표된 플래그십. 총 2.4T / 활성 95B, API 우선, 같은 날 배포된 오픈 웨이트
  • Inkling — Thinking Machines 의 975B/41B Apache 2.0 공개. 의도 면에서 가장 가까운 서구 비교 대상
  • Laguna S 2.1 — Poolside 의 118B/8B OpenMDW-1.1 공개
  • Kimi K3 — Moonshot 의 2.8T 오픈 웨이트 모델. 규모가 아니라 배포 가능성을 두고 이 모델이 암묵적으로 겨냥하는 중국 측 공개
  • GLM-5.3 — 같은 날 출시됐고 정확히 거울상인 거래다. 프런티어급 코딩 모델을 월 $18 구독 뒤에 두고 가중치는 2주 보류하는 쪽과, 27.78B Apache 2.0 가중치를 내놓고 호스팅 티어는 두지 않는 쪽
  • Muse Glimmer — 릴리스 보도가 Qwen3.8-27B 가 "여러 벤치마크에서" 이겼다고 주장하며 지목한 모델. 공통 수치는 공개되지 않았다

상충 보고

  • 컨텍스트 윈도: 여기서는 262,144 인데 이 페이지가 인용하는 앞선 스냅샷에서는 "1 million tokens". 2026-08-03 캡처는 Context window | 1 million tokens 행을 싣고 있고 (source), 릴리스 캡처는 262,144 토큰 네이티브, YaRN 으로 약 1M 확장 가능을 싣고 있다 (source). 둘은 서로 다른 모델에 관한 것이다. 1M 행은 같은 발표에서 함께 소개된 Max 급 플래그십 Qwen 3.8 Max 을 서술하며, 같은 2026-08-03 스냅샷은 본문에서 27B 의 컨텍스트 윈도는 읽은 어떤 자료에서도 찾지 못했다고 적는다. 위 표의 행은 릴리스 캡처를 따른다.

    조용히 화해시키지 않고 밝혀 두는 이유는 이 페이지 자신의 이력이다. Qwen 발표 하나를 두 체크포인트에 대한 것으로 읽는 것이야말로 2026-08-14 정정을 낳은 바로 그 실수다. 이 두 행을 비교하는 독자 — 또는 검사기 — 는 각각이 어느 모델의 것인지 들어야 하고, 같은 모델이라고 넘겨짚도록 남겨져서는 안 된다.

  • "Qwen3.6-27B 와 동일하다". 2026-08-14 16:12 UTC — 출시 72분 뒤 — 에 올라온 r/LocalLLaMA 스레드의 제목이 "Qwen3.8-27B is identical to Qwen3.6-27B!" 다 (source). 그 근거를 찾는 표적 검색은 아무것도 돌려주지 않았다. 보도도, 가중치 비교도, 저장소 이슈도 없다. 이 주장은 위 모델 카드 자신의 네 벤치마크 향상 표와 정면으로 어긋난다. 기록하되 해결하지 않는다 — 한쪽에는 검증되지 않은 커뮤니티 주장이, 다른 쪽에는 하네스가 하나만 공개된 벤더 표가 있고, 어느 쪽도 제3자가 측정한 적이 없다.

Referenced by

Sources