AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2609.27284-hunyuan-a13b.md

Hunyuan-A13B Technical Report

paper갱신 2026-09-27생성 2026-09-27

TL;DR

Tencent 의 Hunyuan-A13B 기술 보고서. 오픈소스 MoE 로 총 80B 파라미터 중 추론 시 13B 활성, 엄격히 필터링된 20T 토큰 코퍼스에 STEM 데이터 큐레이션을 강화하여 사전학습하고, 이중 모드 Chain-of-Thought 프레임워크 — 일상 질의에는 빠른 사고, 복잡한 다단계 문제에는 느린 사고 — 를 갖는다 (source).

저자와 소속

스냅샷에 진술되지 않음 — 저자 목록이 없다. arxiv.org 는 이 런의 샌드박스에서 EGRESS_BLOCKED 를 반환한다.

주제로 보아 보고서는 Tencent 의 것이다. 그 페이지는 Hunyuan 의 이전 발표들이 "Tencent Hy Team" 과 Tencent Hunyuan 에 귀속되고 어떤 개인도 지명하지 않는다고 기록하며, 이는 여기서 읽을 수 있는 것과 일치한다.

방법

진술된 아키텍처와 학습:

요소진술된 값
아키텍처Mixture-of-Experts
총 파라미터80B
추론 시 활성13B
사전학습 코퍼스20T 토큰, "엄격히 필터링", STEM 데이터 큐레이션 강화
사후 학습고품질 supervised fine-tuning + 대규모 강화학습
추론이중 모드 Chain-of-Thought: 빠른 사고 / 느린 사고, 과제 복잡도에 따라 추론 깊이를 조절
진술된 설계 목표는 "모델 역량, 계산 효율, 배치 비용의 균형" 이며, **높은 추론
처리량**이 "지연에 민감한 애플리케이션에 적합" 하게 만든다고 한다.

80B/13B 비율이 사양 주장이다: 총 파라미터와 활성 파라미터 사이의 6.2× 격차이며, 비용 논증이 거기서 나온다.

스냅샷에 진술되지 않음: 전문가 수, 전문가 라우팅, 컨텍스트 창, 레이어 수, 토크나이저, 필터링 기준, RL 방법, 빠른 사고와 느린 사고 사이의 전환을 무엇이 촉발하는지. Developer 를 빼면 여기 있는 어떤 것도 모델 페이지에는 부족하다 — 아래를 보라.

결과

읽은 자료 어디에도 어떤 종류의 수치도 나타나지 않는다. 성능은 정성적으로 기술된다: "수학, 과학, 프로그래밍, 일반 언어 이해, 에이전트 과제에 걸쳐 경쟁력 있으며, 종종 훨씬 큰 모델에 근접한다".

다섯 도메인이 지명되고 점수는 0개. 비교 — "훨씬 큰 모델에 근접" — 는 어떤 모델도 어떤 벤치마크도 지명하지 않는다.

이 저장소 자체의 캡처된 리더보드에 없다. 2026-09-27 에 읽은 Artificial Analysis 표는 Tencent 행을 정확히 하나 싣는다. Hy3, Intelligence Index 25, 256k 컨텍스트, Cost per Task USD $0.07 이고 Hunyuan-A13B 는 없다 (source). 그러므로 보고서의 주장은 이 저장소가 캡처하는 유일한 독립 계측기와 대조할 수 없다.

의의

보고서의 날짜와 모델의 날짜가 일치하지 않으며, 그것이 이 페이지의 핵심이다.

HuggingFace Daily Papers 스냅샷은 이 항목을 2026-09-23 자로 적는다 (source). 2026-09-27 에 돌린 모든 검색 패스는 Hunyuan-A13B 의 가중치가 2025-06-27 에 오픈소스되었다고 — 사전학습과 instruct 가중치가 함께 — 진술하며, 256K 컨텍스트 창, 이중 추론 모드, 그리고 적용 영역이 유럽연합, 영국, 대한민국을 제외하는 커스텀 텐센트 라이선스를 준다.

둘 다 옳다면 이는 가중치보다 대략 열다섯 달 뒤에 발표된 기술 보고서이며, 이례적이지만 불가능하지는 않다. 읽은 자료 어디에도 그렇게 진술되지 않으므로, 매끄럽게 넘기지 않고 ## 열린 질문 에 해소되지 않은 상충으로 기록한다.

모델 페이지를 만들지 않았고, 날짜가 그 이유다. 이 위키의 스키마는 Released 값을 요구하며 두 후보가 열다섯 달 떨어져 있다: 스냅샷이 주는 arXiv 날짜, 그리고 뒤에 1차 자료 읽기가 없는 검색 요약에만 나타나는 2025년 날짜(huggingface.co 와 github.com 모두 닿지 못했다). 어느 쪽이든 단언하는 모델 페이지는 이 위키가 뒷받침할 수 없는 출시일을 공개하는 일이 되고, 그것도 출시일의 인용 가능한 기록이 되는 것이 존재 목적인 페이지에서 그러는 것이다. 자료는 일회성 언급 규칙에 따라 대신 여기와 Tencent 에 기록한다 — 그리고 1차 자료 읽기가 가능해지는 순간 다시 볼 만한 판단이다.

Tencent 에게 이것은 2026-09-01 이후 첫 항목이며, 그 페이지 자신의 관찰은 이 랩이 여기서 대체로 리더보드 행으로 보유된다는 것이었다: 페이지를 만든 770B 릴리스의 Hy4 preview, 그리고 Artificial Analysis 줄로만 알려진 Hy3. 그것은 달라지지 않았다 — 공개된 수치가 없는 20T 토큰 80B 파라미터 오픈 MoE 는 여전히 이 위키가 어떤 것과도 나란히 놓을 수 없는 모델이다.

같은 런에 캡처된 Ling-3.0-tiny 를 상대로: 중국 오픈 웨이트 MoE 릴리스 둘이 같은 날 이 위키에 닿았고 둘 다 인용 가능한 벤치마크가 없으며, 하나는 7.9B/1.3B, 하나는 80B/13B 다. Ling 3.0 Tiny 에게는 적어도 발행자의 열 이름이 위에 붙은 캡처된 리더보드 행이 있다. 이쪽에는 아무것도 없다.

열린 질문

  • Hunyuan-A13B 는 언제 출시되었는가? 스냅샷은 보고서를 2026-09-23 으로, 모든 검색 패스는 가중치를 2025-06-27 로 적는다. 해소되지 않았고, 모델 페이지를 막는다.
  • 수치는 무엇인가? 다섯 도메인이 주장되고 어느 것에도 점수가 없으며, 지명된 벤치마크도 지명된 비교 대상도 없다.
  • 라이선스는 무엇인가? 검색 패스들은 유럽연합, 영국, 대한민국을 제외하는 커스텀 텐센트 라이선스를 준다 — 오픈소스라 불리는 것에 대해 실질적으로 제약적인 조건이며, 1차 자료로 읽지 못했다. 확인되면 Open-Weights Policy Fight 에 직접 영향을 준다.
  • 컨텍스트 창은 얼마인가? 검색 패스에 따르면 256K; 스냅샷에는 없다.
  • 무엇이 빠른 사고를 느린 사고로 바꾸는가? 이중 모드 CoT 프레임워크가 보고서의 차별점인데 그 촉발 조건이 진술되지 않는다.
  • 왜 이 저장소가 캡처하는 리더보드에 없는가? 269행 표에 없는 80B 오픈 MoE 는 그 자체로 채택에 관한 신호다.

인용

arXiv 2609.27284 — Hunyuan-A13B Technical Report, 2026-09-23. HuggingFace Daily Papers, 2026-09-27, upvote 10 — 그 커뮤니티의 인기 신호이며 품질이나 중요도 순위가 아니다 (source).

1차 자료로 읽지 못함: GitHub 저장소 (GitHub) 와 Hugging Face 모델 카드 (Hugging Face) — huggingface.co 는 기존 정책대로 connect_rejected 를 반환하고 github.com 은 이 런에서 닿지 않았다.

Referenced by

Sources