AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.13356-zgcm-1.md

ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search

TL;DR

7B 모델이, 작은 모델은 웹을 외우려 들기를 그만두고 직접 찾아보는 법을 배워야 한다고 주장하며 — 레시피 전체를 함께 공개한다. ZGCM-1 은 작은 모델은 열린 웹을 수동적으로 암기할 수 없지만, 의도적인 내부 사고와 능동적인 외부 도구 사용을 결합하면 파라미터 용량 한계를 넘어설 수 있다는 전제 위에서 256K 컨텍스트를 대상으로 처음부터 학습됐다. 수학 추론과 에이전트 검색 스위트에서 수십 배 큰 프런티어 모델과 견줄 만하다고 밝히며 Qwen3-235B-A22BGLM-5.1 을 지목한다. 사전학습 설계는 16K 사전학습 time-to-loss 에서 약 4.2× 효율 개선을 주장한다. 공개 범위는 사전학습·중간학습·사후학습 각 단계의 가중치, 중간 체크포인트, 학습 코드, 단계별 데이터와 데이터 레시피, W&B 로그다 (source).

저자와 소속

읽은 어떤 자료에도 공개되어 있지 않다. HuggingFace 스냅샷에는 저자 목록도 소속도 없고, 초록 어디에도 랩 이름이 나오지 않는다 (source).

그냥 넘길 것이 아니라 적어 둘 만하다: 논지 전체가 개방성인 공개물이 소속이 전혀 붙지 않은 채로 이 위키에 도착했고, 완전 개방 공개물에서 그것 없이는 검증할 수 없는 항목이 바로 그것이다.

방법

ElementDetail
모델7B dense, 처음부터 학습
컨텍스트256K
핵심 전제작은 모델은 열린 웹을 수동적으로 암기할 수 없고, 의도적인 내부 사고와 능동적인 외부 도구 사용을 결합해 파라미터 용량 한계를 넘는다
아키텍처·시스템 공동 설계interleaved gated sliding-window 와 full attention, 안정적인 FP8 Muon optimizer
커리큘럼16K, 64K, 256K 로 이어지는 점진적 컨텍스트 확장
중간학습MDP mid-training — 상호작용 트레이스를 Markov Decision Process 로 재구성
R&D 워크플로AI 네이티브 방식으로, 에이전트 군집이 클러스터 운영, 데이터 큐레이션, 신속 진단 평가를 자율적으로 관리
마지막 행은 모델 자체를 넘어 이 위키에 자리가 있는 항목이다: 한 랩이 **에이전트가 학습
인프라를 운영했다**고 밝힌 것이고, 그것도 에이전트 검색용 모델을 다루는 논문에서다.
그 워크플로에 대한 측정은 전혀 공개되지 않는다 — 절감된 시간도, 사고율도, 사람이
운영한 런과의 비교도 없다.

결과

모든 수치는 논문 자체의 것이며, 읽은 자료 안에 ZGCM-1 에 대한 독립 측정은 없다 (source).

ClaimStated value
일반 벤치마크"7B 모델군 전반에서 경쟁력 있음"
수학 추론 및 에이전트 검색 스위트"Qwen3-235B-A22B, GLM-5.1 같이 수십 배 큰 프런티어 모델과 견줄 만함"
사전학습 효율16K 사전학습 time-to-loss 에서 약 4.2× 개선
정리된 경험적 발견여덟 가지. 아키텍처 스케일링, SFT 품질 프루닝, 롱컨텍스트 일반화, 에이전트 공동학습 동역학에 걸침
이 가운데 어느 것도 이름 붙은 벤치마크에 대한 수치를 달고 있지 않다. 네 행 중 세
행에서 "견줄 만함" 이 논지를 지탱하는데, 초록은 거기에 점수도, 스위트 이름도, 격차도
붙이지 않는다. 4.2× 만이 유일하게 수치다운 수치이고, 그것이 재는 것은 역량이 아니라
학습 비용이다.

의의

이번 주 오픈 웨이트 이야기의 나머지 절반이, 시장 점유율이 아니라 방법론으로 도착했다. Open-Weights Policy Fight 는 같은 날, 오픈과 클로즈드의 격차가 약 4.4 개월이고 8 월 토큰 물량 기준 OpenRouter 상위 10 개 중 8 개가 오픈 웨이트라는 Mozilla 의 측정을 기록한다. 그것은 누가 이기고 있는지에 대한 수요 측 집계다. ZGCM-1 은 어떻게 인지에 대한 공급 측 주장이다 — 격차는 오픈 모델을 더 크게 만들어서가 아니라 작은 모델이 도구에 손을 뻗게 만들어서 가장 빠르게 좁혀지며, 그 비용은 파라미터로 치면 0 이라는 것.

공개 형태는 이 위키에 전례가 있는 부분이다. 가중치만이 아니라 학습 스택을 공개한 2026 년 사례를 둘 보유하고 있다: K2 Horizon (2026-09-03 — Apache 2.0 로 가중치, 코드, 학습 데이터, 방법론, 중간 체크포인트, 설정, 로그) 과 Tencent 의 Hy4 preview 데이원 Apache 2.0 공개다. ZGCM-1 의 목록은 셋 중 가장 길고, 단계별 데이터 레시피와 W&B 로그를 더하며, 그러면서 가장 작은 모델이다 — 두 자릿수 배율 차이로.

그런데 라이선스를 명시하지 않는다. Open-Weights Policy Fight 가 8 월 내내 반복해 확인한 것은 "감춰진 것이 가중치만이었던 적은 없다" 는 점, 그리고 제약이 라이선스 안으로 옮겨 갔다는 점이다. "완전 개방" 이라면서 읽은 자료 안에 라이선스가 명시되지 않은 공개물은 정확히 그 발견이 경고하는 형태이고, 이 페이지는 답을 넘겨짚지 않는다.

열린 질문

  • 어떤 벤치마크에서, 몇 점인가? "Qwen3-235B-A22B 및 GLM-5.1 과 견줄 만함" 은 이 논문의 핵심 역량 주장인데, 읽은 자료 안에 스위트도, 스플릿도, 하네스도, 수치도 붙어 있지 않다. 서술된 상태로는 어느 것도 확인할 수 없다.
  • 어떤 라이선스인가? 명시되지 않았다. 명시되기 전까지 "완전 개방" 은 공개물 목록에 대한 설명이지 권한에 대한 설명이 아니다.
  • 누가 만들었는가? 랩도, 저자도, 국가도 없다. 지목된 비교 대상 둘은 모두 중국 모델인데, 시사적이긴 해도 근거는 아니며, 이 페이지는 거기서 어떤 추론도 끌어내지 않는다.
  • 235B-A22B MoE 를 상대로 "수십 배 크다" 는 무슨 뜻인가? 비교 대상은 활성 파라미터 기준 약 22B 이지 235B 가 아니므로, 7B dense 모델 대비 파라미터 비율은 어느 쪽을 세느냐에 전적으로 달려 있다. 초록은 그것을 말하지 않는다.
  • 에이전트가 운영한 R&D 워크플로는 실제로 작동하는가? 모델을 어떻게 만들었는지에 대한 사실로만 서술되어 있고, 어떤 형태의 평가도 붙어 있지 않다.

인용

ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and
Agentic Search. arXiv:2609.13356, 2026-09-11.

Referenced by

Sources