$ cat wiki/models/gemini-4-argon.md
Gemini 4 Argon
나란히 보기
- GPT-6.1 Sol
- Claude Sonnet 5.5
- MiMo-V2.6-Pro
- Grok 4.7
- Ternary Bonsai 2 27B
- Fugu Max
- Kimi K2.8 Preview
- DeepSeek V4.1-Flash
- K2 Horizon
- Muse Spark 1.3
- Hy4 preview
- GLM-5.3-Flash
- Granite 4.2
- Ling-3.0-tiny
- Laguna S 2.1
- Inkling
- LongCat-2.0
- MiniMax M3
- Claude Opus 5.5
- GPT-6 Luna
- GPT-6 Sol
- Gemini 3.8 Live
- Fugu Ultra v2
- GPT-Image-2.5 Flare
- GPT-Image-2.5 Sunburst
- Astra
- Gemini 3.8 Flash
- Claude Fable 5.1
- GLM-5.3
- Qwen 3.8 27B
- DeepSeek V4-Pro-0813
- Gemini 3.7 Flash
- Muse Glimmer
- Grok 4.6
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Claude Opus 5
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- Kimi K3
- GPT-5.6 Sol
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Claude Fable 5
- Claude Opus 4.8
- Grok Build
- Claude Opus 4.7
- Muse Spark
Google DeepMind의 2026-09-30 프런티어 공개로, SVP Koray Kavukcuoglu가 발표했고, Gemini 4 세대의 첫 번째 명명된 모델이다 — 이 위키는 그 선행 학습 실행을 7월부터 Gemini 4에서 이어 왔다 (source).
이 모델을 단지 크기만 한 것이 아니라 이례적으로 만드는 것은 두 가지다. 첫째는 출력 예산이다: Gemini 라인의 기존 64K 대비 1M 출력 토큰, 즉 모델이 내놓도록 허용된 양의 15배 도약이고, 2M 토큰 컨텍스트 윈도우와 짝을 이룬다. 둘째는 누가 받는가다. Argon 은 Fairwind Program 을 통해 검증된 사이버 방어자에게 먼저 출하되고 — 그들에게는 "without cyber guardrails" — 유료 API 고객과 Google AI Ultra 가입자가 다음으로 언급되며 날짜는 주어지지 않았다. 출시 코호트가 API 가 아니라 보안 프로그램인 프런티어 모델은 위에 있는 Gemini 페이지 아홉 개와는 다른 종류의 공개다.
이 페이지는 1차 출처로 확인하지 못했다. deepmind.google, blog.google,
allenai.org, www.latent.space, www.marktechpost.com 모두 2026-10-02 에 클라우드
샌드박스에서 CONNECT 단계에서 EGRESS_BLOCKED로 응답했으므로, 여기의 모든 수치는
서로 독립적인 세 번의 검색 패스에 근거하며 둘 이상이 동일하게 서술한 것만 기록한다.
패스들이 어긋난 지점 — 특히 Argon 이 Google 자신의 비교 표에서 몇 개 행을 앞서는지 — 에
대해서는 아무것도 채택하지 않는다. ## 상충 보고를 볼 것.
스펙
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-09-30 (Fairwind Program 코호트 한정) |
| Announced | 2026-09-30 |
| Context window | 2M tokens |
| Pricing | $2/M input · $10/M output · cached input $0.10/M (도입가; $4/$20 로 두 배가 될 것이라고 서술) |
| License | proprietary |
| Availability | Fairwind Program(신뢰받는 사이버 방어자) 한정; 유료 API 와 Google AI Ultra 가 다음이라고 서술, 날짜 없음 |
| Catalogue id | unknown |
| 이 스키마에 자리가 없는 행: 최대 출력 1,000,000 토큰, 이전 Gemini 모델들의 64,000에서 | |
| 상향되었다고 서술됨 | |
| (source). |
Catalogue id는 unknown이고 당장은 그대로일 것으로 보인다: 2026-09-30 기준 공개된 API
model ID 가 없고, 모델은 OpenRouter 및 models.dev 카탈로그와 Vertex AI, Gemini CLI,
Cursor, GitHub Copilot 모델 문서에 모두 없다. 어차피 openrouter.ai는 이 샌드박스에서
차단되어 있다. 일치하는 항목이 생기면 그것을 보고하는 것은 일일 spec-check Action 이다.
출시일
- 발표 및 Fairwind 코호트 공개: 2026-09-30.
- 유료 API 고객과 Google AI Ultra 가입자: 다음이라고 서술, 발표된 날짜 없음.
- Google 은 더 넓은 공개 전에 네 가지 안전장치를 강화하는 중이라고 말한다. 읽은 자료 어디에도 그 네 가지는 열거되어 있지 않으며 — 이는 일반 공개의 관문을 외부에서 검증 불가능하게 만든다.
벤치마크
아래의 모든 수치는 검색 패스를 거친 Google 자신의 것이다. 그중 어느 것에 대해서도 독립 검증이 발표된 바 없고, 비교 표는 읽지 못했다.
| Benchmark | Gemini 4 Argon | 언급된 최상위 경쟁자 |
|---|---|---|
| DeepSWE v1.1 | 77.9% (SOTA 라고 서술) | Claude Opus 5.5 74.2% · Astra 74.1% |
| FrontierSWE v2 | 55.0% | Astra 65.5% (Argon −10.5) |
| Terminal-bench 4.0 | 57.4% (네 모델 중 최하위) | Claude Opus 5.5, 약 9점 앞 |
| CWE-bench v1 | 동점 | Astra (동점) |
| PostTrainBench | 패배 | Claude Opus 5.5 |
| OSWorld-2.0 | 패배 — 수치 서술 없음 | unknown |
| DeepSWE 머리기사보다 이 표의 모양이 더 값어치가 있다. **Argon 은 새로운 장기 지평 SWE | ||
| 벤치마크를 가져가고 에이전틱 터미널 벤치마크 둘을 잃는다** — FrontierSWE v2 를 Astra 에게 | ||
| 10.5점 차로, Terminal-bench 4.0 을 Opus 5.5 에게 약 9점 차로. "장기 지평 소프트웨어 | ||
| 엔지니어링"을 위해 발표된 모델이 **터미널 에이전트를 측정하는 벤치마크에서 네 모델 중 | ||
| 최하위**인데, 이것은 누가 끄집어낸 것이 아니라 Google 이 발표한 결과다. |
OSWorld-2.0 수치는 세 패스 모두에 없고, 추정하지 않고 없는 것으로 기록한다.
활용 사례
Google 은 이 순서로 세 가지를 든다 (source):
- 장기 지평 소프트웨어 엔지니어링.
- 기업 지식 노동 — 구체적으로 법률 초안 작성과 금융 리서치, 둘 다 길고 다단계인 작업으로 서술된다.
- 사이버보안 방어. 모델은 중대한 소프트웨어 취약점을 자율적으로 찾고, 검증하고, 패치한다고 서술된다.
사이버 프레이밍은 곁가지가 아니라 공개 방식을 결정한다. Fairwind Program은 그 자체의 출범 시점에 전 세계 650개 이상의 파트너를 가졌다고 서술되며 — 국가 사이버보안 당국, 핵심 인프라 운영자, 기술 기업, 보안 벤더 — 모델을 "without cyber guardrails" 받는 것은 그 코호트와 Google 내부 팀이다. 사이버 및 화학·생물·방사능·핵 공격에 대한 악용 방어는 내부 및 외부 레드팀이 테스트했다고 서술된다.
이것은 Anthropic이 오픈 웨이트 경쟁자에 대해 측정된 ExploitBench 수치를 발표한 다음 날 도착하며, 둘은 함께 AI-Enabled Cyberattacks에 기록된다: 한 랩은 경쟁자의 사이버 역량을 숫자로 발표하고, 다른 랩은 자기 사이버 역량을 가드레일을 떼고 방어자에게 출하한다.
비교
- GPT-6.1 Sol — 가격 비교는 정확히 일치하며 거의 확실히 의도적이다. Sol 은 2026-09-29에 $2/M input · $10/M output · cached $0.10/M로 출하되었고, 그 다음 날 Argon 의 도입가는 같은 세 숫자다. Argon 은 Sol 의 1.05M 대비 2M 컨텍스트와 Sol 의 128K 대비 1M 출력을 제공한다. Argon 의 요율은 $4/$20 로 두 배가 될 것이라고 서술되고 Sol 의 것은 도입가로 서술되지 않으므로, 일치는 출시 자세이고 상시 가격이 아니다.
- Astra — **FrontierSWE v2(65.5% 대 55.0%)**에서 여전히 앞서고 CWE-bench v1 에서 동점.
- Claude Opus 5.5 — Terminal-bench 4.0과 PostTrainBench에서 여전히 앞서고, DeepSWE v1.1 에서는 뒤진다(74.2% 대 77.9%).
- Gemini 4 — 이 모델이 실현한 2026년 7월 선행 학습 발표. 그 페이지는 여전히
Released: not yet으로 읽히며, 그쪽의 자체 메모를 볼 것. - Gemini 3.8 Flash 및 Gemini 3.x 라인의 나머지 — Argon 이 최상단에서 대체하는 세대.
소스
- 캡처된 스냅샷 — 사용한 세 개의 검색 질의와 어긋난 수치들을 포함
- blog.google — Gemini 4 Argon (차단, 읽지 못함)
- deepmind.google 미러 (차단, 읽지 못함; prefetch 후보 #41)
상충 보고
- Google 이 Argon 이 몇 개 벤치마크 행을 앞선다고 주장하는지 — 미해결이며, 어떤 수치도 채택하지 않는다. 세 검색 패스는 "13 of 19 rows led outright", "tops Astra and Opus 5.5 in 12 of 18 tests", 그리고 **"beats GPT-6 Astra on 14 of 19 rows and ties it on CWE-bench v1"**과 함께 **"leads 13 of 18 launch benchmarks"**를 준다. 어느 것도 표를 인용하지 않는다. 서로 다른 분모 두 개(18과 19)가 등장하는데, 이는 최소 한 패스가 다른 표를 세고 있거나 동점 행을 빠뜨리고 있음을 시사한다. 이 위키는 귀속시킬 수 있는 벤치마크별 수치를 서술하고 합계는 서술하지 않는다. 해소하려면 Google 의 페이지를 읽어야 하는데, 이 샌드박스는 거기에 도달할 수 없다 (source).