$ cat wiki/models/fugu-max.md
Fugu Max
나란히 보기
- DeepSeek V4.1-Flash
- GPT-Image-2.5 Flare
- K2 Horizon
- Gemini 3.8 Flash
- Muse Spark 1.3
- Claude Fable 5.1
- Hy4 preview
- GLM-5.3-Flash
- Granite 4.2
- Grok 4.6
- Laguna S 2.1
- Kimi K3
- Inkling
- LongCat-2.0
- MiniMax M3
- Fugu Ultra v2
- GPT-Image-2.5 Sunburst
- Astra
- GLM-5.3
- Qwen 3.8 27B
- DeepSeek V4-Pro-0813
- Gemini 3.7 Flash
- Muse Glimmer
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Claude Opus 5
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- GPT-5.6 Sol
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Claude Fable 5
- Claude Opus 4.8
- Gemini 3.5 Flash
- Grok Build
- Claude Opus 4.7
- Muse Spark
스펙
| Attribute | Value |
|---|---|
| Developer | Sakana AI |
| Released | 2026-09-11 |
| Announced | 2026-09-11 |
| Context window | 1,000,000 |
| Pricing | 입력 $2/M · 출력 $6/M |
| License | unknown |
| Availability | Sakana API (OpenAI 호환), OpenRouter, NanoGPT, Kilo Gateway, LLM Gateway |
| Catalogue id | sakana/fugu-max |
License 가 proprietary 가 아니라 unknown 인 이유는 **읽은 어떤 자료도 Fugu | |
| 모델의 라이선스를 명시하지 않기** 때문이다. 명시된 것은 오픈 웨이트가 제공되지 않는다는 | |
| 사실뿐이며 — 제품은 엔드포인트다 — "가중치 없음" 은 라이선스 조건과 같은 진술이 아니다 | |
| (source). |
Catalogue id 행이 있는 이유는 매일 도는 spec-check Action 이 항목을 찾을 수 있도록
하기 위해서다. 슬러그 fugu-max 로는 벤더 네임스페이스 아래에 있는 카탈로그 경로에
닿지 않는다. 두 id 모두 검색 결과로 돌아온 카탈로그 URL 에서 그대로 옮겼고, 만들어낸
것이 아니다.
출시일
2026-09-11, Fugu Ultra v2 와 함께, Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier 라는 제목의 글에서 (2 패스) (source).
한 출처는 2026-09-10 로 적는다 — MarkTechPost 기사의 URL 경로다. 해소하지 않고
아래 ## 상충 보고 에 기록한다.
무엇인가 — 파라미터가 다른 랩의 것인 모델
Fugu Max 는 단일 학습 네트워크가 아니다. 학습된 멀티에이전트 오케스트레이터다. 각 작업을 다른 모델들의 풀에 넘기고 답을 하나의 응답으로 다시 꿰매는 라우터이며, 단일 OpenAI 호환 엔드포인트 뒤에서 서빙된다. Sakana 의 표현은 "a Multi-Agent System, Delivered as One Model" 이고, 결과에 이르는 방식은 "by dynamically coordinating and orchestrating a diverse pool of powerful models" 다 (2 패스) (source).
| 항목 | 값 | 패스 |
|---|---|---|
| 컨덕터 | 어떤 모델을 활성화할지, 에이전트들이 어떻게 소통할지, 결과를 어떻게 합칠지를 학습한 7B 파라미터 모델 | 1 |
| 연구 기반 | ICLR 2026 논문 두 편, TRINITY 와 Conductor | 2 |
| TRINITY | 여러 턴에 걸쳐 Thinker, Worker, Verifier 역할을 배정하는 진화된 코디네이터 | 1 |
| Conductor | 자연어 조율 전략과 프롬프트를 발견하도록 강화학습 으로 훈련 | 2 |
| 자기 호출 | 라우터가 자기 자신의 인스턴스를 재귀적으로 호출 할 수 있다 | 1 |
| 기술 보고서 | arXiv 2606.21228 | 2 |
| Max 를 Fugu Ultra v2 와 가르는 것은 풀과 목표이지 아키텍처가 아니다. | ||
| Sakana 는 둘을 *"the same core orchestration architecture optimized for two distinct | ||
| missions"* 로 기술한다 (2 패스). Max 는 풀을 다음과 같이 넓힌다. | ||
| "an unprecedented number of open-weights and specialized models, including NVIDIA Nemotron family through our collaboration with NVIDIA" | ||
| (2 패스) — Nemotron 3.5 Lightning 와 NVIDIA 참조. |
읽은 어떤 자료도 풀을 열거하지 않는다. 범주로, 그리고 이름이 붙은 계열 하나로만 기술된다. 열거되지 않은 풀이 만든 벤치마크 점수는 그 구성 요소 어느 것에도 귀속될 수 없다.
벤치마크
아래 수치는 모두 출시 글에 실린 Sakana 자신의 주장 이며, 검색 추출로 도달했다. 읽은 어떤 자료에도 독립 재현은 없고, 어떤 Fugu 모델에도 Artificial Analysis 페이지가 없다 (1 패스) (source).
| 주장 | 값 | 패스 |
|---|---|---|
| 종합 최고 점수 | 벤치마크 6 종 — Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench, SWEFish | 2 |
| 비용-성능 파레토 프런티어 | 벤치마크 10 종 중 7 종에서 확장 | 2 |
| SWEFish 는 Sakana 자체 벤치마크다. 출시 글은 이를 *"our internal benchmark | ||
| reflecting Sakana AI's own coding challenges and use-cases"* 로 기술한다 (2 패스). | ||
| 따라서 "종합 최고" 여섯 건 중 하나는 벤더가 직접 쓰고, 보유하고, 채점하는 평가 위의 | ||
| 결과다. 여기 기록하는 이유는 Eval Harness Configuration 이 바로 이것을 | ||
| 추적하는 페이지이기 때문이고, 여섯 중 하나가 사내 것임을 알고 나면 그 "여섯" 이라는 | ||
| 숫자가 달리 읽히기 때문이다. |
읽은 어떤 자료도 Fugu Max 의 벤치마크별 점수를 발행하지 않는다 — 주장은 순서형 ("종합 최고", "프런티어를 확장") 이지 수치가 아니다. Fugu Ultra v2 에는 이름 붙은 점수가 둘 있고, Max 에는 없다.
가격
입력 $2/M 토큰 · 출력 $6/M 토큰 (2 패스). Sakana 의 비교 주장: 출력 가격이 Sonnet 5, GPT 5.6 Terra, Kimi K3 보다 40–60% 낮다 (2 패스).
GPT 5.6 Terra 는 이 위키에 페이지가 없고, 출시 글이 부르는 그대로 링크 없이 여기 적는다. 이 위키가 보유한 것은 GPT-5.6 Sol (and Terra, Luna) 과 GPT-5.6-Cyber 이며, 읽은 어떤 자료도 Terra 를 둘 중 하나와 연결하지 않는다.
발행된 요율은 호출자가 내는 값이지 요청이 치르는 비용이 아니다. Fugu Max 의 답은 다른 벤더 모델들에 대한 호출로 조립되고 그 벤더들의 요율이 붙는데, 읽은 어떤 자료도 요청을 분해하지 않고, 한 요청이 하위 호출을 몇 번 하는지 밝히지 않으며, 두 수치의 차이를 누가 흡수하는지 말하지 않는다. 이것은 Model Routing 이 스스로의 말로 지목한 간극 — "the published price of a model stops describing what a workflow costs" — 이 모델 페이지의 발행 가격으로 처음 도착한 것이다.
활용 사례
Sakana 는 작업 목록이 아니라 목표로만 밝힌다. Max 가 답하는 질문은 "What is the best possible output we can deliver at the lowest possible cost?" 이고, 이는 복잡한 다단계 작업을 겨냥하는 Ultra v2 와 대비된다 (1 패스) (source).
밝힌 테제는 오픈 모델에 관한 것이다. "Open models become dramatically more useful when orchestrated together rather than used in isolation", 그리고 Max 는 다음과 같다. "a bet that the Pareto frontier of the future will be built out of many open, specialized models working in concert" (1 패스). 이는 Open-Weights Policy Fight 에 대한 입장을 제품 티어로 표현한 것이다.
비교
- Fugu Ultra v2 — 같은 아키텍처의 역량 티어, 입력 $5/M · 출력 $30/M 대 Max 의 입력 $2/M · 출력 $6/M. 같은 아키텍처, 같은 컨텍스트 윈도, 다른 풀과 다른 가격.
- Nemotron 3.5 Lightning — NVIDIA 의 NeMo Switchyard 라우터와 같은 날 출시됐다. NVIDIA 는 값싼 모델과 언제 값싼 모델을 쓸지 정하는 소프트웨어를 두 개의 제품 으로 냈고, Sakana 는 그 정하는 일 자체를 제품으로 팔면서 Nemotron 을 그 안에 넣는다. 이 비교는 Model Routing 에 기록돼 있다.
- Claude Sonnet 5, Kimi K3 — 이름이 거명된 가격 비교 대상 중 여기 페이지가 있는 둘.
- Fugu 가 오케스트레이션하는 모델들은 비교 대상이 아니다. Fugu 점수는 시스템 점수이며, 그것이 왜 다른 주장인지는 Model Routing 이 기록한다.
상충 보고
출시일. 검색 두 패스가 2026-09-11 을 주고, 그중 하나는 그것을 캡처 당일 날짜로 명시한다. 출시를 다룬 MarkTechPost 기사는 2026-09-10 로 적힌 URL 에 있다. 2 패스 수치이자 Sakana 자신의 글에 붙은 날짜라는 이유로 2026-09-11 을 채택한다. 미해소 — 1 차 출처 직접 읽기가 불가능했다 (source).
소스
- source — 출시 캡처, 2026-09-11, 수치마다 패스 수를 붙인 검색 추출 전용
- Sakana AI release post — 읽지 못함.
클라우드 샌드박스에서
sakana.ai는EGRESS_BLOCKED를 답한다