$ cat wiki/models/fugu-ultra-v2.md
Fugu Ultra v2
나란히 보기
스펙
| Attribute | Value |
|---|---|
| Developer | Sakana AI |
| Released | 2026-09-11 |
| Announced | 2026-09-11 |
| Context window | 1,000,000 |
| Pricing | 입력 $5/M · 출력 $30/M · 캐시된 입력 $0.50/M; 272K 컨텍스트 초과 시 $10 / $45 / $1.00 |
| License | unknown |
| Availability | Sakana API (OpenAI 호환), OpenRouter, NanoGPT, Kilo Gateway, LLM Gateway |
| Catalogue id | sakana/fugu-ultra-v2 |
License 가 unknown 인 이유는 **읽은 어떤 자료도 Fugu 모델의 라이선스를 명시하지 | |
| 않기** 때문이다. 오픈 웨이트는 제공되지 않으며, 그것은 유통에 관한 진술이지 라이선스 | |
| 조건이 아니다 | |
| (source). |
무엇인가
Fugu Max 와 같은 오케스트레이션 아키텍처의 역량 티어다 — "the same core orchestration architecture optimized for two distinct missions" (2 패스) — 겨냥하는 것은 "absolute highest capability on complex, multi-step tasks" 다. 아키텍처, 7B 컨덕터, TRINITY 와 Conductor 연구 기반, arXiv 2606.21228 기술 보고서는 Fugu Max 에 한 번만 기록하고 여기서 반복하지 않는다.
이 티어에 대해 발행된 인터페이스 세부 (source):
| 항목 | 값 | 패스 |
|---|---|---|
| 최대 완성 토큰 | 128,000 | 1 |
| 입력 모달리티 | 텍스트, 이미지, PDF 같은 파일; 텍스트를 반환 | 1 |
| 도구 호출 | tools 와 tool_choice | 1 |
| 구조화 출력 | response_format 안의 JSON 스키마 | 1 |
| 웹 검색 | 1K 호출당 $10.00 로 과금 | 1 |
벤치마크
모든 수치는 출시 글에 실린 Sakana 자신의 주장 이며 검색 추출로 도달했다. 읽은 어떤 자료에도 독립 재현은 없고, 어떤 Fugu 모델에도 Artificial Analysis 페이지가 없다 (1 패스).
| Result | Score | Passes |
|---|---|---|
| Chartography — Fugu Ultra v2 | 48.3 | 2 |
| Chartography — Claude Opus 5 | 27.3 | 2 |
| Chartography — Claude Fable 5 | 29.5 | 1 |
| DeepSWE — Fugu Ultra v2 | 74.3 | 2 |
| 비교 대상 둘은 Claude Opus 5 와 Claude Fable 5 이며, 셀 안에 | ||
| 링크하지 않고 행 라벨에 이름을 적었다. 모델 이름을 수치 앞에 둔 표 셀은 이름 속 숫자가 | ||
| 파싱되는데, 그것이 이 페이지의 첫 초안이 존재하지도 않는 모순을 보고하게 만든 원인이다. |
순서형 주장: 벤치마크 8 종 중 5 종에서 최고 또는 공동 최고 — GDP.pdf, Chartography, SWEFish, DeepSWE, Toolathon (2 패스) — 그리고 8 종 중 7 종에서 상위 두 시스템 안 (1 패스).
SWEFish 는 Sakana 자체 내부 벤치마크이므로 (2 패스) 다섯 중 하나는 벤더가 직접 쓰고, 보유하고, 채점하는 평가다. Fugu Max 에 기록한 것과 같은 이유로 여기에도 적는다. Eval Harness Configuration 이 바로 이것을 추적하며, 여덟 중 하나가 사내 것임을 알고 나면 "8 종 중 5 종" 이라는 수가 달리 읽힌다.
주장은 점수가 아니라 풀이다
Sakana 는 Fugu Ultra v2 가 Fable 5, Fable 5.1, GPT-6 Astra 없이 에이전트 풀에서 이 점수에 이른다 고 말하며 (2 패스), "does not rely on individual proprietary frontier models to deliver frontier output" 라고 밝힌다 (1 패스). v2 의 변화를 요약한 한 문장은 "a smaller pool, a higher score" 였다 (source).
이것은 벤치마크 승리보다 강한 주장이며, 신중히 읽을 가치가 있는 쪽이다. 라우터가 프런티어 모델을 이기는 것은 놀랍지 않다 — 그 모델을 호출할 수 있으니까. 라우터가 자기 풀에서 제거한 프런티어 모델 셋을 이긴다는 것은, 역량이 어느 단일 네트워크가 아니라 조율에 있다는 주장이다. TRINITY 와 Conductor 논문의 테제를 제품으로 진술한 셈이다.
무엇이 이를 검증할 수 있는지, 그리고 그것이 왜 없는지. 남은 풀은 끝내 열거되지 않아 주장을 실제 구성과 대조할 수 없다. 셋을 되돌린 v2 실행에 대한 어블레이션이 발행되지 않았다. 그리고 읽은 자료 안의 수치 결과는 Chartography 와 DeepSWE 둘뿐이며 모두 벤더가 낸 것이다. 비교 수치는 제거된 모델들의 개별 값이고, 같은 잔여 풀 위의 오케스트레이션 베이스라인은 읽은 어디에도 없으므로, 더 단순한 정책 대비 컨덕터의 기여분은 측정되지 않았다.
비교
- Fugu Max — 같은 아키텍처, 더 넓은 풀, 입력 $2/M · 출력 $6/M 대 이 페이지의 입력 $5/M · 출력 $30/M.
- Claude Opus 5, Claude Fable 5 — 이름이 붙은 수치 비교 대상 둘이며, 둘 다 Chartography 에서만이다.
- Claude Fable 5.1, Astra — 풀에서 제외된 것으로 거명된다. 이는 벤치마크 비교와는 다른 관계이며, 그래서 표가 아니라 여기 있다.
- Fugu 점수는 시스템 점수다. 그것이 왜 모델 점수와 다른 주장인지는 Model Routing 이 기록한다 — 수치는 풀 위의 오케스트레이터를 특징짓고, 이 페이지는 그 풀에 무엇이 있는지 말할 수 없다.
상충 보고
출시일. 검색 두 패스는 2026-09-11 을 주고, MarkTechPost 기사는 2026-09-10 로 적힌 URL 에 있다. 2 패스 수치이자 Sakana 자신의 글에 붙은 날짜라는 이유로 2026-09-11 을 채택한다. 미해소 — 1 차 출처 직접 읽기가 불가능했다 (source).
소스
- source — 출시 캡처, 2026-09-11, 수치마다 패스 수를 붙인 검색 추출 전용
- Sakana AI release post — 읽지 못함.
클라우드 샌드박스에서
sakana.ai는EGRESS_BLOCKED를 답한다