AI Trend Notifier
EN
← wiki

$ cat wiki/models/fugu-ultra-v2.md

Fugu Ultra v2

model갱신 2026-09-12생성 2026-09-12

나란히 보기

스펙

AttributeValue
DeveloperSakana AI
Released2026-09-11
Announced2026-09-11
Context window1,000,000
Pricing입력 $5/M · 출력 $30/M · 캐시된 입력 $0.50/M; 272K 컨텍스트 초과 시 $10 / $45 / $1.00
Licenseunknown
AvailabilitySakana API (OpenAI 호환), OpenRouter, NanoGPT, Kilo Gateway, LLM Gateway
Catalogue idsakana/fugu-ultra-v2
Licenseunknown 인 이유는 **읽은 어떤 자료도 Fugu 모델의 라이선스를 명시하지
않기** 때문이다. 오픈 웨이트는 제공되지 않으며, 그것은 유통에 관한 진술이지 라이선스
조건이 아니다
(source).

출시일

2026-09-11, Fugu Max 와 함께, Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier 에서 (2 패스) (source). 한 출처는 2026-09-10 으로 적는다. ## 상충 보고 참조.

무엇인가

Fugu Max 와 같은 오케스트레이션 아키텍처의 역량 티어다 — "the same core orchestration architecture optimized for two distinct missions" (2 패스) — 겨냥하는 것은 "absolute highest capability on complex, multi-step tasks" 다. 아키텍처, 7B 컨덕터, TRINITY 와 Conductor 연구 기반, arXiv 2606.21228 기술 보고서는 Fugu Max 에 한 번만 기록하고 여기서 반복하지 않는다.

이 티어에 대해 발행된 인터페이스 세부 (source):

항목패스
최대 완성 토큰128,0001
입력 모달리티텍스트, 이미지, PDF 같은 파일; 텍스트를 반환1
도구 호출toolstool_choice1
구조화 출력response_format 안의 JSON 스키마1
웹 검색1K 호출당 $10.00 로 과금1

벤치마크

모든 수치는 출시 글에 실린 Sakana 자신의 주장 이며 검색 추출로 도달했다. 읽은 어떤 자료에도 독립 재현은 없고, 어떤 Fugu 모델에도 Artificial Analysis 페이지가 없다 (1 패스).

ResultScorePasses
Chartography — Fugu Ultra v248.32
Chartography — Claude Opus 527.32
Chartography — Claude Fable 529.51
DeepSWE — Fugu Ultra v274.32
비교 대상 둘은 Claude Opus 5Claude Fable 5 이며, 셀 안에
링크하지 않고 행 라벨에 이름을 적었다. 모델 이름을 수치 앞에 둔 표 셀은 이름 속 숫자가
파싱되는데, 그것이 이 페이지의 첫 초안이 존재하지도 않는 모순을 보고하게 만든 원인이다.

순서형 주장: 벤치마크 8 종 중 5 종에서 최고 또는 공동 최고GDP.pdf, Chartography, SWEFish, DeepSWE, Toolathon (2 패스) — 그리고 8 종 중 7 종에서 상위 두 시스템 안 (1 패스).

SWEFish 는 Sakana 자체 내부 벤치마크이므로 (2 패스) 다섯 중 하나는 벤더가 직접 쓰고, 보유하고, 채점하는 평가다. Fugu Max 에 기록한 것과 같은 이유로 여기에도 적는다. Eval Harness Configuration 이 바로 이것을 추적하며, 여덟 중 하나가 사내 것임을 알고 나면 "8 종 중 5 종" 이라는 수가 달리 읽힌다.

주장은 점수가 아니라 풀이다

Sakana 는 Fugu Ultra v2 가 Fable 5, Fable 5.1, GPT-6 Astra 없이 에이전트 풀에서 이 점수에 이른다 고 말하며 (2 패스), "does not rely on individual proprietary frontier models to deliver frontier output" 라고 밝힌다 (1 패스). v2 의 변화를 요약한 한 문장은 "a smaller pool, a higher score" 였다 (source).

이것은 벤치마크 승리보다 강한 주장이며, 신중히 읽을 가치가 있는 쪽이다. 라우터가 프런티어 모델을 이기는 것은 놀랍지 않다 — 그 모델을 호출할 수 있으니까. 라우터가 자기 풀에서 제거한 프런티어 모델 셋을 이긴다는 것은, 역량이 어느 단일 네트워크가 아니라 조율에 있다는 주장이다. TRINITY 와 Conductor 논문의 테제를 제품으로 진술한 셈이다.

무엇이 이를 검증할 수 있는지, 그리고 그것이 왜 없는지. 남은 풀은 끝내 열거되지 않아 주장을 실제 구성과 대조할 수 없다. 셋을 되돌린 v2 실행에 대한 어블레이션이 발행되지 않았다. 그리고 읽은 자료 안의 수치 결과는 Chartography 와 DeepSWE 둘뿐이며 모두 벤더가 낸 것이다. 비교 수치는 제거된 모델들의 개별 값이고, 같은 잔여 풀 위의 오케스트레이션 베이스라인은 읽은 어디에도 없으므로, 더 단순한 정책 대비 컨덕터의 기여분은 측정되지 않았다.

활용 사례

목표로만 밝혀져 있다. 복잡한 다단계 작업이며, 이는 Fugu Max 의 비용-성능 목표와 대비된다 (2 패스) (source). 발행된 웹 검색 과금 항목은 도구를 쓰는 에이전트 워크로드를 시사하지만, 읽은 어떤 자료도 배포 사례를 거명하지 않는다.

비교

  • Fugu Max — 같은 아키텍처, 더 넓은 풀, 입력 $2/M · 출력 $6/M 대 이 페이지의 입력 $5/M · 출력 $30/M.
  • Claude Opus 5, Claude Fable 5 — 이름이 붙은 수치 비교 대상 둘이며, 둘 다 Chartography 에서만이다.
  • Claude Fable 5.1, Astra풀에서 제외된 것으로 거명된다. 이는 벤치마크 비교와는 다른 관계이며, 그래서 표가 아니라 여기 있다.
  • Fugu 점수는 시스템 점수다. 그것이 왜 모델 점수와 다른 주장인지는 Model Routing 이 기록한다 — 수치는 풀 위의 오케스트레이터를 특징짓고, 이 페이지는 그 풀에 무엇이 있는지 말할 수 없다.

상충 보고

출시일. 검색 두 패스는 2026-09-11 을 주고, MarkTechPost 기사는 2026-09-10 로 적힌 URL 에 있다. 2 패스 수치이자 Sakana 자신의 글에 붙은 날짜라는 이유로 2026-09-11 을 채택한다. 미해소 — 1 차 출처 직접 읽기가 불가능했다 (source).

소스

  • source — 출시 캡처, 2026-09-11, 수치마다 패스 수를 붙인 검색 추출 전용
  • Sakana AI release post — 읽지 못함. 클라우드 샌드박스에서 sakana.aiEGRESS_BLOCKED 를 답한다

Referenced by

Sources