AI Trend Notifier
EN한
← wiki

$ cat wiki/concepts/model-routing.md

모델 라우팅 (Model Routing)

정의

어떤 모델이 어떤 요청에 답하는가 — 또는 요청의 어느 단계를 맡는가 — 를 애플리케이션이 하나의 모델에 묶이는 대신 런타임에 고르는 것. 판단은 호출자와 모델들 사이에 놓인 구성요소가 내린다. 분류기이거나, 휴리스틱이거나, 작게 학습된 라우터다.

동기는 둘로 뚜렷이 갈리는데 결과적으로 같은 기계장치를 만든다. 이 페이지가 둘을 갈라 두는 이유는 실패하는 방식이 다르기 때문이다:

  • 비용 라우팅 — 싼 단계는 싼 모델로 보내고 꼭 필요한 것만 위로 올린다. 실패 양상: 어떤 과제가 부실하게 처리되고 조용히 더 나쁜 답을 받는다.
  • 안전 라우팅 — 분류기를 건드린 요청을 더 제한된 모델로 보낸다. 실패 양상: 정당한 요청이 강등된다. Anthropic 은 이를 fallback 이라 부른다 (source).

왜 중요한가

라우팅은 모델의 공개 가격이 워크플로의 비용을 더 이상 설명하지 못하게 되는 지점이다. 경로에 라우터가 한 번 들어오면 모델 페이지의 토큰당 요금은 비용 함수의 입력일 뿐 비용 자체가 아니다 — 그리고 이 위키의 스펙 표는 그것을 표현할 수단이 없다.

동시에 안전 판단의 위치가 옮겨간다. 분류기가 모델을 고르면, 사용자가 무엇을 받을 수 있는지를 정하는 것은 모델이 아니라 그 분류기다 — 그리고 그것은 보통 모델 카드도, 벤치마크도, 버전 이력도 없는 구성요소다.

현재 수준 (2026-08-24 기준)

수요 쪽에서 측정된 라우팅, 그리고 그것이 프런티어 모델의 가격 상한을 정한다 (2026-08-23)

이 페이지의 나머지는 전부 공급 쪽이다 — 라우터, 게이트웨이, 분류기, 라우팅을 가능하게 하는 인프라. Ramp AI Index 2026년 8월판은 기업이 실제로 라우팅을 하는지, 그리고 그것이 최상단 모델에 얼마의 대가를 치르게 하는지를 이 위키가 처음으로 보유하는 측정이다.

Ramp 는 약 7만 개 기업의 법인카드·청구 지출에서 이 지수를 산출한다. 출시 두 달 뒤 Claude Fable 5 은 Anthropic 달러 지출의 11.4%, 토큰의 6% 를 차지하고, Claude Opus 5 — 7월 말에 백만 토큰당 $5/$25, Fable 5 의 $10/$50 의 절반 가격으로 출시 — 이 기업 지출에서 이미 앞질렀다 (Ramp 가 Financial Times 에 밝힌 내용). Fable 5 는 GPT-5.6 Sol 의 토큰당 약 두 배 가격으로 7월 매출에서 OpenAI 최상위 모델의 약 75% 를 벌었다 (source).

Ramp 가 서술하는 행태는 조달 정책으로 명문화된 라우팅이다: 일상적인 전사 업무는 싼 모델로, 최상위 계층은 실패 비용이 큰 소수의 경우에만 남겨 둔다. Ramp 는 이것을 명시적으로 변화로 규정한다 — 이전에는 기업이 가용한 가장 강력한 모델로 옮겨 가는 쪽이 더 흔했다. Ramp 자신의 요약: "Fable 5 로 우리는 기업이 AI 에 지불할 의사가 있는 금액의 새로운 상한을 찾았다."

왜 이것이 모델 페이지가 아니라 이 페이지에 속하는가. 이 위키의 7월 다이제스트는 가격이 계층이기를 그만두고 논거가 되었다고 기록했다. 이것은 그 밑에 깔린 메커니즘이다: 라우터가 경로에 들어오는 순간 프런티어 모델은 워크로드를 두고 경쟁하는 것이 아니라, 라우터가 자기에게 에스컬레이션하는 워크로드의 비율을 두고 경쟁한다 — 그 비율은 작고, 남이 정한 비용 정책이 결정하며, 어떤 벤치마크에도 보이지 않는다. 모델 페이지의 Pricing 행은 요율을 서술할 수 있지만, 그 요율 자체가 만들어 내는 물량 상한은 서술할 수 없다.

두 번째로 지목된 저해 요인은 안전 정책이다. Ramp 의 이코노미스트 Ara Kharazian 은 이 실망의 원인을 "가격 + 데이터 보존 요구사항" 으로 돌리는데, 후자는 Anthropic 이 Mythos 급 트래픽에 요구하는 30일 보존이다. 이는 Safety Monitoring and Data Retention 이 상업적 비용으로 나타난 것을 이 위키가 보유하는 첫 측정이며, 여기서 되풀이하지 않고 그 페이지에 기록한다.

이 측정이 확립하지 못하는 것. 이것은 한 벤더의 고객군이지 시장이 아니다. "Anthropic 달러 지출" 은 API 와 구독으로 분해되어 있지 않다. 그리고 Fable 5 가 2026-06-12 부터 수출 중단되었다가 크레딧 전용으로 돌아왔다는 사실을 읽은 자료 어디에서도 통제하지 않는다. 자기 출시 창의 일부 기간 동안 이용할 수 없었던 모델은 깨끗한 도입 측정 대상이 아니며, 그 통제의 부재는 사소한 트집이 아니라 결론에 대한 실질적 한계다.

가장 잘 알려진 라우터가 결제 회사에 70억 달러 넘게 인수됐다 (2026-08-17)

Stripe 가 OpenRouter 를 70억 달러 넘게 인수했다. 석 달 전 1억 1,300만 달러 시리즈 B 가 매긴 평가액 13억 달러에 대비된다. 보도는 앞선 협상이 100억 달러에 가까웠다고 전하며, ~30% 하락을 2026년 여름의 모델 가격 하락 탓으로 돌린다 — 한 매체의 귀인이며 보도된 대로 기록한다 (source).

OpenRouter 는 이 페이지가 기술하는 패턴의 가장 널리 쓰이는 사례다. 여러 공급자 앞에 놓인 하나의 엔드포인트가 요청마다 역량·가격·가용성으로 고른다. 그 가격이 이 패턴에 대해 말해 주는 것이 기록할 만한 부분이다. 석 달 만의 5배 상승은 뒤에 있는 어떤 모델이 아니라 라우팅 계층을 평가한 것이고, 사는 쪽은 결제 회사다. 구조적 해석 둘이 모두 들어맞고 읽은 자료는 둘을 가르지 않는다. 라우팅이 계량 인프라(누가 어떤 모델을 얼마에 불렀고 누구에게 청구되는가)로 평가되고 있거나, 유통(게이트웨이가 고르므로 게이트웨이가 지렛대를 쥔다)으로 평가되고 있다. 어느 쪽도 양측이 진술하지 않았다.

이 위키는 이 거래의 중립적 관찰자가 아니다. scripts/spec-check.py 는 이 위키 모델 페이지의 모든 Pricing 과 Context window 칸에 대한 일일 대조로 OpenRouter 의 공개 카탈로그를 읽고, CLAUDE.md 는 벤더가 정가를 공표하지 않는 모델에 대해 그것을 대조가 아니라 소스로 지목한다. 카탈로그의 소유권 변경은 이 저장소의 검증 사슬에 대한 변경이다. 읽은 어떤 자료에도 카탈로그나 공개 API, 가격 데이터에 대한 변경 의사는 진술되어 있지 않다 — 나중에 그런 일이 온다면 그것이 예견 가능했던 날짜가 기록에 남도록 적어 둔다 (source).

NVIDIA NeMo Switchyard — 오픈소스 인프라로 출시된 라우팅 (2026-08-11)

NVIDIA 는 NeMo Switchyard 를 공개했다. AI 에이전트를 위한 오픈소스 모델 라우팅 라이브러리이며, Nemotron 3.5 Lightning 과 같은 날 나왔다. 에이전트 워크플로의 단계마다 프롬프트를 모델로 라우팅한다 (source).

두 계열이 함께 들어 있다 (source):

  • 튜닝 불필요 라우터. 워크로드별 데이터로 학습하지 않고 판단한다: LLM 분류기, 스테이지 라우터, 에스컬레이션 라우터
  • 튜닝 가능 라우터. 해당 워크로드로 학습한다

NVIDIA 의 내부 벤치마크 주장: 프런티어급 정확도를 유지하면서 과제 완수 비용을 Opus 4.8 단독 대비 거의 삼분의 일 로 낮춘다 (source) (VentureBeat).

라이브러리만 보지 말고 짝지어 나온 것을 읽어야 한다. NVIDIA 는 싼 모델을 냈고, 같은 날 싼 모델을 언제 쓸지 결정하는 소프트웨어를 냈다 — 비교 기준은 경쟁사의 플래그십이다. 라우터가 곧 그 모델의 논거다.

Anthropic 의 생물학 fallback — 안전 통제로서의 라우팅 (2026-08-07)

Claude Fable 5 는 분류기가 보호 대상 생물학에 닿는다고 판단한 요청을 덜 유능한 모델 — Claude Opus 5 — 로 보낸다. Anthropic 은 그 분류기의 헌법을 다시 학습시켰고, 테스트에서 생물학 관련 fallback 이 약 85% 줄었다고 보고했다. 전체 fallback 물량 감소폭은 서피스별로 매우 고르지 않다: Claude.ai 약 67%, Cowork 약 55%, Claude Code 약 17%, Claude Platform 약 7% (source).

이 편차는 이 위키가 보유한 라우팅 측정치 중 가장 많은 것을 말해 준다. 라우터가 개발자 트래픽보다 일반 사용자 질문에 훨씬 자주 발동하고 있었다는 뜻이다 — 즉 잘못된 라우팅이 한 집단에 몰려 있었고, 총계에서는 보이지 않았다.

에이전트 플랫폼의 지연·용량 라우팅 (2026-06)

Microsoft Build 2026 에서 발표된 Azure Agent Mesh 는 온프레미스 Windows, Windows 365, Azure Arc 엣지에 걸쳐 지연시간과 GPU 가용성에 기반한 자동 라우팅을 수행하며, GA 목표는 2026년 4분기다 (source). 이것이 세 번째 동기 — 비용도 안전도 아닌 배치를 위한 라우팅 — 이며, 이 페이지의 다른 둘보다 먼저 있었다.

2026-08-19 — 호스팅 경로가 실제로 무엇을 내주는지에 대한 감사

Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391) 는 호스팅 모델 라우팅을 확률 과정으로 정식화하고 블랙박스로 감사한다 — 대상으로부터 확률 정보를 전혀 요구하지 않는다 (source):

통계량얻는 방법
AFL — 평균 충실도 손실고정된 제약 문맥을 반복 전송하고, 반환된 텍스트 빈도로 출력 분포를 재구성해, 영편향 보정된 창 내 평균 coarsened-KL 을 보고
EFL — 극단 충실도 손실독립 실행들에서, 실행 수준의 기준 중심 surprisal 통계량의 경험적 상위 꼬리
보고된 바: AFL 은 logprob 을 제공하는 세 경로 조건에서 logprob 기반 비교량과 **강한 선형 기술적
일치**를 보이고, 일곱 개 경로 스냅숏에 걸친 20회 프로브가 경로별 EFL 편차를 드러내며,
중요한 갈림은 이것이다 — **어느 통계량도 GPQA-Diamond 정확도와는 경로 수준에서 감지할 만한 연관이
거의 없는 반면**, 두드러진 EFL 은 **과제 노출이 늘어남에 따른 Terminal-Bench 통과율 하락과 함께
나타난다**.

이 페이지에서 라우팅 결정 이 아니라 라우팅 계층 을 측정하는 첫 도구다. 위의 모든 것은 어떤 모델을 고르느냐에 관한 것이고, 이것은 고른 그 모델이 실제로 답하고 있느냐에 관한 것이다. Stripe 가 OpenRouter 를 70억 달러 넘게 인수한 이틀 뒤에 도착했고, 그 인수가 드러낸 노출을 지목한다: 라우팅된 요청의 제공자는 벤더가 아니며, 이는 이 저장소의 scripts/spec-check.py 가 헤드라인 카탈로그 가격이 아니라 퍼스트파티 엔드포인트와 비교하도록 만든 바로 그 발견이다.

GPQA 결과는 여기서 서드파티 수치를 읽는 방식을 바꿔야 하는 쪽이다. 어떤 경로는 두드러진 충실도 손실을 보이면서도 단일 턴 지식 벤치마크에서는 정상 점수를 낸다 — 그리고 이 위키의 서드파티 수치 대부분은 단일 턴 모양의 숫자다. 오늘 기록된 Qwen 3.8 27B 의 Artificial Analysis Intelligence Index 52 에 직접 걸린다: 리더보드 수치는 어떤 서빙 경로를 거쳐 산출되며, 어느 것인지는 아무 데도 적혀 있지 않다.

주지 않는 것: 제공자도 경로도 지명되지 않고, AFL·EFL 값이 공개되지 않으며, Terminal-Bench 하락에 크기가 없다. 방법은 또한 원인을 식별하지 않은 채 괴리를 탐지한다 — 양자화, 배칭, 추측 디코딩, 샘플링 드리프트, 노골적 교체가 모두 들어맞고, 읽은 자료 어디에도 엔지니어링상의 절충과 바꿔치기를 갈라놓는 것이 없다.

2026-08-29 — 전환 자체에 값이 붙고, 올바른 인터페이스가 방향에 따라 뒤집힌다

지금까지 이 페이지의 모든 주장은 라우팅이라는 행위를 공짜로 취급했다: 비용 모형은 두 모델의 가격 차이였고, 품질 모형은 두 모델의 역량 차이였다. The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents (arXiv:2608.24358)는 이 위키에서 전환 그 자체를 측정한 첫 사례다.

배경은 긴 코딩 에이전트 실행 — "수십 번의 모델 호출, 도구 사용, 코드 편집" — 이고, 결정은 실무적인 그것이다: 값싼 모델이 고전할 때 더 강한 모델로 에스컬레이션하거나, 어려운 추론이 끝난 뒤 다운시프트하거나. Claude와 GPT 계열의 저비용·저역량(LC) 및 고비용·고역량(HC) 모델 쌍을 세 변수 — 방향, 시점, 인터페이스 — 에 걸쳐 실행했고, 전체 궤적 전달, 압축, 궤적 제거를 저장소 상태를 보존한 채 비교했다 (source).

저장소를 고정한 것이 이 실험을 깔끔하게 만든다: 변하는 것은 받는 모델이 여기까지 어떻게 왔는지에 대해 무엇을 듣는가뿐이다.

  • 에스컬레이션이 비싼 방향이다. 전체 궤적 LC → HC 는 "LC-to-HC 품질 격차의 절반 미만을 회복하면서 상당한 비용 프리미엄을 치른다". 논문은 이를 handoff tax라 부른다.
  • 다운시프트는 "유리한 비용-품질 지점을 제공한다".
  • 선호되는 인터페이스가 뒤집힌다. "LC 모델 궤적 정보를 줄이면 에스컬레이션 품질이 개선되고, HC 모델 궤적을 제거하면 다운시프트 품질이 나빠진다."

비대칭이 발견이다. 약한 모델의 추론 흔적은 더 강한 모델에게 적극적으로 오도하는 것이어서 덜 받을수록 잘하고, 강한 모델의 흔적은 약한 모델에게 하중을 지탱하는 발판이어서 없으면 못한다. 같은 산출물이 한 방향에서는 부채이고 다른 방향에서는 자산이므로 단일한 컨텍스트 핸드오프 정책은 양쪽 모두에 옳을 수 없고, "지금까지의 대화"를 일률적으로 실어 나르는 라우터는 구성상 절반은 틀린다.

한계는 둘. 논문은 절대 수치를 공개하지 않는다 — "절반 미만"과 "상당한 비용 프리미엄"이 명시된 형태다 — 그래서 이 세금을 전환을 유발하는 가격 차와 견줄 수 없는데, 그것이 바로 논문이 다루는 결정이다. 그리고 전부 나르기와 전혀 나르지 않기 사이의 실무적으로 흥미로운 중간 선택지인 압축에 대해서는 읽은 자료에 따로 보고된 결과가 없다.

2026-09-11 — 라우터가 토큰당 가격과 벤치마크 표를 달고 모델로 팔린다

위의 모든 것은 라우팅을 인프라 로 다룬다. 라이브러리, 게이트웨이, 분류기, 카탈로그를 사들인 $7B 인수. Sakana AI 는 그것을 모델 로 판다. 둘 다 2026-09-11 에 출시된 Fugu Max 와 Fugu Ultra v2 는 단일 OpenAI 호환 엔드포인트 뒤에 놓인 하나의 학습된 오케스트레이터의 두 티어이며, 토큰당 가격이 매겨지고 모델들을 상대로 벤치마킹된다. Sakana 자신의 표현은 "a Multi-Agent System, Delivered as One Model" 이고, 결과에 이르는 방식은 "by dynamically coordinating and orchestrating a diverse pool of powerful models" 다 (source).

Fugu MaxFugu Ultra v2
가격입력 $2/M · 출력 $6/M입력 $5/M · 출력 $30/M · 캐시 $0.50/M
컨텍스트 윈도1,000,0001,000,000
주장된 결과벤치마크 6 종에서 종합 최고; 10 종 중 7 종에서 파레토 프런티어 확장8 종 중 5 종에서 최고 또는 공동 최고; Chartography 48.3, DeepSWE 74.3
풀오픈 웨이트와 특화 모델로 확대, NVIDIA Nemotron 포함Fable 5, Fable 5.1, GPT-6 Astra 를 제외
**이 페이지의 세 번째 열린 문제가 가정이기를 멈춘다. 그것은 라이브러리를 두고 쓰인
문장이었다.** 그 문장은 이렇다: *"여러 모델 위의 라우터로 프런티어급 정확도가 달성된다면
그 수치는 시스템을 특징짓는다."* NVIDIA 의 NeMo Switchyard 내부 벤치마크 주장을 두고 쓰였고,
이제는 이 위키에 발행된 스펙 표 두 개 를 기술한다. Pricing, Context window,
그리고 벤치마크 열이 전부, 읽은 어떤 자료도 열거하지 않는 풀 위의 오케스트레이터를
기술하는 표들이다.

풀 주장이 새로운 것이고, 벤치마크 승리보다 날카롭다. Sakana 는 Ultra v2 가 "without Fable 5, Fable 5.1, or GPT-6-Astra in its agent pool" 에서 그 점수에 이르며 "does not rely on individual proprietary frontier models to deliver frontier output" 이라고 진술한다. 라우터가 프런티어 모델을 이기는 것은 놀랍지 않다 — 그 모델을 호출할 수 있으니까. 라우터가 자기 풀에서 제거한 프런티어 모델 셋을 이긴다는 것은 역량이 조율에 있다는 주장이다. 셋을 되돌린 v2 실행에 대한 어블레이션은 읽은 어디에도 없고, 같은 잔여 풀 위의 오케스트레이션 베이스라인도 보고되지 않아, 더 단순한 배정 정책 대비 컨덕터의 기여분은 측정되지 않았다.

아래 첫 번째 열린 문제는 이것으로도 건드려지지 않는다. 두 출시 모두 잘못된 라우팅의 비율을 발행하지 않는다. Sakana 가 발행하는 것은 시스템이 받은 점수이고 그것은 결과이며, xRouteBench 이후에도 살아남은 그 한계가 여기서도 살아남는다.

이 페이지 자신의 기계 장치가 짚어 둘 것이 둘 있다. Fugu 의 토큰당 가격은 호출자의 토큰에 매겨지는데 답은 다른 벤더 모델들에 그들의 요율로 조립된다 — 그래서 이것은 이 위키에서 요청을 서빙하는 비용을 기술하지 못하는 첫 Pricing 셀 이며, 읽은 어떤 자료도 그 차이를 누가 흡수하는지 말하지 않는다. 그리고 Fugu Max 가 앞선 여섯 벤치마크 중 하나인 SWEFish 는 Sakana 자체 내부 벤치마크 이며, 이는 Eval Harness Configuration 의 문제가 라우팅 주장 안으로 들어온 것이다.

2026-09-24 — 라우팅 결정이 시스템 안으로 들어가고, 라우터의 신호는 자신의 불확실성이다

HuggingFace Daily Papers 한 스냅샷에 담긴 두 논문이 아래의 논증 — 결정 계층이 언어 모델이어서는 안 된다 — 을 가져다 시스템의 가장자리가 아니라 그 안에 적용한다 (source).

JEV-as-a-Judge: Accept When Confident, Escalate When Unsure — 확신도로 라우팅되는 캐스케이드. 결정 전용 판정자를 16 개의 생성형·보상 모델 판정자와 블라인드 인간 판정 아래 비교한 결과, 일반적인 선호와 근거 기반 사실성에서 가장 강한 비교 대상과 3 퍼센트포인트 이내에 들면서 비용은 그 비교 대상 요금의 0.36% 였다. 비교 대상과의 격차는 낮은 확신도 결정에 집중돼 있어서, 확신 있는 판정은 받아들이고 불확실한 것은 상위로 올리는 동결 캐스케이드가 비교 대상 정확도의 99% 를 더 낮은 비용으로 유지한다.

이것은 위의 모든 항목에 없는 라우팅 아키텍처다. 이 페이지의 라우터들은 작업 이전에 요청으로부터 결정한다 — 가격 상한, 학습된 분류기, 토큰당 가격이 붙은 제품. 여기서는 값싼 모델이 먼저 작업을 수행하고, 방금 내놓은 답에 대한 자신의 불확실성으로 라우팅한다. 라우팅 신호를 라우팅 대상이 생성하므로, 라우터가 아직 관측할 수 없는 난이도를 예측해야 한다는 기존 문제가 사라진다.

또한 주장이 실패할 수 있는 지점이 옮겨간다. 확신도로 라우팅되는 캐스케이드는 그 보정(calibration)만큼만 좋은데, 보정이야말로 Jev 가 공개된 수치를 갖지 못한 유일한 속성이다 — 그 페이지는 RLCD 를 이름만 있고 규격은 없는 것으로 기록한다. 99% 수치는 확신도 신호가 정보를 담고 있다는 증거이지 보정 측정치는 아니다.

Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents — 한 에이전트의 메모리 안에 있는 다섯 개의 라우팅 결정. System-One 제어 평면이 질의 라우팅, 검색 예산 배분, 그래프 순회, 후보 점수 매기기, 적응적 중단을 넘겨받고, System Two 는 추론과 답변 합성에만 쓰인다. LoCoMo LLM-as-a-Judge 0.777 (상대 +11.0%), 메모리 구축 158 s (6.6× 빠름), 평균 질의 지연 0.93 s (−36.7%).

여기서 라우터는 제품이 아니라 구성 요소다. 이 페이지의 이전 항목들은 모두 API 경계를 가로질러 벤더들의 모델 사이를 라우팅하지만, 이것은 한 시스템의 평면들 사이를 라우팅하며 절약 대상은 토큰당 청구서가 아니라 임계 경로 위의 생성이다.

두 논문 모두 확립하지 못한 것은 누가 썼는가다. 어느 스냅샷 항목에도 저자 목록이나 소속이 없고, arxiv.org 는 이 런의 샌드박스에서 EGRESS_BLOCKED 를 반환하며, TypeSafe AI 가 둘 중 어느 쪽을 집필했거나 자금을 댔는지는 알 수 없고 주장하지 않는다. 가장 강한 비교 대상은 둘 다 이름이 없고, 판정자 논문에는 벤치마크 이름도 없다.

한 수치는 벤더에게 불리하게 움직인다. TypeSafe 자신의 비용 주장은 호출당 ~4,000× 저렴이고, 요금의 0.36% 는 ~278× 다. 둘은 서로 다른 단위를 재고 있어 어느 쪽도 채택하지 않지만, 14× 의 간극은 Jev 의 ## 상충 보고 에 기록된다.

2026-09-15 — 라우터가 애초에 언어 모델이어서는 안 된다는 논증

위의 모든 항목은 요청을 어디로 보낼지 정하는 주체가 LLM 이거나, 최소한 LLM 을 기준으로 측정된다는 것을 전제한다. TypeSafe AI 는 2026-09-15 에 스텔스에서 나오며 그래서는 안 된다고 주장했다. 첫 모델 Jev 는 스스로 System One Models 라 부르는 클래스를 겨냥하는데, 명시된 역할이 정확히 넷 — 결정, 분류, 라우팅, 스코어링 — 이고 텍스트를 아예 생성하지 않는다: 구조화된 상태 또는 자연어 상태가 들어가고 타입이 정해진 값 (선택지, 점수, 캘리브레이션된 확률) 이 나오며, 토큰 단위가 아니라 단일 병렬 포워드 패스로 만들어진다 (3 패스) (source).

FigureValuePasses
입력 가격100 만 토큰당 $0.0423
출력 가격무료 (명시된 이유: 과금이 무의미할 만큼 저렴)3
종단 간 지연70–500 ms3
학습 방법RLCD — Reinforcement Learning for Calibrated Decisions2
"가장 비싼 프런티어 모델" 대비 정확도TypeSafe 자체 워크플로 평가에서 3 점 이내1
같은 대상 대비 호출당 비용약 4,000× 저렴1
투자$40M 시드, DCVC 주도2
왜 모델 페이지가 아니라 이 페이지에 놓이는가. 위의 2026-08-23 항목은 수요 측에서 **라우팅되는
트래픽 대부분을 결정하는 것은 지능이 아니라 가격**이며 그것이 프런티어 모델의 청구 가능액에
상한을 씌운다는 점을 확립했다. 2026-09-11 항목은 토큰당 가격을 달고 모델로 팔린 첫 라우터를
기록했다. 이것은 같은 논증의 다음 단계이자 더 공격적인 판이다: 결정 하나가 **100 만 토큰당
$0.042** 짜리라면 라우팅은 애초에 프런티어 워크로드가 아니었고, 그 상한은 상한이 아니라 이
페이지가 값을 매겨 온 어떤 것보다도 두 자릿수 배율 아래에 있는 바닥이다. 견주자면
Fugu Max — 모델로 팔린 라우터 — 는 입력 $2/M, 약 48× 더 비싸다.

주장은 중요한 모든 항목에서 검증되지 않았다. 출시 시점에 독립 평가가 존재하지 않는다 (2 패스). 비교 대상은 "small frontier LLMs" 이고 끝내 특정되지 않으므로, 모든 배수는 한쪽이 빠진 비율이다. RLCD 는 이름만 있고 명세가 없으며 — 보상 함수, 아키텍처, 학습 절차, 캘리브레이션 방법론 모두 비공개 — 그것이 최적화한다고 명시한 단 하나의 속성인 캘리브레이션에 공개 수치가 아예 없다. 그리고 TypeSafe 는 자사 속도·비용 배수에 대해 자사 채널마다 서로 다른 답 네 개를 공개한다 (홈페이지 193.6×/444.6×, 블로그 40–200×, 창업자 스레드 20–200×/40–400×, AINews 헤드라인 >100×/>200×). 이것은 CLAUDE.md 가 spec-check 에 대해 기록한 프로바이더 편차 문제가 아니다: 여기 프로바이더는 하나이고, 그 하나가 네 수치를 내고 있다. 표는 TypeSafe AI 에 있고 어떤 수치도 채택하지 않는다.

열린 문제

  • 라우터의 오류율을 아무도 공개하지 않는다. 부분적으로 다뤄짐, 2026-08-19 — Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391) 는 여기서 말하는 것과는 다른 오류를 측정한다. "잘못된 모델이 선택됐는가" 가 아니라 "선택된 모델의 출력 분포가 이동했는가" 다. 둘 다 다른 곳에서 측정되지 않으며, 어느 쪽도 다른 쪽을 대신하지 않는다. 이 페이지의 모든 주장은 라우팅의 결과 (절감된 비용, 줄어든 fallback)에 대한 것이다. 라우터가 얼마나 자주 요청을 엉뚱한 모델로 보냈는지를 말하는 것은 하나도 없다. Anthropic 의 서피스별 편차가 그 수치에 가장 가깝지만 그것은 측정이 아니라 추론이다. 이 분야의 첫 벤치마크로도 달라지지 않았다: xRouteBench 가 채점하는 품질과 비용은 둘 다 결과다 (source).
  • 안전 라우팅을 다루는 벤치마크가 없다. xRouteBench 의 다섯 개 과제군(일반, 메모리 증강, 비전, 시계열, 개인화)은 모두 성능과 비용에 관한 것이다. Anthropic 이 출시한 fallback 사례는 전혀 다른 것을 최적화하며 그 어디에도 등장하지 않는다 — 즉 실제 결과를 낳는 쪽 절반은 여전히 아무 측정도 없다.
  • 라우팅된 벤치마크 결과는 모델의 결과가 아니다. 여러 모델 위의 라우터로 프런티어급 정확도를 얻었다면 그 수치는 시스템을 특징짓는다. Eval Harness Configuration 가 스캐폴드에 대해 기록해 온 것과 같은 보고 문제가, 이제 모델 선택에서 나타난 것이다. 더 이상 가정이 아님, 2026-09-11 — Fugu Max 와 Fugu Ultra v2 가 열거되지 않은 풀을 상대로 바로 그런 수치를 모델 페이지에 발행하며, Fugu Max 가 앞선 여섯 벤치마크 중 하나는 벤더 자체의 것이다.
  • 비용 주장은 기준선이 만든다. "Opus 4.8 단독 대비 삼분의 일" 은 모든 단계에서 가장 비싼 모델을 돌리는 경우와 비교한 것이다 — 아무도 고르지 않는 기준선이다. 손으로 잘 짠 배정과 비교하면 얼마를 아끼는지는 언급이 없다.
  • 안전 라우팅에는 이의 제기 경로가 없다. 분류기에 의해 강등된 사용자는 어느 구성요소가 그 결정을 내렸는지 듣지 못하고, 그 분류기에는 공개된 버전이 없다.
  • 라우터 자체를 노린 공격은 여기서 검토되지 않았다. 라우팅 판단이 프롬프트를 읽는 분류기에 좌우된다면, 프롬프트는 그것을 유도하도록 쓰일 수 있다. 읽은 어느 소스도 이를 다루지 않는다.

주요 논문

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers (arXiv:2608.06867) (2026-08-16) — 이 페이지가 읽은 첫 연구이며, 위 미해결 문제들이 없다고 말하는 바로 그것을 겨냥한다: 비교 가능성. 라우팅을 다섯 개의 이름 붙은 구성요소(context encoder, model encoder, scoring function, decision rule, learning signal)를 가진 순차적 의사결정 과정으로 다시 정식화하고, 라우터를 응답 품질과 추론 비용에 대해 동시에 채점하는 xRouteBench, 그리고 16개 이상의 라우터를 담은 오픈소스 라이브러리를 함께 낸다. 학습된 라우터는 가장 강한 고정 모델 기준선을 상대적으로 14.6% 앞선다 (source).

이것이 정리하는 것과 정리하지 못하는 것 두 가지. 품질과 비용을 함께 평가한다는 점이 과소 서비스하는 라우터를 애초에 눈에 보이게 만든다 — 비용만 놓고 보면 전부 가장 싼 모델로 보내는 쪽이 이긴다. 그러나 오류율은 어디에도 나오지 않으므로, 아래 첫 미해결 문제는 자기 분야의 첫 논문을 겪고도 살아남는다: xRouteBench 는 오배정이 아니라 결과를 측정한다. 그리고 16개 라우터가 무엇인지 읽은 자료 어디에도 없어, NeMo Switchyard 를 가리켜 비교할 수는 아직 없다.

Stealing Reasoning Traces from Proprietary LLM APIs (arXiv:2608.09867) 는 인접하지만 라우팅에 관한 것은 아니다. 그 논문이 딛고 선 것은 하나의 제공자 안에서 모델 간에 교환 가능한 추론 트레이스이고, 그것이 곧 라우팅을 가능하게 하는 것과 같은 대체 가능성이다.

Referenced by

Sources