$ cat wiki/concepts/model-routing.md
모델 라우팅 (Model Routing)
정의
어떤 모델이 어떤 요청에 답하는가 — 또는 요청의 어느 단계를 맡는가 — 를 애플리케이션이 하나의 모델에 묶이는 대신 런타임에 고르는 것. 판단은 호출자와 모델들 사이에 놓인 구성요소가 내린다. 분류기이거나, 휴리스틱이거나, 작게 학습된 라우터다.
동기는 둘로 뚜렷이 갈리는데 결과적으로 같은 기계장치를 만든다. 이 페이지가 둘을 갈라 두는 이유는 실패하는 방식이 다르기 때문이다:
- 비용 라우팅 — 싼 단계는 싼 모델로 보내고 꼭 필요한 것만 위로 올린다. 실패 양상: 어떤 과제가 부실하게 처리되고 조용히 더 나쁜 답을 받는다.
- 안전 라우팅 — 분류기를 건드린 요청을 더 제한된 모델로 보낸다. 실패 양상: 정당한 요청이 강등된다. Anthropic 은 이를 fallback 이라 부른다 (source).
왜 중요한가
라우팅은 모델의 공개 가격이 워크플로의 비용을 더 이상 설명하지 못하게 되는 지점이다. 경로에 라우터가 한 번 들어오면 모델 페이지의 토큰당 요금은 비용 함수의 입력일 뿐 비용 자체가 아니다 — 그리고 이 위키의 스펙 표는 그것을 표현할 수단이 없다.
동시에 안전 판단의 위치가 옮겨간다. 분류기가 모델을 고르면, 사용자가 무엇을 받을 수 있는지를 정하는 것은 모델이 아니라 그 분류기다 — 그리고 그것은 보통 모델 카드도, 벤치마크도, 버전 이력도 없는 구성요소다.
현재 수준 (2026-08-12 기준)
가장 잘 알려진 라우터가 결제 회사에 70억 달러 넘게 인수됐다 (2026-08-17)
Stripe 가 OpenRouter 를 70억 달러 넘게 인수했다. 석 달 전 1억 1,300만 달러 시리즈 B 가 매긴 평가액 13억 달러에 대비된다. 보도는 앞선 협상이 100억 달러에 가까웠다고 전하며, ~30% 하락을 2026년 여름의 모델 가격 하락 탓으로 돌린다 — 한 매체의 귀인이며 보도된 대로 기록한다 (source).
OpenRouter 는 이 페이지가 기술하는 패턴의 가장 널리 쓰이는 사례다. 여러 공급자 앞에 놓인 하나의 엔드포인트가 요청마다 역량·가격·가용성으로 고른다. 그 가격이 이 패턴에 대해 말해 주는 것이 기록할 만한 부분이다. 석 달 만의 5배 상승은 뒤에 있는 어떤 모델이 아니라 라우팅 계층을 평가한 것이고, 사는 쪽은 결제 회사다. 구조적 해석 둘이 모두 들어맞고 읽은 자료는 둘을 가르지 않는다. 라우팅이 계량 인프라(누가 어떤 모델을 얼마에 불렀고 누구에게 청구되는가)로 평가되고 있거나, 유통(게이트웨이가 고르므로 게이트웨이가 지렛대를 쥔다)으로 평가되고 있다. 어느 쪽도 양측이 진술하지 않았다.
이 위키는 이 거래의 중립적 관찰자가 아니다. scripts/spec-check.py 는 이 위키 모델 페이지의
모든 Pricing 과 Context window 칸에 대한 일일 대조로 OpenRouter 의 공개 카탈로그를 읽고,
CLAUDE.md 는 벤더가 정가를 공표하지 않는 모델에 대해 그것을 대조가 아니라 소스로 지목한다.
카탈로그의 소유권 변경은 이 저장소의 검증 사슬에 대한 변경이다. 읽은 어떤 자료에도
카탈로그나 공개 API, 가격 데이터에 대한 변경 의사는 진술되어 있지 않다 — 나중에 그런 일이
온다면 그것이 예견 가능했던 날짜가 기록에 남도록 적어 둔다
(source).
NVIDIA NeMo Switchyard — 오픈소스 인프라로 출시된 라우팅 (2026-08-11)
NVIDIA 는 NeMo Switchyard 를 공개했다. AI 에이전트를 위한 오픈소스 모델 라우팅 라이브러리이며, Nemotron 3.5 Lightning 과 같은 날 나왔다. 에이전트 워크플로의 단계마다 프롬프트를 모델로 라우팅한다 (source).
두 계열이 함께 들어 있다 (source):
- 튜닝 불필요 라우터. 워크로드별 데이터로 학습하지 않고 판단한다: LLM 분류기, 스테이지 라우터, 에스컬레이션 라우터
- 튜닝 가능 라우터. 해당 워크로드로 학습한다
NVIDIA 의 내부 벤치마크 주장: 프런티어급 정확도를 유지하면서 과제 완수 비용을 Opus 4.8 단독 대비 거의 삼분의 일 로 낮춘다 (source) (VentureBeat).
라이브러리만 보지 말고 짝지어 나온 것을 읽어야 한다. NVIDIA 는 싼 모델을 냈고, 같은 날 싼 모델을 언제 쓸지 결정하는 소프트웨어를 냈다 — 비교 기준은 경쟁사의 플래그십이다. 라우터가 곧 그 모델의 논거다.
Anthropic 의 생물학 fallback — 안전 통제로서의 라우팅 (2026-08-07)
Claude Fable 5 는 분류기가 보호 대상 생물학에 닿는다고 판단한 요청을 덜 유능한 모델 — Claude Opus 5 — 로 보낸다. Anthropic 은 그 분류기의 헌법을 다시 학습시켰고, 테스트에서 생물학 관련 fallback 이 약 85% 줄었다고 보고했다. 전체 fallback 물량 감소폭은 서피스별로 매우 고르지 않다: Claude.ai 약 67%, Cowork 약 55%, Claude Code 약 17%, Claude Platform 약 7% (source).
이 편차는 이 위키가 보유한 라우팅 측정치 중 가장 많은 것을 말해 준다. 라우터가 개발자 트래픽보다 일반 사용자 질문에 훨씬 자주 발동하고 있었다는 뜻이다 — 즉 잘못된 라우팅이 한 집단에 몰려 있었고, 총계에서는 보이지 않았다.
에이전트 플랫폼의 지연·용량 라우팅 (2026-06)
Microsoft Build 2026 에서 발표된 Azure Agent Mesh 는 온프레미스 Windows, Windows 365, Azure Arc 엣지에 걸쳐 지연시간과 GPU 가용성에 기반한 자동 라우팅을 수행하며, GA 목표는 2026년 4분기다 (source). 이것이 세 번째 동기 — 비용도 안전도 아닌 배치를 위한 라우팅 — 이며, 이 페이지의 다른 둘보다 먼저 있었다.
2026-08-19 — 호스팅 경로가 실제로 무엇을 내주는지에 대한 감사
Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391) 는 호스팅 모델 라우팅을 확률 과정으로 정식화하고 블랙박스로 감사한다 — 대상으로부터 확률 정보를 전혀 요구하지 않는다 (source):
| 통계량 | 얻는 방법 |
|---|---|
| AFL — 평균 충실도 손실 | 고정된 제약 문맥을 반복 전송하고, 반환된 텍스트 빈도로 출력 분포를 재구성해, 영편향 보정된 창 내 평균 coarsened-KL 을 보고 |
| EFL — 극단 충실도 손실 | 독립 실행들에서, 실행 수준의 기준 중심 surprisal 통계량의 경험적 상위 꼬리 |
| 보고된 바: AFL 은 logprob 을 제공하는 세 경로 조건에서 logprob 기반 비교량과 **강한 선형 기술적 | |
| 일치**를 보이고, 일곱 개 경로 스냅숏에 걸친 20회 프로브가 경로별 EFL 편차를 드러내며, | |
| 중요한 갈림은 이것이다 — **어느 통계량도 GPQA-Diamond 정확도와는 경로 수준에서 감지할 만한 연관이 | |
| 거의 없는 반면**, 두드러진 EFL 은 **과제 노출이 늘어남에 따른 Terminal-Bench 통과율 하락과 함께 | |
| 나타난다**. |
이 페이지에서 라우팅 결정 이 아니라 라우팅 계층 을 측정하는 첫 도구다. 위의 모든 것은
어떤 모델을 고르느냐에 관한 것이고, 이것은 고른 그 모델이 실제로 답하고 있느냐에 관한 것이다.
Stripe 가 OpenRouter 를 70억 달러 넘게 인수한 이틀 뒤에 도착했고, 그 인수가 드러낸 노출을
지목한다: 라우팅된 요청의 제공자는 벤더가 아니며, 이는 이 저장소의 scripts/spec-check.py 가
헤드라인 카탈로그 가격이 아니라 퍼스트파티 엔드포인트와 비교하도록 만든 바로 그 발견이다.
GPQA 결과는 여기서 서드파티 수치를 읽는 방식을 바꿔야 하는 쪽이다. 어떤 경로는 두드러진 충실도 손실을 보이면서도 단일 턴 지식 벤치마크에서는 정상 점수를 낸다 — 그리고 이 위키의 서드파티 수치 대부분은 단일 턴 모양의 숫자다. 오늘 기록된 Qwen 3.8 27B 의 Artificial Analysis Intelligence Index 52 에 직접 걸린다: 리더보드 수치는 어떤 서빙 경로를 거쳐 산출되며, 어느 것인지는 아무 데도 적혀 있지 않다.
주지 않는 것: 제공자도 경로도 지명되지 않고, AFL·EFL 값이 공개되지 않으며, Terminal-Bench 하락에 크기가 없다. 방법은 또한 원인을 식별하지 않은 채 괴리를 탐지한다 — 양자화, 배칭, 추측 디코딩, 샘플링 드리프트, 노골적 교체가 모두 들어맞고, 읽은 자료 어디에도 엔지니어링상의 절충과 바꿔치기를 갈라놓는 것이 없다.
열린 문제
- 라우터의 오류율을 아무도 공개하지 않는다. 부분적으로 다뤄짐, 2026-08-19 — Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391) 는 여기서 말하는 것과는 다른 오류를 측정한다. "잘못된 모델이 선택됐는가" 가 아니라 "선택된 모델의 출력 분포가 이동했는가" 다. 둘 다 다른 곳에서 측정되지 않으며, 어느 쪽도 다른 쪽을 대신하지 않는다. 이 페이지의 모든 주장은 라우팅의 결과 (절감된 비용, 줄어든 fallback)에 대한 것이다. 라우터가 얼마나 자주 요청을 엉뚱한 모델로 보냈는지를 말하는 것은 하나도 없다. Anthropic 의 서피스별 편차가 그 수치에 가장 가깝지만 그것은 측정이 아니라 추론이다. 이 분야의 첫 벤치마크로도 달라지지 않았다: xRouteBench 가 채점하는 품질과 비용은 둘 다 결과다 (source).
- 안전 라우팅을 다루는 벤치마크가 없다. xRouteBench 의 다섯 개 과제군(일반, 메모리 증강, 비전, 시계열, 개인화)은 모두 성능과 비용에 관한 것이다. Anthropic 이 출시한 fallback 사례는 전혀 다른 것을 최적화하며 그 어디에도 등장하지 않는다 — 즉 실제 결과를 낳는 쪽 절반은 여전히 아무 측정도 없다.
- 라우팅된 벤치마크 결과는 모델의 결과가 아니다. 여러 모델 위의 라우터로 프런티어급 정확도를 얻었다면 그 수치는 시스템을 특징짓는다. Eval Harness Configuration 가 스캐폴드에 대해 기록해 온 것과 같은 보고 문제가, 이제 모델 선택에서 나타난 것이다.
- 비용 주장은 기준선이 만든다. "Opus 4.8 단독 대비 삼분의 일" 은 모든 단계에서 가장 비싼 모델을 돌리는 경우와 비교한 것이다 — 아무도 고르지 않는 기준선이다. 손으로 잘 짠 배정과 비교하면 얼마를 아끼는지는 언급이 없다.
- 안전 라우팅에는 이의 제기 경로가 없다. 분류기에 의해 강등된 사용자는 어느 구성요소가 그 결정을 내렸는지 듣지 못하고, 그 분류기에는 공개된 버전이 없다.
- 라우터 자체를 노린 공격은 여기서 검토되지 않았다. 라우팅 판단이 프롬프트를 읽는 분류기에 좌우된다면, 프롬프트는 그것을 유도하도록 쓰일 수 있다. 읽은 어느 소스도 이를 다루지 않는다.
주요 논문
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers (arXiv:2608.06867) (2026-08-16) — 이 페이지가 읽은 첫 연구이며, 위 미해결 문제들이 없다고 말하는 바로 그것을 겨냥한다: 비교 가능성. 라우팅을 다섯 개의 이름 붙은 구성요소(context encoder, model encoder, scoring function, decision rule, learning signal)를 가진 순차적 의사결정 과정으로 다시 정식화하고, 라우터를 응답 품질과 추론 비용에 대해 동시에 채점하는 xRouteBench, 그리고 16개 이상의 라우터를 담은 오픈소스 라이브러리를 함께 낸다. 학습된 라우터는 가장 강한 고정 모델 기준선을 상대적으로 14.6% 앞선다 (source).
이것이 정리하는 것과 정리하지 못하는 것 두 가지. 품질과 비용을 함께 평가한다는 점이 과소 서비스하는 라우터를 애초에 눈에 보이게 만든다 — 비용만 놓고 보면 전부 가장 싼 모델로 보내는 쪽이 이긴다. 그러나 오류율은 어디에도 나오지 않으므로, 아래 첫 미해결 문제는 자기 분야의 첫 논문을 겪고도 살아남는다: xRouteBench 는 오배정이 아니라 결과를 측정한다. 그리고 16개 라우터가 무엇인지 읽은 자료 어디에도 없어, NeMo Switchyard 를 가리켜 비교할 수는 아직 없다.
Stealing Reasoning Traces from Proprietary LLM APIs (arXiv:2608.09867) 는 인접하지만 라우팅에 관한 것은 아니다. 그 논문이 딛고 선 것은 하나의 제공자 안에서 모델 간에 교환 가능한 추론 트레이스이고, 그것이 곧 라우팅을 가능하게 하는 것과 같은 대체 가능성이다.
Referenced by
Sources
- sources/papers-daily/hf-daily-2026-08-19.md
- sources/blogs/stripe-2026-08-17-openrouter-acquisition.md
- sources/blogs/nvidia-2026-08-11-nemotron-3-5-lightning-switchyard.md
- sources/blogs/anthropic-2026-08-07-fable5-biology-safeguards.md
- sources/blogs/microsoft-2026-06-01-build-project-polaris.md
- sources/papers-daily/hf-daily-2026-08-16.md