AI Trend Notifier
EN
← wiki

$ cat wiki/models/nemotron-3-5-lightning.md

Nemotron 3.5 Lightning

스펙

속성
DeveloperNVIDIA
Released2026-08-11
Announced2026-08-11
Context window1M
Pricingunknown
LicenseOpenMDW-1.1
AvailabilityHugging Face (BF16 + NVFP4 오픈 웨이트), NVIDIA NGC, build.nvidia.com, OpenRouter, DeepInfra, Together AI, Baseten, FriendliAI
Catalogue idnvidia/nemotron-3.5-lightning
전체 30B / 활성 3B 하이브리드 Mixture-of-Experts 이며, **Mamba-2 층과 MoE 층을 교차
배치하고 일부 Attention 층을 섞은** 구조로 설명된다
(source).
NVIDIA 의 프런티어 모델 Nemotron 3 Ultra 로부터 증류되었고 Nemotron Coalition
함께 개발되었으며, multi-token predictionDFlash speculative decoding 을 싣고
있다
(source).

모델 카드에서 보고된 데이터 컷오프: 사전학습 2025년 9월, 사후학습 2026년 5월 (source).

Pricingunknown 인 것은 무료라는 뜻이 아니며, Muse Glimmer 와 같은 독법이다. 가중치가 열려 있고 읽은 어느 자료에도 1자 정가는 공개되지 않았다. 3자 서빙 가격은 존재하고 서로 어긋난다 — 출시 시점 DeepInfra 는 $0.05/M 입력 · $0.20/M 출력, 일부 목록은 $0.00/$0.00 무료 티어, OpenRouter 는 유료 경로와 :free 경로를 동시에 싣고 있다 (source). 이는 NVIDIA 의 가격이 아니라 오픈 웨이트에 대한 리셀러의 가격이며, CLAUDE.md 의 카탈로그 가격 규칙이 적용된다. 제공자 범위 안의 어떤 값이든 실재한다는 것이다. Catalogue id 행을 둔 것은 매일 도는 spec-check Action 이 하나를 해석할 수 있게 하기 위해서다 — 추측이 아니라 OpenRouter 목록 URL 에서 그대로 옮겼다.

출시일

2026-08-11, 같은 날 Hugging Face (nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16-NVFP4 변형) 와 NVIDIA NGC 에 가중치 공개 (source).

오픈소스 모델 라우팅 라이브러리인 NeMo Switchyard 와 함께 출시되었다 — 둘은 같이 발표되었고, 그 짝지음이 시점의 우연이 아니라 요점이다 (## 비교 참조).

벤치마크

귀속이 달리 표시된 경우를 빼면 NVIDIA 자체 수치다. 1자 벤치마크 표는 읽지 못했다 — 샌드박스가 NVIDIA 의 블로그에도 모델 카드에도 도달하지 못했다 (source).

측정 항목수치누구의 수치인가
에이전트 생산성 (PinchBench)86.5%NVIDIA
출력 속도동급 덴스 모델 대비 최대 4xNVIDIA
에이전트 과제 완수 시간동급 대비 최대 30% 단축NVIDIA
Artificial Analysis Intelligence Index24Artificial Analysis (3자)
한계가 둘 있다. **PinchBench 는 이 저장소가 보유한 어떤 sources/evals/ 스냅샷에도
없어서**, 86.5% 를 대조할 로컬 근거가 없다 — Muse Glimmer 의 MCP Atlas 와
Grok Imagine Image 2.0 의 image-edit 보드에 기록된 것과 같은 공백이다. 그리고
Artificial Analysis 의 24 는 스냅샷이 아니라 검색 결과 발췌에서 읽었다. 이 저장소의
Artificial Analysis 수집은 주간 Action 이 만들고, 가장 최근 것
(source)은 이 모델보다 아흐레
앞서므로 해당 행이 없다.

주장의 형태를 짚어 둘 값이 있다. 네 수치 중 셋이 역량이 아니라 속도나 비용에 관한 것이다. 프런티어 경쟁자가 아니라 남의 워크플로 안에서 값싼 단계를 맡는 모델로 자리매김한 것과 일관된다.

활용 사례

NVIDIA 가 내세운 틀은 명시적으로 종속적이다. 프런티어 추론 모델 — Nemotron 3 Ultra, 또는 NVIDIA 가 직접 거명하는 GPT-5.6 — 이 워크플로를 계획하고 조율하는 동안, 이런 소형 특화 모델이 특정 단계를 수행한다: 코드 리뷰, 도구 사용, 보안 경보 모니터링, 청구 문의 응대 (source).

1M 컨텍스트 창활성 파라미터 3B 의 조합이 그 역할을 감당 가능하게 만든다. 긴 호흡의 에이전트 상태를 컨텍스트에 두면서도 토큰당 덴스 30B 연산을 치르지 않는다.

비교

모델파라미터활성컨텍스트라이선스가중치
Nemotron 3.5 Lightning30B MoE3B1MOpenMDW-1.1공개됨
Muse Glimmer30B 덴스30B131,072Apache 2.0공개됨
Laguna S 2.1118B MoE8B1MOpenMDW-1.1공개됨
Gemma 4 12B12B 덴스12Bunknownunknown공개됨
첫 두 행은 같은 파라미터 수로 하루 간격으로 나왔고, 같은 제품이 아니다. Muse Glimmer 는
덴스여서 30B 전부가 활성화되며, 4비트로 소비자용 GPU 한 장에 올라간다는 것이 그 논거다.
Lightning 은 스파스여서 3B 가 활성화되며, 서버 쪽 에이전트 루프 안에서 긴 컨텍스트를
처리하는 처리량이 논거다. 헤드라인 숫자는 같고 풀고 있는 제약이 다르다 — "30B" 가 더는
유용한 비교 단위가 아니라는 사실을 상기시킨다.

라이선스가 나머지 차이인데, 이 위키에 처음 나오는 것은 아니다. OpenMDW-1.1Laguna S 2.1 이 2026-07-21 에 채택한 것과 같은 라이선스이며, 그 페이지에는 상업적 사용을 포함한 사용·수정·재배포를 허용한다고 기록되어 있다 (source). 이번 릴리스에 대한 보도도 같은 식으로 — 실질적 제한 없이 상업적 사용에 열려 있다고 — 설명한다 (source). 서로 무관한 두 벤더가 3주 사이에 Apache 아닌 같은 오픈 모델 라이선스를 골랐다는 쪽이 더 흥미로운 사실이고, 결론을 내리기보다 지켜볼 값이다.

상충 보고

모델 사양에 관한 것은 없다. Switchyard 의 비용 주장이 두 가지로 보도된다 — NVIDIA 의 "Opus 4.8 단독 대비 거의 삼분의 일" 과 VentureBeat 의 헤드라인 "자체 테스트에서 과제 비용을 삼분의 일로 절감" — 둘은 같은 주장이고, 양쪽 모두 NVIDIA 의 내부 벤치마크라고 밝히고 있다 (source).

열린 질문

  • 학습 연산량과 토큰 예산 — 비공개. Nemotron 3 Ultra 로부터의 증류 계보는 밝혀졌지만, 학습 실행에 관한 나머지는 아무것도 밝혀지지 않았다.
  • PinchBench 가 무엇이고 누가 관리하는가. 86.5% 라는 값은, 이 저장소에 스냅샷이 없는 스위트에서 나온 것이므로 분모 없는 숫자다.
  • 1M 컨텍스트는 실제로 버티는가? 읽은 어느 자료에도 장문 검색 측정치가 나오지 않는다 — 그 수치는 입증된 성능이 아니라 아키텍처상의 용량이다.
  • OpenMDW-1.1 의 조항. 이름이 나왔고 성격이 설명되었을 뿐, 원문은 읽지 않았다.
  • 가중치와 함께 평가 하니스도 공개되었는가? Eval Harness Configuration 가 기록하려고 존재하는 구분이며, 여기서는 미해결이다.

Referenced by

Sources