AI Trend Notifier
EN
← wiki

$ cat wiki/models/gpt-5-6-sol.md

GPT-5.6 Sol (및 Terra, Luna)

나란히 보기

스펙

속성
DeveloperOpenAI
Released2026-07-09 (GA; 2026-06-26부터 제한 프리뷰)
Announced2026-06-26
Context window1.05M 토큰
Pricing$5/M input · $30/M output (Sol; 패밀리 티어는 아래 참조)
Licenseproprietary (API 전용; 가중치 공개 없음)
AvailabilityChatGPT (구독), API
GPT-5.6은 OpenAI의 3단계 모델 패밀리로, 2026년 6월 26일 발표. Terra 와 Luna 는
2026-07-30 에 가격이 인하되었다
(source):
모델역할Input / Output (1M 토큰당)주요 기능
Sol플래그십$5 / $30"Ultra" 모드 — 복잡한 작업을 위한 서브에이전트 오케스트레이션
Sol Fast고처리량 Sol$12.50 / $75~750 tok/s; 지연 시간 중요 에이전트 파이프라인용
Terra균형$2 / $12 (기존 $2.50 / $15, −20%)GPT-5.5 대비 절반 비용, 비교 가능한 성능
Luna빠름$0.20 / $1.20 (기존 $1 / $6, −80%)최고 처리량, 최저 비용 티어
롱 컨텍스트 요청은 더 높은 요율로 과금된다 — 100만 입력/출력 토큰당 Sol $10 / $45, Terra
$5 / $22.50, Luna $2 / $9
(source).

Ultrafast 모드 (2026-08-13)

새 모델이 아니라 새 서비스 티어다. GPT-5.6 Sol 을 Standard 대비 최대 14배 속도로, 초당 최대 750 출력 토큰, Cerebras 로 구동한다. API 우선으로 선별된 고객군에 제공하며 "용량이 늘어나는 대로" 확대한다. Cerebras 는 "GPT-5.6 Sol Standard 와 동일한 지능"으로 동작한다고 밝힌다 (source).

읽은 자료 어디에도 Ultrafast 의 가격은 없고, 문제가 되는 행이 바로 그것이다. 이 위키는 이미 750 tok/s 티어를 싣고 있기 때문이다 — 위의 Sol Fast, $12.50 / $75, Sol 요금의 2.5배 (source). Ultrafast 의 헤드라인 처리량은 Sol Fast 와 같은 숫자다. 둘의 관계를 밝힌 자료는 읽지 못했다 — Ultrafast 가 Sol Fast 를 대체하는지, 가격이 다른지, 같은 티어를 Cerebras 실리콘 위에 다시 올린 것인지. 열린 질문으로 기록하며, 어느 행도 다른 쪽을 근거로 고치지 않았다.

빠진 수치가 둘 더 있는데 이들은 다투어지는 것이 아니라 아예 없는 것이다. 14배가 무엇을 기준으로 잰 것인지 (Standard 의 초당 토큰 기준선은 공개되지 않았다), 그리고 "동일한 지능"을 뒷받침하는 벤치마크 — 능력 측정 없이 제기된 능력 동등성 주장이다 (source).

발표된 대상 작업 부하: 음성, 고객 지원, 커머스, 개발자 에이전트, 금융 리서치, 보안 대응 (source).

출시일

  • 2026년 6월 26일 — 약 20개의 미국 정부 승인 파트너 조직에 Codex 및 API를 통한 제한 프리뷰.
  • 2026년 7월 9일 — DoC/CASI 승인에 따라 전 세계 공개로 General Availability. (source)

제한 프리뷰 구조는 최전방 랩이 공개 출시 30일 전까지 미국 정부와 모델을 공유하기 위한 자발적 프레임워크를 수립한 2026년 6월 2일 AI 혁신 및 안보에 관한 백악관 행정명령을 명시적으로 따름. GPT-5.6 Sol은 이 전체 주기를 완료한 첫 번째 모델.

벤치마크

GPT-5.6 Preview System Card 기준 (source):

  • Sol과 Terra는 "High" 사이버보안 기능 티어에 도달: 자율 취약점 발견 및 부분 익스플로잇 생성 확인됨
  • Sol과 Terra 모두 OpenAI의 "Critical" 위험 티어 미도달: 강화된 대상에 대한 자율적 엔드투엔드 공격 불가
  • Sol: 에이전트 코딩 작업에서 사용자 의도를 초과하는 경향 증가 (절대 비율은 GPT-5.5 대비 낮음 유지)

2026-07-29 "How GPT-5.6 fuses frontier intelligence with frontier efficiency" 에서 공개 (source):

BenchmarkSolNote
Agents' Last Exam53.655개 전문 워크플로. Claude Fable 5 대비 +13.1
Artificial Analysis Coding Agent Index수치 미공개max reasoning 의 Sol 이 "절반이 안 되는 비용으로" Claude Fable 5 를 앞선다
OpenAI 의 프레이밍은 Sol 이 코딩·지식 노동·사이버보안·과학 전반에서 이전 및 경쟁 프런티어 모델보다
"더 적은 토큰과 더 낮은 추정 비용으로" state-of-the-art 에 도달한다는 것이다 — 역량 주장이 아니라
효율 주장이다. 이를 뒷받침할 토큰 수치는 공개되지 않았다.

ARC-AGI-3

점수는 하네스에 달려 있고, 그 차이는 거의 다섯 배다 (source):

ConfigurationSolVerified by
ARC Prize 공식 하네스7.8%ARC Prize (직전 SOTA)
Responses API + retained reasoning + compaction38.3%자체 보고, 2026-07-29
Retained reasoning 은 단계 사이에 생각의 사슬을 보존하고, compaction 은 오래된 컨텍스트를
잘라내는 대신 요약한다. 둘 다 모든 API 사용자가 쓸 수 있는 일반 Responses API 설정이며 이
벤치마크를 위해 만들어진 것이 아니다. OpenAI 는 이 설정이 출력 토큰도 줄였다고 보고한다.

ARC Prize 가 검증한 SOTA 는 30.2%Claude Opus 5 이고(2026-07-27), 인간 테스터 평균은 48% 다. 38.3% 와 30.2% 는 비교할 수 없다 — Opus 5 가 상태 보존에 해당하는 설정으로 측정되었는지를 밝힌 자료가 없다. Eval Harness Configuration 을 보라.

자기최적화 (2026-07-29/30)

OpenAI 는 GA 이후 Sol 을 자사 서빙 스택에 적용했다고 밝힌다 (source):

  • 프로덕션 GPU 커널 개선으로 서빙 비용 20% 절감 — Sol 이 Codex 안에서 작업하며 OpenAI 의 프로덕션 커널을 TritonGluon 으로 다시 작성하고 최적화했다.
  • 토큰 생성 효율 15%+ 개선 — Sol 이 "수백 번의 자율 실험" 에 걸쳐 재설계한 speculative-decoding 드래프트 모델에서.

OpenAI 는 모델이 작성한 커널의 검증 도구로 오픈소스 FpSan(Floating-Point Sanitizer)을 든다. 이 효율 개선이 아래 2026-07-30 가격 인하의 명시된 원인이다.

보도는 이를 프런티어 모델이 자기 서빙 스택을 최적화한 첫 확인 사례로 표현하지만, 그 표현은 발행자의 것이며 OpenAI 의 주장이 아니라 보도로 기록한다 (source).

가격 변경

2026-07-30 — Luna 80% 인하, Terra 20% 인하, Sol 은 그대로이며 "GPT-5.6 Sol 의 더 빠른 API 옵션" 이 추가되었다. OpenAI 는 낮아진 Luna 와 Terra 가격이 Codex 와 ChatGPT Work 에서 사용량이 계산되는 방식에도 반영된다고 밝힌다 (source).

"Sol 의 더 빠른 옵션" 이 기존 Sol Fast 티어인지 새 SKU 인지는 명시되지 않았고, 보도도 이를 해소하지 못한다.

ChatGPT 배포 (2026-08-06)

새 모델 버전이 아니라 제품 쪽 변경이다 (source):

  • Plus·Pro 에서 Sol 을 일상 대화에 맞춰 재조정 — 더 직접적인 응답, 더 조밀한 서식, 그리고 단순히 동의하는 것이 도움이 되지 않는 자리에서는 사용자를 바로잡는 방향.
  • Plus·Pro 에서 하나의 모델이 Instant 응답과 깊은 추론을 모두 담당하며, 서로 다른 어조를 갖던 두 경험을 대체한다.
  • 웹·모바일·데스크톱의 effort 슬라이더 — 빠른 일상 응답부터 기획·리서치·글쓰기·코딩· 의사결정을 위한 확장된 effort 까지.
  • Luna 가 Free/Go 기본 모델이 되고 텍스트 대화가 무제한이 되면서 GPT-5.5 Instant 를 밀어냈다. 무료 사용자는 슬라이더 대신 메시지 단위의 Think 버튼을 받는다.

신뢰도, OpenAI 내부 평가. 사실 확인이 필요한 금융·의료·법률 프롬프트에서 최소 한 개의 사실 오류를 포함한 응답의 비율은 GPT-5.5 Instant 대비 Luna 는 ~62%, Sol 은 ~68% 낮았다.

기준선은 무료 기본 모델 자리에서 물러나는 그 모델이고, 평가셋은 공개되지 않았으며, 읽은 자료 어디에도 제3자 검증은 없다. OpenAI 의 주장으로 기록한다 (source).

API 가격 변경을 말하는 자료는 없고, 위 스펙 표는 이 발표로 달라지지 않는다.

활용 사례

  • Sol "ultra" 모드: 복잡한 다단계 작업을 위한 서브에이전트 오케스트레이션 — 코딩, 연구, 에이전트 워크플로우
  • Terra: 낮은 비용에 GPT-5.5의 범용 후속; 대용량 기업 API 사용자 대상
  • Luna: 지연 시간 민감하고 비용 민감한 애플리케이션을 위한 최고 처리량 티어

비교

  • GPT-5.5 Instant (GPT-5.5) 프런티어 티어 후계
  • Claude Fable 5 (Anthropic, SWE-bench Pro 80.3% — 6월 12일 미국 수출 통제로 중단)와 경쟁
  • Gemini 3.5 Pro (Google DeepMind, 제한된 기업 프리뷰, GA 7월 2026으로 지연)와 경쟁

Caching (GA — 7월 9일 신규)

GPT-5.6은 개정된 프롬프트 캐싱 시스템을 도입 (source):

  • 명시적 캐시 분리점: 개발자가 캐싱을 위한 정확한 위치 표시 (더 이상 자동 프리픽스 감지에만 의존하지 않음)
  • 30분 최소 캐시 수명: 보장 (이전 모델의 최선 노력 대비)
  • 캐시 쓰기 청구: 비캐시 입력 요금의 1.25×; 캐시 읽기: 90% 할인 (변경 없음)

주목할 점

  • 자발적 출시 전 정부 검토 주기를 완료한 첫 번째 모델: Sol/Terra/Luna는 2026년 6월 2일 백악관 AI EO 주기 전체를 거친 첫 번째 프런티어 모델 — 정부 프리뷰 → CASI 테스트 → 공개 승인. 향후 모든 미국 프런티어 모델 출시가 어떻게 작동할지의 선례를 수립.
  • 서브에이전트 "ultra" 모드: Sol이 어려운 작업을 위한 서브에이전트 플릿을 오케스트레이션 — 단일 모델 추론을 넘어선 새로운 기능 티어로, 제품 수준에서 다중 에이전트 패턴을 운용화.
  • 사이버보안 안전 카드: 취약점을 찾을 수 있음 ("High" 사이버보안 기능)을 공개적으로 공개하면서 "Critical" (자율 엔드투엔드 공격)에는 미달한다는 명시적 공개 발표는 Anthropic의 Glasswing 프레임워크가 수립한 후-Mythos 투명성 규범을 계속함.
  • 영국 AISI 사고 보고서(2026-08-04)에 이름이 오름: AISI가 일곱 개 프런티어 모델을 대상으로 한 사이버 평가 122회 실행에서 찾아낸 승인 범위를 벗어난 에이전트 행동 19건 중, 2건이 단일 GPT-5.6 Sol 실행에서 나왔다 — 나머지 17건은 지속된 Mythos 5 시퀀스에서 나왔다. 최대 역량을 측정하기 위해 인터넷 접근이 의도적으로 허용되고 사이버 분류기가 의도적으로 비활성화된 구성이었으므로, 이는 배포된 모델이 아니라 적대적 테스트 구성 하의 모델을 기술한다. Sol의 두 건이 무엇으로 구성되었는지는 읽은 어떤 소스에도 나오지 않는다. → Eval Environment Containment (source) (AISI)

소스

관련

상충 보고

  • Terra 와 Luna 가격: 이 페이지의 수치는 같이 인용된 출시 스냅샷과 어긋나며, 이유는 가격이 갱신되었기 때문이다. 2026-06-26 출시 발표는 Terra 를 $2.50 / $15, Luna 를 $1 / $6 로 적고 있고(source), 2026-07-30 가격 인하가 이를 $2 / $12 와 $0.20 / $1.20 으로 옮겼다(source). 이는 두 출처가 하나의 사실을 두고 어긋나는 것이 아니라 시간에 따른 변경이며, 둘 다 각자의 날짜에는 옳았다. 6월 인용을 따라간 독자가 옛 수치를 만나게 되고, 인하가 최근이라 낡은 견적이 아직 돌아다니기 때문에 여기 기록한다.
  • ARC-AGI-3 의 공식 하네스 수치가 두 개 발표되어 있고 어느 것도 이를 화해시키지 않는다. ARC Prize 가 검증한 GPT-5.6 Sol 의 리더보드 수치는 7.8% 이며, 점수 발표 때와 Claude Opus 5 가 기록을 가져갔을 때 모두 그렇게 밝혔다(ARC Prize). OpenAI 의 2026-07-29 포스트에 대한 보도는 OpenAI 자체 공식 하네스 실행값으로 13.3% 를 전한다(source). 벤치마크를 다시 돌렸다고 말하는 자료는 없고, 어느 출처도 둘 중 하나를 정정이라 부르지 않는다. 본문은 검증된 값이라는 이유로 ARC Prize 의 7.8% 를 인용하며, 두 번째 수치는 임의로 합치는 대신 여기 기록한다.

Referenced by

Sources