AI Trend Notifier
EN한
← wiki

$ cat wiki/models/gemini-omni.md

Gemini Omni

model갱신 2026-08-28생성 2026-05-19

스펙

AttributeValue
DeveloperGoogle DeepMind
Releasednot yet
Announced2026-05-19 (Google I/O 2026)
Context windowunknown (I/O 에서 상세 기술 사양 미공개)
Pricingunknown
Licenseunknown
Availability아직 제공 안 됨. Gemini 앱과 API 경유 예상 (배포 일정 미정)
Type멀티모달 비디오 생성 모델
Input무엇이든: 이미지 + 오디오 + 비디오 + 텍스트
Output비디오
이 페이지는 I/O 발표이고 그대로 둔다. 그 이후 Omni 계열은 실제로 출시되었다.
Gemini Omni 1.1 Flash 가 2026-08-27 에 초 단위 가격과 명시된 제공
경로를 갖고 공개되었다. 위의 Released: not yet 은 **I/O 에서 발표된 모델에
대해서는** 여전히 맞다 — I/O 에서 발표된 Gemini Omni 와 출시된 Omni Flash 계열이
같은 산출물이라고 말하는 자료는 읽은 것 중에 없다
(source).

추측하지 않고 기록해 두는 열린 항목: Omni Flash 계열은 2026-05-19 와 2026-08-27 사이 어느 시점에 출시되었고, 이 위키는 그 출시도 1.0 공개도 포착하지 못했다. 08-27 캡처의 어떤 내용도 그 시점을 특정하지 않는다. 이 간극은 Google DeepMind 에서 이어 다룬다.

Veo 와의 핵심 차별점

VeoGemini Omni
Input텍스트무엇이든 (이미지 + 오디오 + 비디오 + 텍스트)
Grounding일반 훈련Gemini 의 실세계 지식 기반
Use case텍스트-비디오 생성멀티모달 비디오 편집·합성
Gemini Omni 는 "세계 이해·멀티모달리티·편집에서의 도약" 이라는 것이 I/O 에서 Google 이 내세운 표현이다.

의의

멀티모달 비디오 생성 영역(Sora, Runway, Kling, Veo)이 크게 달아오르고 있다. Omni 의 any-input 접근은 Google 이 텍스트-비디오를 넘어 월드 모델에 기반한 비디오 합성으로 이동하고 있다는 신호다 — 순수 생성 예술 도구보다 Karpathy 의 "world simulator" 표현에 가깝다.

소스

Referenced by

Sources