$ cat wiki/models/gemini-omni.md
Gemini Omni
model갱신 2026-08-28생성 2026-05-19
스펙
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | not yet |
| Announced | 2026-05-19 (Google I/O 2026) |
| Context window | unknown (I/O 에서 상세 기술 사양 미공개) |
| Pricing | unknown |
| License | unknown |
| Availability | 아직 제공 안 됨. Gemini 앱과 API 경유 예상 (배포 일정 미정) |
| Type | 멀티모달 비디오 생성 모델 |
| Input | 무엇이든: 이미지 + 오디오 + 비디오 + 텍스트 |
| Output | 비디오 |
| 이 페이지는 I/O 발표이고 그대로 둔다. 그 이후 Omni 계열은 실제로 출시되었다. | |
| Gemini Omni 1.1 Flash 가 2026-08-27 에 초 단위 가격과 명시된 제공 | |
경로를 갖고 공개되었다. 위의 Released: not yet 은 **I/O 에서 발표된 모델에 | |
| 대해서는** 여전히 맞다 — I/O 에서 발표된 Gemini Omni 와 출시된 Omni Flash 계열이 | |
| 같은 산출물이라고 말하는 자료는 읽은 것 중에 없다 | |
| (source). |
추측하지 않고 기록해 두는 열린 항목: Omni Flash 계열은 2026-05-19 와 2026-08-27 사이 어느 시점에 출시되었고, 이 위키는 그 출시도 1.0 공개도 포착하지 못했다. 08-27 캡처의 어떤 내용도 그 시점을 특정하지 않는다. 이 간극은 Google DeepMind 에서 이어 다룬다.
Veo 와의 핵심 차별점
| Veo | Gemini Omni | |
|---|---|---|
| Input | 텍스트 | 무엇이든 (이미지 + 오디오 + 비디오 + 텍스트) |
| Grounding | 일반 훈련 | Gemini 의 실세계 지식 기반 |
| Use case | 텍스트-비디오 생성 | 멀티모달 비디오 편집·합성 |
| Gemini Omni 는 "세계 이해·멀티모달리티·편집에서의 도약" 이라는 것이 I/O 에서 Google 이 내세운 표현이다. |
의의
멀티모달 비디오 생성 영역(Sora, Runway, Kling, Veo)이 크게 달아오르고 있다. Omni 의 any-input 접근은 Google 이 텍스트-비디오를 넘어 월드 모델에 기반한 비디오 합성으로 이동하고 있다는 신호다 — 순수 생성 예술 도구보다 Karpathy 의 "world simulator" 표현에 가깝다.
소스
- Google I/O 2026 summary
- 9to5Google coverage
- I/O 2026 전체 맥락은 Google DeepMind 참조