产品简介
Gemini Omni 是 Google 于 2026 年 5 月 19 日 I/O 大会发布的首个全模态生成模型,属于 Gemini 家族中的'创造引擎'。它可以从任意输入(文本、图像、视频、音频)生成任意输出(文本、图像、视频、音频),所有生成内容自动附带 SynthID 水印,是目前市面上输入-输出维度最全的单一模型。
核心功能
- 全模态生成:文→图/视频/音频、图→视频/文字、视频→剪辑/配音,任意组合
- SynthID 内置水印:所有 AI 生成内容自动嵌入不可见水印,可追溯来源
- YouTube Shorts Remix 免费体验:无需订阅即可通过 YouTube Shorts 使用视频生成能力
- 订阅分级访问:AI Plus/Pro/Ultra 订阅用户可在 Gemini App 中完整使用
- 世界理解能力:Google 称其为'world understanding 的飞跃',能模拟物理世界的视觉一致性
适合谁用
以下类型的用户会特别受益于 Gemini Omni:
- 短视频创作(YouTube Shorts/TikTok 素材)
- 多模态内容一站式生产
- 图片/视频风格转换
- 教育场景的可视化解释生成
优点亮点
- 全模态组合自由度最高(任意输入→任意输出)
- SynthID 水印内置,合规省心
- YouTube Shorts 免费入口降低体验门槛
- Google 基础设施保障高可用和全球分发
价格与方案
YouTube Shorts Remix 免费可用。Gemini App 内使用需 AI Plus ($20/mo)、Pro ($50/mo) 或 Ultra ($200/mo) 订阅。API 定价暂未公布。
总结与建议
Gemini Omni 代表了 Google '模态自由'愿景的首个落地产品,通过 YouTube 渠道的免费入口降低了体验门槛。适合短视频创作者和需要快速生成多形式内容的团队,但 API 级集成暂需等待定价公布。
版本演进
- Gemini Omni 1.1 Flash 发布(GA) (2026-08-28):Google 发布视频生成模型 Gemini Omni 1.1 Flash(API:gemini-omni-1.1-flash):支持场景扩展(分析最长 10 秒前文、按 10 秒步长续接、累计最长 40 秒)、首尾帧插值控制镜头运镜、3 秒参考视频保持角色一致性、360p 草稿模式(较 720p 快约 60%、成本为其三分之一),并可输出 1080p 与 4K 成片;旧版 preview 将于 9 月 30 日弃用。