产品简介
Gemini 是 Google 推出的多模态 AI 模型系列和对话产品(前身为 Bard)。作为全球搜索巨头的 AI 布局核心,Gemini 深度集成了 Google 搜索、Gmail、Google Docs、YouTube 等生态,是少数能无缝连接 Google 全家桶的 AI 助手。
核心功能
- Google 生态深度集成:可直接访问 Gmail、Drive、Maps 等服务;支持对 Gmail 收件箱直接发问,邮件搜索、归纳、上下文理解全自然语言化
- 1M token 超长上下文:业界最大的上下文窗口,支持 100 万 token 原生上下文
- 原生多模态:支持文本、图像、音频、视频输入,可分析视频内容、理解截图、听取录音
- 实时联网搜索:背靠 Google 搜索引擎,实时信息获取能力在所有 AI 助手中顶尖
- AI Studio 开发平台:提供免费的 API 调用额度和可视化调试工具,开发者友好度极高
- NotebookLM 知识库:上传资料后构建个人知识库,支持对话式检索和自动生成播客摘要
适合谁用
以下类型的用户会特别受益于 Gemini:
- 重度 Google 生态用户(Gmail、Drive、Docs 日常使用者)
- 需要处理超长文档、视频内容分析的专业人士
- 需要实时信息和联网搜索的研究和资讯工作者
- 想要免费体验强大 AI API 的开发者(Google AI Studio 免费额度慷慨)
- 需要全模态输入输出的创作者
- 多语言沟通场景,Gemini 的多语言能力覆盖面广
优点亮点
- Google 生态集成无可替代:邮件摘要、文档助手、日程管理一体化
- 1M token 超长上下文:处理超大文件的能力超越所有竞品
- 联网搜索顶尖:基于 Google 搜索,信息时效性和准确性领先
- 免费版能力不弱:免费即可使用 Gemini,性价比高
- 多模态原生支持:文本、图像、音频、视频输入输出一体化
总结与建议
Gemini 是 Google 生态内最强大的多模态 AI 助手,尤其适合重度 Google 用户、需要处理超长文档或视频的专业人士,以及追求实时联网信息的开发者。其核心优势在于无与伦比的 Google 全家桶集成、业界领先的 1M token 上下文窗口、原生多模态能力,以及慷慨的免费 API 额度。
版本演进
- Gemini 3.5 Transcribe 发布:更精准的实时语音转写模型 (2026-08-27):Google 推出 Gemini 3.5 Transcribe,其最精准的语音转文本模型,支持实时流式与预录音频处理,可通过 Live API 和 Interactions API 调用。
- Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型 (2026-08-13):Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。
- Gemini 3.7 Flash 全面上线 Pro 与 Ultra 用户 (2026-08-14):Gemini 3.7 Flash 现已向 Gemini 聊天中的 Pro 和 Ultra 用户开放。该模型更新提升了多步骤任务的推理与准确性,如智能整合数十个文件和邮件为一份主文档。同时,Gemini Spark 也已运行于 3.7 Flash,通过改进对 Google Workspace 应用的工具调用,让个人 AI 智能体更精准。
- Gemini 助力 Database Migration Service 加速 PostgreSQL 迁移 (2026-08-11):Google Cloud 在 Database Migration Service(DMS)中推出由 Gemini 驱动的 AI 辅助代码转换,可将 Oracle 或 SQL Server 的存储过程、触发器和自定义函数转换为 PostgreSQL PL/pgSQL 代码。
- 谷歌地图 Ask Maps 智能体升级:可对话订餐、找酒店并接入 Gemini Personal Intelligenc (2026-08-06):谷歌地图宣布 Ask Maps 迎来新一轮升级,新增智能体功能,可替用户执行订餐操作,并综合考虑饮食要求、当前位置和收藏地点等信息;用户还可通过对话指定装修风格、环境氛围等条件查找酒店和当地活动。
- Gemini Robotics ER 2发布 (2026-08-05):新具身推理模型,机器人可理解实时视频、规划多步任务、纠错并与其他机器协作;通过Gemini API和AI Studio开放
- Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人 (2026-07-30):Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。
- Google DeepMind 发布 Gemini Robotics 2 物理 AI (2026-07-30):One brain. For any robot. 🤖 我们正在推出 Gemini Robotics 2:我们的下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人团队协作等能力。
- Gemini Spark 集成 Chrome 自动浏览功能 (2026-07-30):Gemini Spark 🤝 @GoogleChrome Gemini Spark 现已与 Google Chrome 的自动浏览功能集成。经你许可,Spark 可直接在你的 Chrome 浏览器中处理网页任务,例如预约看房或自动填写航班信息。
- Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布 (2026-07-23):Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。
- OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属 (2026-07-24):OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。
- Gemini API Managed Agents 默认升级为 3.6 Flash,新增环境钩子与免费套餐 (2026-07-28):Google DeepMind 将 Gemini API Managed Agents 的默认模型升级为 Gemini 3.6 Flash,并支持显式选择 3.5 Flash 或 3.5 Flash-Lite。新增环境钩子允许在沙箱内工具调用前后执行自定义脚本,用于安全审查或代码格式化。此外,还推出了免费套餐、预算控制和基于 cron 的定时触发功能。