产品简介
AQuA 是 Google 在 2026 年 10 月 8 日开源的环境质量智能体,全称 Ambient Quality Agent。它要解决的是智能体上线之后的问题:离线评测跑过了、线上监控的通过率也看着正常,但真实用户到底在哪一步卡住,没人说得清。
它的工作方式是在你自己的 Google Cloud 项目里,跟你的智能体并排跑,定时从 Cloud Trace、Cloud Logging 或 BigQuery 里扫一批生产会话轨迹。三条边界值得先记住:原始会话转录、源码快照和 BigQuery 表都留在你的项目边界内;它不进入请求链路;它也不会回写你的智能体。换句话说,它是个旁观者,不是参与者。
官方给的类比挺贴切:像一个初级质量工程师做第一轮过筛,读对话、滤掉噪音、把带证据的案例卷宗准备好,交给当班的人。它把原始生产流量变成已诊断的、锚定到代码行的洞察,再把这些归档的失败转录喂回你的离线评测内循环。
核心功能
- 五阶段扫描流水线:每次运行依次做抽样、评审、聚类、验证与跟踪:抽最多 1000 条近期会话以控制成本,按九项常见故障清单逐条打分,把共享同一失效机制的发现聚成候选问题簇,由独立模型对照最多三份完整转录复核并丢弃证据不足的簇,最后在 BigQuery 中标记为新增、复现或 14 天未见后自动解决
- 数据不出项目边界:部署在你自己的 Google Cloud 项目中,原始会话转录、源码快照与 BigQuery 表全程留在项目边界内。AQuA 不进入请求路径,也不向你的智能体回写任何东西
- 用 goal.md 引导评审方向:写一段纯英文的开发者目标存进 goal.md,它会附加到每一次评审提示里,把评审拉向你的领域不变量并压掉风格类噪音。同时可以用 eval_config.yaml 定义确定性 Python 自定义度量,与模型评审并行跑并跟踪通过率趋势
- 根因分析锚定源码快照:从控制面板的对话或 agents-cli aqua run 触发后,它会对照发版时捕获的不可变源码快照读失败轨迹。缺陷在你的仓库里就引用 path 与起止行并给出基于快照行的修改建议;缺陷在上游依赖、handoff 或检索到的 payload 里就归因到轨迹中那一步,不给代码 diff。它从不自行改代码或提 PR
- 两级评审强度可选:默认用 single-pass session_review judge,一条会话一次模型调用,让定时扫描保持经济,并产出驱动聚类的 actual 与 expected 差异。也可以选择接入 Gemini 平台的托管轨迹 AutoRaters,按 task_success、tool_use_quality、trajectory_quality 分别跑专用评估器
- 三条命令完成部署:agents-cli 的 extension add、infra single-project、deploy 三条命令即可接入,同时建好 BigQuery 数据集、IAP 之后的 Cloud Run 控制面板,并把按发版 revision 键控的源码树不可变快照写入 Cloud Storage
适合谁用
以下类型的用户会特别受益于 AQuA 环境质量智能体:
- [object Object]
- [object Object]
- [object Object]
- [object Object]
- [object Object]
优点亮点
- 开源且以可组合构件的形式放出,可以在自己的项目里跑、按自己的技术栈改,并参与塑造方向
- 原始生产数据不出项目边界,且不进入请求链路、不回写智能体,对线上无侵入
- 五阶段流水线自带聚类与独立复核,输出的是证据支持的洞察簇而非单条告警
- 根因分析锚定发版时的不可变源码快照,引用到具体行范围,不会出现对着已改代码给建议的情况
- 能区分仓库内缺陷与外部依赖故障,避免把上游问题当成自家 bug 排查
- 单次抽样上限 1000 条并默认走单遍评审,运行成本可预测
- insight 会跨运行跟踪,标记新增、复现与 14 天未见后自动解决,适合长期观察趋势
价格与方案
项目以开源形式发布,构件可自行部署到自己的 Google Cloud 项目中。部署会创建 BigQuery 数据集与 Cloud Run 控制面板等云资源,相关的 Google Cloud 基础设施与模型调用按各自计费标准另行结算;抽样上限与默认单遍评审机制即为控制这部分开销而设。
总结与建议
AQuA 补的是智能体工程里最容易被跳过的一段:上线之后那段没人盯的时间。离线评测和在线通过率监控各有分工,但都不回答真实会话里到底哪一步出了问题。它用一条五阶段的流水线把生产轨迹变成证据支持的洞察簇,再由独立模型复核一遍,最后锚定到发版时的源码快照上给出归因。
设计上有几处挺克制:明确不进请求链路、不回写、不自动改代码或提 PR,数据也留在你自己的项目边界内。评测强度分两级,默认那级一次会话一次模型调用,把定时扫描的成本压住。这些选择让它更像一个辅助岗位而不是接管者。
它目前以可组合构件的形式开源放出,官方也说希望和社区一起探索持续智能体质量该怎么做,所以接口和流程还在演进中。适合已经有线上智能体、但缺乏生产故障归因手段的团队先跑起来看看。
版本演进
- AQuA 以开源构件形式发布 (2026-10-08):Google 发布并开源环境质量智能体 AQuA(Ambient Quality Agent),部署在自有 Google Cloud 项目中与线上智能体并排运行,从 Cloud Trace、Cloud Logging 或 BigQuery 按计划、发版后或按需抽取生产轨迹。流水线分抽样、评审、聚类、验证、跟踪五阶段:单次最多抽 1000 条会话,按九项故障清单评审,把同类失效机制聚成簇,由独立模型对照最多三份完整转录复核,最后在 BigQuery 中标记新增、复现或 14 天未见后自动解决。根因分析对照发版时不可变源码快照,引用行范围给出修改建议,或归因到外部依赖,从不自行改代码或提 PR。通过 goal.md 与 eval_config.yaml 定制评审方向,默认走单遍 session_review judge,可选接入 Gemini 平台托管 AutoRaters