产品简介
textGrain 是 OpenAI 于 2026 年 10 月 5 日公布的统计文本水印方案,官方把它写在《Our approach to EU text provenance rules》这篇文章里。它的做法是在模型生成文字的过程中,通过词选择注入一个不可见的统计信号:每一步预测都会有一批概率接近的候选词,密钥与前文一起悄悄决定这批候选里哪个更容易被选中,单看一个词没有任何异常,积累到足够长的段落就变成可测量的模式。检测器持有同一把密钥,重新推导出每个位置上的偏好,统计文本命中偏好的比例,再和随机水平比较,差距够大就判定这段文字来自加了水印的模型。
驱动它落地的是监管而不是产品策略。EU AI Act 第 50 条的透明度规则要求生成合成文本的系统以机器可读的方式标记输出,相关报道指出这批规则从 2026 年 8 月 2 日开始适用,这也是为什么这次先从欧盟开始、且 OpenAI 把文章写成对欧盟文本溯源规则的回应。
核心功能
- 嵌在词选择里的统计信号:不碰像素、不写元数据、也不塞隐藏字符。生成时每一步都有若干几乎同样合适的候选词,密钥结合前文决定偏好哪一批,把选择倾向铺满整段回复,人读不出来,机器可以统计
- 检测器按密钥复算偏好:持有密钥的检测器在每个位置重新推导被偏好的候选,统计整段文本跟随偏好的频率,再与随机产生的频率做比较,差距越大越可能来自加了水印的模型
- 长度与熵决定可信度:统计置信度随 token 数量增长,两行邮件几乎没有信号,长报告信号充足;反过来,在下一个词几乎被唯一确定的地方,例如套话、代码语法或引文,没有可供偏置的空间,也就嵌不进信号
- 分层的适用范围:全球 API 客户从发布当天起可以为部分模型主动开启,默认是关闭的;未来数周内为欧盟地区所有套餐的 ChatGPT 与 Codex 文本输出添加隐形水印;发布时不作为全球默认选项
- 检测器先走白名单:初期只向获批的研究者与专家机构开放,按个案申请。原因是这项技术在被改写或截断的内容上存在漏检与误报风险,OpenAI 选择先控制它的使用方式
- 写在明处的能力边界:水印只能说明文本是否由 OpenAI 系统生成或处理,不能揭示使用者身份、不能衡量人工贡献了多少、不能判定归属或版权、也不能验证内容是否准确。官方还直接写明:没有检出到水印,同样不能证明这段文字是人写的
适合谁用
以下类型的用户会特别受益于 OpenAI textGrain:
- 在欧盟向用户提供 AI 生成文本的产品团队,需要满足第 50 条对机器可读标记的要求
- 通过 OpenAI API 生成面向欧盟用户文本的开发者,评估是否要为部分模型开启水印
- 学校、媒体、招聘等流程里考虑引入水印判定的组织,需要先弄清它的适用边界再决定要不要用
- 做内容溯源与合规研究的机构,申请检测器访问并发表独立的复现结果
优点亮点
- 标记随内容本身走,不依赖外部登记,也不依赖后续是否保留元数据
- 没有隐藏字符或可见标签,不改变阅读体验
- 官方称没有观测到明显的输出质量下降
- 适用范围与能力边界写得具体,连不能做什么都一条条列了出来
- API 侧默认关闭,把开不开的选择权留给开发者自己
- 与图像侧已经使用的 C2PA 元数据衔接,把溯源姿态延伸到文本这一最难处理的模态
价格与方案
textGrain 本身不单独收费。API 侧沿用原有的 token 计费,开启水印不改变计价方式;ChatGPT 与 Codex 侧随现有套餐提供,欧盟地区的用户无需为此额外付费。检测器不在公开渠道发放,获批的研究者与专家机构按个案申请,没有面向普通用户的付费入口。
总结与建议
把 textGrain 理解成一件合规工具,比把它当成检测器更接近事实。它解决的是欧盟透明度规则下机器可读标记这个问题,顺带给内容溯源提供一个可用的信号。
它的强弱都由机制决定。文本越长信号越足,官方公布的数据是 200 token 左右检出率约 80%、400 token 约 95%;反过来,编辑会迅速削弱信号,替换约一成的词就可能让检出率从 92% 掉到 66%,替换约四分之一时只剩下约 17%。翻译会换掉整批词选择,信号大概率被破坏;代码和结构化输出因为熵太低,本来就嵌不进多少东西。这些数字来自 OpenAI 公布并经媒体转述,目前还没有拿到检测器访问权限的第三方做过独立复现。
还有一句容易被忽略:水印检测的是文本有没有被 OpenAI 系统生成或处理,不是有没有被 AI 生成。模型改写或润色过的文字同样会带上信号,阳性结果不等于整段都是机器写的;反过来,阴性结果更不能当作人写的证据。官方把这两点都写在了文章里。
如果你在欧盟市场提供 AI 生成的文字,或者你在评估要不要在自己的流程里引入水印判定,它是现阶段值得弄清楚的一套方案,只是别让它承担它承担不了的结论。
版本演进
- textGrain 发布 (2026-10-05):OpenAI 公布应对 EU AI Act 第 50 条的文本溯源方案,推出 textGrain 统计文本水印:在模型词选择中注入不可见统计信号,全球 API 客户即日起可对部分模型选择性开启(默认关闭),未来数周为欧盟地区所有套餐的 ChatGPT 与 Codex 文本输出添加隐形水印,发布时不作为全球默认;检测器初期只向获批的研究者与专家机构开放;官方同时明确它不能识别用户身份、不能判定归属,未检出也不代表文本由人撰写