2026 年 10 月 5 日,OpenAI 开始向全球 API 客户提供可选的文本水印,并计划在未来数周内,为欧盟地区符合条件的 ChatGPT 与 Codex 文本输出默认加入不可见水印。与此同时,检测器暂不向公众开放,只接受研究人员和专业机构申请。
这件事真正重要的地方,不是“AI 文本终于能被抓出来了”,而是文本来源识别第一次明显从论文和演示系统,进入了模型供应商的生产接口、区域化发布和合规流程。
但也正因为它进入生产环境,我们更需要把边界说清楚:文本水印是一种统计来源信号,不是作者身份鉴定,更不是判断内容真伪、版权归属或责任主体的机器法官。
水印写在哪里:不是藏一句话,而是轻推每一次选词
OpenAI 将这套技术称为 textGrain。它不在段落末尾塞入固定字符,也不是简单加入人眼看不见的 Unicode 标记,而是在模型生成下一个词元时,对可选词元的概率分布做微小、受密钥控制的调整。单个词看不出异常,但足够长的一段文字会累积出统计特征,检测器再判断这段特征是否与水印规则吻合。
这类方法的基本思路并不新。Google DeepMind 的 SynthID Text 同样在生成阶段介入词元采样,并已经给出论文、开源参考实现和 Hugging Face Transformers 集成。其价值在于:检测时不必保存每一次对话全文,也不必依赖一个不断猜测“人类文风”和“机器文风”差异的通用分类器。
后者尤其关键。传统 AI 文本检测器通常根据困惑度、句法分布或分类模型作判断,模型一升级、写作领域一变化,阈值就可能漂移。已有研究还发现,这类检测器可能对非英语母语写作者产生更高的误报风险。水印换了一个问题:它不是问“这段话像不像 AI”,而是问“这段话里有没有某个生成系统主动留下的统计信号”。
这使检测对象更明确,却不意味着结论更强。水印能证明的,最多是某套系统曾经参与生成或处理,并且信号尚未被破坏。
OpenAI 自己公布的数据,已经说明它为什么不能成为判决工具
OpenAI 给出的评估很有代表性。在目标误报率设为 1% 时,对心理学类内容,检测器能识别约 80% 的 200-token 水印文本;长度增加到 400 token,识别率约为 95%。但数学等措辞空间更小的内容表现明显更差,因为正确答案和表达路径更受约束,模型没有足够多的“选词自由”来埋入稳定信号。
编辑的影响更直接:在 400-token 英文段落中,替换 10% 的词,同义词改写会让识别率从约 92% 降到 66%;替换 25% 后,只剩 17%。翻译、深度改写、多个模型接力处理,都会继续削弱信号。
这组数字不该被理解为“水印没用”。它说明的是水印适合什么工作:平台侧的大规模风险筛查、研究抽样、来源调查中的一项证据,以及合规体系中的机器可读标记。它不适合被单独用于退稿、处分学生、认定抄袭或确定法律责任。
| 检测结果 | 可以合理推断 | 不能据此推断 |
|---|---|---|
| 检测到水印 | 文本可能包含特定系统留下的统计信号 | 全文由 AI 独立完成、用户是谁、内容是否虚假 |
| 未检测到水印 | 当前检测器没有找到足够强的信号 | 文本必然由人类创作 |
| 结果不确定 | 文本过短、低熵、被编辑或超出支持范围 | 可以强行二选一 |
欧盟真正要求的,也不是一个万能“AI 测谎仪”
这次上线与欧盟《人工智能法》第 50 条密切相关。该条要求生成合成音频、图像、视频或文本的 AI 系统供应商,在技术可行范围内,让输出以机器可读形式被标记,并可被识别为人工生成或操纵;同时明确要求考虑不同内容类型的特性、技术限制、实施成本和公认的技术水平。
这段限定语很重要。法律目标是提高透明度和可追溯性,不是宣称已经有一种方法能无条件识别所有 AI 文本。欧盟随后形成的透明度实践准则,也把供应商的机器标记与部署者对深度伪造、公共利益文本的披露分开处理。技术标记、可见披露、编辑责任和平台治理,是不同层次的控制。
对公开发布的公共利益文本,第 50 条还设置了与人工审阅、编辑控制和责任主体有关的例外条件。这意味着合规设计不能简化为“接口打开水印,一切责任自动解决”。企业仍要回答:谁审核内容,谁决定发布,日志保存多久,用户在何处看到披露,发生争议时谁处理申诉。
检测器为什么不直接公开:透明度与攻防之间存在真实冲突
OpenAI 选择让 API 客户自行开启水印,却只向获批研究者和专业机构提供检测器。这个安排会引起质疑:如果公众无法验证,水印怎样形成社会信任?
但完全公开也有代价。攻击者可以批量试探检测阈值,反复改写直至信号消失;如果水印密钥、配置或检测逻辑暴露不当,还可能制造伪造信号,把人写的内容嫁接成“AI 生成”。Google 的开发文档同样提醒,水印配置应安全保存,否则可能被轻易复制。
所以,检测器访问控制不是一个纯粹的开放或封闭问题,而是典型的安全接口设计:验证服务需要限流、审计、版本标记、置信区间和用途约束;高风险决定必须允许复核与申诉。理想状态并不是给每个人一个红色的“AI”印章,而是提供可解释、可追踪、能被专业机构审计的证据链。
对开发者而言,变化不是多一个布尔参数
API 客户现在可以选择开启水印,但生产团队至少要同步改造四件事。
第一,把内容来源当成数据字段,而不是事后猜测。 在生成请求、模型版本、区域、是否启用水印、人工编辑状态和发布记录之间建立关联。水印用于跨系统验证,内部日志用于责任追踪,两者不能相互替代。
第二,按内容类型测试,不要只看平均准确率。 客服短句、代码、数学答案、法律模板和营销长文的词元熵完全不同。应建立自己的长度分布、语言分布和改写链路测试集,分别计算误报、漏报和“不确定”比例。
第三,把“未检测到”设计成未知,而不是人类原创。 数据库字段最好采用 watermarked、not detected、uncertain、unsupported 等多状态表达。一个布尔值会诱导产品界面和审核人员做出超出证据范围的结论。
第四,为高风险决定增加人工程序。 教育处分、内容下架、劳动考核和版权争议不能只看检测分数。至少需要原始文档历史、引用情况、编辑记录、任务要求和当事人陈述。检测器应触发调查,而不是直接触发惩罚。
真正的分水岭:从“识别 AI”转向“记录内容如何形成”
文本水印最容易被误用的原因,是人们仍在寻找一个简单答案:这段文字到底是人写的,还是 AI 写的?现实中的内容生产早已不是二选一。有人让模型列提纲后独立写作,有人完成初稿再让模型润色,也有人让多个代理检索、起草、审校,最后由编辑承担责任。
在这种协作链里,“AI 参与过”与“人类没有贡献”不是同义句。OpenAI 也明确表示,水印不衡量人类贡献,不确定所有权或责任,不识别用户,更不验证内容准确性。
我的判断是,文本水印的生产化值得肯定,但它最合适的位置是来源基础设施,而不是身份裁判。下一阶段真正需要比较的,不只是不同厂商谁的检测率更高,而是谁能提供跨模型、跨语言、跨编辑流程的互操作标准,谁能把置信度、申诉和责任链纳入产品。
如果平台把水印当成唯一真相,它会制造新的误判;如果完全因为水印不完美而拒绝使用,又会错过建立内容来源基础设施的机会。更成熟的路线,是让水印、内容凭证、生成日志、可见披露和人工编辑责任共同工作。机器给出信号,人和制度决定这个信号应该如何被使用。
参考资料
- OpenAI:Our approach to EU text provenance,2026-10-05。
- OpenAI:textGrain 技术报告。
- EU AI Act, Article 50:Transparency Obligations。
- European Commission:Code of Practice on Transparency of AI-generated Content。
- Nature:Scalable watermarking for identifying large language model outputs。
- Google AI for Developers:SynthID Text safeguards and limitations。
免责声明:本文为基于公开资料的技术评论,仅代表作者观点,不构成法律、合规或投资建议。
评论
发表评论