首页 / 文章 / AI徽章衡量的并非你所想
← 返回
AI技术

AI徽章衡量的并非你所想

✍️ zhirenhun 📅 2026/8/16 👁 129 阅读 ⏱ 17 分钟
AI徽章衡量的并非你所想

Anthropic 签署了《欧盟人工智能法案》关于人工智能生成内容透明度的实践准则,并开始用不可见的统计水印标记 Claude 生成的文本。几天之内,同一事件在我的信息流中得到了两种截然不同的解读。

第一篇解读在 dev.to 上,作者是 @sylwia-lask

她实际上阅读了 官方文档,并报告了 Anthropic 的真正说法:水印并不能证明文本完全由 AI 生成——你可以自己写点东西,让 Claude 修改或翻译,它仍然可能带有水印。反之亦然:没有检测到水印也并不能证明一切都是人写的。

第二篇在Medium上发出的文章,称这一公告对AI生成社区来说是一枚“核弹”,并声称“你实际上携带了一个数字红字”。没有引用实际文档,只有愤怒,配上恰到好处的戏剧性标点。

在这两者之间,我在Sylwia的文章下留下了一条评论。它用法语写成,由ChatGPT翻译,并以一个问题结尾:如果一篇文本经过人类的思考、撰写和审查,但最终英文措辞出自模型,你该如何归类它?这不是一个反问句。我仍然没有答案。

人们经常混淆的三件事

Medium上的那篇文章没有明说,却把三种几乎毫不相干的机制混为一谈。

Anthropic的水印。一种内置于模型中的统计信号,有文档记录,并公开承认其自身的局限:经过足够的编辑或翻译后它可能会消失,而且它的存在并不能说明最初的想法出自谁。

第三方消费级检测器。ZeroGPT及其同类工具。这些工具已存在多年,与Anthropic无关,其可靠性从未在大规模应用中得到严肃验证。

平台决策。在Medium上展示的徽章,以及一个惩罚被标记内容的策展算法。这些是各平台特有的编辑选择,而非水印的机械性后果。

Medium上的那篇文章写得好像第一个环节会自动触发后两个环节:Anthropic做标记,因此检测器会抓住一切,因此平台会惩罚。这种推理在你一拆开这些环节时就土崩瓦解——而且这理所当然:检测出模型参与了文本的生成,并不等于判定该文本是“由AI写的”。这种混淆掩盖了一个更深层的混淆,而公共讨论几乎总是系统性地忽视它。

辅助、生成、产出:三个不同的动词

由AI辅助的文本从头到尾都处于人类的编辑控制之下:想法、角度、结构以及最终发布决定都归属于某人,无论过程中与模型进行了多少次来回交互,以纠正、改写、翻译或检验推理链条。由AI生成的文本来自一个提示词,没有这种上游控制——想法本身来自人类,但生成的文本,就现状而言,属于模型。由AI以工业规模产出的文本又是另一回事:一条自动化出版流水线,没有任何类似编辑监督的东西。

那么,区分这三者的并不是模型干预了多少,而是谁一直掌握着决定权。

这三种情况承载着完全不同的编辑责任。把它们当作一个单一类别(“AI内容”)来对待,意味着用一个二元标准来评判文本,而现实却是一个充满细微差别的完整光谱——这正是不加区分的“经AI处理”徽章所做的。

实际测试揭示了什么

我把一篇写于2021年4月的文章——那时还不存在任何面向消费者的LLM——通过ZeroGPT进行了测试。大约一年前的一次测试显示其有97%的AI概率。最近的一次测试,对完全相同的文本、使用完全相同的工具,给出的结果是8.6%。

同样的工具。同样的文本,连标点符号都一模一样。两个互不相容的分数,相隔一年。

仔细查看第二次测试中被标记的段落,一种规律浮现出来。这些并不是随机的句子:它们始终是文章中最中性、最具教学性、结构最工整的段落——比如定义网络服务器是什么、解释CentOS Stream、逐步自动更新流程。而真正体现我个人风格的段落——自嘲、口头习惯、在跳蚤市场买的那只那不勒斯摩卡壶——从未被标记。

一次测试并不能证明检测模型总体上在衡量什么。但这一次测试强烈表明,该工具是对风格上的中立性和结构上的规律性作出反应,而不是对文本的真正来源作出反应。这正是问题所在:这些特征早在LLM出现之前就存在于人类写作中。检测器是在追逐一种源自人类的风格,却以机器对其的模仿作为参照点。这种推理咬住了自己的尾巴。

这篇文章实际上是如何写成的

既然这篇文章的核心论点是,判断文本的来源而非内容有多么困难,那么透明地交代这篇文章是如何产生的,是值得的。

起点并不是这篇文章:而是Medium上一篇帖子下的评论,它惹恼了我,让我忍不住回复。从那以后,我与Claude进行了数小时的来回交流——不是为了让它替我写,而是为了检验各种角度、核实数字、去寻找原始来源,而不是依赖自己模糊的记忆。ZeroGPT测试也不是为了这篇文章临时起意:我重新运行了它,以验证我记忆中的东西,而结果改变了我正要得出的结论。

初稿用法语写成——这是我真正用来思考的语言。经过几轮审查,并在几个不同的AI模型之间交叉核对——ChatGPT、Kimi、Grok、Mistral——以找出不一致之处和论点薄弱的地方。之后,我自己在Claude之外(我使用NotepadMD)阅读并修正了它,因为如果不逐行检查,我绝不会让文本出门。此后翻译成英文,然后对翻译进行审查,因为如果没有人检查,一份用词忠实的翻译仍可能背叛原文的语气。

在这个过程中结束时,文本很可能带有水印。同时,它也花去了数小时的研究、验证以及自动化和人工审查——而我自己审查的部分绝不是最不重要的:在每次重写之后,以及过程结束时。这两个事实同时为真,任何检测器都无法将它们区分开来。

一个徽章实际上的代价

以上一切都是技术层面的演示。它没有说明文本发布之后会发生什么,而这可能是更重要的部分。

一个“经AI处理”徽章,如果不区分“辅助”、“生成”和“产出”,就会把一个花费数小时思考、核对和写作的作者,与一个每天发布上百篇无人监督文章的内容农场归为一类。匆忙的读者看不到细微差别——他们只看到徽章,然后将这个思考型作者归入“作弊者”一类。对于从未作弊的人来说,这是真正的损失:他们的作品被一个既衡量不出努力、也衡量不出背后实际编辑控制的信号所评判,只衡量工具是否在链条中的某个环节出现。

而这种损失有一个荒谬的镜像。那些拒绝阅读标注着“AI”的文章的读者,却会毫不犹豫地接受谷歌搜索结果顶部的AI生成摘要——不加批判地阅读,不检查它从哪些来源提取信息,而且往往根本不会点击进入原始文章。独立研究在这一问题上趋于一致:当谷歌搜索中出现AI摘要时,第三方网站的点击量会下降一半,有时甚至更多,具体取决于研究方法。换句话说,一个仅仅因为徽章就称文章为“AI垃圾”的读者,可能在同一周里让AI帮他们总结了其他十个主题,却从未检查过它保留了什么、扭曲了什么。AI并非在原则上被拒绝。它在可见且被明确标注时遭到拒绝,在不可见且被默认强加时却被接受。

这种从点击到摘要的转变,也是一种更广泛的阅读损失,与任何徽章无关:一篇完整的、细腻的、有时甚至自相矛盾的文章,被三行无人质疑的平滑概括所取代。读者失去了那种本会迫使他们去评估来源、推理脉络和写作风格的摩擦——而这正是徽章声称让人们去判断的东西,也是摘要完全不经任何讨论就跳过的东西。

这不能解决什么

这些都无法阻止这篇文章下面出现“AI垃圾”评论。我在dev.to上从未收到过。但在Reddit上,我收到过。

但看看谁倾向于写这类评论。很少是真正在深入讨论话题的人。往往是追逐某个能引起共鸣的热词的人。在Reddit上,这些评论背后的账号往往展现出一种更广泛的模式:在不同无关帖子中反射性地、反复地点“踩”——这是一种排斥信号,与他们面前的实际内容关系不大。

技术论证和社会评判是两回事,后者不会因为前者而被化解。“AI垃圾”已经完全不再是一种对文本的判断:它变成了一种人们展示出来的钝化的、反射性的排斥信号,无论他们是否读过任何东西。

如果徽章不能衡量来源,而社会评判也不在乎这种衡量,那么值得问的问题也许不是“这是谁写的”,而是“这是谁想透彻的”。

这里的细微差别很重要。在我刚刚描述的过程中,主动权从未易手:是我打开会话、设定主题、决定一个角度是否成立或需要舍弃。模型不会带着一个我本来没有的想法来找我。如果它写了一段我没有要求的段落,它就会进垃圾桶——这一点在我每一次会话中保留什么、丢弃什么之中完全可见。

是谁想清楚了与Medium那篇文章的最初分歧,并选择将水印、检测器和平台分开对待,而不是将它们视为一体的?是谁决定一个测试比一种观点更有价值,并重新运行了两次,而不是重新发布一段模糊的记忆?

这些问题我可以逐一回答,一篇文本接一篇文本,一个决定接一个决定。没有检测器会问这些问题。它看着最终的形态,并从中推断出来源——然而来源从来不在形态之中。它存在于其前的决策链之中。

——

🧑‍💻

zhirenhun

一个热爱技术的程序员,喜欢分享前沿AI知识和开发经验。

ai llm writing discuss
← 上一篇
基于PHP、cPanel和Gemini Flash每月零成本构建生产级AI智能体
下一篇 →
你的提示词不是安全边界

📌 相关推荐

停止相信仅文本代理排行榜:来自 Cua-Bench 和 Factorio 的教训
2026/8/26
Agent Memory 有两种不同含义,回答引擎给出的却是错误的那一种
2026/8/26
LLM的止境:AI辅助VAPT流水线的确定性评分
2026/8/22
← 返回文章列表