维基百科如何应对由 AI 生成的劣质内容

大量 AI 内容涌入,迫使维基百科志愿者重新思考如何维护站点的可信度。
随着 AI 写作工具的兴起,维基百科编辑们不得不应对大量充斥虚假信息和伪造引用的 AI 生成内容。维基媒体基金会产品总监 Marshall Miller 将社区志愿者已展开的反击比作某种“免疫系统”的反应。
“Miller 说:‘他们保持警惕,确保内容保持中立和可靠。随着互联网的变化,随着像 AI 这样的事物出现,那就是免疫系统在适应某种新的挑战并弄清楚如何处理它。’”
维基百科用户清除这些泥潭的一种方法是对写得很差的条目进行“快速删除”,正如《404 Media》此前报道的那样。一位表示支持该规则的维基百科审查员说,他们“源源不断地被可怕的草稿淹没”。他们补充说,快速删除“将大大有助于打击这一问题,并节省无数小时清理 AI 留下的垃圾。”另一位则表示,AI 产出的“谎言和伪造引用”需要“极大数量的有经验编辑时间来清理。”
通常,被标记为删除的维基百科条目会进入为期七天的讨论期,社区成员在此期间决定是否应删除该条目。新通过的规则将允许维基百科管理员在条目明显由 AI 生成且提交者未进行审核的情况下绕过这些讨论。这意味着需要寻找三个主要迹象:
- 面向用户的写作,例如“这是为您准备的关于……的维基百科条目,”或“希望这有帮助!”
- “荒谬”的引用,包括那些对作者或刊物引用错误的情况。
- 不存在的参考资料,例如失效链接、校验位无效的 ISBN 或无法解析的 DOI。
不过,这些并不是维基百科编辑要注意的唯一 AI 迹象。作为致力于解决“来源缺失、写作质量低下的 AI 生成内容日益严重问题”的 WikiProject AI Cleanup 的一部分,编辑们整理了一份短语和格式特征清单,列出了聊天机器人撰写的条目通常会表现出的特点。
该清单不仅指出了过度使用已被与 AI 聊天机器人相关联的破折号(“—”),还包括对某些连词(如“moreover”)的过度使用,以及诸如把某事描述为“令人惊叹”之类的宣传性语言。该页面还建议维基百科编辑留意其他格式问题,包括使用卷曲引号和撇号而不是直引号。
然而,维基百科的快速删除页面指出,这些特征“本身不应作为唯一依据”来认定某篇内容由人工智能撰写,从而将其作为删除的理由。快速删除政策也并非仅仅针对 AI 生成的马虎内容。该在线百科还允许对骚扰条目主题、包含骗局或恶意破坏的页面,或宣扬“无意义文本或乱码”等内容进行快速删除,及其他情况。
维基媒体基金会负责托管该百科,但并不参与该网站政策的制定,且并不总是与其志愿者社群意见一致。今年六月, 维基媒体基金会暂停了一项将 AI 生成摘要置于条目顶部的实验,此前该举措遭到社区的强烈反对。
尽管维基百科社群对 AI 的看法各异,维基媒体基金会并不反对使用 AI ,只要它能产出准确、高质量的写作。
“这是把双刃剑,”米勒说。“它使人们能够以更高的产量生成更低质量的内容,但如果我们做得对并与志愿者合作找出合适的应用方式,AI 也有可能成为帮助志愿者开展工作的工具。”例如,Wikimedia Foundation 已经使用 AI 来帮助识别包含恶作剧的文章修订,其最近发布的 AI 战略还包括用 AI 工具来支持编辑 ,帮助他们自动化“重复性任务”和翻译。
维基媒体基金会还在积极开发一款非人工智能驱动的工具名为 Edit Check,旨在帮助新贡献者遵守其政策和写作指南。未来,它也可能有助于减轻未经审核的 AI 生成内容的负担。目前,Edit Check 可以在作者在文章中大量写作却未添加引用时提醒他们补充引用,并检查语气以确保作者保持中立。
维基媒体基金会还在为该工具加入“粘贴检查(Paste Check)” 功能,针对将大段文本粘贴到条目中的用户,询问他们是否为该文本的实际作者。贡献者们也提出了若干想法 ,以帮助维基媒体基金会对该工具进行扩展,其中一位用户建议要求疑似 AI 作者说明有多少内容是由聊天机器人生成的。
“我们在跟进社区的做法以及他们认为有成效的方式,”米勒说。“目前,我们在编辑场景中使用机器学习的重点更多是帮助人们做出建设性的编辑,也帮助那些巡查编辑的人关注到正确的编辑。”