人工智能检测器分数不是监管链。它是由工具产生的统计信号,其错误率因文本长度、体裁、语言背景、编辑历史和模型版本而异。
本人工智能检测评估指南为学校、出版商和产品团队提供了更公平的工作流程。它建立在独立宣言误报示例 和更广泛的AI 聊天机器人检测方法 文章的基础上。
从实际问题开始
“用了AI吗?”往往过于模糊而难以管理。一篇有用的评论至少可以区分四个问题:
- 是否曾使用过人工智能系统?
- 此任务或工作流程是否允许使用它?
- 该人是否按照要求披露或记录了使用情况?
- 提交的作品是否准确、原创且归属于本人?
探测器得分无法回答所有四个问题。它无法识别确切的工具、证明意图或解释允许的语法更正是否变成了未公开的代写提交。
证据层次
更喜欢描述过程的证据,而不是从最终文本中推断出的数字。
| 证据 | 它有助于建立什么 | 主要限制 |
|---|---|---|
| 草稿和版本历史 | 工作随着时间的推移如何变化 | 有些工具不保留历史记录 |
| 注释、来源和引文 | 作者是否理解并支持主张 | 注释也可以生成或不完整 |
| 对话或工具日志 | 人工智能系统被要求做什么 | 日志可能不可用或隐私敏感 |
| 作者访谈或演练 | 该人是否能够解释决定并修改工作 | 人类的判断仍然容易出错 |
| 探测器得分 | 提出更多问题的理由 | 误报和工具漂移 |
正确的结果通常是具有记录的不确定性的置信度评估,而不是一次扫描生成的二进制标签。
为什么检测器分数失败
检测工具寻找与生成的文本相关的模式。这些模式也出现在正式的、高度编辑的、公式化的、翻译的或由第二语言编写的人类写作中。
短文特别不稳定,因为区分风格和偶然的证据较少。当相同的文本经过轻微编辑、重新格式化或发送到不同的检测器版本时,分数也会发生变化。
因此,永远不要像比较校准概率一样比较不同工具的分数。记录工具名称、版本、日期、输入长度、语言以及扫描前文本是否经过编辑。
四阶段审核工作流程
1. 保留上下文
保存提交的文本、检测器报告及其生成条件。不要为了获得另一个分数而将敏感作品粘贴到未经批准的第三方服务中。
2. 索取出处
要求提供草稿、源材料、大纲注释、引文以及编辑过程的简要说明。在工作场所中,存储库历史记录、设计文件和评审意见可以提供相同类型的证据。
3. 进行人工审核
审稿人应检查事实的准确性、来源质量、与先前工作的一致性以及作者解释结果的能力。审查不应该是基于写作风格的变相审问。
4. 提供上诉途径
记录哪些证据改变了决定、谁可以审查上诉、记录保留多长时间以及如何保护隐私。不透明的自动拒绝并不是一个站得住脚的政策。
设计负责任的政策
负责任的政策应该说:
- 允许、限制或禁止哪些人工智能用途;
- 需要披露什么内容;
- 人们应该保留哪些过程证据;
- 探测器分数本身永远不是决定性的;
- 谁审查已标记的案件;
- 该人如何回应或上诉;
- 如何存储和删除敏感草稿和日志。
该政策还应该在已知的人类写作、翻译写作和编辑写作上进行测试,然后再用于高风险决策。如果误报率不可接受,则不应将检测器用作门。
底线
人工智能检测最适合提示就流程、质量和政策进行公平对话。当概率分数被视为证据时,它就会变得有害。保留出处,审查工作,解释不确定性,并保留有意义的上诉路径。