AI改写追踪:行级溯源如何精确区分人机文本

当AI深度参与写作,我们如何知道谁写了什么?
随着大语言模型和智能体(Agent)深度介入文本创作流程,一个日益紧迫的问题浮出水面:在一份经过多轮人机协作编辑的文档中,究竟哪些内容出自人类之手,哪些又是AI生成或改写的?
这个问题看似简单,实则触及了内容溯源(Provenance)、责任归属乃至学术诚信的核心。内容溯源这一概念源自拉丁语"provenire"(来自何处),最初是艺术品和文物鉴定中的核心方法论,用于追踪一件作品从创作到当前持有者的完整流转链。在数据科学领域,W3C曾专门制定PROV数据模型标准(2013年成为正式推荐标准),定义了实体(Entity,即被描述的数据或事物)、活动(Activity,即导致实体产生或变化的过程)和代理(Agent,即对活动负责的行为者)三者之间的关系图谱。W3C PROV数据模型不仅是一个孤立的标准,它实际上与更广泛的语义网(Semantic Web)和知识图谱生态紧密相连。PROV使用RDF(资源描述框架)作为底层数据表示,这意味着溯源信息可以被链接到更大的知识网络中。在实践中,科学数据管理平台如DataONE和CERN的开放数据门户都采用PROV来记录数据的产生和转化过程。
在传统场景中,这三者的关系相对清晰——比如一篇论文(实体)通过写作过程(活动)由某位研究者(代理)创作。然而在AI时代,传统溯源假设创作主体是明确的,但当AI深度介入时,"代理"的边界变得模糊——人类的意图通过提示词转化为AI的输出,形成了一种委托-执行的嵌套关系。PROV模型中的"delegation"(委派)关系虽然可以部分描述这种情况,但对于AI在执行过程中的自主决策(如选词、组织结构)如何归责,缺乏足够的表达力。PROV模型设计时的核心假设是活动的执行者具有明确的意图和可追责性,这一假设在AI代理场景下面临根本性挑战——当一个LLM在推理过程中做出的"决策"是基于概率分布的采样而非明确的意图推理时,传统的责任归因框架需要根本性的扩展。这种间接创作关系如何在溯源模型中精确表达,至今仍是争论的焦点。
传统的AI检测工具往往只能给出一个整体的"AI生成概率",却无法精确定位到具体的行、句或段落。而在真实的智能体编辑(Agentic Editing)场景中,文本是被人类和AI反复交替修改的——一段话可能由人类起草、AI润色、人类再校订,最终形成一个难以厘清来源的"混合产物"。
值得一提的是,智能体编辑与传统的"人类提问-AI回答"的对话模式有本质区别。在Agentic Editing中,AI具备自主规划、工具调用和多步执行能力:一个写作智能体可以自主决定先进行信息检索、再生成草稿、然后自我评估并迭代修改,整个过程可能涉及数十次对文档的独立编辑操作。其技术实现通常基于ReAct(Reasoning + Acting)或Plan-and-Execute等架构模式——智能体在每个步骤中交替进行推理(Thought)和行动(Action),一次看似简单的"润色段落"指令,可能在底层触发了信息检索、风格分析、多版本生成、自我评估等十余个原子操作,每个操作都可能对文档产生独立的修改。ReAct架构由Yao等人于2022年提出,其核心创新在于将链式思维(Chain-of-Thought)推理与外部工具调用交织在一起,形成Thought-Action-Observation的循环。Plan-and-Execute架构则更进一步,先生成完整计划再逐步执行,支持计划的动态调整。这种自主性意味着用户给出的单一指令可能被分解为一棵操作树,每个叶节点都对文档产生原子级修改,传统的"一次输入对应一次输出"的溯源模型在此完全失效。LangChain、AutoGPT等框架为这类工作流提供了标准化的编排能力。Cursor、Windsurf等代码编辑器已经实现了类似的Agentic工作流,而Notion AI、Jasper等文本工具也在向这一方向演进。AI不再是被动的"笔",而是主动的"共同作者"。
近期在 Hacker News 上出现的一个项目正试图解决这一痛点:基于差异比对(Diff-based)的行级文本溯源。它的核心主张是不再把文档当作一个黑箱去判断整体来源,而是通过追踪每一次编辑操作,为每一行文本打上"人类"或"AI"的来源标签。

从整体检测到行级溯源:思路有何不同?
传统AI文本检测的两大局限
目前主流的AI文本检测方法(如基于困惑度、水印或分类模型的方案)存在两个根本性缺陷:
- 检测粒度太粗:只能输出"这篇文章有80%可能是AI写的",无法告诉你具体是哪几句由AI生成。
- 鲁棒性不足:一旦人类对AI文本进行少量修改,检测器的准确率就会显著下降;反之亦然。
为了更好地理解这些局限的技术根源,有必要了解两种主流检测方法的工作原理:
困惑度(Perplexity)检测法的原理是:AI生成的文本通常具有较低的困惑度(因为模型倾向于选择高概率的词语组合),而人类写作因为更具创造性和不可预测性,往往呈现较高的困惑度。从数学定义上看,困惑度是语言模型对测试文本赋予的概率的倒数的几何平均值,即PPL = exp(-1/N × Σlog P(wi|w1...wi-1)),直观地衡量模型在预测下一个词时的"困惑程度"。GPTZero等早期检测工具正是基于这一假设。DetectGPT(2023年,Mitchell等人提出)进一步改进了这一思路:它不仅计算困惑度本身,还通过对原文进行多次随机扰动并比较扰动前后的对数概率变化来判断——AI生成的文本通常处于模型概率空间的局部最大值附近,扰动后概率普遍下降,而人类文本则没有这种特征。然而,受过良好训练的专业写作者可能写出低困惑度的"工整"文本,而经过特定提示词引导的AI也能生成高困惑度的"伪人类"文本,加之非英语文本和专业术语密集的场景下准确率大幅下降,使得这种方法的实际可靠性存疑。
AI水印(Watermarking)技术则在生成阶段嵌入隐蔽统计信号。其代表性方案由马里兰大学Kirchenbauer等人于2023年提出:在每个token生成时,算法根据前序token将词表划分为"绿色"和"红色"两组,偏向选择绿色token。通过检测绿色token出现频率即可判断来源。但水印方案面临的深层挑战是一个典型的博弈论问题——鲁棒性(抗攻击能力)与不可察觉性(对输出质量的影响)之间存在根本性权衡:信号越强越容易检测,但对文本质量的损害也越大。攻击方式包括释义攻击(用同义词替换)、翻译回译攻击(翻译成另一种语言再译回)、以及通过另一个无水印模型进行改写。2024年的研究表明,仅需替换约25%的token就可以使大多数水印方案失效。此外,水印方案需要模型提供方主动嵌入(开源模型难以强制),这在开源生态中尤为棘手——任何人都可以部署无水印的模型副本。Google的SynthID和OpenAI的内部水印系统是目前已知的工业级实现,但都未能从根本上解决人机混合文本的细粒度归属问题。
在智能体编辑流程中,人机内容高度交织,这类整体判断几乎失去了实用价值。
Diff-based行级溯源的核心逻辑
该项目提出的方案换了一个视角:与其事后猜测,不如在编辑过程中直接记录来源。其核心思路是利用版本差异(diff)——就像 Git 追踪代码变更那样,追踪文本的每一次修改:
- 当人类敲下键盘时,产生的变更行被标记为
human; - 当AI智能体执行改写、扩写或润色时,产生的变更行被标记为
AI; - 通过逐行比对前后版本的差异,系统可以维护一份行级别的来源账本。
这种方法的最大优势在于:它不依赖于"猜测"文本风格特征,而是直接记录"事实"——谁在什么时候改了哪一行。溯源从一个模糊的概率问题,变成了一个确定性的记账问题。
值得注意的是,这一思路与更广泛的内容认证生态系统存在天然的互补关系。C2PA(Coalition for Content Provenance and Authenticity)由Adobe、Microsoft、BBC等机构于2021年联合发起,旨在为数字内容建立从创建到发布的完整溯源链,使用加密签名将元数据绑定到内容上。行级文本溯源技术未来可能与C2PA标准集成,将文本的逐行归属信息作为元数据嵌入到C2PA的manifest中,实现跨平台的溯源互操作——这意味着一篇文章的行级溯源信息不仅存在于创作工具内部,还能随着内容的传播而保持可验证性。
行级溯源落地面临哪些技术挑战?
尽管思路清晰,但要在真实的智能体编辑场景中落地,仍面临不少工程与理论难题。
编辑操作的归属判定
最棘手的问题在于:当一行文本被人类和AI共同修改时,它到底算谁的?举个例子,AI生成了一个完整句子,人类随后改动了其中两个词——这一行的来源标签应该怎么打?
目前可能的解决方案包括:
- 主导贡献判定:根据编辑字符数的比例确定主要来源;
- 混合标签机制:允许一行同时拥有多个来源标记,如"AI生成 + 人类修改";
- 子行级追踪:进一步细化到词或字符级别,代价是复杂度和存储成本大幅上升。
如何在追踪精度和系统实用性之间取得平衡,是这类溯源系统设计的核心难点。这一问题在法律和学术语境中尤为敏感——如果AI生成了一段论述的核心论点,人类仅调整了措辞,从知识产权和学术诚信的角度看,"贡献"的度量不能简单地等同于字符编辑量。这里涉及一个更深层的哲学问题:创作贡献的本质是什么?是信息量的增加、是创意的原创性、还是表达的最终形式?不同的回答将导向不同的技术实现方案和政策框架。
diff算法的选型与优化
行级溯源高度依赖底层diff算法的质量。经典的 Myers diff算法由Eugene W. Myers于1986年提出,是目前应用最广泛的差异比对算法,也是Git默认使用的diff引擎核心。该算法的核心洞见是将序列比对问题几何化:对于长度为M和N的两个序列,构建一个(M+1)×(N+1)的网格图,从左上角(0,0)到右下角(M,N)的每条路径都对应一种编辑方案——向右走表示删除源序列的一个元素,向下走表示插入目标序列的一个元素,沿对角线走表示两个元素匹配。最短路径(对角线移动最多、水平/垂直移动最少的路径)即为最小编辑距离方案,在O(ND)时间复杂度内完成计算。这里D是实际编辑距离,意味着当两个版本相似度高时算法非常高效,非常适合追踪增量编辑的场景。
Myers diff算法的论文《An O(ND) Difference Algorithm and Its Variations》至今被引用超过3000次,是计算机科学中少有的将理论优雅性与工程实用性完美结合的案例。该算法本质上解决的是最长公共子序列(LCS)问题的一个等价形式,而LCS问题本身是动态规划教学中的经典范例。值得注意的是,Git实际使用的是Myers算法的线性空间改进版本(论文中的"进一步优化"部分),将空间复杂度从O(N²)降至O(N),这对处理大型文件至关重要。在Git的实现中,diff还结合了xdiff库的histogram diff等变体,以在不同场景下获得更好的结果。
Myers diff擅长处理增删操作,但在文本被大幅重组(如段落移动、句子重排)时,容易将"移动"误判为"删除+新增",从而错误地重置来源标签。针对文本溯源场景的改进方案包括:Patience diff(由Bram Cohen提出,优先匹配唯一行以获得更符合直觉的结果,特别适合处理有大量重复模式的文本)、语义diff(基于语义相似度而非字面匹配的比对,利用文本嵌入向量判断两段不同措辞的文本是否表达相同含义)、以及块移动检测算法(类似Git的rename detection思路,通过计算文本块的指纹哈希来识别跨位置的内容迁移)。如何组合这些策略以适应自然语言文本(而非代码)的特性,是工程实现中的关键技术选型。自然语言相比代码有更高的同义表达密度和更灵活的结构组织,这使得基于字面匹配的传统diff方案在文本溯源场景中的误判率显著高于代码场景。
行级溯源的应用场景与实际价值
行级溯源技术在多个领域都有显著的应用价值:
- 学术与教育:帮助界定论文、作业中AI辅助的具体边界,支持更精细化的AI使用规范,而非简单地"一刀切"禁止或允许。例如,学术期刊可以要求作者提交溯源报告,明确标注哪些段落由AI辅助完成,审稿人据此判断AI参与的程度是否符合期刊政策。
- 新闻与出版:满足内容透明度要求,让读者清楚知道哪些段落经过AI处理。美联社、《纽约时报》等机构已经制定了AI使用披露政策,行级溯源可以为这些政策提供技术支撑。
- 软件与法律文档:在责任追溯场景下,明确每一处修改的来源,对合规审计至关重要。当AI生成的合同条款出现法律问题时,行级溯源能够精确定位责任。
- AI训练数据清洗:精确识别并过滤AI生成内容,避免"污染"下一代模型的训练语料。
训练数据污染问题的严重性值得特别展开。模型坍缩(Model Collapse)是2023年由Shumailov等英国和加拿大研究者在Nature上首次系统论证的现象:当AI模型在包含前代AI输出的数据上训练时,会逐渐丧失对低概率事件的表征能力,输出分布趋向退化——就像"复印件的复印件"逐渐失真。从数学机制来看,假设真实数据分布为P,第一代模型学到的近似分布为P1≈P,当第二代模型在P1的采样上训练时得到P2≈P1,经过n代迭代后Pn与P的差异会不断累积,特别是分布尾部(低概率但有意义的内容)最先被"遗忘"。
从信息论角度可以获得更深刻的理解:每一代模型在训练时实际上是在执行一次有损压缩——它学到的分布是对训练数据分布的一个近似,必然丢失某些信息。当这个近似分布本身又成为下一代的训练数据时,信息损失会累积,具体表现为输出分布的熵(entropy)逐代降低,多样性缩减。Shumailov等人的实验使用了OPT-125M等模型进行了多达100代的递归训练,发现文本生成最终退化为重复固定短语。这一现象在图像生成领域同样被验证——Stable Diffusion在递归训练后生成的图像逐渐趋同于少数几种模式。实验表明,经过仅5-9代递归训练,模型输出就会出现明显退化。值得注意的是,即使AI内容仅占训练数据的一小部分(如10-20%),在特定领域中的累积效应也可能达到退化阈值。
随着互联网上AI生成内容的比例急剧增长——The Pile和Common Crawl等主流训练数据集的审计研究已发现AI生成内容的比例从2022年的不足5%上升到2024年的超过25%,有估计认为2024年网络新增内容中AI贡献已超过50%——如何在训练数据中精确识别并过滤AI生成部分成为各大模型厂商的核心工程挑战。行级溯源技术的价值在于:它不仅能标记整篇文章是否AI生成,还能在人机混合文本中精确剥离AI贡献的部分,为训练数据提供更细粒度的过滤依据,这对维护下一代模型的输出多样性和质量至关重要。
你可能没注意到,该项目目前仍处于早期探索阶段。但它所指向的方向——从事后检测转向过程记录——很可能代表了内容溯源领域一个更务实、更可靠的技术路径。
透明协作时代的基础设施
随着AI从"工具"进化为"协作者",人机共创正在成为常态。在这样的趋势下,我们真正需要的或许不是一道"人还是机器"的判断题,而是一套能够如实记录协作过程的透明基础设施。
Diff-based 行级溯源正是朝这个方向迈出的关键一步。它提醒我们:与其在成品上做事后推测,不如在创作过程中就建立起清晰的来源账本。当AI编辑变得无处不在时,这种"过程可追溯"的能力,可能会像版本控制之于软件开发一样,成为内容创作领域不可或缺的标配。
事实上,版本控制在软件开发中的普及历程为我们提供了有益的参照:Git在2005年由Linus Torvalds为Linux内核开发而创建时,许多开发者认为简单的文件备份或CVS/SVN等集中式版本控制已经足够。但随着协作规模的扩大——从数十人的团队发展到如Linux内核般数千名贡献者的项目——以及代码责任追溯需求的增长(git blame命令正是为此而生),分布式版本控制最终成为行业标准基础设施。GitHub上超过1亿开发者的协作实践证明了这种"每次变更都有记录"的模式对于大规模协作的不可替代性。内容创作领域正处在类似的拐点上——当人机协作的深度和频率达到某个临界值时,"谁写了什么"的精确记录将从可选的增值功能变为必需的基础能力。行级溯源技术正是为这个即将到来的时代做准备。
核心要点
- 传统AI文本检测(困惑度、水印、分类器)只能给出整体概率判断,在人机混合编辑场景下粒度过粗且鲁棒性不足
- Diff-based行级溯源通过记录每次编辑操作的来源,将溯源从概率推测转变为确定性记账,实现逐行的人/AI归属标注
- 核心技术挑战包括:混合编辑的归属判定、diff算法对自然语言重组的适应性、以及追踪精度与系统复杂度的平衡
- 该技术在学术诚信、新闻透明度、法律合规、训练数据清洗(防止模型坍缩)等领域具有直接应用价值
- 从"事后检测"到"过程记录"的范式转换,代表了AI时代内容溯源的更务实方向,正如版本控制之于软件开发,行级溯源有望成为人机共创时代的基础设施
- 行级溯源技术与C2PA等内容认证标准的潜在集成,可能推动跨平台、可验证的内容溯源生态系统的形成
相关推荐

AI网络攻防能力逼近临界点:模型研发该踩刹车吗
AI模型的网络攻防能力正逼近关键阈值,能自主发现漏洞、编写exploit甚至执行完整攻击链。本文深入分析放慢研发与加速防御两派观点,探讨能力封锁的博弈困境及系统性治理路径。
fx:极简开源原生编码智能体深度解析
fx:极简开源原生编码智能体深度解析
深度解析fx开源编码智能体,探讨其Tiny、Open、Native三大核心理念,分析极简AI编程工具在可控性、隐私保护和模型无关性方面的独特价值与局限。

ROS成立Physical AI特别兴趣小组,开源机器人生态拥抱具身智能
开源机器人联盟OSRA正式成立Physical AI SIG,推动ROS生态系统整合物理AI能力。本文解析Physical AI特别兴趣小组的目标、路线图及其对机器人开发者的深远影响。