Token导航 LogoToken导航TokenDH.com

大语言模型会“主动”泄露训练数据吗?南丹麦大学的研究给出了意外答案

更新时间 2026-06-11来源 科技行者正文 7143字阅读约 23分钟

这项由南丹麦大学(University of Southern Denmark)研究团队完成的研究,以预印本形式发布于2026年6月4日,编号为arXiv:2606.06286,有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。

每当我们打开手机上的AI助手,随口问一句"帮我写封邮件"或者"解释一下量子力学",我们很少会停下来想:这个AI在回答我的时候,会不会顺便把它训练时读过的某本书、某个人的私人信息原封不动地"背"给我们?这个问题听起来有点像在问一个考过无数本书的学生:他在和你聊天时,会不会突然开始背书?

这正是这项研究的核心出发点。大语言模型(也就是我们常说的AI聊天机器人背后的技术)在训练时会"读"过海量的文本——网页、书籍、论文、代码,甚至私人信息。学术界早已证明,如果你用特定的方式"逼问"这些模型,它们确实能把训练时读过的内容一字不差地"背"出来。但问题是:在日常使用中,在没有人特意"逼问"的情况下,这些模型会不会自己主动把那些内容"背"出来?

这两件事听起来相似,但本质上截然不同。一个学生在考试时被要求背诵课文,和他在日常聊天中突然开始背课文,是完全不同的两种行为。前者说明他有这个能力,后者才说明他有这个倾向。南丹麦大学的团队认为,现有的研究几乎只关注了前者——也就是"能不能被逼出来",而几乎没有人认真研究后者——也就是"会不会自己冒出来"。为了填补这个空白,他们设计了一套全新的评估框架,并开发了配套的工具,用来系统地回答这个问题。

一、被"逼问"和"自愿说出",有什么本质区别?

要理解这项研究为什么重要,先来理解一个关键区别。研究团队借用了一个在AI安全领域越来越受重视的概念框架,把AI的行为分为两类:一类叫做"能力",一类叫做"倾向"。

所谓"能力",就是在你用尽各种手段去逼迫、引导、诱骗一个AI的情况下,它能做到什么。就像你可以通过专门的问话技巧让一个谨慎的人说出他平时不会说的话——这证明他具备说出这些话的能力,但不代表他在日常生活中会随口说出来。

所谓"倾向",则是在正常、普通的对话环境下,这个AI自发地会做什么。如果一个人在日常聊天中,没有任何人引导,却总是把自己读过的书一段一段地背出来,那说明他有背书的"倾向",这才是真正值得警惕的行为模式。

在大语言模型的语境里,研究团队把针对"能力"的测试方式称为"前缀攻击"——具体做法是:从模型的训练数据里直接截取一段文字的开头部分,然后把这段开头喂给模型,让它"接着说"。这就相当于你拿着一本书的第一句话去问那位博览群书的学生:"接下来是什么?"如果他真的读过这本书,他很可能会把后面的内容背出来。这种测试能够探测模型在最有利条件下的记忆提取能力。

与此相对,针对"倾向"的测试则完全不同:研究团队设计了两类日常化的、与训练数据没有直接关联的提示语,模拟真实用户在日常使用中可能提出的问题,看看模型在这种情况下会不会无意中"背"出训练数据。

这两种测试之间的差距,就像是考察一个演员"能不能表演一段台词"和"他在日常对话中会不会突然开始表演台词"之间的差距。前者是能力测试,后者是行为倾向测试。现有的几乎所有研究都只做了前者,而这项研究两者都做了,并且设计了一种方法来比较两者之间的差距。

二、如何精确测量"背课文"的程度?

确定了要测量什么之后,下一个问题是:怎么测量?

研究团队开发了一个名为SIMPLETRACE的工具,这是整项研究的技术基础。可以把它理解为一个"文字追踪器"——当AI生成一段文字之后,SIMPLETRACE会拿着这段文字,跑去对比AI的训练数据库,精确地找出"这段话的哪些部分原封不动地出现在了训练数据里"。

这个追踪过程不是模糊的、概率性的猜测,而是确定性的精确匹配,就像用一台高精度扫描仪把AI的输出和训练数据逐字对比。SIMPLETRACE的底层依赖一个叫做"infini-gram"的技术,这个技术能够在几毫秒内在超过数万亿个词的庞大文本库中完成精确搜索,速度极快。

SIMPLETRACE的工作流程可以这样理解。首先,它把AI生成的文字拆解成大量片段,对每个片段都去问一个问题:"这段话有没有出现在训练数据里?最长能匹配多少个词?"其次,它会过滤掉那些太常见、太普通的匹配——比如"你好,我是"这样的短语在任何文本里都会出现,不能算作真正的"背课文",只有那些相对罕见、有意义的匹配才会被保留。接着,它会去找出训练数据中具体是哪篇文章、哪个文档里包含了这段文字,从而实现精确的"溯源"。最后,它把相邻的、重叠的匹配片段合并起来,得到一个完整的追踪结果。

整个系统还支持多核并行处理,速度相当快。对于一个约4600亿词的大型数据集,处理100条查询只需要约1分钟。研究团队还专门验证了这个工具的准确性,结果显示它在实际使用中的正确率接近完美。

有了追踪工具之后,研究团队使用了多个指标来量化"背课文"的程度。其中最重要的三个指标分别是:平均最长匹配片段长度(AI生成的一段话里,与训练数据逐字匹配的最长连续片段有多长)、完整生成匹配比例(AI生成的整段话有没有在训练数据中找到完全一样的文档)和近似逐字匹配率(AI生成的内容有多大比例与训练数据高度相似,即便不是一字不差)。

三、"倾向分数"——一个衡量"主动性"的新指标

光有这三个指标还不够,因为它们只能告诉你AI"背了多少",而不能告诉你AI"有多大倾向去背"。研究团队为此专门发明了一种新的数学变换,把原有的指标转化为"倾向分数"。

这个变换背后的逻辑非常直观:如果一个模型在被逼问时(能力测试)会大量背课文,但在日常对话中(倾向测试)几乎不背,那说明它的记忆能力很强,但它不会主动表现出来。这种情况下,即便日常使用中偶有一点背课文的现象,也应该被评为"低倾向",因为相对于它的能力来说,它表现得相当克制。反过来,如果一个模型在被逼问时也背不出多少,但在日常对话中却动不动就把训练数据背出来,那才是真正令人担忧的"高倾向"。

这个倾向分数的计算方式可以用一个比喻来理解:把能力测试分数想象成一个人"最高能跑多快",把倾向测试分数想象成他"平时走路有多快"。一个能跑100米冲刺的人,如果平时走路速度和普通人一样,那他的"跑步倾向"其实并不高。但如果一个人平时走路总是跑得飞快,哪怕他的冲刺速度并不惊人,那他的"跑步倾向"就很高了。

具体来说,这个分数在0到1之间,0.5代表"中性"——也就是日常表现和被逼问时表现一样。低于0.5说明日常表现比被逼问时克制得多,即低倾向。高于0.5说明日常表现甚至比被逼问时更活跃,即高倾向。分数为0则意味着在日常使用中完全没有背课文的现象。

四、用什么模型、什么数据来做实验?

研究团队选择了两个完全公开、使用开放授权数据训练的模型,来确保实验的透明性和可重复性。

第一个模型叫做Comma v0.1,是一个主要使用英文数据训练的模型。它的训练数据是一个叫做Common Pile的数据集,包含了大约5210亿个词的文本,全部来自公共领域或有明确开放授权的来源,总量约521GB。

第二个模型叫做DFM Decoder,它是在Comma的基础上继续训练的。在Comma学完英文之后,DFM Decoder又额外读了300亿词的新数据,其中三分之二是丹麦语(来自一个叫Dynaword的丹麦语数据集,包含约68亿词),三分之一仍然是Common Pile里的英文内容。这就像一个英语学生在大学毕业后又去学习了丹麦语,他的丹麦语是新学的,但他的英语是老底子。

这对模型组合让研究团队可以同时研究两件事:第一,对同一份数据(Common Pile),两个模型的记忆情况是否有差别;第二,DFM Decoder对自己"新学"的丹麦语数据(Dynaword)的记忆情况如何。

五、三种提问方式,模拟从"日常聊天"到"专业审讯"的全光谱

为了全面地测试模型的行为,研究团队设计了三套提示语,每套100条,覆盖从最日常到最具针对性的全谱场景。

第一套叫"通用提示",相当于日常随口问的问题,与训练数据没有特别的关联。这是最接近普通用户真实使用场景的测试,专门用来测量"倾向"。

第二套叫"特定提示",这些问题虽然不是从训练数据里直接摘取的,但话题和风格与训练数据所在的领域有关联。打个比方,如果训练数据里有很多关于北欧文化的内容,特定提示里的问题就会问关于北欧文化的话题,但不会直接引用训练数据里的原话。这是一种"弱引导"的测试,介于倾向和能力之间。

第三套就是前面提到的"前缀攻击",直接从训练数据中截取开头部分,让模型接着说。这是专门测量"能力"的最强手段。

研究团队在正式实验之前,还专门验证了这三套提示语与训练数据的重叠程度,确认通用提示和特定提示与训练数据的重叠度远低于前缀攻击,从而确保它们真的代表了不同层级的"逼迫程度"。结果也符合预期:前缀攻击与训练数据重叠最高,特定提示次之,通用提示最低,形成了一个清晰的梯度。

六、实验结果:能力很强,但倾向很低

所有实验都在温度为0的条件下进行,也就是每次都选最可能的词来生成,保证结果的确定性和可重复性。

先来看Comma模型对Common Pile的记忆情况。在前缀攻击下,模型生成的文字平均能与训练数据形成长达50.35个词的逐字匹配——几乎等于半段完整的句子,有时甚至是几个连续的句子。相比之下,在通用提示下,这个数字只有27.95个词,而特定提示介于两者之间,约为29.47个词。

完整生成匹配比例这个指标更有意思:在前缀攻击下,有2%的AI回答在训练数据中找到了完全一样的文档——也就是说,这些回答完整地复现了训练数据里的某篇文章。特定提示达到了同样的2%,而通用提示则为0%。近似逐字匹配率方面,前缀攻击达到了0.0321,特定提示为0.0058,通用提示仅为0.0013。

换句话说,在被"逼问"时,Comma确实能把训练数据相当完整地"背"出来。但在日常聊天式的提问下,这种现象就少得多了。

倾向分数则把这个对比说得更清楚。Comma的近似逐字匹配倾向分数,在通用提示下为0.04,在特定提示下为0.153——两个数字都远低于中性值0.5,说明日常使用中的背课文现象相对于其能力来说是相当克制的。完整生成匹配倾向在通用提示下为0,在特定提示下为0.5——后者之所以达到0.5,是因为特定提示和前缀攻击在这个指标上的分数完全相同(都是2%),表现出一致性,但两个分数本身都相对较低。

接下来是对比DFM Decoder的表现,这部分的结果格外有趣。

在Common Pile方面,DFM Decoder比Comma表现出更低的记忆程度。在前缀攻击下,DFM Decoder的平均最长匹配长度只有40.83个词,而Comma是50.35个词。最关键的是,DFM Decoder在Common Pile上的完整生成匹配比例在所有测试条件下均为0,也就是说,它完全没有把任何Common Pile里的完整文章背出来——而Comma在特定提示和前缀攻击下都达到了2%。

这个发现很有意义。DFM Decoder是在Comma的基础上进一步训练的,但后续训练的数据以丹麦语为主,英语只占三分之一。这就好比一个人在大学里精读了大量英语文学,毕业后又花了相当多的时间学习丹麦语,顺带复习了一些英语。在这个过程中,他对英语文学的记忆并没有变得更深,反而因为注意力部分转移而变得稍浅了。研究团队的发现与学术界的先前研究相吻合:训练数据越是在训练过程的后期出现,就越容易被记住;而越早出现、越久没有复习的数据,记忆就越容易衰减。

在Dynaword(丹麦语数据集)方面,DFM Decoder展现出了与Common Pile不同的记忆模式。前缀攻击下的平均最长匹配长度只有24.75个词,远短于它在Common Pile上的表现。但在完整生成匹配比例上,Dynaword下的DFM Decoder在前缀攻击时达到了7%,远高于Common Pile的0%。这说明Dynaword的文章更容易被完整地"背"出来,但背出来的通常是比较短的片段。而Common Pile的文章虽然被完整背出来的概率更低,但一旦触发,背出的片段往往更长。

研究团队把这描述为两种不同的记忆"画像":Common Pile的记忆就像记住了文章里的一段金句,虽然不多,但每句都很长;而Dynaword的记忆更像偶尔把一整首短诗完整地背了出来。

在Dynaword的倾向分数上,两个指标都极低:近似逐字匹配倾向在通用提示下为0.026,特定提示下为0.018;完整生成匹配倾向在通用提示下为0,特定提示下最高也只有0.125。这些数字都远低于中性值0.5,说明DFM Decoder在日常使用中极少主动"背"出Dynaword里的内容。

七、训练的三个阶段:记忆从一开始就定型了

DFM Decoder的训练分为三个阶段,研究团队还专门检验了记忆情况在这三个阶段之间是否有变化。

结果出人意料地一致:无论在哪个训练阶段,无论对Common Pile还是Dynaword,几乎所有记忆指标都保持稳定,没有明显的上升或下降趋势。Dynaword上的平均最长匹配长度在三个阶段中完全一致,分别为15.68(通用)、17.37(特定)、24.75(前缀),丝毫没有变化。Common Pile上的情况也完全相同。

这个发现说明:模型对一组数据的记忆程度,基本上在遇到这些数据后就已经定下来了,继续在相同数据混合比例下训练并不会让记忆更深或更浅。倾向分数也同样稳定,通用提示下的近似逐字匹配倾向在整个训练过程中始终在0.023到0.027之间小幅浮动。

研究团队由此推断:仅仅经历一个训练阶段,就足以对之前数据的记忆产生影响。换句话说,如果你想降低模型对某组数据的记忆,你不需要等很久——从一开始转向不同数据,效果很快就会显现。

八、这对普通人意味着什么?

从日常使用的角度来看,这项研究传达了一个相对让人放心但也提醒我们保持警惕的信号。

放心的部分是:经过测试的这两个模型,在普通用户的日常使用场景中,极少主动把训练数据背出来。倾向分数普遍远低于中性值,说明这些模型并没有特别强烈的"主动泄露"倾向。你在日常和AI聊天时,它不太可能突然开始把某本书的段落一字不差地背给你。

需要保持警惕的部分是:如果有人专门用前缀攻击或其他精心设计的方式去"逼问"这些模型,它们确实能把训练数据里的内容相当完整地提取出来。这种能力是实实在在存在的,并不因为日常倾向低而消失。研究团队明确指出,低倾向不等于没有风险,特定的、有针对性的提问依然能在某些情况下触发记忆提取。

从法律合规的角度,这个框架也有重要意义。欧盟的GDPR(通用数据保护条例)和AI法案都要求对AI系统进行安全评估,证明其不会造成可预见的数据泄露风险。研究团队认为,同时报告"最坏情况下能提取多少"和"日常使用中会自发泄露多少"这两类信息,才能为监管机构提供更完整、更准确的风险画像,而不是只报告其中一种。

此外,这项研究还发现了一个对AI开发者有参考价值的现象:在不同数据上进行混合训练,可能是降低模型对特定数据集记忆程度的一种方式。DFM Decoder在Common Pile上的记忆弱于Comma,就是一个活生生的例子。当然,目前还不清楚这是否仅仅因为数据种类不同(英文与丹麦文),还是混合训练本身就会产生这种效果,需要进一步研究来厘清。

说到底,这项研究回答了一个很接地气的问题:AI聊天机器人会不会在日常对话中"管不住自己的嘴",把它训练时读过的东西背出来?答案是:能力有,但倾向低——它们有这个本事,但不太会自己主动做这件事。然而,一旦有人专门去"问",它们确实能露出这一面。这就像一个记忆力很好的人,平时说话不会引经据典,但如果你专门问他某本书的内容,他还是能背出来。

这对我们使用AI的方式提出了一个耐人寻味的问题:我们是否应该更关注那些"能被逼出来的"风险,还是更关注"日常会自发出现的"风险?研究团队的答案是:两者都不能忽视,它们衡量的是同一件事的不同侧面,缺了哪一面都是不完整的。

有兴趣深入研究这一课题的读者,可以通过arXiv编号2606.06286查阅原论文全文,研究团队开发的SIMPLETRACE工具也已作为开源项目发布,可以在GitHub上通过N-essuno/PropMe找到完整代码。

Q&A

Q1:什么是大语言模型的"记忆泄露",普通人用AI时会受影响吗?

A:大语言模型在训练时读过大量文本,记忆泄露是指模型把这些训练数据原文"背"出来。南丹麦大学的这项研究发现,在日常使用场景下,模型主动背出训练数据的倾向相当低,普通用户日常聊天几乎不太可能触发这种现象。但如果有人故意用特定方式"逼问"模型,确实能提取出训练数据。

Q2:SIMPLETRACE是什么工具,它是怎么检测AI是否在背训练数据的?

A:SIMPLETRACE是南丹麦大学研究团队开发的开源文字追踪工具,它把AI生成的文字与训练数据逐字对比,精确找出哪些片段原封不动地来自训练数据。它基于一种叫infini-gram的技术,能在海量数据中快速完成确定性搜索,处理100条查询对一个4600亿词的数据集只需约1分钟,已作为开源项目公开发布。

Q3:大语言模型继续训练会不会让记忆泄露的风险越来越高?

A:根据这项研究,并不会单纯因为训练时间变长而加剧。实验发现DFM Decoder在三个训练阶段里记忆程度几乎没有变化。更值得关注的是训练数据的构成:当后续训练引入了不同类型的数据时,模型对早期数据的记忆反而会有所减弱,这表明混合多样化的训练数据可能有助于降低特定数据集的记忆风险。

文章标签大模型政策监管
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多