Token导航 LogoToken导航

大模型真的会“扔骰子”吗?不列颠哥伦比亚大学揭露AI随机性的惊人真相

更新时间 2026-06-15来源 科技行者正文 6897字阅读约 22分钟

这项由不列颠哥伦比亚大学(University of British Columbia)与独立研究者合作完成的研究,以预印本形式发布于2026年6月,论文编号为arXiv:2606.06622,有兴趣深入了解的读者可通过该编号查询完整论文。

**当AI被要求"随机"时,它到底做了什么?**

设想一下,你委托一个助手帮你模拟掷骰子。这个助手学识渊博,知道骰子六个面每面出现的概率都是六分之一,也能滔滔不绝地向你讲解概率论。然而,当它真正开始"掷骰子"时,你却发现它每次给出的答案总是3或4,偶尔是5,几乎从不给出1、2或6。这位助手并非在欺骗你,它只是在给出它认为"最合理"的答案——而这恰恰背叛了随机的本质。

这正是当今大型语言模型(AI大模型)面临的困境。上述研究团队将这一问题系统化,建立了一个名为UNPREDICTABENCH的测试基准,专门用来检验AI模型能否真正产生符合目标概率分布的随机样本。结果发现,即便是当前最顶尖的AI模型,在这项任务上也表现得令人担忧。

为什么这件事值得普通人关注?因为AI越来越多地被用来模拟复杂的现实系统。经济学家用它来模拟市场行为,流行病学家用它预测疾病传播,工程师用它测试分布式系统。这些应用的核心前提,是AI必须能够忠实地再现真实世界的随机性与不确定性。如果AI只是不断输出它认为"最可能"的答案,那么用它做出的所有预测和模拟,都会带有系统性偏差——就像一个不会真正随机分配商品的超市抽奖机,总是让同一批人中奖。

**一、让AI扮演随机数生成器:一场复杂的考试**

为了严格测试这个问题,研究团队设计了UNPREDICTABENCH这套考试体系。整个考试包含448道题目,覆盖40种不同的概率分布,从最基础的硬币正反面(伯努利分布),到描述网络延迟的指数分布,再到用于统计突变事件的泊松分布,应有尽有。

考试的结构围绕七种不同的出题方式展开。最直接的一类是"文字显式"题目,直接告诉AI"请从参数为λ=18的泊松分布中采样一个数",一点不拐弯抹角。稍难一些的是"文字隐式"题目,不提分布的名字,而是描述一个现实场景——"一名质检工程师检查6个零部件,每个零部件独立以不同概率发生故障,请问一次检查中总共有多少个零部件损坏?"AI需要自己判断出这背后对应的是泊松二项分布,再进行采样。

更具挑战性的是代码题。"代码显式"类题目直接给出一段Python程序,让AI预测该程序随机运行一次的输出结果。而"代码隐式"类题目则更狡猾——代码里刻意隐藏了分布的真实身份,比如用两个Gamma分布变量的比值来生成一个Beta分布的样本,AI需要通过数学推理才能明白输出结果服从什么分布。此外还有"多峰分布"题目,要求AI从两个分量混合而成的分布中采样;以及专门测试排列随机性的"洗牌"任务;最后还有30道来自真实工程场景的题目,涵盖多线程竞争、内存垃圾回收、网络仿真等复杂情境。

每道题的评判方式也颇具匠心。AI模型被要求独立回答同一道题100次,然后将这100个答案合在一起,与从真实目标分布中抽取的10000个标准答案进行统计对比。使用的核心统计工具叫做Kolmogorov-Smirnov检验(可以理解为一种"分布形状相似度"的测量仪),如果AI的100个答案整体上与真实分布"长得像",就算通过。这个通过率就是论文核心指标KS@100的含义:在100道题中有多少比例的分布被AI正确复现了。

理论上,如果AI真正理解了随机采样,它的KS@100应该接近100%,就像一台真正的随机数生成程序。实际结果如何?

**二、成绩单出炉:没有一个模型及格**

当KS@100的成绩单摆在面前时,场面相当令人震惊。测试覆盖了十几款主流AI模型,包括GPT-4o、Claude Sonnet、DeepSeek V3.2、Llama系列以及多个Qwen模型等。

表现最好的是英伟达公司的Nemotron-3 Super 120B模型,KS@100达到了32.64%。听起来不算差?换个角度看:这意味着在448个分布任务中,这款AI有将近三分之二的时候无法生成与真实分布相符的样本序列。排名第二的GPT-4o为23.90%,DeepSeek V3.2为21.73%。

更值得玩味的是一些令人意外的排名。GPT-5.4这款OpenAI旗舰级产品,KS@100仅为15.18%,而Claude Sonnet 4.6只有4.70%。相比之下,Qwen3.5-2B这款只有20亿参数的小模型,KS@100达到了17.67%,力压众多体积大得多的强力模型。这说明模型大小并不是决定随机采样能力的主要因素,训练数据和调优策略才是关键。

从另一个角度看这份成绩单也很有意思。每个模型在"只采样1次"(KS@1)时都能拿到100%,这不难理解——只要输出一个在合理范围内的数字,就不会被统计检验拒绝。随着要求的样本数量增大,成绩急剧下滑。Claude Sonnet 4.6在KS@2时高达97.73%,到KS@100却跌至5.04%,这一落差堪称全场最惨烈——它能给出一个"看起来合理"的单次答案,却完全无法维持长期的分布一致性。这好比一个人虽然能随口说出一个随机数,但让他说一百个,你就会发现他一直在重复相同的几个数字。

**三、模型为何会失败:两种截然不同的"偷懒"方式**

研究团队通过定性分析,识别出AI在这项任务上失败的两种主要模式,可以形象地称之为"懒得想"和"想了不够宽"。

"懒得想"是指模型对目标分布根本没有内化正确的理解。以OLMo-3-7B面对参数λ=18的泊松分布为例,真实的泊松分布的样本应该广泛分布在10到30之间,但这个模型给出的100个答案几乎全部集中在0附近的极小数值,完全不符合λ=18时分布的真实形状。它不是在随机采样,而是在套用某种固定的错误模式。

"想了不够宽"则是另一类更微妙的失败。模型理解了分布的大致形状,能说出"应该在正负几的范围内",但输出时总是反复给出几个中间值,而忽略了分布的尾部——那些发生概率较低但真实存在的极端值。Nemotron-3-Super-120B在Skellam分布任务上的表现就是这类情况的典型:它能覆盖正负两侧,但概率质量的分配比例与真实情况相差甚远。

更深入的分析揭示了一个有趣的机制。研究团队不仅观察了模型的最终输出,还研究了模型内部的"logit概率"——可以理解为模型在选择输出每个数字之前对各种可能性的评估权重。结果发现,模型内部对各个数字的评估权重,与它最终实际输出的分布高度吻合。这意味着,问题并不在于"AI明明知道答案却给出了错误的答案",而是"AI的内部信念本身就是有偏的"。它在反复独立给出答案时,每次都稳定地给出同样偏斜的分布,说明这是一种结构性的认知局限,而非随机噪声。

**四、调优反而帮了倒忙:训练过程的意外副作用**

这项研究还做了一个颇有意思的对比实验:将同款模型的基础版(base model)与指令调优版(instruction-tuned model)进行了横向比较,测试对象包括Qwen3.5-2B、Llama-3.2-1B和Ministral-3B。

所谓指令调优,是指在基础模型之上,通过人类反馈对模型进行进一步训练,使其更听话、更安全、更擅长执行具体指令。这个过程通常会让模型在大多数任务上表现更好。然而,在随机采样这项任务上,调优版的表现在KS@100和JSD(另一种分布相似度指标)方面比基础版更差,或者提升幅度极为有限。

原因在于,指令调优的训练机制会惩罚那些"不寻常"的输出,鼓励模型给出人类评估者认为"合理"的答案。对于一个概率分布来说,"不寻常"的采样结果(比如一个出现概率只有5%的极端值)虽然不常见,但完整表达分布时是不可缺少的。调优让模型越来越保守,越来越倾向于给出分布中央的典型值,从而破坏了输出的多样性。这一发现与其他研究者的结论相互印证——人类反馈强化学习(RLHF)这一主流训练范式,在提升对话友好性的同时,系统性地压缩了模型的输出多样性。

**五、"想一想再回答"能解决问题吗?**

既然直接给答案不行,那让模型先思考一番再输出呢?研究团队测试了"推理模式"——让模型在给出最终答案之前先进行一段链式推理,也就是大家熟悉的"思维链"方式。

结果喜忧参半,而且各个模型的反应截然不同。对于Nemotron-3 Super 120B和DeepSeek V3.2而言,启用推理模式后最终输出的分布质量确实略有提升,但如果从推理过程中直接提取数字,质量反而大幅下降。这说明这两款模型在推理时并没有真正"探索"各种可能的采样值,而是反复在几个候选值之间来回考虑,最终输出的多样性实际上比直接给答案还差。

Qwen3.5-35B-a3b则呈现出最戏剧性的反差。这款模型在最终输出上几乎没有任何改善,无论样本数量是20还是100,KS@N变化为零。但如果直接从它的推理过程中提取数字,质量却大幅提升——在KS@20上提高了35个百分点以上。这意味着这款模型在"脑子里"其实想到了足够多样的候选值,但在给出最终答案时,它总是只报告其中某个特定的数字,而压制了其余的可能性。借用研究团队的一句话:"这个模型知道的比它说出来的要多。"

总体而言,推理对改善随机采样有一定帮助,但远远不够,无法从根本上解决问题。

**六、其他干预措施的效果:温度、批量与预算**

除了推理,研究团队还测试了几种其他可能的改善手段。

首先是调整"温度"参数——这是控制AI输出随机程度的旋钮,值越高,AI的输出越"跳脱"和多样化,值越低则越保守。结果非常符合直觉:对于较强的模型,提高温度(如从1.0提高到1.2或1.5)能显著提升随机采样质量。但对于较弱的模型,情况恰恰相反——提高温度虽然让输出更多样,但也带来了更多"出界"的异常值,反而加大了与真实分布的偏差。这一发现提示,温度调整是一个依赖模型能力的手段,并非通用解药。

其次是"批量输出"策略——与其每次只要求AI给出一个答案,不如让它一次给出10个甚至35个答案。这种方式背后的逻辑是:当模型需要同时给出多个值时,它自然会被迫考虑更广泛的可能性,而不是反复给出同一个"最合理"的答案。实验结果显示,这个策略对多数模型确实有帮助,尤其是一次要10个答案时效果最明显。Nemotron-3 Super 120B和Ministral-3B的KS@100在这一条件下提升了14到17个百分点。但Llama-3.2-1B是个例外,批量输出反而让它的表现变差——它在长列表中会重复值或漂移出支持范围。

研究团队还测试了"更大生成预算"策略,即让AI总共生成500甚至1000个答案,然后从中取前100个进行评估。短期来看,更大的预算确实略微提升了KS@100,因为样本更多,覆盖到各种可能值的机会也更大。但当用更严格的KS@500或KS@1000来评估这1000个答案时,质量迅速下滑,揭示出模型深层的分布偏差并没有消失,只是在小样本评估下暂时被掩盖了。

**七、任务难度差异:洗牌最难,真实场景最易但有例外**

不同类型的题目,AI的表现差异悬殊,呈现出一些有趣的规律。

洗牌任务是公认最难的类别。要求AI将一个列表均匀随机地重新排列,理论上每种排列方式出现的概率应该相同。然而GPT-5.4、Mercury-2、Claude Sonnet 4.6等多款强力模型在这个任务上的得分直接归零,完全没有再现均匀随机的排列分布。相比之下,DeepSeek V3.2、OLMo-3-7B、Llama-3.2-1B和Qwen3.5-2B反而在这个任务上维持了约37%的得分,说明这些模型在生成序列时保留了一定的排列多样性。

真实世界场景任务则呈现出另一种奇特的规律。Llama-3.2-1B这款整体表现垫底的小模型,在真实场景类任务上却拿到了高达59.09%的惊人成绩,成为全场单类最高分。研究团队认为这与题目性质有关——许多真实场景类任务(如垃圾回收顺序、网络包路由)的输出只有两三种可能,且近似均匀分布,连较弱的模型也能凑合着覆盖。

多峰分布(即两个分量混合的分布)对强模型反而更容易,对弱模型则近乎灾难。GPT-4o在多峰任务上的KS@100为38.75%,高于其单峰任务的22.96%。研究团队的解释是,混合分布的取值范围往往更广,能接受更多样的答案,这恰好迎合了强模型的输出倾向。但对于那些倾向于反复给出单一答案的弱模型,两峰结构意味着至少要覆盖两个区域,这超出了它们的能力上限,反而全面崩溃。

**八、与创意能力测试的对照:随机采样是模型质量的真实映照**

研究团队还做了一个跨基准的比较实验,将UNPREDICTABENCH的得分与另外两个专门测试创意能力的基准进行了对比,分别是NoveltyBench(测试词汇多样性和输出的实用性)和CREATE(测试联想创造力)。

结果显示,一个模型在UNPREDICTABENCH上的分布保真度得分,与它在CREATE实用性评分(r=0.75和0.78)以及NoveltyBench实用性评分(r=0.65)之间存在较强的正相关。这意味着,一个能够忠实再现概率分布的模型,也往往在创意任务上更有用。

另一个有趣的反差在于词汇多样性(Distinct10指标):这个指标与分布保真度之间是负相关(r=-0.21)。Llama-3.2-1B这款模型在词汇多样性上独占鳌头,但它的KS@100接近垫底。这说明"输出的词汇花样多"和"输出的分布符合目标"完全是两回事,不能混为一谈。真正重要的,是输出是否经过校准,是否忠实地反映了背后的随机过程,而不仅仅是表面上看起来丰富多样。

这一发现对"如何评价AI模型质量"这个问题也有启示:分布保真度可以作为一种不依赖人类评判者的统计客观指标,补充甚至部分替代需要AI充当评委的主观评测方法。

**归根结底,AI的随机性问题揭示了什么?**

说到底,UNPREDICTABENCH揭示的不只是"AI不擅长扔骰子"这么简单的事实,它触及了一个更根本的问题:AI的训练过程让它天然地倾向于给出"最可能正确"的答案,而不是"来自真实分布的随机答案"。这两件事在某些应用中可以共存,但在需要真实模拟随机系统时,它们是根本矛盾的。

对于经济学家、流行病学家、系统工程师等依赖AI进行仿真的人来说,这项研究是一个重要的警示。当你用AI模型替代真实的随机过程时,你得到的输出可能系统性地偏向某些结果,而远离真正的不确定性。这可能导致对风险的低估、对极端情境的忽视,以及过度自信的决策建议。

当前没有任何一个模型真正解决了这个问题,最佳成绩也不过32.64%,距离理论上限还有巨大差距。提高温度、让模型思考、批量生成答案,这些手段都能带来一定改善,但都不能从根本上修复问题。这意味着,如何在保持对话能力的同时,让AI真正掌握分布采样的能力,仍然是一个有待攻克的研究方向。

有兴趣深入了解完整实验细节和技术方法的读者,可以通过arXiv编号2606.06622找到这篇论文。UNPREDICTABENCH的数据集已在Hugging Face平台公开,代码与标准答案也已在GitHub上发布,供研究者使用和复现。

---

Q&A

Q1:KS@100具体是怎么计算的,为什么用这个指标来衡量AI的随机采样能力?

A:KS@100的计算方式是:对同一个分布任务,让AI独立回答100次,然后用Kolmogorov-Smirnov统计检验,比较这100个答案的整体分布形状与从真实分布中抽取的10000个标准样本是否"长得像"。如果统计检验没有拒绝这两组样本来自同一分布的假设,就算这道题通过。所有题目的通过率就是KS@100分数。选用这个指标是因为它只需要样本,不需要知道真实分布的解析形式,适用范围广;而且随着样本数量增加,检验会越来越严格,天然地体现了任务难度。

Q2:Nemotron-3 Super 120B为什么在随机采样任务上表现明显优于GPT-4o、Claude等更知名的模型?

A:研究没有给出确切原因,但结合其他发现可以推断几点。首先,指令调优程度越深的模型,输出多样性越低,Claude Sonnet 4.6等为对话体验深度优化的模型恰恰属于这一类。其次,MoE(混合专家)架构的模型(如部分Qwen系列)在给定输入时倾向于激活固定的专家子集,进一步压缩了输出多样性。Nemotron-3系列的训练目标和架构设计可能在多样性保留上做了更好的权衡,但具体机制仍需进一步研究。

Q3:UNPREDICTABENCH测试的分布保真度能力,对普通用户使用AI有什么实际影响?

A:对大多数日常使用场景(如写作、问答、编程辅助),这个能力影响不大。但如果你用AI来做任何涉及概率模拟或不确定性建模的工作,影响就非常显著。例如用AI模拟市场波动、测试系统在随机故障下的行为、生成多样化的训练数据,或者让AI扮演具有随机行为的实体,当前所有主流模型都会系统性地低估极端情况的发生概率,导致模拟结果偏向中间态,风险评估可能严重失真。

文章标签大模型学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多