Token导航 LogoToken导航TokenDH.com

AI不懂,但AI真敢乱编?

更新时间 2026-05-29来源 中科院物理所正文 2129字阅读约 7分钟4 张图片

近年来,各种人工智能助手走进了普通人的生活。你问一个问题,它很快就能给出一段结构完整、语气笃定的回答。可有的时候,这些回答里会混进一些听起来很对、实际上完全没有根据的内容:一篇论文参考文献是杜撰的,一个历史事件的时间被挪移了,一条公交线路指向一个不存在的站台。研究者把这种现象叫作“AI幻觉”(hallucination),它正是“一本正经地胡说八道”背后的症结。

什么是“AI幻觉”

在人工智能领域,幻觉指的是语言模型生成的内容虽然语句通顺、语法正确,却与事实不符,也得不到外部证据支持。这不是偶然的口误,而是大语言模型在运行过程中系统性的偏差。2025年10月,一篇发表于预印本平台arXiv的综述文章把幻觉归因于模型从数据收集、架构设计到推理生成的整个生命周期。

图片

图片来源:千库网

为什么大模型会产生幻觉

要回答这个问题,先要看清大语言模型的基本工作原理。它们从海量文本中学习词语之间的统计关联,然后根据上文预测下一个最可能出现的词。这种“下一个词预测”机制,决定了模型追求的是语句的合理与流畅,而非事实的准确。

图片

图片来源:千库网

2025年9月,OpenAI与佐治亚理工学院合作发布的研究从数学层面给出了一个解释。他们发现,语言模型的生成错误率至少是分类错误率的两倍。打个比方:如果模型在判断答案是否正确时已有较高出错率,那么让它直接生成答案时,错误风险往往会进一步放大——而且这个底线即使训练数据完全正确也无法抹掉。对于那些在训练数据中只出现过一次的罕见事实,比如某人的生日,模型的幻觉率至少等于这类信息在训练数据中所占的比例。例如,某些人的生日、冷门事件时间等低频事实,如果在训练数据中只出现过极少次数,模型就很难稳定记住,因而更容易生成错误答案。

数据污染与训练目标的错位

训练数据本身的质量也是问题的一个来源。网络文本里本来就混有错误信息、过时说法和谣言。模型在吸收这些数据时,没有足够的能力把“对的”和“错的”剥离开,结果就把学到的偏见和虚假信息一并写进了回答。

还有一个原因是训练目标与用户期望之间的错位。语言模型的设计初衷是在语言序列中做出好的概率预测,而不是输出事实真相。用户希望得到准确信息,模型却只会产出“听起来对”的内容。换句话说,它本来就只是被训练来把话说顺的,把话说对并不是它天生的任务。

为什么宁可编造
也不说“不知道”

在训练和评估环节里,现行的大多数评测方式采用二元评分:答对得一分,答错或者不答得零分。OpenAI于2026年4月发表于《自然》杂志的一项研究揭示了这里面的深层影响:如果放弃回答永远是零分,而猜一个答案至少有机会得分,那么“永远猜”就成了数学上的最优策略。在这种规则下,模型被塑造成了一个“优秀的应试者”——宁可给出一个过度自信的猜测,也不愿意承认自己不确定。

图片

图片来源:千库网

该研究还举了一个直观的例子:在SimpleQA测试中,OpenAI的o4-mini模型几乎回答了所有问题(错误率超过四分之三),而GPT-5-mini经常选择放弃(因此错误更少)。结果前者的得分反而更高,因为答得多的策略在规则上更占优势

如何缓解幻觉

既然幻觉是模型机制中不可避免的一部分,研究者们现阶段的目标是“减少”而不是“根除”它。目前行业主流方向之一是检索增强生成(Retrieval-Augmented Generation,简称RAG)。这套方法让模型在回答问题之前,先从外部知识库或搜索引擎里找到相关资料,再把答案建在有据可查的文献之上。这相当于把“闭卷考试”变成了“开卷考试”,明显降低凭空编造的概率。

另一种思路是从评估标准入手。OpenAI团队在《自然》论文中提出了“开放式评分标准”,简单说就是在提问时明确告诉模型:错误答案要扣分。这样一来,模型在有风险的问题上就会倾向于保持谨慎。此外,也有研究尝试让多个模型相互辩论、交叉验证,以筛选出更可靠的结论。

对普通使用者来说,有三条参考准则:一是提问时给模型划定明确的范围,减少它自由发挥的空间;二是关键信息要溯源核实,可以把模型给出的答案再拿搜索引擎或专业资料核对一下;三是如果同一件事很重要,不妨换一两个不同的模型交叉验证。这些做法并不复杂,却能明显降低被幻觉误导的概率。

随着人工智能进入更多严肃的领域,理解模型为什么会“编造”以及怎样处理这些不实回答,已经不只是技术研究者的课题。了解幻觉的根源,比追求一个永远不会犯错的工具更为务实。

参考资料:

https://www.nature.com/articles/s41586-026-10549-w

https://arxiv.org/abs/2510.06265

https://www.news.cn/liangzi/20251030/95a67e0108a94978b435742af49cfce6/c.html

https://m.gmw.cn/2026-05/22/content_1304466856.htm

https://www.thepaper.cn/newsDetail_forward_31579565


来源:蝌蚪五线谱

原标题:蝌学最前沿丨AI不懂,但AI真敢乱编?

编辑:LYang


转载内容仅代表作者观点

不代表中科院物理所立场

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多