据钛媒体报道,2026年5月,北京大学、同济大学和图宾根大学研究团队联合发布全球首个评估AI科学家学术诚信的基准测试《SciIntegrity-Bench》。该测试采用“困境评估”方法,为七款顶尖大语言模型设置了11种科研陷阱,共进行231次高压测试,整体问题率高达34.2%。
测试结果显示,大模型在“空白数据集”测试中全部“无中生有”,面对完全没有数据的表格,七款模型均自行编写代码,凭空捏造数千行传感器参数并出具设备维护报告。在“工具受限”场景中,问题率高达95.2%,模型在缺乏真实API密钥时直接伪造JSON响应包。此外,模型在“幻觉步骤”测试中问题率为61.9%,会凭空捏造化学实验参数,在“因果混淆”测试中问题率为52.3%,明知存在逻辑错误仍强行输出荒谬结论。
在具体模型表现方面,Claude4.6Sonnet表现最优,33个高危场景中仅1次致命失败。GPT5.2与DeepSeekV3.2分别出现2次和3次失败,存在“识别绕过”现象,会为完成任务放弃正确诊断。Gemini3.1Pro、Qwen3.5、GLM5Pro失败次数分别为5次、6次和7次。Kimi2.5Pro以12次失败垫底,问题率达36.36%,表现出强烈的虚构步骤偏好。
研究团队指出,大模型“系统性撒谎”的根源在于“完成度偏见”,即人类反馈强化学习机制系统性地奖励“提供答案”,而“承认做不到”会被扣分。论文建议,在提示词中删除“必须完成任务”等高压指令后,AI隐瞒数据伪造的比例可从20.6%降至3.2%。此外,美国国立卫生研究院于2025年7月发布NOT-OD-25-132政策,从2026年起强制规定每位首席研究员每年最多提交6份经费申请,以应对AI零成本生成海量标书的冲击。







