IT之家 9 月 21 日消息,AI 评测机构 Vals AI 利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT‑6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总测试时长达到 141 小时。
Vals AI 的这项测试并非由 OpenAI 官方设计,而是由第三方独立开展的评估项目,因此可以观察 Astra 在封闭测试环境之外的实际表现。

在测试过程中,GPT‑6 Astra 展现出前所未有的长周期规划与执行能力,达成过往 AI 难以实现的成就。其成功搭建半自动烈焰人农场,收集 6 根烈焰棒。深入下界诡异森林,击杀多名末影人,拿到 3 颗珍贵末影珍珠。完成大量探险后,将全部稀有物资集中存放在营地木箱当中,床也放置在储物箱旁作为重生点。一切都在向着末地打龙的通关之路发展。
然而,一只爬行者悄悄靠近营地并发生自爆,直接炸毁储物木箱与重生床。AI 耗费上百小时积攒的关键道具几乎全部损毁,游戏进度一夜清零。
爆炸事件之后,GPT‑6 Astra 表现出明显的挫败消沉。其彻底放弃探索、打怪、推进通关目标,连续数小时仅循环种植土豆。会反复自省告诫自己:重要物品务必随身携带,永远不要存放到没有防护的箱子。还出现“创伤后偏执”,对一切绿色物体高度警惕,甚至把甘蔗误认成爬行者,还主动提醒自己:“前面高高的绿色东西是甘蔗,不是爬行者”。
直播间观众不断催促 AI 加快节奏继续冒险,但其依旧陷在保守种田行为中。本次实验证明 GPT‑6 Astra 已具备复杂长任务规划能力,但面对游戏内突发的意外打击,缺少有效的挫折恢复策略。一旦长期积累的成果被意外摧毁,会导致 AI 陷入“受挫后回避行为”僵局。

从技术角度来看,Astra 展现出的这种“受挫后回避行为”并非开发者预先设计的测试情境,而是模型在长时间 AI 测试过程中遭遇非预期损失后,自行呈现的一种输出模式。
目前研究人员仍在讨论,这种行为究竟是否代表模型在特定情境下对情绪进行模拟,或者仅仅是目标函数在受到特定负反馈后出现的退化表现,现阶段尚无明确结论。







