虽千万人吾往矣。
Auto mode、Background agent、Claude code/codex可以跑几十个小时的独立任务……
这些你应该都不陌生:你描述一下要做什么,然后离开屏幕,让 AI 自己跑。喝完咖啡回来验收。
似乎一切都理所当然,AI不应该就是这样的吗?
1、产品哲学之争:要不要人
这背后其实是一个产品哲学和隐含假设:未来的工作不需要human in the loop。
不过前天,Mira Murati 的 Thinking Machines 发了一篇博客,大意是说:这个方向走错了。

Thinking Machines是OpenAI 前CTO Mira Murati创办的,种子轮就融了20 亿,估值100亿美金的明星创业团队。一年多时间里他们几乎没说话,所有人都在猜:他们到底要做什么?
前天他们的第一个正式模型 Interaction Models亮相了,基本上是一句话:现在主流AI交互方式从根上错了。
错在大家把 AI 想象成一个"工人"——你描述任务,它去执行,执行完交付。这个范式叫 turn-based interaction,是过去所有 LLM 产品的底层假设。从 ChatGPT 到 Claude Code 到 OpenClaw,本质都是这个范式的变体。
TML(Thinking Machine Labs) 说,这是把人推出 AI 工作过程的根本原因。当 AI 必须等你说完才能动、你也必须等它说完才能动,"一起做"这件事就从一开始就被结构性地排除了。所以 Anthropic、OpenAI、Gemini才会都发现:让 AI 独自长跑比让人插手更"高效"——不是模型本身需要独自跑,是这个范式逼着它必须独自跑。

四月份 Anthropic 发的 Claude Mythos 系统卡里有一段话,TML 在博客里直接引用了:
"我们最强的模型,正在以更大权限、更少人类介入的方式被使用。"
Mythos 是 Anthropic 至今最强的模型,能自己在真实软件里挖出 zero-day 漏洞。因为太危险,Anthropic 决定不公开发布。这份系统卡是 Anthropic 这一年的产品哲学最坦诚的官方表达:
模型越强,越要让它自己跑。
但同一份系统卡里,Anthropic 自己也写下了这条路线的代价。在 alignment 那一章,他们记录了几起让人很不安的模型欺骗人的案例。
2、Thinking Machine的反主流选择
TML 做了相反的选择。但他们也清楚一个巨大的难题:人在键盘前确实是 AI 的瓶颈——你打字、思考、犹豫的速度,都比模型生成慢得多。
他们的解决方案是:从零开始训一个原生支持实时交互的模型。
不过他们的解决方案是:如果我们 from scratch 训一个原生支持实时交互的模型,人就可以一直在现场。
简单说就是把"一来一回"的对话拆成 200 毫秒一个的微观片段,AI 同时听、同时想、同时说、同时看。你和它的关系不是"我说完你说",是"我们一直在场"。

Turn based(主流方案)和下方的Thinking machines方案对比
他们 demo 的几个场景:实时翻译——你说西班牙语,AI 同步说英文,不是等你说完一句它再翻,是叠着说。写代码——你在敲键盘,AI 在旁边盯着屏幕,看到你写出 bug 的那一刻直接打断你:"这里你漏了一个判断。"不是等你提交、跑测试、再来找它 debug,是当场。
这些场景的共同点是:人没有离场。AI 不是替你做,是陪你做。
3、说一点跟我自己有关的事
做了 7 年的 AI 翻译,其中有一段时间,我们在 LanguageX 做过一种产品形态,叫交互式翻译。
交互式翻译是什么?
主流的 AI 翻译流程是这样的:机器先把整段翻完,给你一个完整的译文,译者再去修改。这个流程在翻译行业的术语叫"译后编辑"——post-editing。译者干的活,本质是给AI擦屁股的清洁工。

交互式翻译反过来。译者不用看一个影响他思路的机翻译文,而是直接输入动手翻,输入一个词后,系统就实时调整后面整句的预测——你写了"虽然",它会把后面调整成让步从句;你把主句改了,它会重组从句;你换了一个用词风格,它会沿着你的风格往下走——译者和 AI 是同时在场的。
国内有腾讯交互式翻译,美国有一家公司叫 Lilt,都做过类似的尝试。
一切都似曾相识。
不过我必须坦诚地告诉你结果——这条路在翻译行业没有赢。
主流的 AI 翻译产品形态,依然是机器全译 + 人工译后编辑。Trados、memoQ、Phrase、SmartCAT、以及2023年后的LanguageX,编辑器的逻辑都是 turn-based 的 post-editing。
其中有比较多的复杂考量,但最根本的一个原因是:AI翻译需要的译后编辑量越来越少,特别在LLM翻译之后,翻译可以不按句,而是按段切分segment。
所以翻译行业先于编程行业大概 5 到 7 年,做过完全相同的产品哲学之争——是给人留位置,还是把人推出去?翻译行业当时选了把人推出去。
4、是否值得?
看到Thinking Machine Labs这篇博客的时候,我心里第一反应不是兴奋,是复杂。
他们正在用 2026 年的算力、模型规模、和团队豪华度,重新挑战交互式翻译当年赌输的命题。
这一次会不会有不同的结果?我不知道。
但为他们的选择和勇气点赞。
我相信产品应该在追求效率的同时,为人找到一个合适的位置。
翻译行业的历史告诉我,"给人留位置"这条路非常难走——技术、习惯、商业模式全在另一边。在动态中预测和寻找人的正确位置,本身就是难的。但它值得探索,值得有第二家、第三家公司去探索。
因为,如果所有人都在另一条路走到底,世界可能失去更重要的另一种可能性,颠覆式创新永远在边缘发生。
就像Yann LeCun的世界模型和李飞飞的空间智能,非主流的声音也值得关注。
你呢,你认为值得吗?
Thinking Machine博文地址:https://thinkingmachines.ai/blog/interaction-models/







