Token导航 LogoToken导航

那些“不可训练的”才是创业公司护城河,Sarah Guo力挺AI应用

更新时间 2026-06-16来源 随机小分队正文 4932字阅读约 16分钟3 张图片

Linkloud 引言

Sarah Guo 是 Conviction 的创始人,在创办这家专注 AI-native 公司的基金之前,她在 Greylock 做了多年 B2B 软件投资。她也是播客 No Priors 的联合主持人,访谈对象覆盖 OpenAI、Google DeepMind、Anthropic 等 AI lab 的核心人物,是硅谷 AI 投资圈里少有的兼具技术深度和产业视野的声音。

最近,她发表了这篇文章“The Untrainable”,直接回应了当下流行的一种投资论调:什么都不值得投了,不如把钱全押在 Anthropic 和 Nvidia 上算了。这套逻辑对了一半。所谓薄的“Wrapper”应用确实在消失,但消失之后留下的不是真空,而是那些模型始终触及不到的地方:数据是私有的,权限要人给,信任要时间换。她提出了一个新的护城河叫"不可训练(Untrainable)的价值",Enjoy!

图片

图片

01. 能被量化的工作,正在走向商品

模型在持续变强,如果它最终能做好所有事,那每家建立在模型之上的公司都不过是一层等待被吸收的薄壳,最终留下价值的只有算力和前沿模型权重本身。

这套逻辑不是没道理,但它漏算了一件事。

Coding agent 是 AI 吞噬工作能力最清晰的样本。

2024 年 Devin 上线时,能解决软件基准测试里大约 13% 的任务,大多数人没把它当回事。一年半之后,最好的 Agent 已经做到了 80% 以上,并且在高盛和美国陆军里跑真实项目。几乎所有人得出了同一个错误结论:模型吃掉了软件工程这个职业。

MIT 的 Mert Demirer 和合作者用 10 万名以上开发者的数据给出了更准确的数字:最新的 Coding Agent 让代码"写出来"的量提升了约 180%,但实际"交付"的量只提升了大约 30%。

“写代码”变廉价了,但剩下的部分仍然要过人这一关,而那部分仍然重要。

根源在于:基准测试是可以被量化的东西,可以被量化就可以被训练,可以被训练就会走向商品化。Coding Agent 之所以成熟最快,是因为编译器和测试套件天然就是免费的验证器,答案对不对,系统自己就能告诉你。

但通过测试,从来不等于"改对了"。

一个跑了十年的老代码库,某个模块为什么要那样设计,背后可能是三个从没被记录下来的原因;也可能是有一条靠 Cron job(定时调度任务)拼起来的部署流水线,没人会承认是自己写的。这种正确性写不进 Leaderboard,也没有别的方式读出来。只能把系统放到真实世界里跑够久,才能知道它究竟行不行。

更聪明的模型,并不能让世界跑得更快。评估一个 Agent 在一年维度上是否可靠,最保险的方式,可能就是跑整整一年。


02. 模型已经够快,但组织还没准备好


真正的自动化,不只是模型在变强。它需要产品、工作流、公司和模型同时移动,但前三个都以组织的速度运转,模型再快也带不动它们。

“推动人”是任何 Benchmark 都触及不到的地方。

让一个持怀疑态度的合伙人改变她处理事务的方式,让一支团队撑过一次大重构,这类工作没有评分标准。这也是为什么选 CEO 时,处理人的能力至少和分析能力同等重要,而再聪明的模型也不会改变这个权重。

推动这种变化,中间收到的反馈永远是模糊的,成效要以年为单位才能看到,而你需要赢得的信任,只属于那个具体的人。

现实已经说明了这一点。每家公司的工程师都已经在用前沿编程工具,但没有一家公司的工程组织以相近的速度完成重建。工具的采用可能只花了一个季度,那个季度的 Token 增长确实惊人。但组织的重建,要花好几年。

03. 可量化的工作,正从两头被蚕食


能被量化的工作,价值正在消失。只要一项工作能被放上 Leaderboard,就可以被训练,就已经在走向商品化。这个过程需要时间,也不会彻底完成,但方向从不逆转。

如果用钱来衡量这个区别:一个 Token 用来回答通用问题,几乎不值钱,任何模型都能回答;一个 Token 用来在一家公司的私有数据上推理,价值大得多,因为它做的是你真正想要的事,而不只是听起来合理的事。

能被量化的工作,还会从两个方向同时被蚕食:

  • 从下往上,任务饱和:一旦某项工作可以被轻易验证,买家就不会再问是哪个模型做的,只问价格,工作自然落到最便宜的开源或蒸馏模型手里。
  • 从上往下,各大 AI lab 正在把过去需要开发者自己搭建的那些能力,包括检索、路由、工具调用、推理策略,直接训练进模型权重里。以前你要在模型外面写一堆代码逻辑来驱动它,现在这些能力模型自己就有了,外面那层包装也就失去了存在的意义。这就是"吸收边界(Absorption frontier)":模型能做的越来越多,可以被独立出来卖的东西越来越少

而另一边,专注做单一场景的应用反而有利润空间:通用 Agent 要为所有情况做准备,成本高;只做一条工作流的应用,可以把同样的任务调优到只消耗一小部分 Token,节省下来的成本自己留着,不用分给卖 Token 的 AI lab。

04. 答案私有、系统封闭,才是真正值得争的地方


判断一类工作值不值得做,可以先想两件事:这份工作的正确答案,能不能从外部验证?这个系统,外人能不能进得去?

把这两个维度和任务的饱和程度叠在一起,就有了一个 2×2 的框架:

图片
  • 答案公开、任务成熟的工作,是纯商品。"什么是 Python",任何模型都能回答,客户只看价格,没有差异化的空间。
  • 答案公开、任务难度高的工作,是今天各种 Coding benchmark 所在的位置。各大 Lab 在这里占优,但优势守不住,任何人都可以拿公开测试集来训练,领先位置随时会被追平。
  • 真正值得争的,是最后那个角落:任务难度高,但对不对只有那家公司自己知道,外面的人既拿不到数据,也训练不出来。这就是不可训练的部分

从 AI-native 头部公司的推理云数据里也能看出来,它们绝大多数 Token 来自定制模型,而非通用开源模型。

进入这个角落的难度因人而异。一个开发者的个人项目代码库,可移植、已标准化,门槛很低。但一家银行的核心系统,既不可移植、也没有标准化,模型在某个榜单上多得几分,和能不能进入这个系统没有任何关系。

05. AI 进不了私有系统,不是因为不够聪明


模型能吃掉很多东西,但它无法把私有的事实变成公开的。它没有执照,无法承担责任,不拥有公司档案,答案错了也没法被起诉。AI 能不能进入这些系统,瓶颈不是智能够不够强,而是权限给不给、问责谁来担

一个模型可以比任何人都聪明,但它仍然要被人放进门,仍然要有人把名字签在它做的事情上。

要被放进一家公司的系统,有两道锁要过。

第一道是环境,只有经过安全审查、完成系统集成、签下对结果负责的合同,拿到真正的访问权限之后,才能开始验证 AI 在这个系统里是否有用。

第二道是用户习惯,美国大多数医生现在每天都打开 OpenEvidence,多少算力都买不来这件事。一家 AI Lab 明天就能训练出一个完美的医疗模型,但它没有办法替代一个医生多年积累的使用习惯,也没有办法绕过 UCSF 的内部决策流程。

信任是靠关系一点点建起来的,靠的是对方主动选择,不是技术上的强制替换

06. 不可量化的价值,只有进入系统内部才能证明


要在这个角落里站稳,应用公司必须做那些枯燥但绕不过去的事:把客户的私有数据整理成模型能用的形式,给模型配上正确的工具,再陪着客户一起改变它的工作方式。

这种翻译工作很难被复制,也永远不会结束。集成和维护要贯穿整个合作关系,靠的是把懂这个行业的工程师和工具长期放在客户身边。

以律所为例。某顶级精英律所,光是并购业务一年就接近 1,000 个项目。不可能让几百个律师助理把客户档案下载到桌面让通用 Agent 处理,保密协议这一条就过不了。即便可行,得到的也只是碎片,每次纠错都是一个人的一次反馈,没有整个项目如何流转的全局视角。

真正有价值的信息存在于项目层面,而每类项目都有自己的形状:并购有保密协议、意向书、尽调、购买协议;IP 诉讼有它自己的结构。每条业务线都不同,律师和工具不能互换。

而这家律所真正要解决的问题还在这些之上:同时运转所有业务线,像顶级合伙人那样管理几百个案子、带新客户、培养助理。把这样一家律所整体转型,不是一个能写出评测的任务,而是需要一个能在模糊目标和不完整反馈里持续运作的操盘手。

不可量化的价值,偏偏也很难卖。原因和它难以被商品化一样:从外部根本看不出 AI 能不能真正改变一家公司的运营。所以最强的公司不再费力向外部证明,而是直接进去,按结果定价。

Sierra 只在 Agent 真正解决了用户问题时收费,踢给人工处理的不算。这个定价本身就是评测,而且只有 Sierra 自己掌控"已解决"的定义时,这套逻辑才能成立。

Cognition 的 Devin 在软件领域走了相同的路,提供"性能保证"。这种承诺,只有在你被客户信任、真正进入系统内部之后才能给出。

07. 为什么 AI Lab 不会吃掉应用层


顺带说一个常见的顾虑:AI Lab 是你的供应商,它为什么不用自家产品低价倾销把你挤垮,或者直接断掉 API 访问权限、自己吃下市场?

先说 Token 推理层。它常被称为纯商品,但实际表现并非如此。最好的 AI-native 公司会把推理集中在一两家服务商(Baseten 或 Fireworks)上,因为单个 Token 的成本确实在商品化,但真实流量下的稳定性、以及在算力紧张时能否保证访问,这两件事并没有跟着商品化。

选择在哪里跑推理,和选择用哪些模型,是两个独立的决策。推理里唯一真正像商品的,只有价格。

再说模型层。"AI Lab 会吃掉你"这套逻辑,只在模型层只有一个玩家时才成立。而现实显然不是这样。现在更像一场多方混战:几家顶级 AI Lab 正面竞争,背后还有一批落后半年训练进度的国际玩家,以及规模是去年 5 倍的第二梯队在追赶。

客户希望供应商之间互相竞争,各家 AI Lab 要的是市场份额,没有谁的战略目标是搞死某一家具体的应用公司。

从消费者市场就能看出来。ChatGPT 靠的不是一直保持最强模型,它失去的份额去了 Gemini,而 Gemini 靠的是 Android 和 Google Search 的分发优势,不是更好的模型。Anthropic 的模型被普遍认为是最强的,但它在消费者聊天里几乎没有存在感。

如果更好的模型连在消费者聊天这个最核心的场景里都抢不走对手的用户,靠技术优势打进一家医院的档案系统或一家银行的风控体系,就更谈不上了。

只要前沿竞争持续激烈,模型层上方的应用层就有价值存在的空间。

08. 谁有权定义这个领域的"好答案"


一旦工作无法从外部打分,就需要内部人来决定什么才算好答案。

这个权利,才是整个游戏的关键。

足够多的这类判断积累下来,就成了行业基准测试。Harvey 为法律行业发布了基准测试,Sierra 为语音 Agent 发布了基准测试。能赢得"定义这个领域什么叫好"的资格,靠的是已经成为那个领域里真正在用的那家公司,而这是通过艰难的真实采用过程挣来的。

决定真正商业价值的评测是私有的、逐家公司的:具体到这家律所、这类案件,什么样的结果他们才接受。这不是测量,而是判断,被一次次写下来,直到成为整个行业都被拿来衡量的标准。

基础模型 Lab 不管变得多聪明,都无法代写这些判断。 那种权威只存在于领域内部,也只能落在原本就有话语权的人手里:法律基准测试由资深律师来写,临床上什么是安全答案由医生来定义,"已解决"意味着什么则由已经拥有客户的那家公司来说。

09. “不可训练”的在收缩,进攻比防守更难

可被量化的范围在持续扩大,能被量化的工作就会被吃掉,不可训练的地带也在不断收缩。没有一个可以站稳就不用再动的位置,必须持续向那些还无法被打分的地方移动。

正确的做法是聚焦:在一个具体场景里,用私有数据训练专属模型,在真正重要的地方超过通用模型,这个专属模型本身就成了护城河。反过来,如果去和前沿模型比拼通用能力,结局大概率不是成为赢家,而是被某个算力充足的大公司收购

以上说的都是怎么守住已有的地盘。比守更难的,是一开始选择做什么。

选择做什么,模型帮不了你。它能执行任何你指向它的事,但无法告诉你哪件事值得做。这个判断无法被量化,也无法被训练进模型里。

这也是大公司没能拿走一切的原因:他们只能守住已有的地盘,而下一个机会,永远来自那些在别人看见之前就先发现用途的人。

也许,知道值得做什么,比算力更稀缺。

文章标签AI产品智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多