先说结论:
斯坦福法学院6月1日发布的一项研究,可能是我今年看到的关于"AI能力边界"最具冲击力的证据之一。不是因为它证明了AI有多强——而是因为它证明了一个很多人不愿意面对的事实:在一些我们以为只有"人"才能做好的事情上,AI已经不是追赶者了。
一、研究到底说了什么?
这项研究由斯坦福法学院的Julian Nyarko教授主持,设计非常干净:
参与者:16位来自美国各顶尖法学院的教授任务:每人创建一组合同法问题(共40道),模拟学生课后或办公时间的提问场景流程:教授和AI分别回答同一批问题 → 答案被打乱、匿名化 → 送回给教授盲评打分关键控制:校准了AI答案的长度和结构,使其与人类回答匹配
核心结果有三组数据值得关注:
维度 | 数据 | 含义 |
|---|---|---|
盲评胜率 | AI赢75% | 每4次对比,3次教授认为AI更好 |
有害标记率 | AI 3.5% vs 教授 12% | 教授写的答案被标为"可能误导学生"的概率是AI的3.4倍 |
总评估量 | 近3000次 匿名比较 | 样本量足够大,统计意义显著 |
来源:Stanford Law School Official Press Release(2026年6月1日)
为什么这项研究值得认真对待?
第一,它测试的不是"事实记忆"类能力。Nyarko教授在原文中明确指出:他们选择法律领域正是因为它需要判断力、精细推理和在模糊中导航的能力——恰恰是我们认为AI最难攻克的领地。
第二,盲评设计消除了偏见。教授不知道自己在评谁,所以不存在"因为知道是AI所以打低分或高分"的情况。
第三,"有害标记率"这个指标很有意思。它衡量的不是"谁答得更漂亮",而是"谁答得更负责"。AI在这个指标上大幅领先人类——说明AI不仅答得好,而且答得更安全。
"The conversation should shift from whether AI can give accurate, high quality responses to how we can deploy it responsibly to the benefit of our students."
— Julian Nyarko 教授,斯坦福法学院
翻译过来:讨论不该停在"行不行",该转向"怎么用"。
二、从法律到编程:这不是孤例
如果说法律领域的突破还可以用"语言能力强"来解释的话,那么编程领域发生的事情就没法用这个理由搪塞了。
就在同一天,Claude Code团队的工程总监Fiona Fung分享了他们团队的实际变化。我仔细读了她发的文章,提炼出四个关键变化:
1规划范式崩塌
传统的软件开发流程以"长期规划"为核心——上来先搞六个月的产品路线图。但Fiona说她刚加入团队时也写了这样的路线图,三个月就过时了。原因很简单:有了AI辅助编码之后,迭代速度太快了,任何超过一个月的计划都会被现实甩在后面。
现在的做法是JIT(即时制):原型化 → 内部用户试用 → 根据反馈改。不写长篇设计文档了。
2信息获取路径重构
以前你想了解某段代码的背景,得找到写代码的人问。现在的默认流程变成了:先问Claude → 问完追问"这事能不能自动化?" → 真正需要人类判断的事再找人。
她举了一个具体的例子:团队以前每天早上有人边喝咖啡边手动整理客户反馈摘要。这个流程现在已经被Claude自动在后台完成了。
3代码审查分工重组
以前代码审查是人类工程师的核心工作量——检查代码风格、找Bug、补充测试。现在这些全部由Claude处理。人类的注意力收缩到一个问题上:这里需不需要领域专家的专业判断?
具体来说,法务风险审查需要法务伙伴参与;涉及信任边界和安全敏感的代码需要资深工程师把关;产品的"品味"和体验感需要PM和设计师拍板。除此之外的一切,AI都能处理。
4团队角色边界模糊
这句话可能是整篇文章最让我注意的:
"我们的产品经理现在写很多代码,非传统程序员也能做工程工作了,工程师也开始做内容和设计。"
— Fiona Fung,Claude Code 工程总监
招聘的标准也变了。不再看重"原始代码吞吐量"——模型已经承担了这个部分。现在看两件事:一是能不能创造性地解决问题,二是对系统有没有深层理解。
来源:Running an AI-Native Engineering Org — Claude Blog(2026年6月3日)
三、对普通人意味着什么?
看到这里你可能会说:好,法律和编程都被AI渗透了。但我既不是律师也不是程序员,这跟我有什么关系?
关系比你想象的大。原因有三个:
这就好比计算器发明之后,数学家并没有失业。他们只是不再花时间做算术了,把认知资源投入到了更高层次的数学探索上。
AI不是一个替代你的工具,是一个放大你的工具。 但前提是——你得学会用它。
四、关于 AI Agent
今天这篇文章其实是在拆解一个概念——AI Agent(智能体)。
很多人把AI Agent和聊天机器人混为一谈,但其实它们有本质区别:
聊天机器人 | AI Agent | |
|---|---|---|
工作方式 | 被动等待提问 | 主动完成任务 |
能力范围 | 回答问题 | 审合同、写代码、整理资料、做决策 |
记忆力 | 单次对话 | 可跨会话积累上下文 |
自主性 | 无 | 可独立规划和执行多步骤任务 |
📌 概念定义
AI Agent = 你的数字同事 / 24小时在线实习生
不是聊天机器人等着你提问,而是主动帮你看合同、写东西、整理资料的同事。
你可以把它理解为一个不知疲倦、还变得越来越聪明的工作伙伴。
法学教授的这位"实习生"已经有75%的概率超过师父了。
下一个会是谁的行业?
这个问题值得每个人认真想一想。
你的行业,准备好了吗?
参考资料
- [1]AI Outperforms Law Professors in Stanford Law Study — Stanford Law School, June 1, 2026
- [2]Running an AI-Native Engineering Org — Claude Blog (Anthropic), Fiona Fung, June 3, 2026
- [3]Signs of AI Writing — Wikipedia WikiProject AI Cleanup







