Token导航 LogoToken导航TokenDH.com

一天一个冷门AI用法:给AI记本错题集,可能比换模型管用

更新时间 2026-09-19来源 Simonlin的精神世界正文 2445字阅读约 8分钟7 张图片
 SIMONLIN / AI TOOL NOTE 先看判断

给普通人看的 AI 工具学习记录

一天一个冷门AI用法:给AI记本错题集,可能比换模型管用

同一个模型,只改了一个地方,得分从14.6%涨到93.5%,一行代码没动。AI不好用先修哪一环?四层顺序:先能测、喂对东西、修系统,微调放最后。

先讲结论,再讲过程;能复核,才值得推荐AI 工具小白视角

Hello啊朋友们,我是Simonlin,用通俗易懂的语言,手把手带你玩转AI,提升10倍效率!

全体目光向我看齐啊!

图片

我宣布个事儿:

从今天起,我开一个新专栏:《一天一个冷门AI用法》。

干的事很简单:把我自己用AI时那些好用、但没什么人知道的用法,一天讲一个。每期都是我真用过的,不是从网上盘点来的清单。不保证热闹,只保证你看完就能上手。

会用AI和用得好AI之间,差的往往就是几个不起眼的小动作。这个专栏,就讲这些小动作。

(我是~~~~分割线)

第一期,先说个离谱的数据。

一套研究AI检索能力的测试题,题目有标准答案,AI答完按对错打分。同一个模型,同一批题:让它自己上网找资料再答题,得分14.6%;把正确资料直接放到它面前,得分93.5%。

从14.6到93.5,模型一个字没变。变的只有一件事:它有没有拿到对的材料。

这是搞搜索研究的Nandan Thakur在一场分享里给的对照数据。它说明一个很多人不愿意承认的事实:你觉得AI笨,很多时候不是模型不行,是你喂它的东西不行。

这个数据出自Hamel Husain整理的一份笔记。这人是谁不重要,重要的是他今年办了一个AI产品工程系列,13场分享、9.5小时,讲的全是"AI产品不好用到底该修哪里",然后他自己把9.5小时浓缩成了20分钟的笔记。

这活我让AI替我啃了一遍,我负责复核它划的重点、核对原文出处——本来就该这么分工。下面是我从里面拆出来的东西,加上我自己这条AI流水线的对账经验。

四层,从便宜到贵,按顺序修。

01

PART

 

先能测

VIEW / 往下看判断

图片
给AI记错题集

笔记里有个反面教材我印象很深。

巴西有个教育平台,月活一百万用户,二十万教师用他们的AI备课。他们一开始给AI输出定标准,定了标准才开始看数据,结果发现两个标注员对"什么是好的输出"的一致率低于随机瞎猜。意思是:连"好"都没定义清楚。最后只能请教学专家重写标准,全部重标。

先定规矩再看病,白标一整套数据。

我自己的教训是另一面的。我每篇文章发出去都会做个对账:让AI按读者身份预测这篇的数据,三天后拿后台真数撞它。有一篇我预测完读率在30%到50%,真实数字26%。错了。查原因,发现那篇的平均阅读时长只有1.2分钟,大部分人滑了两屏就走了。

这个26%要是没有后台数据撑着,我永远会觉得"写得还行"。

没有评估,你连自己错在哪都不知道,后面三环全是瞎修。

起步不用什么工具:给AI记一本错题集。它给你的每个结果都留个底,第二天回头看对错,错的记一笔——攒上二十条,它常错哪自己就浮出来了。

02

PART

 

喂对东西

VIEW / 往下看判断

图片
同一个AI,喂对喂错

这是Hamel笔记里明确说的"最低垂的果子",行话叫检索和上下文,说人话就是:资料找得到吗、给得对不对。

开头那个14.6%对93.5%就是这个层的极端案例。大多数产品的版本温和一点,但方向一样:不是模型不够聪明,是它没看到该看的东西。

我自己的体感很一致。我让AI扮演我的读者来预审文章,最开始效果很玄学。后来我干了一件事:把AI能找到的我读者说过的话全收了一遍——我自己号的留言、知乎的评论、小红书和B站——拿这些真实语料归纳出几个具体的"人",再让它按这些人读文章。

没换模型,没改什么咒语,只是把喂进去的东西换成了真的。前后差出好几倍的命中率。

这个果子的特点是便宜。改提示词是猜测,换模型是烧钱,修检索和语料是哪儿疼贴哪儿,当天见效。

03

PART

 

修系统

VIEW / 往下看判断

图片
锅在系统不在模型

这一环最容易被忽略,因为它根本不在"AI"里。

笔记里有个实验让我拍大腿。一个测AI能不能把真实任务做完的评测榜,按任务完成情况打分。某模型跑46.3分。研究团队没有调模型,只是把给AI的做题时间放宽到原来的五倍——分数变成60.97。

涨了快15分,模型一行代码没动。所以,之前是它没做完就被掐了。

再看我那条流水线上那些"AI不行了"的时刻,回头复盘全是这一层的问题。

有一次AI帮我发公众号推送,怎么调提示词都报错。折腾半天发现根本不是AI的问题:我这边上网的地址变了,微信不认生地址,就像你换了手机号,所有朋友都打不通——人没变,号码变了。把新地址跟微信报备一下,一秒发出去。

还有让它去抓知乎评论,光有提示词它连门都进不去——知乎把它当机器人拦在门外。最后我把自己登录好的浏览器借给它,它顶着我的身份才进得去。

这些事提示词背一万年也没用。锅在系统里,不在模型里。

04

PART

 

微调放最后

VIEW / 往下看判断

图片
修车别急着拆发动机

前面全干完了还不行,才轮到"自己训一个模型"。先说什么是微调:拿自己的数据再训练一下模型,让它变成你的专才。笔记给的开训门槛很严,翻译成人话就两条:一是你的任务得像有标准答案的考卷,能自动判对错;二是它现在的成绩不能是0分也不能是满分——一点不会的教不动,已经会的不用教。

用人话说:前三层是修车,微调是重造发动机。修车没修完就拆发动机,是大多数人在干的事。

这层我老实交代:因为我自己没跑过,没资格装内行。只能转述他的结论——大多数人觉得该微调的时候,其实是前三层没修完。

05

PART

 

抄走这个顺序

VIEW / 往下看判断

图片
四环顺序,别跳级
 下次你的AI产品、AI工作流不对劲,按这个顺序过一遍:
  • 第一问,能测吗?有没有拿真实数据对你的产出做过对账,还是全凭感觉?

  • 第二问,喂对了吗?它看到的信息完整、干净吗?还是塞了一堆无关的杂讯?

  • 第三问,是不是系统问题?超时、权限、登录态、网络——这些锅提示词背不动。

  • 第四问,以上全修完还不行,再谈微调。

顺序反了,就是在最贵的那层修最便宜的问题。

我是Simonlin,下次见。

文章标签AI产品
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多