Token导航 LogoToken导航

blurt 口喷鸡:Vibe Coding 语音整理工具开源

更新时间 2026-09-28来源 AGIHunt正文 4033字阅读约 13分钟12 张图片

它叫 blurt,中文名口喷鸡,是我为 Vibe Coding 打造的最佳伴侣。

一句话介绍:把你的一顿乱喷整理成有图有文的清单的工具。

疯狂 vibe coding 之后

01

当你的 AI 在一夜奋战后给你写了 40 个页面、几万行代码(别告诉我你没这么干过),那接下来呢?

图片
一夜 40 个页面

当然不是直接发布上线,而是需要验收并继续反馈问题、提出新要求。

只要你在做的不是个 demo 或一次性的玩具,而是要产品化、商业化的带有复杂性东西,那无论前期你的 spec 写得多好、AI 完成度多高,总会有大量细节是需要继续打磨的。

这里有些是你没想到但 AI 自己完成的,然后有些完成得还不错,有些则因为其实你也没想清楚所以 AI 做得也并不对,当然还有些纯粹是 AI 自己没做好。

所以 AI 写完之后,会有一段时间进度看起来突然变慢了。这就是进入了下一个阶段:精细打磨每个页面、每个角落、每处交互,每个按钮和每个逻辑都要有人去点、去看、去找出可能更好的方案。

而这么大量的代码背后要验收和调整的细节实在是太多太多了,常常一不经意,就忙到了凌晨……

如何提出一个好问题

02

在这个阶段,瓶颈便从写代码变成了提问题。

但提好一个问题,其实并不容易。

一个不够清晰的问题,可能会让人听了一头雾水(多人协作中),让 AI 会错意,改出来的东西跟想要的牛头不对马嘴。

所以一套严谨的模板和提问规范,还是很有必要的。

为了准确反馈,就必须像提 bug 一样把问题讲清楚。要么用 Jira(多少有点过时了),要么建一个飞书多维表格,一条条去填:

•  所属模块 

•  异常描述 

•  预期效果与实际效果 

•  复现步骤 

•  截图或录屏 

这套格式,不论是对解决问题的人,或是 AI 来说,都是不可或缺的。少了某个信息都可能看不懂、理解不准确,然后还得来回确认上几轮,效率反而更低了。

可对提问题的人来说,要求又实在太高了。需要截图、画红框、打字、写步骤,再粘贴进表格,一条接着一条……

图片
截图画框打字粘贴

繁琐、重复、低效,一点也不 AI。

试过的几种办法

03

那怎样能更高效呢?

我确实还试过一些其他方案。

截图 + 口喷方案:

让 Claude Code 直接连飞书,只需要截图、再加 typeless 口喷一段文字,它也能自动填进多维表格。

但每个这样截图、画圈、标注、语音输入下来,一个小时能记录 10 到 20 个问题,就已经非常高效了。

元素选取方案:

Claude Code 桌面版和 Codex 的 Annotate 可以支持在页面上直接点中对应的 DOM 元素后写 comment,加到当前 session 的输入区再让它执行。

React 项目里也有 React Grab 这类方案,能很方便地选中组件。

这确实比截图快了一些,但还是得一下一下地点,而且只适合一个人干,多人协作时就不太 work 了。

网页插件方案:

在网页上装个标注插件,自己或其他人直接在页面上反馈问题即可。

但我还是觉得效率不够高,需要点击 + 打字,且同样得一个问题一个问题地把内容填写严谨和完整。

纯语音方案:

用 Typeless 这类语音输入法直接口喷。

我之前在文章里也提过,用语音代替打字,可以边说边想,不用去琢磨字怎么打出来,思维会放松很多,往往效果更好。

局限是,这只适用于纯文字能讲清楚的情况。

所以有时我得给 AI 说“在首页的什么什么地方”、“点击什么什么之后出来的搜索框”之类的用于让 AI 能定位的文字,因为 AI 可看不见你说的「这里」「这个按钮」到底是指哪儿……

图片
光靠语音没有眼睛

问题在于:纯语音,终究是少了一双能看见的眼睛。

呵斥小弟的大领导

04

那……最自然的方式是什么呢?

假设你是一个超级大且懒的领导,你最省事、最自私的方式是什么样呢?

你大概是不想截图和打字的。

你会让小弟站到你旁边和电脑前,然后指着屏幕对着它和他一顿喷,就完事了。

当然了,能成你的合格小弟,自然是一看一听就懂,就可以回去干活了的。

但……如果你不是个大领导呢?或者你并不喜欢这么呵斥小弟呢?

口喷鸡想做的,便是让人人都可以当个自私而懒的大领导:你只需要一边用,一边喷,就像身边站着一个非常能察言观色的小弟。

你只管想到哪就说哪,一会儿说 A 模块,一会儿又跳到 B 模块,说错了再改口没关系,逻辑乱一点也没关系,只管泄愤就是。

而在你终于喷完了之后,blurt 会将录好的视频、录音、鼠标轨迹等交给 AI 去理。

图片
口喷鸡登场

口喷鸡的 slogan 是「Show it. Say it. Your AI gets it.」。

中文叫做:

“

边看边喷,AI 全懂。

对人的要求,则是要「自私」一点,怎么爽就怎么来。

这才是鞭策 AI 最自然也最高效的姿势。

如何使用

05

口喷鸡的安装很简单,只要给你的 Claude Code、Codex、Cursor 等任何能装 skill 的 agent 说上这一句话:

●●●

npx skills add AGIHunt/blurt

└

或者也可以直接把仓库地址丢给它,让它自己装。它会根据你电脑的配置选好语音模型,再把一个叫 Blurt 的小 App 装进菜单栏。

图片
口喷鸡图标

然后在项目里对 agent 说一句「开始口喷」,就可以了。

使用时你只需按下 ⌥⇧R,框出要录的区域(拖拽框选、单击选中某个窗口,或者全屏均可),然后就可以开始边点边喷了。

图片
按快捷键框选开录

屏幕上会有个小悬浮条,显示计时和音量,可以暂停、重录,说完点「完成」或者再按一次 ⌥⇧R 即可结束。

Blurt 还可以常驻在 macOS 的菜单栏里,图标就是那只小鸡,可以随时按快捷键开喷。

整理和审核

06

录完之后,你就可以去干别的了,剩下的交给你的 Claude Code 和 Codex 们就好。

图片
录屏变成一条条事项

它会把你东拉西扯的一段话拆成一条条独立的事项,给每条挑出最合适的截图,并按你当时鼠标的真实位置把问题框出来,再写清楚实际效果、预期效果、复现步骤和负责人。

而因为 skill 是跑在你项目的 repo 里的,AI 还能结合代码,给每条问题标上最可能出问题的代码位置,后面让 AI 去修的时候,就不用再从头定位了。

整理好之后,会自动打开一个本地的审核页,可以像刷短视频一样一条条地过:A 保留,X 丢弃,J/K 上下切换,Z 撤销。

图片
像刷短视频一样审核

以前要截图、填表填上两天的反馈,现在半个小时就能讲完。

图片
两天变三十分钟

审完之后,可以导出到飞书多维表格、GitHub Issues 或 Markdown/CSV,会沿用你们团队自己的列名规范。

图片
导出或直接修

当然你可以不导出,直接跟 agent 说:帮我改掉。

原理

07

口喷鸡的核心思路是:必须人来的才让人来,确定的事交给脚本,模型能做的交给模型。

录屏、识别、抽帧、审核页、导出这些理解性工作,由脚本来完成:

• 录屏:

MacOS 上用原生的 ScreenCaptureKit,麦克风单独采集,再按两边的时间戳对齐,实测音画同步误差不到一帧(最早用 ffmpeg 录麦克风,结果会丢掉约 10% 的声音,字幕时间轴最多偏了 7 秒……)

• 鼠标轨迹:

录制时每秒采样 10 次鼠标位置,并记下每一次点击,存成带时间戳的数据。

AI 画框时直接读这些坐标,不用靠看截图去猜(第一版就是让模型看缩略图估坐标,结果红框歪了 12%……)

• 语音识别:

默认在本地跑阿里开源的 SenseVoice,模型约 240MB,普通 CPU 就能跑得很快,中英混说的识别效果也不错,你大可中英混杂放心来。

Apple Silicon 或 N 卡上可以换 Whisper,也可以填自己的 Groq、OpenAI 或百炼 Key,且默认不上传任何内容。

• 抽帧:

结合语音字幕里每个问题的时间点,再加上画面变化和鼠标动作,挑出候选帧,拼成带时间戳的对比图交给模型去挑

而怎么拆分、怎么写、怎么判断这条是问题还是想法、该归到哪个模块,则全都交给 agent 自己决定,我并没有给它太多的有碍泛化性的约束。

所以它能很好的适应不同的产品和团队,你说什么语言,整理出来就是什么语言。

速度与成本

08

以一段 3 分 12 秒的录屏口喷为例,从录完到打开审核页,大约 2.5 分钟。

其中语音识别 16 秒,抽帧约 40 秒,剩下约 1.5 分钟是模型在看截图、拆问题、查代码。

Token 方面,整个过程一共调用了 32 次模型,按 Opus 5.5 的 API 价格折算,处理这段录屏本身大约 1.1 美元。(不过我用的是 Max 订阅,这么点额度,九牛一毛了不必心疼)。

bug 之外,还可以是……

09

但其实,它显然不只是个提 bug 的工具而已。

比如你有了什么想法,也可以直接打开电脑四处逛逛,比如打开 A 网页说这里的引导做得好可以重点参考,打开 B 网页说觉得这个定价页也不错……录完它会整理出一份想法清单,每个想法是什么、为什么会想到、灵感来自哪里、下一步做什么,再附上一页总览和方案。

图片
问题想法笔记待办

同一段录屏里,问题、想法、笔记、待办都可以混着讲,每一条算什么类型,agent 会自己判断,不用事先选定模式,非常灵活。

当然,如果需要你也可以加自己的模板,比如用户调研、销售电话、SOP、软件用户指南等(有些我会再来细化,也欢迎提 pr)。

多人协作时,没有代码库的同事(产品、设计、运营甚至客户)也直接下载 Blurt,把口喷视频录好后发来,再交由开发人员的 agent 结合代码去分析处理。

后面,我可能还想往个人助理的方向,让它成为一个能看、能听、能帮你推进项目、完成记录和各种杂活的助理。不过,那是后面的事了……

花絮

10

分享一些小花絮。

Claude 一开始给起的中文名叫「吐槽机」,我改成了一只鸡的「鸡」,便成了吐槽鸡。

后来 Claude Code 告诉我,这个项目其实不只是能用来提 bug、反馈问题,还可以用来做各种 idea 的思考和探索。大家完全可以一边浏览各个页面、各个网站,一边讲自己的想法。

所以我便给它改名为:「口喷鸡」。

而开头的宣传片,则是我让 Opus 5.5 制作的:画面是 Remotion 写的动画,点击、键盘、快门这些音效全是它用代码合成的,背景音乐用 Lyria 3 生成,花了我 8 美分。

图片
一行命令安装

项目支持 MacOS 和 Windows,但由于我手里没有 Windows 电脑,所以至今我还没实测过……(非常不严谨,该喷)

欢迎试用、口喷、提 issue、提 PR,尤其如果你手里有个 Windows 的电脑!

◇ ◆ ◇

文章标签模型发布开源
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多