想象这样一个场景:
你正在和AI讨论出行计划。你说到一半,它已经开始查航班;你把镜头对准桌上的设备,它能根据画面继续回答;后台查询还没结束,它不会突然沉默,而是告诉你“我正在处理”。
这正是Google这次发布Gemini 3.8 Live系列想实现的体验。
当地时间9月15日,Google推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。前者主打实时、低延迟的语音交互,后者则进一步加入后台推理和多步骤任务处理能力。
减少“等AI”的时间
过去使用语音助手,交互逻辑很简单:用户说完,AI识别,再给出回答。
但只要任务稍微复杂一点,问题就来了。比如查资料、比价格、安排日程,AI往往需要停下来等待工具返回结果。用户不知道系统是在思考,还是已经卡住。
Gemini 3.8 Live试图把这段等待隐藏起来。
Google开发者文档显示,Gemini 3.8 Live支持文本、图片、音频和视频输入,并支持文本与音频输出。它还支持实时音频流、交错式推理和异步函数调用。
这意味着,AI可以在用户继续讲话时处理新的信息,也可以在对话过程中调用外部工具。语音交互不再是“说完一句、等待一句”,而更接近一段连续的交流。
Google还称,Gemini 3.8 Live能够在对话中自动识别并切换97种语言。不过,这一数字属于Google公布的产品信息,实际效果仍会受到口音、噪声和具体语言组合影响。
Extended Thinking更像一个会持续跟进的助手
Gemini 3.8 Live Extended Thinking的变化更明显。
Google在Live API文档中介绍,当任务需要复杂规划、数据分析或调用耗时较长的工具时,模型可以在后台继续推理,并通过语音提示向用户反馈进度。
比如用户说:“帮我找一个周末去上海的方案。”模型可以先确认预算和时间,再分别查询交通、酒店和行程信息。等待过程中,它不会完全没反应,而是继续维持对话。
这让语音AI从“问答工具”往“任务助手”靠近了一步。
当然,这并不代表模型已经可以独立、准确地处理所有复杂事务。它能否完成任务,仍取决于工具接口是否可靠、数据是否及时,以及模型能否正确理解用户意图。
两款模型像两种不同的工作状态
从Google给出的开发说明来看,Gemini 3.8 Live更适合快速响应的场景,比如语音搜索、客服分流、语言练习和简单的设备控制。
Extended Thinking则更适合多步骤任务,例如技术排障、出行规划、复杂信息检索和代码辅导。
两款模型目前都开始接入Gemini API和Google AI Studio。企业侧相关能力仍以私有预览为主,普通用户能够使用哪些功能,则取决于地区、产品和订阅类型。
对开发者来说,这意味着语音应用可以不再局限于“语音转文字再交给模型处理”,而是直接构建实时、双向、可调用工具的语音智能体。
真正的难题不在于“会不会说”
Google在发布材料中引用了Artificial Analysis、τ-Voice和Sierra等评测结果,称Extended Thinking在部分语音和智能体测试中取得了较好成绩。
但对于语音智能体来说,榜单只是一个切面。用户更关心的是:AI会不会听错,能不能处理打断,工具调用是否准确,遇到异常时能不能及时说明白。
尤其在客服、办公和车载等场景中,一次错误执行可能比一次答错知识题更麻烦。语音交互越接近真实工作流,对稳定性、权限管理和数据安全的要求就越高。
所以,Gemini 3.8 Live系列值得关注的地方,不只是Google公布了多少项评测成绩,而是它正在尝试改变人与AI的交流方式:AI不必等你完全说完,也不必在后台处理时保持沉默,而是可以边听、边想、边做。
这条路最终能走多远,还要看后续的真实体验和第三方测试。但至少在产品方向上,语音AI正在从“会回答”走向“能协助完成事情”。







