Token导航 LogoToken导航

ZPedia|视频版 GPT-Live 来了,形界智能发布 Genesis-1.0,面向长时、智能的 AI 互动娱乐基础设施

更新时间 2026-09-20来源 ZFinTech正文 5660字阅读约 18分钟10 张图片
图片

今年 7 月,OpenAI 发布 GPT-Live。相比过去一问一答式的语音助手,其核心突破不仅在于更自然的拟真音色,更在于把 AI 的交互方式从“回合制”推向了真正的实时对话:模型具备边说边听的全双工能力,支持随时打断,甚至懂得在恰当的时机保持沉默;遇到复杂推理和工具调用时,再把任务交给后台模型处理,而不需要让当前对话停下来。OpenAI 当时披露,每周已经有超过 1.5 亿人通过 Voice、Dictation 等语音功能和 ChatGPT 交互。

这件事带来的一个直观变化是,人开始更愿意和 AI 进行更长时间、更高频率的持续互动。

文字聊天天然是一种“输入—回答”的离散交互,语音则更接近现实中的持续交流。而当交互形式继续从 Voice 走向 Video,问题会再往前一步:AI 不仅要一直听着,还要一直“看着”。

用户正在说话还是已经停下来,脸上的表情是什么,突然挥了挥手还是比了一个心,甚至一句话都没有说,只是移开视线——这些没有进入文字和语音的信息,本身就是人与人交流的一部分。

9 月 18 日,成立不到四个月的形界智能(Frame-X)计划正式发布 Genesis-1.0,并向用户开放体验 24 小时 AI 直播。形界把它定位为一套面向 AI 社交、陪伴和互动娱乐的视频双工模型。

相比今年 7 月在 WAIC 首次亮相的 Genesis,1.0 版本给出了一组更接近产品化的数字:连续生成超过 24 小时,画面行为响应平均 1.5 秒,最快可达到 1.2 秒,支持全身动作,调用价格为每秒 0.003 美元。

放到今天的实时 Avatar 市场里,这组参数已经颇具进攻性。Runway Characters 的 API 单次会话最长为 5 分钟;HeyGen LiveAvatar 根据不同产品层级,单次会话上限从 5 分钟到 60 分钟不等;另一家实时视频公司 Vivix 推出的 A1,则把能力进一步扩展到全身动作与开放世界交互,并持续响应新的用户输入。

图片

图片来源:Frame-X

但 24 小时、1.5 秒这些数字并不是 Genesis-1.0 真正想讲的故事。

形界把一个面向社交的 AI 角色需要具备的基本能力归结成两件事:它能不能一直在,以及它是不是真的看得到你。前者要求模型长期维持一个稳定的角色和世界;后一个问题则更接近真实社交的本质——AI 不仅要听懂用户说了什么,还要持续读取人的表情、动作、姿态乃至沉默,把这些非语言信号一并纳入交互。只有做到这一步,视频才不只是给用户看的输出,而真正成为模型类人感行为输出的另一条通道。

图片

长时一致性大考:24 小时不宕机背后的“世界维持”能力

今天绝大多数 AI 视频仍然是一种有终点的内容。

用户输入一句提示词,模型生成几秒或者几十秒的视频,任务就结束了。但实时交互视频没有天然的终点,它更像一场不会提前写好剧本的直播,用户可能随时改变动作、说一句话、拿起一个物体,甚至突然离开镜头。视频必须根据已经发生的一切实时演算继续向前生成。

这也带来了实时视频最棘手的问题之一——误差累积

实时视频生成采用 Auto-Regressive(AR)方式连续生成,模型刚刚生成的结果很快会成为下一轮生成的上下文。一次很小的偏差,如果没有被纠正,就可能不断传下去:先是人物五官稍微变化,接着衣服颜色漂移、物体消失、空间结构变形,最后连人物和环境之间原本成立的关系都逐渐失真。

所以,当生成时间从几十秒拉长到几十分钟甚至数小时,真正关键的问题在于画面的一致性——生成到足够久以后,模型还知不知道这个世界现在的确切状态。

Genesis-1.0 此次针对长时误差累积与生成一致性问题进行了专项优化,将业界约 5 分钟级的互动时长,提升至稳定的  24 小时

图片

图片来源:Frame-X

但 24 小时本身并不是重点。它更像一次压力测试,测试模型在经过成千上万轮连续生成之后,角色身份、场景结构和已经发生过的状态变化能否继续被模型正确继承。

这和大语言模型的长上下文能力有些相似。长上下文的关键并不是简单“读得更长”,而是在经历大量历史以后,仍然知道哪些信息和当前有关。放到视频里,就是运行足够久之后,模型仍要知道谁是谁、东西在哪里、此前发生过什么,以及下一刻有哪些状态要保持连续。

如何解决这一问题,行业正在出现不同的技术路线。

一种典型思路是 3D / Spatial 路线:在视频之外显式保存空间结构、物体状态和历史记忆。世界的结构由一套结构化状态负责维护,而视频模型更像一个翻译器,负责把它渲染成画面。对于游戏、仿真等要求精确空间关系的场景,这是一条非常自然的技术路线。

但形界押注的是另一种选择:让视频模型自己学习和维护世界状态。

它希望人物身份、空间关系和历史变化直接沉淀在模型学习到的视频表征中,而不是随着世界越来越复杂,在模型之外同步增加一套越来越庞大的状态系统。

这背后是一种更彻底的 Scaling 假设:如果世界的结构、状态和变化规律本身可以被视频模型学习,那么随着模型规模、数据规模和训练规模增加,模型能够在同一种表征中不断吸收更复杂的世界知识。相比之下,一旦把大量状态显式放在模型之外,世界复杂度上升时,外部结构化表示也需要同步变得更加复杂。

换句话说,形界希望把“记住世界”也逐渐变成模型能力本身,而不是长期依靠模型之外的一套工程系统兜底。

这当然还不是一场已经有定论的路线之争。显式 3D 状态在许多场景中有不可替代的确定性优势,而一次 24 小时实验也不足以证明视频表征能够解决所有长期记忆问题。

但 Genesis-1.0 至少把这个原本偏研究的问题向前推进了一步:互动视频开始从“不断生成下一段内容”,走向“持续维护一个正在运行的状态”。更值得注意的是它的迭代速度:从今年 7 月 Genesis 在 WAIC 首次公开亮相,到 Genesis-1.0 把连续生成推到 7x24 小时,中间只隔了两个月。

图片

告别“套皮数字人”,端到端行为推理创造真正的“类人感”

不过,对于 Genesis-1.0 来说,长时稳定只是一层地基。如果一个角色能够在屏幕里稳定存在 24 小时,却对屏幕外用户的举动毫无察觉,它仍然只是一张无限延长的动态壁纸。

过去几年,数字人在“长得像人”这件事上经历了飞速的技术迭代。脸、口型、声音乃至微表情越来越逼真,但真正交流几十秒之后,另一种“不像人”的割裂感往往很快出现:它不知道你还没说完,不知道什么时候应该看着你,更不知道你一个没有说出口的动作究竟意味着什么。

因为真正的人际交流从来不限于单纯的语言。

人在对话中会不断观察对方的状态,再决定自己应该倾听、等待、回应还是主动表达;自己的行为又会成为对方下一轮判断的输入。社交本身就是一个持续运行的反馈回路。

这也是 Genesis-1.0 想强调的“类人交互”体验。

这些动作本身并不难生成,真正困难的是:用户并没有先告诉模型“接下来请挥手”——行为是由交互本身触发的。

一个更纯粹的测试场景:用户把手放到摄像头前做出数字手势,然后问角色“这个加起来等于多少”。

这时候,问题已经不再是简单的动作跟随:模型不仅需要准确感知摄像头里发生了什么,还要结合交互历史,把视觉和语言信息联系起来,再决定下一刻应该给出什么反馈。

形界把这种能力称为“端到端行为推理”。这里的“推理”不必简单等同于大语言模型内部的思维链。更值得关注的是它对应的产品能力:实时视频模型开始从“被动按照指令生成动作”,走向“根据当前场景主动选择行为”。

这和今年 GPT-Live 给语音交互带来的体验颠覆非常相似。

GPT-Live 的自然感并不只来自声音本身,更来自一些行为细节:用户插话时,它能停下来;合适的时候会用很短的回应告诉用户“我还在听”。正是这些看似细小的行为反馈,决定了一段交流是不是像真正的人类对话。

视频模态则把这种要求进一步放大了。

一个真实的人不仅会通过声音表现“我在听”,还会用视线、表情、身体姿态和动作来表达自己的状态。也因此,视频双工面对的并不是一个简单的“语音助手加数字人外壳”问题,而要考虑如何把整套非语言互动也交给模型处理。

8 月,形界与中国科学技术大学等机构联合提出 SemComp-Bench。和传统视频 benchmark 关注画质、运动质量不同,它专门评价模型有没有真正完成用户要求的语义任务,并提出 Outcome Achievement 和 Generation Reliability 两类指标。

当视频只是一种内容时,最重要的问题是“生成得好不好看”;但当视频变成实时互动方式以后,评价标准会多出更关键的一层:它有没有理解你,以及它有没有做出正确的行为。

所以 Genesis-1.0 想建立的“类人感”,不只是一个看起来更逼真的 Avatar,更是一个能够完成倾听、思考、反馈、表达完整交互反应闭环的智能体。

图片

1.5 秒背后,AI 的“反应”和“思考”开始被拆开

类人感还有一个很现实的前提:速度。

你向一个人挥手,对方 4 秒以后才慢慢挥回来,动作即使完全正确,交流仍然会显得怪异。真实社交里的自然感很大程度上来自 timing——什么时候回应,什么时候等待,什么时候保持一个倾听中的表情。

形界此前发布沉浸式视频模型 Rise 时,公开展示过最低 500 毫秒级的端到端交互延迟。其背后的技术主张,是把视频输入、行为理解和画面生成拉进同一个连续时序中,尽量减少独立理解模型与生成模型之间的串行传递。

Genesis-1.0 延续了这条思路。但进入社交场景以后,它还需要处理另一个矛盾:有些反馈必须立刻发生,有些任务却需要更长的计算时间。Genesis-1.0 此次给出的画面行为平均响应时间是 1.5 秒。模型本身会持续感知用户输入,并即时生成角色的动作、表情和画面,维持低延迟感知和生成的闭环;Genesis-1.0-Brain 则负责问答内容、语言风格、MCP 工具调用等更高层的异步规划。

图片

图片来源:Frame-X

这里的核心并不是简单把所有任务都压缩到 1.5 秒以内,而是让“反应”和“思考”运行在两个不同的时间尺度上。当用户抬手打招呼时,角色不应该等一个复杂的大模型完成数秒推理以后才做出动作;但当用户要求它回答复杂问题、调用工具或者完成某项任务时,系统又必须允许更深的推理发生。

如果所有能力被串在一条链路里,任务越复杂,模型越聪明,交互就可能越慢。更合理的方式,是让即时感知和行为生成保持高速运转,同时把需要更多计算时间的智能任务放到另一层异步完成。

有意思的是,GPT-Live 在系统设计上采用了类似的分层思路。OpenAI 的全双工语音模型负责维持实时交流,需要复杂推理或工具使用时,再异步委托后台模型处理,而当前语音流不必因此中断。

但“视频版 GPT-Live”这个说法并不是说 Genesis 与 GPT-Live 使用了相同的技术架构,而是两者都在处理实时 AI 的共同矛盾点:人要求即时反馈,但智能本身需要时间。实时交互时代的产品需要一种新的能力——即使 AI 还在“想”,它也不能在关系层面消失。

对于声音,这意味着倾听、停顿和简短回应;对于视频,则意味着眼神、表情、身体动作,以及始终保持“在场”的状态。

这可能比单纯把延迟从 2 秒压到 1 秒更重要。

图片

从文件到软件,视频会成为下一代人与 AI 的交互界面

传统视频模型的交付物通常是一段内容。生成结束,模型的工作也就结束了。但一个社交角色、陪伴对象或者互动世界不止于此。它必须长期存在,持续接受另一个人的输入,并在每一次新的交互之后动态更新自己的状态。

这也是 Genesis-1.0 更大的产品野心。过去,构建一个长期在线的虚拟角色,开发者需要分别处理角色资产、剧情逻辑和各种事件反馈。内容制作和交互逻辑是两个高度依赖人工的割裂系统。生成式 AI 首先改变了前者。形界接下来想做的,是让模型继续吞掉后者。

他们并不只想把一个 AI 角色直接交到用户手里,而是希望把“持续在场、敏锐感知和即时回应”这些能力进一步沉淀为一种可被不同互动产品复用的底层基础设施。社交陪伴是目前最直接的落点,但这套能力同样可以延伸到直播、游戏 NPC、互动娱乐以及其他今天尚未成熟的产品形态中。

当一个模型能够理解用户、持续维持人物和环境状态,并根据交互直接决定下一刻发生什么,开发者得到的就不只是“生成一段视频的 API”,而开始接近一套新的互动内容生产方式——没有冗余系统,“模型即产品”。

但对商业落地而言,这件事最终要落到非常现实的问题上:一个角色能在线多久?用户一个动作以后要等多久?互动能否超越一张会说话的脸?以及当几千、几万名用户每天持续使用时,这套体验在经济上能不能成立?只有这些指标同时过线,实时视频才可能从模型 Demo 变成社交、陪伴、直播和互动娱乐真正可调用的一层基础设施。

形界特别看重社交场景,也正是因为它对这套技术提出的要求最完整。直播允许内容仍然以“主播”为中心,游戏可以预先规定大量交互规则,而社交需要模型真正围绕另一个人不断调整自己的行为——它既考验内容生成,也考验感知、理解和即时反馈。

对于一家刚成立数月的公司,形界没有选择先用很长时间去讲一个宏大的世界模型故事,再慢慢等待技术成熟,而是几乎每一个阶段都拿出能够被实际感知到的成果。Genesis-1.0 就是在这条务实路径上一次明确向产品层的收束:同时解决时长、行为、响应和成本这四个指标。

但技术走到这里以后,问题已经开始不同。

过去,用户打开一个 AI 产品,通常是为了得到一段内容或者一个答案:人输入需求,机器返回结果,交互是离散的。这种受限的信息带宽无法支撑起更加复杂的应用。而社交和陪伴需求是另一种深度关系——一个对象长期存在,精准感知用户现在的状态,并根据双方共同经历的历史持续互动。

文字很难承载这种关系,语音把它向前推了一步,而视频提供了更高的信息带宽。所以 Genesis-1.0 真正押注的,并不只是 AI 视频的下一次升级。它押注的是一种新的交互范式:让视频从 AI 生成的一次性结果,变成人和 AI 之间持续发生的交互本身。

过去的视频模型,往往以“生成完成”为终点。如果这条路线成立,那么下一代互动模型真正重要的竞争力,可能恰恰是:它不再轻易结束。

https://www.frame-x.ai/models/genesis

图片
图片
文章标签模型发布智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多