Token导航 LogoToken导航TokenDH.com

鸿蒙看中了极顶数创什么?: 一家3D 大模型公司的产品逻辑

更新时间 2026-07-16来源 虎嗅网正文 3432字阅读约 11分钟7 张图片

极顶数创创始人嵇盼博士详解V2Fun:从3D资产生成到世界模型的进化路径

本文来自微信公众号: 少数派 ,作者:thusplay,原文标题:《鸿蒙看中了极顶数创什么?—— 一家 3D 大模型公司的产品逻辑》

过去,做一个3D模型是件门槛极高的事——建模、拓扑、UV、贴图、材质,一整套专业软件里的复杂操作,把绝大多数普通人挡在门外。而随着AI时代的到来,3D创作第一次有机会像拍照一样简单。

带着关于「为什么是3D」「为什么是鸿蒙」以及「一支研究型团队如何做产品」的诸多疑问,少数派专访了极顶数创创始人、CEO嵇盼博士。

▍请介绍一下自己和你的产品。

少数派的读者们大家好,我是嵇盼,极顶数创(Vertex Lab)的创始人和CEO。我毕业于浙江大学,之后到海外攻读博士,师从3D视觉领域的知名科学家Hongdong Li教授,博士后师从澳大利亚工程院和科学院双院院士Ian Reid,一直主攻三维视觉、空间计算、感知交互和3D内容生成等方向。在硅谷的核心AI圈待了差不多五年后,我回国加入大厂工作,曾经担任腾讯XR感知交互中心的负责人。2025年,我创立了极顶数创,目前的主要产品就是V2Fun。

▍如今流行的AI方向主要是文本、图片和视频生成,为什么选择更小众可能也更难的3D生成方向?

我的判断是,3D大模型是AI从「二维内容生成」走向「三维世界生成」的关键基础设施。真正的空间智能、未来的世界模型,底层入口一定是三维的。3D生成确实更难,它要同时解决结构、纹理、视角和资产可用性的问题;但也正因为难,才会离未来更近。

这个种子其实在十几年前就种下了。2009年,我还是大三学生,在浙大紫金港校区附近的一家影院里看了《阿凡达》。还记得银幕上呈现出一个纵深、有光影的立体世界,潘多拉星球的丛林与生物以一种前所未见的方式「活」了过来。我被这种「另一个世界真实存在」的错觉击中了。

散场后,我除了感叹特效震撼,也开始琢磨一个更实际的问题:这些三维的角色和场景,究竟是怎么生成出来的?带着这个问题,我一头扎进了校内的3D数字电视实验室,从此和「三维」这两个字较上了劲。

十几年后,我在硅谷做完自动驾驶的3D视觉,又转战AR、VR赛道,最后回国加入腾讯游戏的XR感知交互中心。但那个当年在电影院里冒出来的念头始终没有消失:如果三维世界的构建门槛能够被彻底打破,普通人也能像写一句话那样「造」出一个三维角色,那会怎样?

2025年,这个念头终于落地成了一次创业。我后来常说,3D模型是真实世界的一种物理表达。这句话听起来像是产品理念,但对我而言,其实是从16年前那个电影院的座位上,一路走到今天的答案。

▍先来说说V2Fun的移动端吧。一个完全没有建模基础的普通人,打开它能做什么?

▍为什么选择在鸿蒙平台首发V2Fun app?主要是出于技术上还是生态上的考虑?

两方面考虑都有。

▍根据你们目前掌握的情况,移动端的大众用户最常生成的是哪些类型的3D模型?和你们最初的设想一致吗?

说实话,和我们最初的设想有重合,但也有不少意外。

从后台数据来看,目前用户生成最多的还是人和宠物两大类:自拍、证件照、和朋友的合影,占了相当大一部分;紧随其后的是宠物,猫猫狗狗几乎是每天生成量最高的品类之一。这两类符合我们最初的判断,人们最想留住的,永远是和自己有情感联系的东西。

▍与移动端相比,V2Fun网页版服务群体有何不同?为什么选择同时服务两个需求差异极大的群体?

例如,我们有一位叫做喵不灵的专业用户,他是⼀名拥有8年经验的资深游戏原画师,曾参与过《⽆限暖暖》等⼤型项⽬,但⼀直想独⽴完成⼀个属于⾃⼰的童话⼩镇《唯诗利亚》(Wishlia)。过去,他曾先后尝试过7次,但每⼀次都在进⼊建筑细节、空间搭建和模型资产制作阶段时,因为⼯作量过⼤⽽被迫放弃。

首先说技术上的优势,我觉得主要有两个层面,一是底层的3D基础大模型,二是几何与纹理的联合优化。

我们基础模型有过几次重要迭代。最早是「二维升三维」,相当于给模型看几张照片、让它去猜物体的立体结构。这种方式速度快、好上手,但应对复杂造型的能力不足,不同角度还常常对不上。后来我们换成VAE+Diffusion,其中的VAE(变分自编码器)先把庞杂的三维数据压成一份紧凑的「压缩包」,Diffusion(扩散模型,和大家熟悉的AI画图是同一类技术)再在这份压缩包上生成3D。这样一来,细节和复杂纹理的效果就提高很多。

现在,我们进一步发展到VAE+DiT,DiT是指Diffusion Transformer(扩散Transformer),通俗说就是把模型的骨架换成和大语言模型同源的Transformer。这样不仅能应对数据更多、结构更复杂的情况,还能把形状、质感、每个角度乃至语义放进同一个模型里一起处理,结果更稳定、更可控。

几何与纹理的优化也很重要。一个3D图形的质量,很大程度上取决于它的形状是怎么保存的。传统的方法存在精度均一的问题,数据量太大,给模型学习造成很大负担。而我们只保留刚好够重建形状的关键信息,只在形状复杂的位置用更密集的数据记录,实现了精度和效率的良好平衡。

(几何算法原理图)

而在纹理贴图方面,主流做法是先用AI生成几张不同角度的图、再「贴」回模型上,但这样无法补全没拍到的细节,不同角度之间还容易「打架」。我们则区分「全局」和「局部」,全局上定好整体结构,局部用高清小图块补充表面细节,所有视⻆和图块通过同⼀套三维表⾯表达交换外观信息。这套方案很轻,还和角度数量、分辨率彻底解耦,推理时能一路放大到8K甚至12K的纹理效果。

▍3D生成的赛道里也有大厂和其他野心勃勃的创业公司,你们认为V2Fun的差异化在哪?

具体来说,我们赌的是从「3D原生资产」进化到「3D世界模型」这条路:先让用户生成一个带有精准几何、材质和骨骼的高精度实体,解决资产结构的确定性;下一步让模型拥有动作和骨骼;未来再通过动作控制与动态记忆机制,让主体和环境发生真正的物理交互与因果推演,最终收敛成一个全功能的世界模型。

所以在我们看来,3D资产生成只是入口,不是终点。

▍「3D原生资产」进化到「3D世界模型」听起来很有吸引力,但具体要如何实现呢?

我们把世界模型的核心能力拆成三类:负责画面质感的渲染器、负责空间物理规律的仿真器、负责行动决策的规划器。行业现在的局限是,纯2D视频路线缺三维结构,高频交互下画面容易变形、崩塌;纯三维路线能生成精美场景,却丢了时间维度,只是一具静态标本。

而我们的核心判断是:下一代世界模型必须是渲染、仿真、规划的深度融合。所以我们选择以带实体模型、动画、骨骼的「真3D」为世界主体,再借助面向交互的「动作控制视频生成技术」为环境引入时间与因果。

这具体分为两个阶段。第一阶段,也就是现在已经做到的,是构建主体和确定性资产:让用户生成带精准几何、材质和骨骼的高精度模型,把结构底座打牢。第二阶段则是引入动作和时间维度。例如,我们正在研究「隐空间高斯记忆体」(Latent Gaussian Memory),把实时的动作和视角切换转成3D记忆颗粒,让AI无论走多远都能精准召回空间记忆、以低延迟渲染出符合物理规律的画面;还在研究「动态偏差归档机制」(Dynamic Deviation Archive),在交互推理时自动修正长程误差。这样,无论视角在虚拟世界里绕多大一圈,场景、颜色、结构都能始终如一。

(隐空间高斯记忆体原理图)

▍你们经常说自己是一支「研究型团队」,为什么这么定义?怎么做好「前沿研究」和「适应市场」之间的平衡?

▍V2Fun对于商业模式的计划是怎样的?最终会以什么形式向谁收费?

▍最后一个轻松的问题:用V2Fun生成过的所有东西里,哪一个是你自己最喜欢、也最意想不到的?

说出来可能挺普通,不是什么炫酷的角色,是我给自己一岁半的小孩做的一个3D模型。

那天他刚睡醒,头发翘得到处都是,坐在爬爬垫上啃一个积木,表情特别专注。我随手用手机拍了张照片,扔进我们自己的模型里试效果,其实就是想看看AI处理小朋友这种五官比例特殊的对象效果怎么样。结果没一会儿,一个圆滚滚的小人就生成出来了,连他啃积木时那种嘟起来的小嘴、翘起来的那撮头发都还原得清清楚楚。

把模型给我爱人看,她当时就愣住了,说「这也太像了吧,连他那个专注的小表情都在」。我当时心里也咯噔了一下。我们做这套系统,本意是服务专业的动画师、游戏公司,天天讨论的都是精度、拓扑、渲染效率,结果真正戳中我的,是以普通爸爸身份随手一拍的照片,就能变成一个可以从任何角度看、可以留存下来的立体存在。

文章标签大模型AI产品
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多