Token导航 LogoToken导航

九章云极尚明栋谈如何让同一张卡产出更多Token

更新时间 2026-09-27来源 南方周末正文 5995字阅读约 19分钟1 张图片

用AI提质增效,从个人到企业,Token的消耗越来越多、越来越快。

AI算力成本还能降多少?要怎么降?

九章云极给出的答案,是六成。

这个数字来自一个头部大模型厂商的真实项目,九章云极将其综合算力成本降了60%以上。

九章云极是一家创办于2013年的中国AI基础设施及智算云提供商。它不建超大数据中心,却建高效的调度系统;不卖最贵的GPU,却让每一度算力都物尽其用。在智算硬件受限的情况下,在大厂云、电信运营商智算云等AI基础设施巨头面前,这类“小个头”的效率让人惊叹。

这要归功于他们自主研发的Alaya NeW智算操作系统,能够向下纳管大规模异构算力,向上提供模型工具链。九章云极想要做“AI工厂”。其中,训练工厂解决智能“从0到1”的研发与制造,Token工厂完成智能“从1到N”的规模化交付,以低成本、高稳定的方式输出AI能力。

目前,九章云极已完成智谱GLM-5.2、DeepSeek-V4 Flash、Kimi K3等中国主流大模型适配,并与百度昆仑芯、海光信息、天数智芯等芯片厂商达成生态合作。

九章云极能站在今天这个生态位,则要追溯到2013年,其创始人尚明栋、方磊从美国微软回到中国,开始创业。

在那之前,尚明栋在微软做了5年的服务器高可用集群和文件系统核心开发工程师,参与Windows 7、Windows 8的研发,是SMB 3.0网络文件共享协议的主要起草人之一,理解操作系统如何统筹硬件、定义软件。方磊当时担任必应(Bing)部门的数据科学家,亲历机器学习在搜索推荐上的早期应用。

图片

九章云极联合创始人兼COO尚明栋 图源:九章云极

2013年3月,方磊、尚明栋共同创立九章云极DataCanvas,这是中国最早切入数据科学服务的平台之一。该平台将数据清洗、特征工程、模型训练、部署上线等一系列高难度工作自动化,用户无需深厚的编程背景就能在平台上完成从建模到投产的全流程。

2022年年底,ChatGPT引爆生成式AI,模型参数的规模急剧膨胀,智算云时代由此到来。九章云极自2023年开始转型,作为独立智算新云的提供商,与“大厂云”们形成差异化供给。

传统算力租赁模式通常包年包月,九章云极提出DCU(1度算力)的标准化计量单位:1度算力=312TFLOPS(FP16) 的有效浮点计算持续1小时,近似一张英伟达A100在典型训练负载下的有效算力输出。

这类似于电力行业的“一度电”,可计量、可结算、可按需消费,中小企业就能按需购买,让闲置的资源流向更多需求方。

九章云极同时给客户两份账单:一份是包月计费、一份是按照DCU计费,实测对比发现能省40%。在九章云极自己的账本里,不同模型能力的单位Token成本,差距更是高达五六倍。

以下为南方周末研究员与九章云极联合创始人兼COO尚明栋的访谈。

能力平台化、低门槛化

南方周末:你此前在微软的主要工作是什么,为什么在2013年选择回国创业?

尚明栋:我在微软主要是做底层操作系统中的文件系统与存储可靠性,方磊负责搜索团队必应。我们正好见证了AI的早期阶段——小模型时代,机器学习被应用于广告排序和推荐,本质就是从海量数据中学习规律、形成模型,进行业务预测。

在这个过程中,我们观察到两个趋势:第一,数据资产越来越重要,模型数量和数据量级正在快速增长;第二,企业对数据价值的挖掘需求越来越迫切,数据无法产生价值,就只会带来存储、查询等一系列成本。

当时我们有一个非常朴素的愿景:希望AI变得普惠化,可以进入千行百业。我的工作侧重底层数据的结构优化,方磊擅长将数据规模化应用,两者正好覆盖从数据产生到价值变现的链条,于是决定一起创业。

南方周末:当时数据可视化很热,你们怎么首选做数据科学平台?

尚明栋:刚刚提到AI普惠,那要怎么降低成本?整个过程是一个链条:数据收集整理、打标签,之后结合机器学习算子做模型训练,最后到应用。其中最难、最贵、最具前景的环节就是建模,值得做深、做透。

起步阶段,我们对标的工种是数据科学家(Data Scientist),他们要做特征选择、算法选择、参数调优,当时资深数据科学家薪酬高企。我们希望把这种建模能力平台化、低门槛化,而不是跟风做链条末端的数据可视化。

南方周末:你们的第一款产品是如何诞生的?

尚明栋:第一款产品的设计灵感来自麻省理工学院(MIT)2007年推出儿童编程工具Scratch。它把程序框架搭好,孩子们不需要理解循环语法这些编程,就可以像填空一样拼成复杂图案。我四年级的女儿一两天就能上手,编出不错的图案或小游戏。

2014年3月,我们推出建模平台DataCanvas 1.0,两年后升级为DataCanvas APS机器学习平台——内置两百多个经过测试的机器学习算子,把关键参数空出来让用户“填空”。用户即使不懂参数配置,系统也会自动推荐最佳配置,一路“Next”就能完成模型训练。优质的数据科学家能做出90分的模型,不懂编程的小白也能练出80分。

后来,我们还加入了自动机器学习功能——用户只需描述场景、输入数据、定义输出,系统就能自动进行特征衍生、算子选择和迭代优化,最后输出冠军模型及其指标,选定后一键部署到生产环境。这样一来,建模的门槛和成本都大大降低了。

南方周末:早期你们如何招募团队核心成员?

尚明栋:创业后的前半年我几乎没做业务,像专职HR一样每天筛简历、打电话、沟通面试。我们第一个办公室只有4个工位,三个月后招到第一批33人,基本都是工程师。

我觉得员工首先要认可AI普惠的愿景,愿意承担早期风险,而不是先谈年薪福利。创业公司拿期权,风险高,但做成了回报也大。

转型,等不起时间窗口

南方周末:2013-2023年,你们的数据科学平台服务一直稳定增长。后来为什么要转向智算云?

尚明栋:在做数据科学平台的时候,我们渐渐发现一个卡点:每家企业都有个性化需求,比如接口怎么开、功能怎么调、内部数据仓库怎么对接。而我们是标准化软件,面对非标需求既要定制开发又要维护,边际成本太高。

2020年前后,很多国央企开始建自己的私有云,它们与公有云一样分层建设,最底层是IaaS(基础设施即服务),中间层是PaaS(平台即服务),上层是SaaS(软件即服务)。数据科学平台的本质属于AI能力层,被作为PaaS的一部分嵌入客户的私有云。

到了2022年年底,GPT-3.5代表的生成式AI从根本上改变了算力需求性质(从通用串行逻辑处理转向大规模并行计算),让我们进入最焦虑的几个月。不同于传统云,AI新云(智算云)基于GPU而非CPU,需要先明确大模型AI工作的负载需求,再自上而下倒推设计PaaS层的训练框架与推理引擎,以及IaaS层的存储、网络和计算架构。

那一刻我们意识到,与其继续在别的私有云上做PaaS,不如自己从底层构建一套原生的智算云。2024年4月,九章云极发布Alaya NeW智算操作系统,首次提出DCU标准化计量单位;同年9月上线Alaya NeW Cloud智算云服务,推出“算力包”产品。

南方周末:转型过程中,你们的优势和短板是什么?

尚明栋:优势在于十年AI基础软件积累。我们从2013年开始做数据科学平台,到2020年位列IDC中国机器学习开发平台市场前三,客户涵盖金融、运营商、制造等多个行业。另外我们有微软系统架构基因,了解大规模系统如何稳定运行。

短板也很明显,一是没有GPU库存,在供应链上没有话语权;二是数据科学平台多是项目制,没有Token级别的计费和账期模型。

南方周末:当时团队内部有没有争议?

尚明栋:团队建立统一认知非常艰难,有些同事在原有模式下做得很好,业务也在上涨,他们很难理解公司转型,商业模式和客户群体都要发生巨大变化,自己团队一下子被边缘化。

但我们还是坚持了战略推进,2023年开始主动推动商业模式持续演变:从数据科学平台,升级为智算云与AI工厂;组织能力同步向算力调度、推理服务、AI系统工程迁移。原有数据科学的客户也会持续获得维保与升级。

现在的行业情况也证明,我们的预判比较准确。

南方周末:整个团队变动率大概有多少?客户情况呢?

尚明栋:这要分部门来看,比如一些偏后台的财务、商务、HR部门变动不大,越偏向前台、尤其销售团队流动非常大。随着业务由数据科学平台向智算新云演进,客户结构由金融/政企项目制客户,逐步扩展到 AI 原生科技企业。

原有那批大企业客户,未来两年也可能成为重度AI使用者,但我们作为创业公司,等不起这个时间窗口。

单位Token成本,可相差五六倍

南方周末:2026年6月,你们发布“AI工厂”战略。选择这个时间点的原因是什么?

尚明栋:“工厂”这个比喻,其实2023年我们内部就开始用了。我们不只是卖算力,而且是把算力变成可计量、标准化、随时取用的产品。2023-2025年,我们逐步建了智算中心,服务国内主流大模型和智能体公司,早期算力主要用在训练上。

2026年上半年出现一个拐点:算力需求爆发的同时,推理消耗算力第一次超过训练算力。前几年大家比参数规模,现在更多看具体场景的效果,比如AI编程、短视频生成这些实在的生产力。相应地,我们的训练工厂也随产业迁移,从侧重生产往应用倾斜。

训练工厂负责生产,将数据和算法转化为专业模型;Token工厂负责流通,将模型能力封装为标准化Token。用黄仁勋讲的五层AI生态架构来看,我们正好处在中间层——向下协同芯片算力,向上承接模型和应用。

南方周末:在AI工厂推进的过程中,客户的主要诉求或痛点有哪些?

尚明栋:一是算力分配问题,高性能算力“一卡难求”,而不少企业买了GPU后使用率不到30%;二是Token的成本问题,它的智能能力取决于由哪个模型生成,不同模型能力的单位Token成本相差五六倍。

南方周末:你们如何解决以上问题?

尚明栋:对于算力分配,我们提出DCU计量体系,1度算力等于312 TFLOPS运行1小时的浮点运算量。不用时,算力通过优先级队列动态调度给其他用户,在典型调度场景下可将GPU的有效利用率显著提升。

动态调度还能进一步错峰。比如傍晚至晚间是游戏、社交等实时任务的使用高峰,需要优先保障;深夜至次日早晨是算力需求的低谷,视频生成这些离线推理任务时间不敏感,可调度到此时段运行,成本能降低20%-30%。

对于Token成本,我们按任务复杂度匹配不同模型,将Token分成三类:按任务复杂度分层计价。去年年初DeepSeek刚火的时候,很多企业急着搭一体机搬回去用,后来就没什么声音了,核心原因就是把一个标准模型搬回家,它解决不了具体的业务问题,需要专业类Token来做,这样一体机才能真正走进业务。

南方周末:按DCU计量、按需使用,这一模式推出后市场反响如何?

尚明栋:客户反响很不错,因为包年包月的模式已经存在很多年,大家都清楚其中痛点——机器闲着也要付钱。当我们提出按度计费的时候,客户很容易理解。我们会给两份账单:同样一个月,一边用包月方式,一边按度计费,部分客户实测对比发现能省40%的费用。

不过,推动行业标准落地并不容易,其中涉及利益结构:一旦统一折算,所有芯片厂商就在同一套尺度下被衡量,标准博弈的背后其实是产业话语权博弈。此外,异构折算涉及芯片型号、任务负载、调度算法、机房环境等诸多变量,要做得公平合理极其困难。我们把DCU定义为“算力投入度量”,而非“某款芯片性能标尺”。

南方周末:帮用户省钱,你们自己的利润率呢?

尚明栋:这其实是批零逻辑——包年包月相当于批发业务,按度计费则是单价更高的零售。只要我们把闲置时段的算力通过调度填满,把GPU的利用率拉上去,就能比传统算力运营商获得更高的毛利,这也是我们持续努力争取的方向。

目前,我们同时维持两个资源池:每月到期的包时算力,会从低毛利“批发”池转入高毛利“零售”池;新建算力中心则先放入“批发”池跑几个月覆盖建设成本。随着算力持续向高毛利池迁移,整体的变现曲线逐步爬升。

按签单金额来算,客户结构正从单一大单向多客户、经常性收入倾斜。如果只是纯算力,中客比大客的利润率高几个百分点;如果在这个过程中叠加推理服务,利润率可能会多出30%左右。

算力中心闲置,但算力没有过剩

南方周末:2026年以来,市场对“AI泡沫”的争议加剧,算力过剩是核心论据之一。你怎么看?

尚明栋:现阶段确实存在一类公司,建了很多智算中心,把设备放进去就快速做算力租赁业务,但其实很多租不出去。不过,闲置并不能等同于过剩,而是算力重复堆砌导致结构性错配。随着算力市场经历快速繁荣期、发展平台期,最后到淘汰换代期,优先被洗出局的一定是那些成本高、附加值低的企业。

南方周末:一些智算中心的使用率不到30%,这种错配的根源是什么?

尚明栋:因为建出来的算力不好用。不少智算中心的算力集群、生态适配都面临很大挑战,使用门槛和成本非常高,自然会被闲置,这是国产芯片追赶的必经阶段。到了2026年,推理端的算力需求正在快速爆发,国产算力在推理侧进步也很明显。

南方周末:你们也与多家国产芯片厂商开展生态适配,彼此合作的基础是什么?

尚明栋:国产GPU进步非常快,在推理场景的落地速度更快,所以九章云极今年下半年开始布局国产算力,也符合从训练工厂向Token工厂倾斜的战略。国产芯片厂商愿意给我们卡,是因为我们能让他们的芯片跑满、跑出效率。

比如我们在某国产主流芯片上跑模型,通过PD分离(Prefill和Decode用不同芯片或资源分开跑)、MTP加速(多Token预测)、KV缓存复用这些工程手段,在特定模型与工程优化下,Token的产出效率显著优于通用部署方案。另外,在某头部大模型厂商的项目中,我们将综合算力成本降了60%以上,让同样一张卡产出更多Token。

南方周末:你们目前Token的产出量如何?

尚明栋:当前通过Alaya NeW Cloud平台纳管的智能算力超过25000P(25 EFLOPS),单日趋近千亿Tokens,还处于起步阶段。据易观分析相关报告,公司在第三方普惠智算云市场位居前列。

公司设定的中期战略目标是,平台纳管及调度能力向100 EFLOPS(约10万P)演进,并支撑单日十万亿级Token流转,这是面向智能工业化时代的交付能力目标。

南方周末:随着算力租赁赛道进入发展平台期、淘汰期,最终会走向寡头垄断还是细分领域百花齐放?

尚明栋:我觉得会分层共存。互联网云厂商占据一部分市场,它们天然绑定自有模型,但不是所有企业都能接受;九章云极这类独立智算云厂商会占据另一部分,核心卖点是“开放独立+多模型+DCU计量+ AI 工厂全链路交付”。

AI工厂以数据和算法为原料,以算力为燃料,生产的是智能,交付给应用端智能系统。谁能利用算力高效产出智能,谁就有价值。相比大厂,我们的优势在于专注和灵活,没有历史包袱,可以从零开始为智算云设计最优架构,让算力充分利用,真正降低用户的成本。

南方周末研究员 曹妍

责编 黄金萍

文章标签算力应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多