Token导航 LogoToken导航TokenDH.com

一手实测 Step 5 Preview,国产 AI 模型卷麻了!

更新时间 2026-09-21来源 甲木未来派正文 6303字阅读约 20分钟32 张图片
STEP 5 PREVIEW · HANDS ON一手实测Step 5 Preview做出来,也要验明白。创意交互 · 三维场景 · 真实任务FROM IDEAS TO CHECKED RESULTS创意前端3D 建模工程与办公规格 → 实现 → 自检留档

大家好啊,我是甲木。

七月份的时候,我就受邀参加了「阶跃」的新品发布会。当时还发了个朋友圈,那场的主角是手机,主打端侧智能。

图片

当时想的就是:接下来他们发的模型,大概率是冲着手机去的。

果然,不到两个月的时间,阶跃的整个模型家族果然迎来了新成员,Step 5 Preview。

不管是Coding、前端、Working 和 Agent 能力,对比上一代,都有非常大的提升。

图片

通过官方信息我们也能看到,Step 5 Preview 的定位是「向前一步,智能效率的新一代“帕累托前沿”」

图片

在 AA 榜单中也名列前茅,总参数600B,激活参数27B,1M上下文窗口,同样支持多模态,以更具竞争力的成本,把 Frontier Model 级能力转化为真实可交付的生产力。

拿到模型内测权限后,我直接在 WorkBuddy 的 Agent Harness 里跑的。

话不多说,直接看测评。

4 PARTS · CONTENT MAP

左右滑动

PART 01

创意前端

动画、交互与贩卖机

PART 02

视觉与 3D

客厅、轻轨、机械键盘

PART 03

真实任务

修复工程,核对材料

PART 04

慢,但较真

场景取舍与端侧判断

PART

01

先来看一批创意 Case

CREATIVE FRONTEND

CASE 01

鹈鹕骑自行车:放开工具再迭代

先来个经典测试题目:鹈鹕骑自行车。

图片

这是第一轮交出来的效果。自行车和鹈鹕都挺像样。

图片

第一轮是严格限制调用工具的。这一次我们放开工具,让它可以用视觉模型截图参考。

图片

所以它自己改了 4 轮,不光加了一些插画和交互,还把第一轮截图暴露的问题都修了。总的来说,这个动画还不错。

简单的先到这儿。接下来实测 X 上特别火的效果。

CASE 02

动画短片:从逐秒脚本到播放器

第一个是 Remotion 这个是用来测它的前端以及视频生成

提示词如下所示:

PROMPT 01 · 动画短片 · 逐秒脚本与播放器

逐秒时间码:用代码渲染一条六十秒的动画短片 ← 变体自「30 秒 boss 过场逐秒时间码 + Remotion 科普片」 我要一条六十秒的动画短片,主题是「我敲下一句话之后,模型内部发生了什么」—— 从输入、拆词、注意力、逐字生成,到把答案还给我。 先写逐秒时间码的脚本:0 到 5 秒什么画面、5 到 12 秒什么画面,一直写到 60 秒。每一秒都要有内容,不许有静止的黑屏,不许用一段长动画糊过去。写完把这份脚本给我看,同时开始做。 技术要求: 用代码渲染,HTML/CSS/SVG 或者 canvas 都行,不要用 PPT 味的东西,不要插值动画硬撑时间。 在浏览器里能播:播放、暂停、逐帧步进、拖到任意时间点、循环。 如果手边有工具能导出视频文件,就导出成 MP4 一起给我;不能导出也行,那我要一个能逐帧截图、能录屏的播放器。 字幕是中文的,字卡要能一眼看清;音效用代码合成,别下载任何音频素材。 视觉上先给我两套风格各五秒的样片:一套是技术图纸感的(细线、标注、单色),一套是有点手绘温度感的。你自己挑一套做完,告诉我为什么。 最后交一份逐秒对照表:每个时间码、画面上是什么、这五秒在讲什么。再告诉我:哪几秒你做得不满意,为什么没做到你想要的效果。

图片
图片

从提示词到第一版交付,它花了一个多小时,成片、播放器、逐秒脚本、对照表整套交齐,整体上看效果还算可以。

CASE 03

自动贩卖机:先写规格,再做实现

下一道题:先让模型写产品规格书,再照着产品规格书做出一台能投币、会卡货、能补货的自动贩卖机。

提示词如下所示:

PROMPT 02 · 自动贩卖机 · 规格与实现

这个活分两个阶段,第一阶段只写字,不许写代码;第二阶段只按文档实现,不许改规格。中间不许跳。  第一阶段,交一份 SPEC.md 给我,把这些写死:整体美术方向(色值、字体、圆角、材质、光影)、机身和货道的几何尺寸、界面布局(每一块在屏幕的什么位置、多大)、所有机制的具体公式和数值(投币面额、每种货的价格、找零逻辑、卡货概率、卡货后连拍几次振动的概率、库存数量、冷藏温度)、动画时长、音效(每个操作什么声音、多长、用代码怎么合成)、以及明令禁止的东西(不许外链、不许下载素材、不许用第三方库)。写完先交我这份文档,别动代码。  第二阶段,严格照 SPEC 实现成单文件 HTML,双击就能玩:  投币:支持多种面额,找零要算对,零钱不足、投多了、退币都要有正确反应。 选货:货道编号可点,售罄要明确标出来。 卡货:按你 SPEC 里写的概率真卡,卡了之后拍机身有概率出货、有概率退钱、有概率彻底坏掉。 补货:我能把货补回去,库存和收益要实时能看到。 出货动画:商品从货道掉落到取货口要有重量感,不许凭空出现。 故障模式:断电、卡币、货道卡死,每种都要能手动触发,方便我看。 所有数值必须从一份外部的 JSON 配置里读,我改 JSON 就能改价格和库存,不许写死在代码里。  最后交一份「规格—实现对照表」:SPEC 里的每一条,你的实现在哪一段、有没有偏离、偏离的原因是什么。你偏离了几条,我要看到。

第一阶段阶跃模型首先先梳理完了产品规格书:

图片

然后我再让其推进生成内容,最后生成了这么个售卖机:

它能买。投币、找零、选货、出货、退币,整套流程都能走通;哪条货道卖完了,当场标上售罄。

规格书里写下的机制,它一条条都做出来了。它交活还会逐条验收,每一条都能当场演示。

图片

PART

02

视觉参考和 3D 建模

VISION TO 3D

CASE 04

客厅复原:从照片到 3D 场景

先看第一道:一张客厅照片,搭成能走进去的 3D 场景。

图片
图片

提示词如下所示:

PROMPT 03 · 客厅照片 · 三维重建

我有一张照片,是个客厅。我想请你把它变成能走进去看的三维场景。  照片我发给你了,文件名是 客厅照片.jpg。(这张图来自 Wikimedia Commons,CC BY 2.0)  我要的不是把照片贴到一块板上。要用几何体把里面的东西真的搭出来:房间的长宽高、墙和地面的边界、后面那扇推拉门的位置和尺寸、每一件家具的形状和摆放。照片没拍到的部分,比如我站的位置身后、天花板上面,你自己按合理的方式补全。  几个要求:  一、场景里至少四十个独立物件,每一件都能单独点选,点开显示它的名字和大致尺寸。 二、物件要能按类别开关显示:只看家具、只看门窗帘幕、只看摆设小物、只看灯具和光。 三、做一条时间轴,从空房间开始,按顺序把东西一件件放进去,可以拖到任意位置。 四、再做一个对比页:左边是这张照片,右边是场景,视角能和照片里的机位对上;能一键切线框,也能一键切成纯色体块,让我看清形体关系。 五、跑起来要流畅,1080p 下稳定在 60 帧,几十个物件别卡成幻灯片。整份东西不连外网也要能打开,我双击就能看。 六、交一份自检记录:你自己打开、自己截图、自己对着照片看,把不对的地方列成清单,然后改,再列一次。至少做三轮,每一轮的截图和差异清单都留着,别只给我最终版。  最后告诉我:怎么打开、物件一共多少个、哪些地方是你推断的、哪些地方你自己知道和照片对不上。

图片

这是最终交出来的对比页:照片在左,场景在右,机位对齐。

图片

第三轮自检它又截了一版线框的,把两边的形体关系摊开看。

图片

同轮的实景对比。

一张照片进去,一个能走进去、也能跟照片并排比的 3D 场景出来,自己还验了三轮,该有的都有了。

CASE 05

程序化轻轨:用代码造一条线路

先看这道:程序化轻轨,空手造一条能坐进去的线路。

提示词如下所示:

PROMPT 04 · 程序化轻轨 · 代码生成场景

我要一个能在浏览器里坐进去的城市轻轨,一根模型文件都不许用。  所有东西都要在运行时用代码生成:车厢、座椅、扶手、拉环、报站屏、车窗、轨道、道岔、接触网、隧道壁、站台、闸机、沿线楼群——不许下载任何模型文件,不许下载贴图,不许连外网,双击 HTML 就能跑。  功能上我要这些:  一、线路自己设计:至少八站,每站有名字。列车进站要减速、停稳(车头和停车线对齐,误差别超过二十厘米)、开门、上下客、关门、起步。 二、三种视角:车厢里乘客视角(能左右转头,看窗外和车厢里的细节)、车头司机视角、站台上等车的视角。视角切换要顺,不能瞬移。 三、三个时段:白天、黄昏、夜里。窗外的光、车厢里的灯、站台的灯要跟着变,夜里车厢玻璃上要能看到自己的倒影。 四、一条线路图:整条线缩略画出来,当前列车位置实时在动,点任意一站能直接跳过去。 五、性能:1080p 稳定 60 帧,说清楚你用了什么手段(实例化、几何合并、视锥剔除、LOD 都行),把帧率和绘制调用的实测数字给我。  视觉上别做成低多边形的塑料玩具感。先做两套方向各一屏给我看——一套是干净克制的现代地铁(磨砂金属、哑光塑料、灯带),一套是有年代感的旧车(暖黄灯、绿色墙面、老式拉环),你自己挑一套深入做完,告诉我为什么挑它。  最后自己坐三趟:一趟白天看准点,一趟夜里看灯光,一趟专门盯着上下客。每趟都截图,把不对的地方列出来,改完再坐一趟。三轮的记录都留给我。

先看它交出来的:

没有模型文件、没有贴图,车厢、轨道、沿线楼群,全是它当场用代码生成的,双击 HTML 就能跑。

而且在做的过程中,它还会自己截图去验证,这三张就是它截的不同时刻列车状态的图:

图片
图片
图片

这些截图只是过程中的片段。

收尾时它把整轮验证整理成了一份测试留档:规格逐条核对、三趟试乘记录、性能数据,连还没把握、要真机复测的地方,也都自己标了出来。

图片
图片

这道题跑下来,能看出它的长程任务规划能力还行:一道题从头到尾自己规划、自己验证、自己留档,中间没掉链子。

CASE 06

键盘复原:从局部到零件级拆装

接下来来试试这道:键盘零件级复原站,一张角落特写,补出整块键盘。

图片
图片

提示词如下所示:

PROMPT 05 · 机械键盘 · 零件级复原

我给你一张照片,是拆掉键帽的老式机械键盘的一个角落特写:能看到三个装好的黑色轴体(银色弹簧、银色轴顶、白色轴芯都露着)、三个空的轴位、米白色的塑料定位底板,以及底板上的加强筋和一个螺丝柱。照片就拍了这么一小块,别的什么都没有。  照片我发给你了,文件名是 键盘开关特写.jpg。(来自 Wikimedia Commons,CC BY 2.0)  我要你把这一小块补成整块键盘,并且做成一个能拆开的零件级网页。  一、先推理图外的东西:整块键盘有多少键、什么配列、外壳什么形状、脚垫和铭牌在哪、线从哪出。推理出来的东西要单独列一份清单,写清楚哪些是照片里看到的、哪些是你推的、依据是什么。 二、零件级可交互,零件总数不少于两百个:掀键帽、拔轴体、把轴体拆成上下壳、弹簧、轴芯、金属触片;外壳、定位板、PCB、卫星轴、连接线都要有。每个零件点一下能看名字、材质、尺寸、在整机里干什么。 三、三种看法:爆炸视图(一根滑杆控制散开程度)、剖切(能切到轴体内部看弹簧怎么压)、装配动画(从一地板零件自动装回成整块键盘,可以暂停、倒放)。 四、一份可导出的零件清单(CSV):零件名、数量、尺寸、装配位置,让我能对着数。 五、相机功能:一键回到跟照片完全一致的机位,左边照片右边模型并排比;再一键切成纯色体块,让我看结构关系。 六、1080p 六十帧,不连外网也能双击打开。  做完自己验三轮:第一轮把模型和照片并排看,列出哪里不像;改;第二轮看零件拆装有没有卡住的、装配动画有没有零件穿模;改;第三轮看性能和跳帧。三轮都要截图,最后告诉我哪几处你的模型和照片是明确对不上的。

和照片并排比,除了个别凹槽没对上,别的都还行。

图片
图片

物理这一层还原得也齐:轴体、弹簧这些小零件都在,还能看它把整块键盘拆开、再装回去:

PART

03

实战Working

ENGINEERING & OFFICE

CASE 07

linkding:真实工程修复与压测

前面都是前端,这道换 coding:把一个真实开源项目里的 bug 修掉,还得自己证明修好了。

项目是 linkding,一个自托管的开源书签管理器。它有个毛病是导出不跟着筛选条件走,一导出就是导出全部内容,容易把内存吃爆。

图片

提示词如下所示:

PROMPT 06 · linkding · 压测、改造与验证

我手上这个项目是 linkding,一个自托管的开源书签管理器。  我要你在真实工程里把一件活干完,不是给我一段代码。  先把代码拉下来,切到我线上跑的版本:git clone 官方仓库,再 git checkout 到 f32af96123e9749e60c54caa3ac7709621faffee 这个 commit。它是 Django + SQLite,本机要能起得来,Python 3.13 以上,用 uv 或者 docker compose 都行。  第一件事,造压。写个脚本造十万条书签,标签、归档状态、时间跨度都要有像样的分布。造完把这份数据跑起来,量三个数:列表页首屏、全站搜索、全量导出,各花多久、各吃多少内存。先给我这份基准。  第二件事,改造。目标是在十万条下——列表页首屏一秒内打开,搜索两百毫秒内返回,导出五万条不把内存吃爆(现在它是全量读进内存再吐,你自己去看它崩在哪一步)。改的过程中,列表、筛选、分页、归档开关这些老功能一样都不能坏。  第三件事,验证。把改造前后的数字摆在一起,写清楚你动了哪些文件、为什么这么动。项目自带一整套测试,跑完必须全绿;你自己补的测试要能证明新逻辑真的生效——把你新写的关键逻辑临时还原一次,看测试会不会红,红了才算测到了东西。  做完自己滚一遍,确认能起、十万条下三个数字达标、测试全绿,再告诉我。   第一件事,先压测复现 bug:十万条数据灌进去,把改之前的三个基准量出来。

图片

第二件事,改造:照着压测发现的问题,一步步优化。

图片

第三件事,验证:确认这些优化真的生效。

图片

三件事连下来,从拉代码到测试全绿,一共花了2 小时 5 分。整体来看长程调度能力还行:它验证得特别细,前面测 case 的时候一度想吐槽;放到真实业务里一看,这点较真反而用得上。

接下来是办公,就测了两个 case。

CASE 08

招标文件:78 页逐条核对

第一个,政府采购的招标文件,78 页。

提示词如下所示:

这是一份真实的政府采购公开招标文件,78 页,中文,PDF 有文字层,你直接读。

图片
图片

CASE 09

收入核对:两个数字,用哪一个

第二个,同一家公司报了两个不一样的营业收入,让它裁决用哪个。

提示词如下所示:

同一家公司,我在两个地方看到了两个不一样的营业收入,我要你帮我裁决用哪个。

图片
图片

办公这边也一样:它验证得细,所以特别适合求证类的东西。

读 78 页招标文件、裁决对不上的收入,逐行逐行都是对着原文抠的活。

真放到日常办公里,最耗精力的,经常就是在几份材料之间来回翻,确认一条要求有没有漏、两个数字为什么对不上。

这些细节核清楚了,后面整理投标材料、写经营分析,才有能追溯的依据,也方便交给同事继续复核。

所以这两个 case 跑下来,我觉得 Step 5 Preview 在办公里的价值相对实在:能帮你把交付前那些繁琐、又不能含糊的核对工作往前推进。

PART

04

结语

SLOW, BUT THOROUGH

说点实话。

这模型跑 coding 是真慢,动辄两三个小时,我测的没有低于两小时的,很多都特别长。

但它也挑场景。文档类的活,它干得特别较真,每个点都能给你核验到位。现在有很多模型,碰见问题也是拣最快、最省事的法子给你解决了事;阶跃它就一条一条对着原文抠。

而且他们也一直在做端侧,对后面的智能设备也很看好。这一步,我觉得是押对了方向:等智能设备这波真起来,端侧模型是谁的,入口就是谁的。

这种较真劲儿,跟端侧正好搭得上:端侧要的,不见得是跑得最快的脑子,是交件事给它,它能自己盯着干完、自己验好。

往后等它正式上线,再磨几轮,速度上应该能找补回来。

真到了那天,这股较真劲儿配上阶跃一直以来端侧的布局,

感觉是有得打的。

以上。

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多