Token导航 LogoToken导航TokenDH.com
阶跃星辰 StepFun logo
官方核验于 2026-04-16

阶跃星辰 StepFun

在多模态和新模型热度上有存在感,适合关注国内新一线厂商、想尝试新能力路线的团队。价格和长期稳定性还需要持续观察,但作为增量选择有收录价值。

官方入口原生官方接口付费入口多模态模型

主分类:多模态模型

适合:新能力尝鲜 / 多模态产品 / 国内备选

付费:平台余额充值 / 企业采购

地区:中国大陆

接入判断

按原生接口接

阶跃星辰 StepFun 适合作为官方原生入口,接入前先按文档核对鉴权方式、模型 ID 和计费口径。

协议:官方原生 API

价格:以官方价格页为准

模型:已收录 25 个

模型能力

25 个模型
多模态模型推理多模态Agent

Step 3.7 Flash

分类:多模态模型 / 上下文:256K / 调用名:step-3.7-flash

Step 3.7 Flash 是阶跃星辰当前公开的旗舰多模态推理模型,支持图片、视频输入、推理强度调节、工具调用和 Agent 工作流。

长上下文推理函数调用代码视觉结构化输出
语音模型实时语音副语言感知人设自定义

StepAudio 2.5 Realtime

分类:语音模型 / 上下文:- / 调用名:stepaudio-2.5-realtime

StepAudio 2.5 Realtime 是阶跃星辰当前公开的实时语音对话模型,支持副语言感知、情绪反馈和人设自定义。

语音输入realtime语音输出
语音模型对话情绪理解人设自定义

StepAudio 2.5 Chat

分类:语音模型 / 上下文:- / 调用名:stepaudio-2.5-chat

StepAudio 2.5 Chat 是阶跃星辰当前公开的对话模型,突出副语言感知、情绪理解和可自定义人设。

语音输入语音输出
图像生成图片生成图片编辑低延迟

Step Image Edit 2

分类:图像生成 / 上下文:- / 调用名:step-image-edit-2

Step Image Edit 2 是阶跃星辰当前公开的轻量图像生成与编辑模型,支持文生图、图像编辑和低延迟交互修图。

图像生成image_edit视觉
语言模型推理Agent低推理模式

step-3.5-flash-2603

分类:语言模型 / 上下文:256K / 调用名:step-3.5-flash-2603

基于 Step 3.5 Flash 针对高频 Agent 场景优化,在保留旗舰推理与工具调用能力的同时,进一步提升 Token 效率与推理速度,并支持切换低推理模式以降低消耗。对 Coding 与 Agent 框架兼容性也做了专项优化。

长上下文推理函数调用代码
语音模型Contextual TTS双档语境控制Zero-shot Clone

stepaudio-2.5-tts

分类:语音模型 / 上下文:- / 调用名:stepaudio-2.5-tts

真正具有声音表演能力的语音合成模型,首次将语境理解能力引入语音生成全流程。通过 Global Context(全局语境)+ Inline Context(文中语境)双档控制,配合 Zero-shot Clone,让合成语音有呼吸感、轻重主次和情绪弧线,适合有声书、短剧配音、广告旁白、情感叙事等高表现力场景。

tts语音输出

价格记录更新时间:2026-04-23

查看模型详情
语言模型推理工具调用深度推理

step-3.5-flash

分类:语言模型 / 上下文:256K / 调用名:step-3.5-flash

旗舰级推理模型,专为智能体构建而生。推理深度比肩顶尖闭源模型,同时具备极速响应与稳定可靠的工具调用能力。在通用推理能力基础之上,更擅长复杂项目规划与长程任务执行。

¥0.70 / ¥2.10
长上下文推理函数调用

价格记录更新时间:2026-04-23

查看模型详情
多模态模型推理图片理解深度推理

step-3

分类:多模态模型 / 上下文:64K / 调用名:step-3

兼顾智能与效率的高性价比推理模型,典型应用场景有图片内容识别和提取、图片分析和推理、逻辑与数学问题回答、代码生成和补全、智能助手和日常问答、复杂问题调研和解答等。

¥1.50 / ¥4.00
长上下文推理代码视觉

价格记录更新时间:2026-04-23

查看模型详情
语言模型文本代码工具调用

step-2-mini

分类:语言模型 / 上下文:32K / 调用名:step-2-mini

典型应用场景有文本创意改写、文本摘要生成、文本内容翻译、专业问题回答、角色扮演、信息提取与合并、query指令补全等。

¥1.00 / ¥2.00
函数调用代码

价格记录更新时间:2026-04-23

查看模型详情
多模态模型图片理解视频理解文本生成

step-1o-turbo-vision

分类:多模态模型 / 上下文:32K / 调用名:step-1o-turbo-vision

典型应用场景有社媒发帖文案创作、AI问答助手、图片与视频理解等。单次请求限制输入最多50张,总大小控制在20M以内的图片,输入视频为小于128MB的MP4文件。

¥2.50 / ¥8.00
视觉video_understanding

价格记录更新时间:2026-04-23

查看模型详情
语音模型语音生成音色复刻情绪风格

step-tts-mini

分类:语音模型 / 上下文:- / 调用名:step-tts-mini

支持中、英、日语、粤语、四川话,提供19种官方音色,兼具出色的音色复刻能力,支持中、英、日语复刻。适合客服外呼、情感陪伴、智能助手语音交互等对发音真人感要求高的场景。

tts语音输出

价格记录更新时间:2026-04-23

查看模型详情
语言模型文本通用规划

step-2-16k

分类:语言模型 / 上下文:16K / 调用名:step-2-16k

典型应用场景有资源处理引擎、聊天主播扮演、用户记忆数据整理、食物重量热量预估、意图识别与推荐query生成等。

¥38.00 / ¥120.00
能力标签未整理

价格记录更新时间:2026-04-23

查看模型详情
语言模型文本数学代码

step-1-8k

分类:语言模型 / 上下文:8K / 调用名:step-1-8k

典型应用场景有对话中控引擎、销售客服、自动化快讯生成、问题改写、角色扮演、文本分类或关键词提取等。

¥5.00 / ¥20.00
能力标签未整理

价格记录更新时间:2026-04-23

查看模型详情
语言模型文本数学代码

step-1-32k

分类:语言模型 / 上下文:32K / 调用名:step-1-32k

典型应用场景有问答助手、词条编辑、行业分析、搜索查询词生成等。

¥15.00 / ¥70.00
能力标签未整理

价格记录更新时间:2026-04-23

查看模型详情
多模态模型推理图片理解代码

step-r1-v-mini

分类:多模态模型 / 上下文:100K / 调用名:step-r1-v-mini

典型应用场景有图片内容识别、图片分析和推理、代码生成和补全、数学问题回答、逻辑问题解答、日常问答等。

¥2.50 / ¥8.00
长上下文推理代码视觉

价格记录更新时间:2026-04-23

查看模型详情
多模态模型图片理解文本生成视觉理解

step-1o-vision-32k

分类:多模态模型 / 上下文:32K / 调用名:step-1o-vision-32k

典型应用场景有管家机器人、智慧座舱助手、医学影像分析助手、食物识别、图片信息判断、图片内容描述等。单次请求限制最多50张图片,总大小控制在20M以内。

¥15.00 / ¥70.00
视觉

价格记录更新时间:2026-04-23

查看模型详情
多模态模型图片理解短上下文视觉理解

step-1v-8k

分类:多模态模型 / 上下文:8K / 调用名:step-1v-8k

典型应用场景为图片描述、食物识别、心理咨询、穿搭建议等。单次请求限制最多20张图片,总大小控制在20M以内。

¥5.00 / ¥20.00
视觉

价格记录更新时间:2026-04-23

查看模型详情
多模态模型图片理解长上下文视觉理解

step-1v-32k

分类:多模态模型 / 上下文:32K / 调用名:step-1v-32k

典型应用场景有文献阅读助手、图片理解、角色扮演、日常问答等。单次请求限制最多50张图片,总大小控制在20M以内。

¥15.00 / ¥70.00
视觉

价格记录更新时间:2026-04-23

查看模型详情
图像生成图片生成中文支持图像生成

step-1x-medium

分类:图像生成 / 上下文:- / 调用名:step-1x-medium

适用于需要高质量图像生成的场景,如艺术创作、游戏开发等。输入文本最大长度为1024个字符;输入图片需在10Mb以内,像素不大于2048x2048,格式为png或jpeg。单次可请求生成1张图像。

图像生成

价格记录更新时间:2026-04-23

查看模型详情
图像生成图片生成中文提示词图像生成

step-2x-large

分类:图像生成 / 上下文:- / 调用名:step-2x-large

新模型生成图片质感更真实,中英文文字生成能力更强。输入文本最大长度为1024个字符;输入图片需在10Mb以内,像素不大于2048x2048,格式为png或jpeg。单次可请求生成1张图像。

图像生成

价格记录更新时间:2026-04-23

查看模型详情
图像生成图片编辑图像增强图像生成

step-1x-edit

分类:图像生成 / 上下文:- / 调用名:step-1x-edit

模型能够理解用户的意图,并生成符合要求的图像编辑结果,适合应用于图像编辑、人像美化、艺术创作等场景。输入文本最大长度为512个字符;输入图片需在10Mb以内,像素不大于1024x1024,格式为png或jpeg。单次可请求生成1张图像。

图像生成image_edit

价格记录更新时间:2026-04-23

查看模型详情
语音模型高准确率低延迟中英双语

stepaudio-2.5-asr

分类:语音模型 / 上下文:- / 调用名:stepaudio-2.5-asr

阶跃新一代流式语音识别模型,基于 4B MTP 架构,在识别准确率与响应延迟之间取得良好平衡。支持中英文识别与 ITN 文本规范化,适合实时字幕、语音输入、会议记录等对识别速度与准确率均有要求的场景。

speech_recognition语音输入

价格记录更新时间:2026-04-23

查看模型详情
语音模型大参数语音交互

stepaudio-2-asr-pro

分类:语音模型 / 上下文:- / 调用名:stepaudio-2-asr-pro

32B 参数的 ASR Pro 模型。

speech_recognition语音输入

价格记录更新时间:2026-04-23

查看模型详情
语音模型语音识别实时离线

step-asr

分类:语音模型 / 上下文:- / 调用名:step-asr

具有强大的中英文语音识别能力的ASR模型,能够自动区分语音和噪音,支持中英文混合语音识别和多种重口音普通话识别。可广泛应用于语音输入、语音控制、会议记录等场景。

speech_recognition语音输入

价格记录更新时间:2026-04-23

查看模型详情
语音模型实时交互工具调用Agent

step-1o-audio

分类:语音模型 / 上下文:- / 调用名:step-1o-audio

提供超低延迟的双向交互语音对话体验,支持中文、英语、重口音普通话输入,支持中、英、日语、粤语和四川话输出。单次互动时长最长30分钟,可处理音频时长最长70分钟。已在智能座舱、智能终端、社交娱乐、情感陪伴、智能客服、金融调解等行业领域落地。

¥25.00 / ¥60.00
函数调用realtime语音输入语音输出

价格记录更新时间:2026-04-23

查看模型详情