stepaudio-2.5-asr
阶跃新一代流式语音识别模型,基于 4B MTP 架构,在识别准确率与响应延迟之间取得良好平衡。支持中英文识别与 ITN 文本规范化,适合实时字幕、语音输入、会议记录等对识别速度与准确率均有要求的场景。
计费价格
0.15元/小时
输入形式
音频
官方模型目录与价格对比
按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。
先缩小候选,再进详情页看接口、计费和能力边界。
已收录模型
1,303
覆盖厂商
63
带价格信息
355
阶跃新一代流式语音识别模型,基于 4B MTP 架构,在识别准确率与响应延迟之间取得良好平衡。支持中英文识别与 ITN 文本规范化,适合实时字幕、语音输入、会议记录等对识别速度与准确率均有要求的场景。
计费价格
0.15元/小时
输入形式
音频
计费价格
2元/小时
输入形式
音频
计费价格
0.9元/小时
输入形式
音频
提供超低延迟的双向交互语音对话体验,支持中文、英语、重口音普通话输入,支持中、英、日语、粤语和四川话输出。单次互动时长最长30分钟,可处理音频时长最长70分钟。已在智能座舱、智能终端、社交娱乐、情感陪伴、智能客服、金融调解等行业领域落地。
计费价格
¥25.00 / 1M Tokens
输入形式
音频 / 文本
This page describes how the Cohere Transcribe model works and how to use it.
计费价格
公开资料未说明
输入形式
音频
Cohere Transcribe Arabic 是 Cohere 于 2026 年 6 月公开的阿拉伯语语音识别模型,支持阿拉伯语方言和英语混合转写。
计费价格
公开资料未说明
输入形式
音频
Deepgram 当前面向英语实时语音 Agent 的 Flux 会话转写模型,主打 turn detection、打断处理和更低语音交互延迟。
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频