step-1o-audio
提供超低延迟的双向交互语音对话体验,支持中文、英语、重口音普通话输入,支持中、英、日语、粤语和四川话输出。单次互动时长最长30分钟,可处理音频时长最长70分钟。已在智能座舱、智能终端、社交娱乐、情感陪伴、智能客服、金融调解等行业领域落地。
计费价格
¥25.00 / 1M Tokens
输入形式
音频 / 文本
官方模型目录与价格对比
按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。
先缩小候选,再进详情页看接口、计费和能力边界。
已收录模型
1,303
覆盖厂商
63
带价格信息
355
提供超低延迟的双向交互语音对话体验,支持中文、英语、重口音普通话输入,支持中、英、日语、粤语和四川话输出。单次互动时长最长30分钟,可处理音频时长最长70分钟。已在智能座舱、智能终端、社交娱乐、情感陪伴、智能客服、金融调解等行业领域落地。
计费价格
¥25.00 / 1M Tokens
输入形式
音频 / 文本
Deepgram 当前面向英语实时语音 Agent 的 Flux 会话转写模型,主打 turn detection、打断处理和更低语音交互延迟。
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频 / 文本
NemotronLabs VoiceChat 11B 是 NVIDIA 于 2026 年 7 月发布的端到端全双工实时语音模型,支持自然轮流对话、打断和实时工具调用。
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
文本 / 音频
计费价格
公开资料未说明
输入形式
文本
1.5B fully interleaved audio/text model for TTS, ASR, and voice chat
计费价格
公开资料未说明
输入形式
文本 / 音频
Speechmatics Flow 是官方公开的 Voice Agent 工作流能力线,负责实时对话编排、TTS 返回和工具调用。
计费价格
公开资料未说明
输入形式
音频 / 文本