Deepgram Flux TTS
Deepgram Flux TTS 是 2026 年 8 月发布的面向实时语音 Agent 的对话式文本转语音模型,支持跨轮上下文、打断处理和流式输出。
计费价格
公开资料未说明
输入形式
文本
官方模型目录与价格对比
按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。
先缩小候选,再进详情页看接口、计费和能力边界。
已收录模型
1,303
覆盖厂商
63
带价格信息
355
Deepgram Flux TTS 是 2026 年 8 月发布的面向实时语音 Agent 的对话式文本转语音模型,支持跨轮上下文、打断处理和流式输出。
计费价格
公开资料未说明
输入形式
文本
提供超低延迟的双向交互语音对话体验,支持中文、英语、重口音普通话输入,支持中、英、日语、粤语和四川话输出。单次互动时长最长30分钟,可处理音频时长最长70分钟。已在智能座舱、智能终端、社交娱乐、情感陪伴、智能客服、金融调解等行业领域落地。
计费价格
¥25.00 / 1M Tokens
输入形式
音频 / 文本
Deepgram 当前面向英语实时语音 Agent 的 Flux 会话转写模型,主打 turn detection、打断处理和更低语音交互延迟。
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
音频 / 文本
NemotronLabs VoiceChat 11B 是 NVIDIA 于 2026 年 7 月发布的端到端全双工实时语音模型,支持自然轮流对话、打断和实时工具调用。
计费价格
公开资料未说明
输入形式
音频
Nemotron 3.5 ASR Streaming 0.6B 是 NVIDIA 于 2026 年 5 月发布的多语种流式语音识别模型,面向实时转写和语音 Agent。
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
文本 / 音频
计费价格
公开资料未说明
输入形式
文本
计费价格
公开资料未说明
输入形式
音频
计费价格
公开资料未说明
输入形式
文本
Universal-3.5 Pro Realtime 是 AssemblyAI 于 2026 年 6 月发布的实时语音识别模型,支持上下文感知转写和低延迟语音 Agent。
计费价格
公开资料未说明
输入形式
音频
Universal-3 Pro Streaming 是 AssemblyAI 当前高准确率实时转写主力模型,适合低延迟语音 Agent 和电话流式场景。
计费价格
公开资料未说明
输入形式
音频
Speechmatics 的 Realtime STT Enhanced 面向更高准确率的实时语音识别,适合语音 Agent、直播和高要求电话场景。
计费价格
公开资料未说明
输入形式
音频
Speechmatics Flow 是官方公开的 Voice Agent 工作流能力线,负责实时对话编排、TTS 返回和工具调用。
计费价格
公开资料未说明
输入形式
音频 / 文本