Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

语音模型OpenAI稳定版

gpt-realtime-1.5

OpenAI 当前最新语音旗舰,适合语音助手、客服和实时语音 Agent。

计费价格

$4.00 / 1M Tokens

输入形式

文本 / 图像 / 音频

语音交互实时对话Agent
语音模型OpenAI稳定版

gpt-audio-1.5

OpenAI 当前最新 Chat Completions 音频主力,适合音频输入输出和语音交互工作流。

计费价格

$2.50 / 1M Tokens

输入形式

文本 / 音频

语音交互音频内容Agent
语音模型OpenAI稳定版

gpt-realtime

OpenAI 当前首个 GA 实时模型,支持 WebRTC、WebSocket 或 SIP 下的实时文本和音频交互。

计费价格

$4.00 / 1M Tokens

输入形式

文本 / 图像 / 音频

语音交互实时对话Agent
语音模型OpenAI稳定版

gpt-realtime-mini

GPT Realtime 的低成本版本,适合成本敏感的实时文本与语音交互场景。

计费价格

$0.60 / 1M Tokens

输入形式

文本 / 图像 / 音频

语音交互实时对话成本敏感
语音模型OpenAI稳定版

gpt-audio

OpenAI 当前通用音频输入输出模型,适合音频对话和音频到文本流程。

计费价格

公开资料未说明

输入形式

文本 / 音频

语音交互音频内容Agent
语音模型OpenAI稳定版

gpt-audio-mini

GPT Audio 的低成本版本,适合更便宜的语音输入输出和语音自动化流程。

计费价格

$0.60 / 1M Tokens

输入形式

文本 / 音频

语音交互成本敏感音频内容
语音模型OpenAI稳定版

GPT-4o Audio

GPT-4o Audio 是 OpenAI 的音频交互模型,适合语音助手、实时对话和多模态语音工作流。

计费价格

公开资料未说明

输入形式

文本 / 音频

语音交互音频内容Agent
语音模型OpenAI稳定版

GPT-4o mini Audio

GPT-4o mini Audio 是 OpenAI 的音频交互模型,适合语音助手、实时对话和多模态语音工作流。

计费价格

公开资料未说明

输入形式

文本 / 音频

语音交互音频内容Agent
语音模型OpenAI稳定版

GPT-4o Realtime

GPT-4o Realtime 是 OpenAI 的音频交互模型,适合语音助手、实时对话和多模态语音工作流。

计费价格

公开资料未说明

输入形式

文本 / 音频

实时对话语音助手Agent
语音模型OpenAI稳定版

GPT-4o mini Realtime

GPT-4o mini Realtime 是 OpenAI 的音频交互模型,适合语音助手、实时对话和多模态语音工作流。

计费价格

公开资料未说明

输入形式

文本 / 音频

实时对话语音助手Agent
语音模型Google稳定版

Magenta RealTime 2

Magenta RealTime 2 是 Google DeepMind 于 2026 年 5 月发布的实时音乐生成模型。

计费价格

公开资料未说明

输入形式

音频 / 文本

音乐生成实时音频开放模型
语音模型Google预览版

Gemini 2.5 Flash Live Preview

Gemini 2.5 Flash Live Preview 是 Google 的实时语音模型,适合实时语音、语音助手等低延迟语音交互场景。 当前仍是预览版。

计费价格

$0.50 / 1M Tokens

输入形式

音频 / 视频 / 文本

实时语音语音助手音频对话
语音模型Google预览版

Gemini 3.1 Flash Live Preview

Gemini 3.1 Flash Live Preview 是 Google 的实时语音模型,适合实时语音、语音助手等低延迟语音交互场景。 当前仍是预览版。

计费价格

$0.75 / 1M Tokens

输入形式

文本 / 图像 / 音频 / 视频

实时语音语音助手音频对话
语音模型xAI预览版

Grok Speech to Text

Grok Speech to Text 是 xAI 的语音识别模型,用于音频转写和语音输入处理。

计费价格

公开资料未说明

输入形式

音频

语音转写语音输入多模态 Agent
语音模型xAI预览版

Grok Text to Speech

Grok Text to Speech 是 xAI 的文本转语音模型,用于语音输出和语音 Agent 场景。

计费价格

公开资料未说明

输入形式

文本

文本转语音语音 Agent语音输出
语音模型xAI稳定版

Voice Agent API

Voice Agent API 是 xAI 当前公开的实时语音会话能力线,面向低延迟语音交互和语音 Agent。

计费价格

$0.05 / min

输入形式

音频 / 文本

语音助手实时通话语音 Agent
语音模型智谱稳定版

GLM-Realtime

GLM-Realtime 是智谱当前实时音视频模型,支持语音对话、视频理解和函数调用。

计费价格

音频 ¥0.18 / min,视频 ¥1.20 / min

输入形式

文本 / 音频 / 视频

实时语音视频通话多模态交互
语音模型ElevenLabs稳定版

Eleven v3 Conversational

Eleven v3 Conversational 是 ElevenLabs 面向实时对话的表现力语音模型,延迟约 280ms,支持 70 多种语言和上下文对话表达。

计费价格

公开资料未说明

输入形式

文本

实时语音对话低延迟情绪表达
语音模型ElevenLabs稳定版

Eleven Flash v2.5

ElevenLabs 当前低时延文本转语音模型,适合更重视速度和成本效率的场景。

计费价格

公开资料未说明

输入形式

文本

低时延播报语音 Agent成本敏感 TTS
语音模型ElevenLabs稳定版

Scribe v2 Realtime

ElevenLabs 当前实时语音转写模型,适合实时会议、通话和语音 Agent 场景。

计费价格

公开资料未说明

输入形式

音频

实时转写语音 Agent直播字幕