Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

多模态模型NVIDIA稳定版

Nemotron-Parse

视觉语言文档抽取模型,适合从图像中提取文本与元数据。

输入价格

公开资料未说明

输出价格

公开资料未说明

文档解析图像取数元数据抽取
多模态模型NVIDIA稳定版

Nemotron-OCR-v1

高速高精度 OCR 模型,适合从图片和扫描文档中抽取文本、版式和结构。

输入价格

公开资料未说明

输出价格

公开资料未说明

OCR版式抽取文档智能
多模态模型NVIDIA稳定版

Nemotron-Page-Elements-v3

文档页面元素检测模型,适合识别图表、表格和标题等页面对象。

输入价格

公开资料未说明

输出价格

公开资料未说明

文档结构化页面元素检测多模态 RAG
多模态模型NVIDIA稳定版

Nemotron-Graphic-Elements-v1

文档图形元素检测模型,适合识别图表和图形对象,服务文档理解链路。

输入价格

公开资料未说明

输出价格

公开资料未说明

图形元素识别文档理解结构化预处理
视频生成Luma稳定版

Luma Ray3.2

Ray3.2 是 Luma 面向专业视频工作流的新一代视频模型,强调多关键帧、视频改写、动作迁移、角色一致性和 1080p 输出。

计费价格

公开资料未说明

生成形式

text_to_video / image_to_video / video_modify / video_reframe

视频生成视频编辑角色一致性
视频生成Luma稳定版

Luma Ray 2

Luma 当前主力 Ray 2 视频模型,适合强调镜头运动、自然动态和成片质量的视频生成。

计费价格

公开资料未说明

生成形式

text_to_video / image_to_video / video_modify / video_reframe

高质量视频镜头运动概念短片
视频生成Luma稳定版

Luma Ray Flash 2

Luma 当前公开的 Ray Flash 2 视频模型,主打更快生成速度和更低单价。

计费价格

公开资料未说明

生成形式

text_to_video / image_to_video / video_modify / video_reframe

高性价比视频快速出片批量创作
图像生成Luma稳定版

Luma Photon 1

Luma 当前主力 Photon 1 图像模型,适合高质量概念图、品牌视觉和参考图驱动生成。

计费价格

公开资料未说明

生成形式

text_to_image / reference_to_image / image_reframe / image_edit

高质量图像概念设计品牌视觉
图像生成Luma稳定版

Luma Photon Flash 1

Luma 当前公开的 Photon Flash 1 图像模型,主打更快出图和更低成本。

计费价格

公开资料未说明

生成形式

text_to_image / reference_to_image / image_reframe / image_edit

高性价比图像快速出图批量素材
图像生成Stability AI稳定版

Stable Image Ultra

Stability 当前旗舰图像服务,强调最高质量、细节和复杂提示词遵循能力。

计费价格

公开资料未说明

生成形式

text_to_image / image_to_image

高质量出图品牌视觉复杂细节画面
图像生成Stability AI稳定版

Stable Fast 3D

Stable Fast 3D 用单张图像快速生成 3D 资产,适合更快的 3D 内容生产链路。

计费价格

公开资料未说明

生成形式

image_to_3d

图像转 3D快速资产生产游戏与零售素材
图像生成Stability AI稳定版

Stable Point Aware 3D

Stable Point Aware 3D 是 Stability 当前更新一代的 3D 服务,强调更完整结构与实时编辑能力。

计费价格

公开资料未说明

生成形式

image_to_3d

高质量 3D结构完整性可编辑 3D 资产
图像生成Stability AI即将下线

Stable Video Diffusion API

Stable Video Diffusion API 已被官方下线,当前仅保留历史记录与迁移说明。

计费价格

公开资料未说明

生成形式

image_to_video

历史链路排查退役模型记录迁移梳理
语音模型Pika稳定版

Pika Soundtrack

Pika Soundtrack 是 Pika 于 2026 年 8 月发布的视频配乐生成模型,可根据视频内容生成同步的音乐和声音设计。

计费价格

公开资料未说明

输入形式

文本 / 视频

视频配乐声音设计音画同步
多模态模型小米稳定版

MiMo-V2.5

MiMo 当前主力全模态理解模型,支持图像、视频、音频与文本输入,并具备原生 Agent 执行能力和 1M 上下文。

输入价格

¥2.80 / 1M Tokens

输出价格

¥14.00 / 1M Tokens

多模态问答Agent内容理解
多模态模型小米即将下线

MiMo-V2-Omni

小米 MiMo 官方模型页提示 MiMo-V2 系列已于 2026 年 6 月 30 日正式下线,原模型名称已失效,应迁移到 V2.5 系列。

输入价格

¥2.80 / 1M Tokens

输出价格

¥14.00 / 1M Tokens

视觉理解语音理解多模态助手
visionMicrosoft稳定版

Mage-ViT

Mage-ViT 是 Microsoft 于 2026 年 7 月公开的视觉模型,面向图像理解和视觉研究。

输入价格

公开资料未说明

输出价格

公开资料未说明

图像理解视觉研究开放权重
多模态模型Microsoft稳定版

Phi-Ground-Any-4B

Phi-Ground-Any-4B 是 Microsoft 的 GUI grounding 模型,可将自然语言指令定位到图像界面中的目标区域,服务于电脑操作 Agent。

输入价格

公开资料未说明

输出价格

公开资料未说明

GUI 定位电脑操作Agent
多模态模型Microsoft稳定版

Mage-VL

Mage-VL 是 Microsoft 发布的高效流式多模态基础模型,面向视频理解和连续视觉语言交互。

输入价格

公开资料未说明

输出价格

公开资料未说明

视频理解流式多模态视觉语言