Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

多模态模型NVIDIA稳定版

Nemotron-Page-Elements-v3

文档页面元素检测模型,适合识别图表、表格和标题等页面对象。

输入价格

公开资料未说明

输出价格

公开资料未说明

文档结构化页面元素检测多模态 RAG
多模态模型NVIDIA稳定版

Nemotron-Graphic-Elements-v1

文档图形元素检测模型,适合识别图表和图形对象,服务文档理解链路。

输入价格

公开资料未说明

输出价格

公开资料未说明

图形元素识别文档理解结构化预处理
多模态模型小米稳定版

MiMo-V2.5

MiMo 当前主力全模态理解模型,支持图像、视频、音频与文本输入,并具备原生 Agent 执行能力和 1M 上下文。

输入价格

¥2.80 / 1M Tokens

输出价格

¥14.00 / 1M Tokens

多模态问答Agent内容理解
多模态模型小米即将下线

MiMo-V2-Omni

小米 MiMo 官方模型页提示 MiMo-V2 系列已于 2026 年 6 月 30 日正式下线,原模型名称已失效,应迁移到 V2.5 系列。

输入价格

¥2.80 / 1M Tokens

输出价格

¥14.00 / 1M Tokens

视觉理解语音理解多模态助手
多模态模型Microsoft稳定版

Phi-Ground-Any-4B

Phi-Ground-Any-4B 是 Microsoft 的 GUI grounding 模型,可将自然语言指令定位到图像界面中的目标区域,服务于电脑操作 Agent。

输入价格

公开资料未说明

输出价格

公开资料未说明

GUI 定位电脑操作Agent
多模态模型Microsoft稳定版

Mage-VL

Mage-VL 是 Microsoft 发布的高效流式多模态基础模型,面向视频理解和连续视觉语言交互。

输入价格

公开资料未说明

输出价格

公开资料未说明

视频理解流式多模态视觉语言
多模态模型Microsoft稳定版

Fara1.5-4B

Fara1.5-4B 是 Microsoft Research AI Frontiers 发布的浏览器 Computer Use Agent,通过截图理解网页并输出结构化点击、输入、滚动等动作。

输入价格

公开资料未说明

输出价格

公开资料未说明

电脑操作浏览器 Agent开放权重
多模态模型Microsoft稳定版

Fara1.5-9B

Fara1.5-9B 是 Microsoft Research AI Frontiers 发布的浏览器 Computer Use Agent,通过截图理解网页并输出结构化点击、输入、滚动等动作。

输入价格

公开资料未说明

输出价格

公开资料未说明

电脑操作浏览器 Agent开放权重
多模态模型Microsoft稳定版

Fara1.5-27B

Fara1.5-27B 是 Microsoft Research AI Frontiers 发布的浏览器 Computer Use Agent,通过截图理解网页并输出结构化点击、输入、滚动等动作。

输入价格

公开资料未说明

输出价格

公开资料未说明

电脑操作浏览器 Agent开放权重
多模态模型零一万物 Yi稳定版

Yi Vision V2

零一万物当前公开的复杂视觉任务模型,支持单张或多张图片理解、图表分析、OCR 与视觉推理。

输入价格

公开资料未说明

输出价格

公开资料未说明

图片问答图表理解OCR
多模态模型华为盘古稳定版

Pangu-MM-M2-Img2Txt

2026年2月发布的多模态理解大模型版本。该模型具有百亿级参数量,支持图像理解,支持预训练、微调。

输入价格

公开资料未说明

输出价格

公开资料未说明

视觉理解图文问答企业接入
多模态模型华为盘古稳定版

Pangu-CV-物体检测-S-V3

物体检测。从高精度、低时延、小目标检测三方面进行定向优化,为业界性价比最优检测模型。

输入价格

公开资料未说明

输出价格

公开资料未说明

视觉检测工业质检企业接入
多模态模型华为盘古稳定版

Pangu-CV-视觉交互检测-V3

视觉交互检测。盘古计算机视觉交互检测大模型,支持根据视觉提示或者文本提示进行任务目标检测,也可以基于自己场景的数据进行微调。

输入价格

公开资料未说明

输出价格

公开资料未说明

视觉检测工业质检企业接入
多模态模型华为盘古稳定版

Pangu-CV-目标跟踪-V3

目标跟踪。盘古计算机视觉目标跟踪大模型,盘古计算机视觉目标跟踪大模型,在视频中对感兴趣物体进行检测、提取、识别和跟踪,从而获得目标物体的相关参数。

输入价格

公开资料未说明

输出价格

公开资料未说明

视频分析目标跟踪企业接入
多模态模型华为盘古稳定版

Pangu-CV-万物检测-V2

万物检测。盘古计算机视觉万物检测大模型,能够识别和定位已知类别对象,同时也能处理未知类别对象的模型。具备对未知类别的泛化能力,并在面对新类别时能够做出合理的响应。

输入价格

公开资料未说明

输出价格

公开资料未说明

视觉检测工业质检企业接入
多模态模型华为盘古稳定版

Pangu-CV-物体检测-N-V2

物体检测。千万到亿级参数量物体检测,支持模型抽取,使用盘古自有海量数据进行预训练。

输入价格

公开资料未说明

输出价格

公开资料未说明

视觉检测工业质检企业接入
多模态模型华为盘古稳定版

Pangu-CV-图像分类-V2

图像分类。使用盘古统一预训练基模型底座,添加分类任务头构建图像分类模型。

输入价格

公开资料未说明

输出价格

公开资料未说明

图像分类视觉理解企业接入