详细参数
模型定位
vision_language_model
适合场景
具身感知 / 空间推理 / 视频理解
输入价格
公开资料未说明
输出价格
公开资料未说明
上下文窗口
32.768K
Molmo2-ER 是 Ai2 于 2026 年 5 月发布的 4B 具身推理视觉语言模型,面向空间理解、像素级定位和视频时序推理。
适合
具身感知 / 空间推理 / 视频理解
vision_language_model
价格
公开资料未说明
1M Tokens
输入
文本 / 图像 / 视频
输出
文本
支持结构化输出
规格
32.768K
所属厂商:AllenAI / OLMo
详细参数
模型定位
适合场景
输入价格
输出价格
上下文窗口
能力与信息
文本主能力
推理
工具调用
结构化输出
训练与版本
微调
蒸馏
多模态扩展
视觉理解
语音输入
语音输出
实时交互
输入与输出
输入形式
输出形式
接入信息
知识截止
调用名
API 基础地址
调用协议
主接口
接口说明
发布时间
价格与计费
计费摘要
输入价
输出价
缓存输入
币种
计费单位
单位类型
价格说明
原始价格文案
补充说明
发布时间
官方入口