Token导航 LogoToken导航

商汤信息图增强模型,论文图表、海报、菜谱、产品介绍等统统搞定

更新时间 2026-06-02来源 AIGC开放社区正文 2830字阅读约 9分钟15 张图片
专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注!

AI 画图已经不稀奇了,画一张文字对、数据准、排版好看的完整信息图,才是真正的硬仗。

商汤日日新 SenseNova-U1-8B-MoT-Infographic 信息图增强版模型,在8B参数规模上把这件事往前推了一大步,拿到同级别最高评测分数。

图片

信息图,AI生成最难啃的骨头

信息图(infographic)是 AI 图像生成里公认最难的一类。

海报、菜谱、学术论文页、产品介绍页,看起来只是一张图,背后同时要求模型做好三件事:文字写准、版式优美、图表数据正确。

文字写不准的情况很常见。密集小字糊成一团,列表编号出错,脚注看不清,表格注释模模糊糊,一段本来该读得清楚的信息变成了色块。

版式排不好也一样糟糕。多模块挤压变形,对齐错乱,背景杂乱,表格交替底色和图标对应关系不稳。单独看每个模块内容好像还行,整体一看就觉得散了。

图表数据画不对就更致命。柱状图的柱高跟数值对不上,坐标轴刻度标错,百分比标注有误,箭头指向了错误的数据点。

正因为同时满足三个维度太困难,过去开源模型在信息图场景里的表现普遍不理想。

商汤日日新 SenseNova-U1-8B-MoT-Infographic 信息图增强版,在原生统一模型 SenseNova-U1-8B-MoT 基础上做了专项增强:开源SOTA!商汤原生多模态一个大脑完成看图、推理、作画。

字写对了,图画准了

高密度文字渲染,是信息图生成里一个老大难。

密集的文字段落、表格注释、脚注、列表编号,过去模型在这些小字场景里容易糊,编号容易跳号错号,一整段文字看起来模模糊糊,信息图最基本的可读性都没法保证。

信息图增强版通过专项数据训练加上文字准确率强化学习(RL,Reinforcement Learning),在小字渲染的清晰度和正确率上有了显著提升。

密集的小字号文字不再是模糊一片,列表编号也能做到准确无误,脚注和注释文字清清楚楚,表格里的小字也不再糊在一起。

图片
图片

一个比较惊艳的场景是 arXiv 风格的学术论文页面渲染。

图片
图片

单栏标题、双栏正文、脚注、页码、侧边 arXiv 水印,这些元素挤在一页里,小字密度很高。

增强版能轻松实现该排版,密集小字保持清晰可读。

图表生成又是信息图里另一个容易翻车的重灾区。画一个柱状图,柱子画出来不难,让柱高、刻度、标签、图例全部跟数据对得上,非常难。

这要求模型真正理解数据语义,知道这根柱子为什么这么高,那个刻度应该标在哪里,单纯模仿图表的外形做不好这件事。

饼图、折线图、面积图也一样,每种图表都有各自的数据映射规则,模型需要在像素级别把数值关系画准确,稍有偏差就能看出来。

SenseNova U1 统一架构本身具备先理解再生成的能力,信息图增强版在此基础上,进一步用图表类数据做了强化训练,帮模型在生成之前把数据关系想清楚。

图片
图片

最终的效果是,柱高与数据一致,坐标轴刻度正确,年份月份与数值对应,百分比标注无误,连箭头标注都能准确指向正确的数据点。

版式稳住了,图就好看了

文字和数据的准确性解决之后,版式设计的稳定性和美观性是另一道坎。

多模块、多列构成的信息图,模块之间容易挤压变形,对齐容易错乱,背景杂乱不干净,表格交替底色和图标对应关系不稳。

信息图增强版的解法是,用版式合理性专项数据,并延长中期训练(MT,Mid Training),让模型对网格结构、留白、层级关系有更稳定的把握。

训练时间拉长之后,模型学到了更合理的空间布局规则,元素层级更清晰,背景更干净,美观度也有明显提升。延长 MT 的好处在于,模型有更多时间消化版式相关的模式,不像短训练那样容易出现布局上的随机偏差。

图片
图片

版式稳定性上来之后,应用场景自然就打开了。

增强版能覆盖 100 多种风格和版式,海报、产品介绍、食谱菜谱、游戏卡牌、百科教程、漫画创作、塔罗抽卡,各类场景都能稳定生成。

图片
图片
图片
图片

画图增强,理解没掉队

统一模型专项增强生成能力,通用理解能力容易退化,这是一个绕不开的挑战。

信息图增强版在 U1-8B-MoT 基础模型之上构建,做法上分了三步走。

在 MT 阶段用高质量数据延长训练,在 MT 和 SFT 阶段优化理解与生成任务的数据配比,在 RL 阶段进一步打磨奖励设计,减少生成信息图时出现黑色背景等问题。

三步走每一步都有针对性。MT 阶段延长训练,给模型更多时间学习信息图的结构和文字模式。SFT 阶段调数据配比,保证理解任务的数据不被生成任务淹没,模型不会偏科。RL 阶段打磨奖励函数,让模型知道什么样的信息图是好的,什么问题需要避免,比如黑色背景这类生成中的常见故障。理解和生成不是两条互斥的路,数据配比和奖励设计做到位,两者可以共存。

图片

从评测结果来看,增强版在信息图相关基准上提升明显,视觉理解能力基本保持。

图片

BizGenEval 模型能力评估围绕布局、属性、文字、知识四个维度打分。信息图增强版在 BizGenEval Hard 上较原版提升 6.8 分,从 39.8 涨到 46.6;在 BizGenEval Easy 上提升 4.3 分,从 61.1 涨到 65.4。与同级别开源模型的差距进一步拉开。

IGenBench 的 Q-ACC(问答准确率)测试,衡量的是信息图是否同时满足文本、图表、数据、结构要求。增强版从 51.3 分跃升到 69.5 分,提升 18.2 分,成绩大幅上涨。I-ACC 从 4.2 分提升到 17.0 分,提升 12.8 分。这两项提升幅度都很可观,说明增强版在信息图的整体正确性上有了质的飞跃。

在 OneIG 英文和中文基准上,增强版分别为 55.6 和 53.3,与原版的 54.5 和 53.8 基本持平,视觉理解能力没有明显退化。专项增强做到了,通用理解也没丢。

开源模型里,信息图增强版的 BizGenEval 和 IGenBench Q-ACC 分数都明显领先其他开源选手。

IGenBench Q-ACC 的 69.5 甚至超过了商业模型 GPT-Image-1.5 的 55.0 和 Qwen-Image-2.0 的 50.0,在信息图问答准确率这一项上,8B 开源模型打过了体量大得多的商业对手。

Z-Image、Qwen-Image、Bagel 等开源模型在 BizGenEval Hard 上都没超过 10 分,和信息图增强版的 46.6 差距明显。在 OneIG 英文和中文基准上,增强版和原版差距很小,理解能力稳住了。

跟商业模型比,Nano-Banana-Pro 和 Nano-Banana-2.0 在多项指标上依然领先,但增强版是仅 8B 参数规模的开源模型。

SenseNova-U1-8B-MoT-Infographic 在 8B 这个轻量规模上,把信息图生成这件事推进了一大步。

参考资料:

https://modelscope.cn/models/SenseNova/SenseNova-U1-8B-MoT-Infographic/summary

https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic

文章标签学术研究AI产品
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多