这项由弗吉尼亚理工大学与fal公司联合开展的研究成果发表于2026年5月,论文编号为arXiv:2605.30351,有兴趣深入了解的读者可通过该编号查询完整论文。
在我们今天讨论的核心问题正式登场之前,不妨先做一个形象的类比。你大概有过这样的经历:用手机拍了一大堆照片,拍得越多,手机存储空间就消耗得越快,最终不得不删掉一些才能继续拍新的。AI生成长视频面临的困境与此几乎一模一样——它需要不断"记住"刚刚生成的内容,以便让后面的画面保持连贯,而这些记忆占用的空间会随着视频变长而急剧膨胀,直到把显卡内存撑爆为止。
这项研究提出的方案叫做VideoMLA,它的核心思路是:与其让AI把每一帧的记忆都完整保存下来,不如把这些记忆压缩成一个精简的"速记本"——用更少的空间存储同样有用的信息。最终的结果相当惊人:每个记忆单元占用的空间减少了92.7%,而生成的视频质量却没有明显下降。
一、为什么长视频对AI来说这么难?
要理解这项研究解决的问题,先得弄清楚当前AI是怎么生成视频的。主流做法是"自回归生成",可以把它理解成一个接力棒游戏:AI先生成前几帧画面,然后把这些画面作为参考,再生成接下来的几帧,如此循环往复。为了保证前后连贯,AI每次生成新内容时都需要"回头看"之前已经生成的内容,这份"回头看"所需的记录就叫做KV缓存(Key-Value Cache,可以理解为AI的短期记忆本)。
问题在于,这个记忆本随着视频变长会越来越厚。以本研究使用的Wan-1.3B模型为例,每缓存一个画面单元,就需要在模型的30个处理层中,每层都记录12个"注意力头"(可以理解为12个同时在观察画面的视角)各自的键值信息,每个视角需要128个数据通道来存键、128个数据通道来存值。算下来,每个画面单元在每一层就要存3072个数字。如果缓存21帧画面,每帧有1560个单元,乘上30层,整个记忆本就包含了30亿个数字,换算成常见的存储格式大约是6GB。这还只是5秒钟的视频——要生成一分钟的视频,这个数字会继续成倍增长,迟早把显卡内存耗尽。
正因如此,目前大多数系统都采用"滑动窗口"策略,就像一个只能看最近几页的活页笔记本,旧的记录满了就翻掉,只保留最新的部分。这虽然控制了内存总量,但每个记录单元本身的"体积"依然没有缩小。VideoMLA的贡献正是在这里——它直接把每个记录单元的体积压缩了,而不是调整哪些记录应该被保留。
二、记忆压缩的灵感来自哪里?
VideoMLA的设计灵感来源于一种叫做MLA(Multi-Head Latent Attention,多头潜在注意力)的机制,这一机制最初由知名AI公司DeepSeek在其语言模型DeepSeek-V2中提出。
理解MLA的核心,可以用这样一个比喻:假设一个侦探团队正在调查一个案件,传统方式是让12名侦探各自准备一份完整的案卷,每份都包含所有线索的详细记录,于是存档室里堆满了12份高度重复的档案。MLA的做法是:全体侦探共用一份精简的核心案卷(这就是"低秩潜在"或说"压缩潜变量"),每位侦探只需在工作时临时从这份核心案卷中提取自己需要的部分,而不必永久保存各自的完整副本。
在VideoMLA中,这个"共享案卷"的维度是192(原始的每个视角单独存储需要128×2=256,12个视角合计3072),加上一个专门记录位置信息的小型索引(32维),合计每个记忆单元只需224个数字,相比原来的3072个数字,压缩了约13.7倍,达到了92.7%的内存节省。
除了这个共享内容案卷之外,VideoMLA还单独维护了一份"位置索引",用于记录每个画面单元在时间轴和空间坐标中的位置。这个位置信息采用了一种叫做3D-RoPE(三维旋转位置编码)的技术,分别沿时间、高度、宽度三个维度对画面中的每个单元打上坐标标签,就像给地图上的每个地点标注经纬度和楼层。在VideoMLA中,这套位置标签是所有视角共用的,而不是每个视角各自维护一套,进一步减少了存储需求。
三、一个出人意料的发现:压缩有效,但原因不是你以为的那个
MLA在语言模型中被提出时,支持者给出的理由是:语言模型的键值矩阵本身具有"低秩"特性,意思是说这些矩阵虽然看起来很大,但实际上包含的独立信息维度并不多,可以用一个小得多的矩阵来近似表达,就像一张高分辨率的照片经过有损压缩后,肉眼看起来仍然清晰。
然而,当研究团队把同样的分析应用到视频扩散模型(Wan-1.3B)上时,得到的结论完全相反。他们对模型的键值矩阵做了奇异值分解(这是一种数学工具,用于分析矩阵中实际包含多少"有效信息维度"),结果发现:在使用192维压缩潜变量的情况下,一个典型层的矩阵平均只有45.8%的信息能被保留,而保留99%信息所需的维度在每一层都超过了1300。换句话说,视频扩散模型的键值矩阵信息分布非常均匀,远远称不上"低秩",直接用数学压缩的话会损失大量信息。
那么问题来了:既然数学上说不应该能压缩,为什么VideoMLA实际上效果很好?
研究团队的解释是:MLA并非在"提取"矩阵中已经存在的低秩结构,而是在"重新定义"优化问题。当你把模型架构改成MLA的瓶颈结构之后,整个学习过程就被限定在了一个最多只有dc(本例中为192)维度的空间内工作。模型不再尝试去完美复现原来的高维矩阵,而是在这个被限定的空间里重新学会如何做好视频生成任务。
用一个类比来说:原来的模型像是在一个有1536个抽屉的大柜子里存放工具,而MLA相当于把柜子换成了只有192个抽屉的小柜子。工人不会傻傻地把1536个抽屉的工具硬塞进192个抽屉(那样会损失很多工具),而是重新思考"我真正每天需要用的工具是哪192件",最终用192件工具完成同样的工作。
研究团队通过实验验证了这一点:不管是用SVD(奇异值分解,数学上的最优初始化方式)还是随机初始化,训练结束后两种初始化方式下的模型都充分使用了192维的完整空间(有效秩约为0.98×192),而且在整个训练过程中这个"充分使用程度"几乎没有变化。这说明模型在训练过程中没有自发地寻找更低维的解,而是稳定地在192维空间内发挥。由此可见,压缩后能保持质量,靠的不是"原本就低秩",而是"在新的约束下重新学习"。
四、VideoMLA到底是如何运作的?
现在可以更具体地描述VideoMLA的工作流程了。整个机制可以分解为两条并行的信息通道:内容通道和位置通道。
在内容通道中,每一个视频潜变量单元(可以理解为视频经过编码后的一个基本信息块)首先经过一个"压缩投影矩阵"(W_KV↓),从1536维压缩到192维,得到一个精简的共享潜变量。这个潜变量就是写入记忆本的内容。当后续需要生成新画面、回头查阅这段记忆时,模型再通过两个"还原投影矩阵"(W_K↑和W_V↑)把192维的潜变量分别还原成12个视角各自需要的键信息和值信息。整个过程就像把一本厚书先制成摘要存档,需要时再根据摘要重新展开阅读,而不是把原书完整保存。
在位置通道中,VideoMLA单独计算一个32维的位置向量,记录每个单元在三维空间(时间×高度×宽度)中的坐标,这个向量在所有12个视角之间共享。重要的是,这个位置向量在存入记忆本时不带旋转(不编码绝对位置),只在实际使用时才根据当前窗口的相对位置关系进行旋转计算。这样做的好处是:当视频越来越长、窗口不断滑动时,旧的记忆可以被重新赋予新的相对位置,而不必重写整个记忆本。
查询通道(即当前帧提问"我应该关注过去哪些内容"的部分)也采用了类似的压缩结构:先压缩到768维的查询潜变量,再分别还原为内容查询和位置查询,确保整个注意力计算在数学上等价于标准的多头注意力,只是中间换了一种更节省空间的表达方式。
在推理阶段,研究团队还设计了一个巧妙的等价变换:通过预先计算固定的混合矩阵,可以完全避免在推理时展开还原出完整的键值矩阵,注意力得分直接从压缩潜变量计算得出。这意味着内存节省不仅体现在存储上,还体现在实际运算的带宽消耗上,是真实意义上的提速,而非只是纸面上的减少。
五、实验结果:数字说话
研究团队在多个维度上验证了VideoMLA的效果,使用的评测基准是视频生成领域常用的VBench评分体系,涵盖美学质量、背景一致性、动态程度、画面质量、运动流畅度、主体一致性等多个维度。
在30秒视频生成的测试中,VideoMLA获得了0.859的综合总分,与当时评分最高的Reward Forcing(0.863)非常接近,排名第二。而在更具挑战性的60秒视频生成测试中,VideoMLA以0.859的总分排名第一,明显领先其他方法。特别值得关注的是动态程度这一指标:VideoMLA在30秒和60秒测试中分别取得了0.981和0.958的得分,均为所有测试方法中的最高分。这意味着VideoMLA生成的视频画面动态丰富、不会变成"假动画",这一点直接回应了一个常见质疑——压缩内存会不会让AI倾向于生成静态或少动的画面以节省信息量。
在效率方面,VideoMLA在单张B200显卡上的生成速度达到了23.96帧/秒,延迟为3.38秒,分别比Self-Forcing(18.06帧/秒,4.19秒延迟)提升约1.33倍。同期对比的LongSANA虽然帧率达到19.35,但生成的视频被质疑过于静态,CLIP-F(帧间一致性,静态视频天然得分更高)得分高但实际动态表现差。VideoMLA在CLIP-T(文本对齐度)上得分最高(0.3278),HPSv3(人类偏好综合评分)也以9.74领先LongSANA的7.54。
用户研究部分邀请了50名参与者对一分钟视频进行评分,维度包括提示词符合度、时间一致性和动态一致性。VideoMLA在三个维度上分别获得3.04、3.24和3.22的平均分(满分5分),均为所有测试方法中的最高分,而排名第二的Reward Forcing在三项上分别为2.91、2.99和2.83。
批处理能力的提升同样显著。在固定B200显卡内存上限的条件下,原始密集键值缓存(MHA)在批大小达到28时就会内存溢出崩溃,而VideoMLA在dc=192的默认配置下,批大小可以扩展至原来的8倍;在dc=64的极度压缩配置下,批大小可达到原来的11.4倍以上,每批次的内存增长斜率从6.26GB降低至0.82GB,降幅达87%。
六、关键设计选择的实验验证
研究团队对两个核心设计参数进行了系统性消融实验,验证了各参数设定的合理性。
第一个参数是压缩维度dc,即共享潜变量的大小。实验结果显示,dc=64时模型虽然获得了最高的内存压缩比(32倍),但语义和质量评分都明显下降,说明192维以下的空间太局促,无法保存视频生成所需的关键信息。将dc增加到128时,质量基本恢复,综合评分达到83.24。进一步提升到256或512时,评分提升非常有限(分别为83.66和83.40),但内存优势大幅缩水(压缩比分别降至10.67倍和5.65倍)。由此可见,dc=192是一个平衡点,既能保留足够的信息容量,又能维持足够高的压缩效率。
第二个参数是内容维度与位置维度的分配比例,即每个注意力头的128个通道中,有多少用于内容(NoPE部分),有多少用于位置(RoPE部分)。实验测试了四种分配方案:112/16、64/64、32/96和96/32。结果显示,96/32(绝大部分用于内容)是最优方案,综合评分83.89,而位置维度过多(32/96)或过少(112/16)都会损害性能。这一结果直观上也很合理:视频内容的语义信息比精确的位置坐标更难压缩,需要更多维度来表达,而位置信息相对规整,32维就足够了。
七、这项研究没解决的问题
研究团队在论文中坦诚指出了当前工作的局限性。首先,192的维度压缩限制并非可以无限缩小,dc=64已经展示了过度压缩的质量代价,存在明显的下限。其次,目前所有实验都基于Wan2.1-T2V-1.3B这一具体模型,规模为13亿参数,分辨率为480×832。对于更大规模的模型、更高分辨率的视频、更长的生成时长(超过一分钟),以及需要在生成中途切换文字提示的场景,VideoMLA是否依然有效,仍需进一步研究。
此外,尽管VideoMLA在保持质量的同时大幅减少了内存,但它并没有从根本上解决长视频生成中内容一致性的问题——这是一个仍在活跃研究中的开放课题,需要依赖滑动窗口策略和注意力机制设计等配合来保障。VideoMLA更多是在"用更少资源做同样的事",而不是在解决"如何让AI记住更长时间前发生的事情"这个本质难题。
说到底,VideoMLA干的事情其实非常直接:它拆穿了一个通行假设("压缩之所以有效是因为原始数据本就低秩"),然后用实验告诉大家,真正起作用的是"被迫在有限空间里重新学习"这件事本身。这个发现其实蛮有意思——很多时候,给AI施加约束反而让它表现得更好,就像强迫一个厨师只用五种食材反而逼出了精妙菜肴。
从实际影响来看,这项研究意味着同样一张显卡现在可以同时服务更多人的视频生成请求,或者在相同硬件上生成更长的视频。对于希望做AI视频应用的开发者来说,内存墙往后推了一大步;对于普通用户来说,将来使用AI生成一段一分钟的连贯视频,成本和等待时间都可能大幅降低。
一个值得继续思考的问题是:如果这种"约束反而提升效果"的现象在视频生成中成立,它在其他AI任务中是否也同样适用?内存压缩与模型质量之间的关系,或许比我们一直以为的要微妙得多。有兴趣的读者可以通过arXiv编号2605.30351找到完整论文,自行验证和深入探索。
---
Q&A
Q1:VideoMLA的KV缓存压缩是怎么实现的,压缩之后AI还能记住视频内容吗?
A:VideoMLA把原本每个注意力头各自存储的键值信息合并成一个共享的低维潜变量(192维),加上一个32维的位置向量,合计224个数字,而原来需要3072个数字。AI在需要回顾之前内容时,通过学习到的还原矩阵临时重建各个视角的信息,不是永久存储完整副本。实验表明这套机制在60秒视频生成中综合表现优于其他方法,说明关键信息确实被有效保留了。
Q2:VideoMLA为什么说视频扩散模型的键值矩阵"不是低秩",这对压缩意味着什么?
A:低秩的意思是矩阵虽然尺寸大,但真正独立的信息维度很少。研究团队对Wan-1.3B做了数学分析,发现要保留99%的信息,每层都需要超过1300个维度,远超192的压缩目标。这说明直接做数学近似会丢失大量信息。但VideoMLA的成功表明:压缩有效不是因为原始矩阵低秩,而是模型在192维的约束下重新学会了完成任务,本质上是换了一种学习方式。
Q3:VideoMLA和LongSANA相比哪个更适合生成长视频?
A:两者路线不同。LongSANA用线性注意力替代标准注意力,内存固定但生成的视频动态性较差,帧间相似度高但画面往往趋于静止。VideoMLA保留标准注意力机制,只压缩每个缓存单元的体积,动态程度评分(0.958)和人类偏好评分(HPSv3 9.74)均明显高于LongSANA(0.103和7.54)。如果追求真实、有动感的长视频,VideoMLA在当前测试中表现更好。







