CVPR 2026 | 显存杀手救星!剪掉90%的Token,性能几乎不掉?带你图解视频大模型极速推理神器 AOT!
如今,视频大语言模型(Video LLMs)在理解复杂视频内容方面展现出了惊人的天赋 。但是,跑过视频大模型的肯定都有一个痛点:显存根本不够用,推理实在太慢了! 这是因为视觉编码器会将采样的视频帧转化为海量的视觉 Token(Token序列) 。当遇到长视频或者复杂场景时,成千上万的输入 Token 会让模型的计算成本和显存消耗直冲云霄 。为了缓解这个问题,以前的方法通常是直接“剪枝”(Pruning)——简单粗暴地把认为不重要的 Token 丢掉,或者把相似的 Token 融合 。但这往往会带来一个致命缺点:不小心丢弃了微小但关键的上下文信息 。
这篇被 CVPR2026 录用的最新论文《Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models》,来自特伦托大学、清华大学和电子科技大学的研究团队 。他们提出了一种全新的**免训练(Training-free)**视角:既然丢掉可惜,不如把不需要的 Token “浓缩”起来!
研究团队提出了基于“最优传输”(Optimal Transport,简称 OT)的 AOT 框架 。它不仅能干掉冗余,还能通过全局优化策略,把被删减 Token 里的语义和上下文信息,巧妙地聚合到保留下来的“锚点 Token”中 。

- 论文标题:Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
- 论文链接:https://arxiv.org/abs/2603.01400v1
- 代码链接:https://tyroneli.github.io/AOT/
一、 核心理念:不仅是“断舍离”,更是“海纳百川”
想象一下你在收拾行李箱(对应视频模型的 Token 压缩)。传统的剪枝方法就像是你为了把箱子盖上,直接把看起来不那么重要的衣服全扔进了垃圾桶 。而 AOT 的做法是:把那些不带走的衣服压缩、打包,提取出它们最核心的功能(比如保暖、防水),然后“融合”进你决定带走的那几件核心外套里 。
在论文中,作者将这一理念清晰地展示在了 【Figure 1】 中:
-
上半部分(The top):展示了 AOT 与传统 Token 减少方法的本质区别 。传统方法是简单地移除(Prune)或合并,而 AOT 则是利用全局优化策略,把有用的语义和上下文“聚合”(Aggregate)到剩下的 Token 上 。
-
下半部分(Bottom):展示了 AOT 采用最优传输(Optimal Transport)在帧内(intra-frame)和帧间(inter-frame)层级对视频 Token 进行信息聚合的流水线 。
二、 深度图解 AOT 的两阶段
AOT 的整个处理流程非常清晰,它沿着空间(单张画面)和时间(多张连续画面)两个维度逐步“浓缩”信息 。我们可以对照论文中的核心架构图 【Figure 2】 来理解 。
第一阶段:帧内最优传输压缩(Phase I: Intra-Frame OT)
在面对视频的每一帧画面时,AOT 会进行如下操作:
-
建立“局部-全局”令牌锚点(Local-Global Token Anchors):
-
模型不能瞎融合,得先选出“带头大哥”(也就是 Token Anchors)。
-
为了不遗漏信息,AOT 在输出层根据 [CLS] Token 的注意力得分,选出获得关注最多的全局 Token 。
-
同时,为了保留细粒度的局部细节,画面会被划分为无重叠的网格窗口,在每个窗口内根据浅层的注意力得分选出局部重要的 Token 。
-
这两种 Token 合并在一起,就成了兼顾重要性和空间多样性的“锚点” 。
-
-
最优传输(Optimal Transport)聚合:
-
这里是论文最核心的数学魔法。剩下的那些未被选中的 Token 怎么办?
-
AOT 把“锚点 Token”和“未选中 Token”看作是两个离散概率分布 。
-
未选中的 Token 就像是“供应商”(Supplier),能提供一定程度的上下文信息;而锚点 Token 就像是“需求方”(Demander),需要获取上下文 。
-
为了计算这两个集合之间的距离,作者使用了最优传输距离公式:
dOT(u,v∣C)=minT⟨T,C⟩d_{OT}(u,v|C) = \min_{T} \langle T, C \rangledOT(u,v∣C)=Tmin⟨T,C⟩ -
这里的 CCC 是成本矩阵,论文中使用了锚点和未选中 Token 集合之间的反余弦相似度(inverse cosine similarity)来作为优化的成本矩阵 。
-
利用现成的 Sinkhorn-Knopp 迭代算法,模型可以用极低的算力开销,飞速找到一个最优的“传输计划” TTT 。通过这个计划,未选中 Token 里的有效信息就被按比例完美地“吸收”进了锚点里 。
-
第二阶段:帧间最优传输压缩(Phase II: Inter-Frame OT)
搞定了单张画面的空间冗余,接下来就是处理连续画面的时间冗余了(视频中有很多静止或变化缓慢的画面) 。
-
首先,把视频切割成多个帧片段(Frame Clips) 。
-
在每个片段里,把第一帧的压缩 Token 当作“时间锚点” 。
-
随着后续帧的输入,AOT 继续利用最优传输,把连续帧里相似的 Token 融合进当前的片段锚点中,不断更新锚点 。
精妙之处:如果某一帧里的某个 Token 和之前的锚点截然不同(说明画面发生了剧烈变化,比如突然出现了一个新物体),AOT 会把它作为代表时间动态(temporal dynamics)的关键 Token 单独保留下来,绝不强行融合!
三、 令人惊艳的实验结果:降本增效的极致
我们最关心的永远是:这套花里胡哨的操作,真的好用吗?
根据论文在多个主流视频理解基准(如 MVBench、EgoSchema、Long VideoBench 和 VideoMME)上的详尽测试,结合 LLaVA-OneVision 7B 和 LLaVA-Video 7B 模型的实验数据,AOT 交出了一份满分答卷 。
-
极端的压缩率与计算节约:
-
AOT 能够剪掉高达 90% 的视频 Token!
-
这就意味着,它将计算成本(FLOPs)暴降到了原始水平的 8.3% 。
-
-
恐怖的性能保留率:
-
在如此狠辣的剪枝力度下,模型在所有基准测试中的平均性能依然保留了原始模型的 97.6% !
-
甚至在某些基准测试中,使用 AOT 压缩后的模型得分还超越了原始模型(见论文 Table 1 )。这是因为原始视频中充斥着太多无用的噪音信息,AOT 的提纯反而让大模型更能抓到重点 !

-
-
零额外训练成本:
-
整个降维打击过程完全是**免训练(Training-free)**的!
-
引入的 Sinkhorn-Knopp 迭代带来的额外计算时间微乎其微(处理帧内和帧间 OT 仅需约 2.11 毫秒,占比不到总推理时间的 1%)。
-
四、 总结
AOT 通过在空间和时间维度上双管齐下的“最优传输”聚合策略,打破了传统视频大模型 Token 剪枝“非留即扔”的粗暴模式 。它巧妙地衡量了废弃 Token 对保留锚点的内在贡献,在极大压缩计算时空开销的同时,完美保留了视频的时间动态和视觉完整性 。
对于每一位饱受算力折磨的 AI 开发者来说,AOT 无疑提供了一种极其优雅且极具工程实用价值的破局思路 。
更多推荐

所有评论(0)