【VR】CoVR-R:Reason-Aware Composed Video Retrieval
note
- 任务:参考视频 + 修改文本 → 召回修改后的目标视频。
- 先推理后检索(Reason-then-Retrieve)框架:参考视频 + 修改要求 → 推断修改后的视觉后果 → 构造目标视频向量 → 向量检索
文章目录
一、研究动机
CoVR-R:Reason-Aware Composed Video Retrieval
https://github.com/mbzuai-oryx/CoVR-R
CVPR Findings 2026
任务定义:组合视频检索(CoVR)旨在根据用户提供的参考视频和一段文本修改指令,在海量视频库中精准检索出符合预期变化的目标视频。
传统局限:现有的 CoVR 方法大多将修改文本视为字面关键词约束,假设文本已经完整指定了所有视觉变化。然而,真实世界的编辑指令往往高度简略,隐含着大量未言明的“后效应”(After-Effects)。例如,指令“煎炸蔬菜”不仅涉及物体状态的改变,还隐含着动作阶段的推进、相机景别的变化、场景环境的切换以及节奏的加快。传统方法因缺乏对因果、时序和电影摄影层面后效应的推理能力,极易在复杂场景下失效。
二、CoVR-R 方法
1. 先推理后检索(Reason-then-Retrieve)框架
总结:参考视频 + 修改要求 → 推断修改后的视觉后果 → 构造目标视频向量 → 向量检索
第一阶段:先推理。输入参考视频和修改文本,让 Qwen3-VL 推断目标视频应出现的五类变化:
object state:物体状态变化
action/phase:动作及阶段顺序
scene:场景与背景
camera:镜头、景别、运镜
tempo:节奏和速度
得到一份结构化 reasoning trace。
第二阶段:再检索。根据“参考视频 + 修改文本 + 推理结果”,生成目标视频的完整描述,并提取为查询向量。
候选库中的每个视频也先由 Qwen3-VL 生成描述,再对 token hidden states 做加权池化:
- 动作、物体、状态等关键词权重大;
- 普通虚词权重低。
最后用余弦相似度,在预计算的视频向量库中召回目标视频。

论文提出了一种零样本、免微调的检索范式,核心在于让大模型先“想清楚”编辑的后果,再去检索。
- 两阶段查询生成:首先,利用 Qwen3-VL 对参考视频和编辑指令进行结构化推理,显式列出预期的视觉变化(涵盖物体状态、动作阶段、场景、相机运镜、节奏五个维度);接着,基于推理轨迹生成一段完整的“假设目标视频描述”,将其作为新的检索查询。
- 重要性加权池化:在将文本描述转为向量时,摒弃简单的均值池化,而是根据语义丰富度分配权重(动作动词、物体名词权重最高,场景属性次之,功能词最低),确保核心语义不被稀释。
- 离线预编码与相似度匹配:视频库中的所有候选视频预先通过上述方式生成语义嵌入并缓存。检索时,直接计算查询嵌入与候选视频嵌入的余弦相似度并进行排序。
2. CoVR-R 推理基准
为了公平评估模型的深层推理能力,论文构建了 CoVR-R 基准(包含 2800 个高质量三元组)。
- 过滤与构造:数据源自 Dense-WebVid-CoVR 和 SSv2,筛选标准严苛,要求样本必须满足时序依赖、状态转换、电影摄影变化、隐性因果关系及低词汇重叠度中的至少两项。
- 推理轨迹标注:每个样本均配有由专家人工审核的结构化推理记录,包含原子化的断言(如“物体状态:从生变熟”),并强制要求使用受控谓词和可验证的时间跨度。
- 困难负样本:刻意引入了在关键词上与编辑指令高度重合,但在逻辑后效上完全违背指令的干扰视频,迫使模型必须理解因果意图而非死记硬背关键词。
三、实验结果与性能分析
1. 核心性能表现
实验在 CoVR-R 和 Dense-WebVid-CoVR 两个基准上进行,主要指标为 Recall@K(R@K)和推理质量评分(满分10分)。
- CoVR-R 基准:基础版方法(无显式推理)R@1 达 44.32%;加入显式推理(+R)后,R@1 跃升至 49.88%,推理得分高达 8.31,较此前最佳基线(BSE-CoVR 的 37.90%)实现了约 32% 的相对提升。
- Dense-WebVid-CoVR 基准:零样本方法 R@1 达到 58.19%,推理增强版更是高达 61.21%,大幅超越此前的最佳基线(48.08%),证明了该方法在标准大规模评测中的泛化能力。
2. 消融实验洞察
- 骨干网络规模:性能随 LMM 参数量提升而稳定增强(Qwen3-VL-4B/8B/72B 的 R@1 分别为 43.98%、49.88%、55.48%),证明更强的底层推理能力直接转化为更好的检索效果。
- 池化策略:重要性加权池化(R@1 49.88%)显著优于均值池化(44.87%)、最大池化(35.95%)和末位 token 池化(1.51%),凸显了语义聚焦的必要性。
- 推理粒度:存在“金发姑娘原则”。过短的推理缺失关键信息,而过长的详细推理(186 tokens)会因引入噪声稀释判别信号,反不如标准长度(89 tokens)有效。
四、定性分析与失败边界
- 成功机制:面对复杂指令(如“将切菜变为在炉灶前翻炒辣椒”),模型能通过结构化推理准确捕捉从“切菜”到“翻炒”的动作阶段递进、物体容器变化、场景迁移及特写镜头要求,从而生成精准的查询向量,有效剔除仅含单一关键词的干扰项。
- 失败边界:当遭遇极度细颗粒度、包含大量离散元素的“超长清单式”修改指令时(如要求同时替换十几个具体道具和建筑纹理),LMM 容易在中间推理环节遗漏关键细节。这种信息损失会逐级传导,导致最终生成的查询向量偏离真实目标,陷入“抓大放小”的语义漂移困境。
五、总结
CoVR-R 的核心贡献在于将 CoVR 任务从传统的“三元组匹配”升维至“后果建模”。它证明了通用多模态大模型(LMM)的零样本推理能力足以驱动复杂的视频检索,显著降低了对任务特定监督和海量标注数据的依赖。该研究为可解释性视频搜索指明了方向,未来的重点将是开发自适应路由机制,让系统能智能判断何时只需轻量级的关键词匹配,何时必须启动深度的因果推理。
更多推荐




所有评论(0)