note

  • Video Quality Assessment,视频质量评估。常见输出:质量分数 + 质量问题原因,比如模糊、噪声、压缩块、抖动、曝光差、运动不稳定、构图差等。
  • VQA近几年的发展路线:
    • 1、参考论文:FAST-VQA → DOVER → MD-VQA → MaxVQA → LMM-VQA → VQA² → VQAThinker → MDS-VQA
    • 2、路线演变:高效打分模型 → 多维质量建模 → 可解释评估 → 大模型/VQA化 → RL增强 → 数据选择优化。

一、Video Quality Assessment

Video Quality Assessment,视频质量评估
常见输出:质量分数 + 质量问题原因,比如模糊、噪声、压缩块、抖动、曝光差、运动不稳定、构图差等。

方向 核心变化
1. 从传统指标到深度 BVQA 早期 PSNR/SSIM/VMAF 偏压缩质量,现在更多做无参考质量评估,直接看用户视频
2. 从单一分数到多维诊断 不只输出 MOS 分数,还判断清晰度、运动、压缩失真、美学、语义质量
3. 从 CNN/Transformer 到大视觉 Encoder 用 Video Swin、ViT、Mamba、DINO/CLIP/SigLIP 等提取更强时空特征
4. 从打分模型到 VLM/VQA 范式 把视频质量评估转成“视觉问答”,模型能输出分数和解释
5. 从固定数据集到数据选择/RL 最新工作开始关注 OOD 泛化、难样本选择、GRPO/RL 训练和可解释性

近几年的发展路线:
1、参考论文:FAST-VQA → DOVER → MD-VQA → MaxVQA → LMM-VQA → VQA² → VQAThinker → MDS-VQA
2、路线演变:高效打分模型 → 多维质量建模 → 可解释评估 → 大模型/VQA化 → RL增强 → 数据选择优化。

推荐优先级 论文 会议/年份 为什么值得看
1 FAST-VQA / FasterVQA ECCV 2022 附近 经典高效 BVQA,提出 fragment sampling,大幅降低高分辨率视频计算量,是很多后续工作的基础 (arXiv)
2 DOVER ICCV 2023 把 UGC 视频质量拆成 technical quality + aesthetic quality,很适合业务理解“技术质量”和“美感质量”区别 (GitHub)
3 MD-VQA CVPR 2023 面向 UGC 直播视频,从 semantic / distortion / motion 多维度评估质量,很适合理解多维质量建模 (arXiv)
4 MaxVQA ACM MM 2023 做可解释视频质量评估,不只给分,还能解释不同质量因素 (arXiv)
5 LMM-VQA 2024 较早把大多模态模型引入 VQA,核心是用 LMM 做时空质量感知 (arXiv)
6 VQA²: Visual Question Answering for Video Quality Assessment ACM MM 2025 很重要,把视频质量评估正式做成 VQA 指令数据和模型,既能打分又能回答质量问题 (arXiv)
7 MVQA: Mamba with Unified Sampling ICCV 2025 关注长视频/高清视频下的高效 VQA,用 Mamba 做高效时序建模 (CVF开放获取)
8 VQAThinker AAAI 2026 用 GRPO/RL 训练可解释、泛化更强的视频质量评估模型,重点解决 OOD 泛化和解释能力 (arXiv)
9 MDS-VQA CVPR 2026 Highlight 不是单纯换模型,而是做“难样本 + 多样性”的数据选择,用少量高价值数据提升 VQA 模型 (arXiv)

二、2606最新进展

建议阅读顺序:VQA² → VQAThinker → MDS-VQA → VQ-Insight → PreResQ-R1

VQA²:先理解“视频质量评估怎么变成视觉问答任务”。
VQAThinker:看怎么用 GRPO/RL 让模型既会打分又会解释。
MDS-VQA:看业务里最实用的数据选择/难样本挖掘。
VQ-Insight:看 AIGC 视频质量评估和多维 reward。
PreResQ-R1:看 rank + score 联合优化的新 RL 思路。

优先级 论文 推荐原因 开源情况
1 VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning 最值得看。把 VQA 做成 LMM + GRPO/RL,既打分又解释,重点解决 OOD 泛化和可解释性。AAAI 2026。 有官方代码/作者 GitHub;AAAI 2026 页面已收录 (GitHub)
2 MDS-VQA: Model-Informed Data Selection for Video Quality Assessment CVPR 2026 Highlight。不是换模型,而是研究 怎么选难样本/高价值数据 来提升 VQA,适合业务数据闭环。官方代码里说明 base VQA model 可用 VisualQuality-R1,另训 failure predictor。 官方 GitHub 已开源 (GitHub)
3 VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual RL AAAI 2026 Oral。更偏 AIGC 视频质量评估,能做偏好比较、多维打分、自然视频打分,并带 reasoning。适合关注生成视频质量评估。 官方 GitHub / ByteDance Q-Insight 系列开源 (GitHub)
4 PreResQ-R1: Fine-Grained Rank-and-Score RL for Visual Quality Assessment 质量评估的 RL 新路线:同时做 绝对分数回归 + 相对质量排序,覆盖 IQA 和 VQA;论文称在 10 个 IQA、5 个 VQA benchmark 上达到 SOTA。 论文声明 code/model available (arXiv)
5 VQA²: Visual Question Answering for Video Quality Assessment 虽然是 ACM MM 2025,但非常值得补。它是把视频质量评估正式做成 VQA 指令问答范式 的代表,代码和数据都比较完整,适合复现。 官方代码和数据集开源 (GitHub)
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐