【Vid-llm】Video Quality Assessment研究进展
·
note
- Video Quality Assessment,视频质量评估。常见输出:质量分数 + 质量问题原因,比如模糊、噪声、压缩块、抖动、曝光差、运动不稳定、构图差等。
- VQA近几年的发展路线:
- 1、参考论文:FAST-VQA → DOVER → MD-VQA → MaxVQA → LMM-VQA → VQA² → VQAThinker → MDS-VQA
- 2、路线演变:高效打分模型 → 多维质量建模 → 可解释评估 → 大模型/VQA化 → RL增强 → 数据选择优化。
一、Video Quality Assessment
Video Quality Assessment,视频质量评估
常见输出:质量分数 + 质量问题原因,比如模糊、噪声、压缩块、抖动、曝光差、运动不稳定、构图差等。
| 方向 | 核心变化 |
|---|---|
| 1. 从传统指标到深度 BVQA | 早期 PSNR/SSIM/VMAF 偏压缩质量,现在更多做无参考质量评估,直接看用户视频 |
| 2. 从单一分数到多维诊断 | 不只输出 MOS 分数,还判断清晰度、运动、压缩失真、美学、语义质量 |
| 3. 从 CNN/Transformer 到大视觉 Encoder | 用 Video Swin、ViT、Mamba、DINO/CLIP/SigLIP 等提取更强时空特征 |
| 4. 从打分模型到 VLM/VQA 范式 | 把视频质量评估转成“视觉问答”,模型能输出分数和解释 |
| 5. 从固定数据集到数据选择/RL | 最新工作开始关注 OOD 泛化、难样本选择、GRPO/RL 训练和可解释性 |
近几年的发展路线:
1、参考论文:FAST-VQA → DOVER → MD-VQA → MaxVQA → LMM-VQA → VQA² → VQAThinker → MDS-VQA
2、路线演变:高效打分模型 → 多维质量建模 → 可解释评估 → 大模型/VQA化 → RL增强 → 数据选择优化。
| 推荐优先级 | 论文 | 会议/年份 | 为什么值得看 |
|---|---|---|---|
| 1 | FAST-VQA / FasterVQA | ECCV 2022 附近 | 经典高效 BVQA,提出 fragment sampling,大幅降低高分辨率视频计算量,是很多后续工作的基础 (arXiv) |
| 2 | DOVER | ICCV 2023 | 把 UGC 视频质量拆成 technical quality + aesthetic quality,很适合业务理解“技术质量”和“美感质量”区别 (GitHub) |
| 3 | MD-VQA | CVPR 2023 | 面向 UGC 直播视频,从 semantic / distortion / motion 多维度评估质量,很适合理解多维质量建模 (arXiv) |
| 4 | MaxVQA | ACM MM 2023 | 做可解释视频质量评估,不只给分,还能解释不同质量因素 (arXiv) |
| 5 | LMM-VQA | 2024 | 较早把大多模态模型引入 VQA,核心是用 LMM 做时空质量感知 (arXiv) |
| 6 | VQA²: Visual Question Answering for Video Quality Assessment | ACM MM 2025 | 很重要,把视频质量评估正式做成 VQA 指令数据和模型,既能打分又能回答质量问题 (arXiv) |
| 7 | MVQA: Mamba with Unified Sampling | ICCV 2025 | 关注长视频/高清视频下的高效 VQA,用 Mamba 做高效时序建模 (CVF开放获取) |
| 8 | VQAThinker | AAAI 2026 | 用 GRPO/RL 训练可解释、泛化更强的视频质量评估模型,重点解决 OOD 泛化和解释能力 (arXiv) |
| 9 | MDS-VQA | CVPR 2026 Highlight | 不是单纯换模型,而是做“难样本 + 多样性”的数据选择,用少量高价值数据提升 VQA 模型 (arXiv) |
二、2606最新进展
建议阅读顺序:VQA² → VQAThinker → MDS-VQA → VQ-Insight → PreResQ-R1
VQA²:先理解“视频质量评估怎么变成视觉问答任务”。
VQAThinker:看怎么用 GRPO/RL 让模型既会打分又会解释。
MDS-VQA:看业务里最实用的数据选择/难样本挖掘。
VQ-Insight:看 AIGC 视频质量评估和多维 reward。
PreResQ-R1:看 rank + score 联合优化的新 RL 思路。
| 优先级 | 论文 | 推荐原因 | 开源情况 |
|---|---|---|---|
| 1 | VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning | 最值得看。把 VQA 做成 LMM + GRPO/RL,既打分又解释,重点解决 OOD 泛化和可解释性。AAAI 2026。 | 有官方代码/作者 GitHub;AAAI 2026 页面已收录 (GitHub) |
| 2 | MDS-VQA: Model-Informed Data Selection for Video Quality Assessment | CVPR 2026 Highlight。不是换模型,而是研究 怎么选难样本/高价值数据 来提升 VQA,适合业务数据闭环。官方代码里说明 base VQA model 可用 VisualQuality-R1,另训 failure predictor。 | 官方 GitHub 已开源 (GitHub) |
| 3 | VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual RL | AAAI 2026 Oral。更偏 AIGC 视频质量评估,能做偏好比较、多维打分、自然视频打分,并带 reasoning。适合关注生成视频质量评估。 | 官方 GitHub / ByteDance Q-Insight 系列开源 (GitHub) |
| 4 | PreResQ-R1: Fine-Grained Rank-and-Score RL for Visual Quality Assessment | 质量评估的 RL 新路线:同时做 绝对分数回归 + 相对质量排序,覆盖 IQA 和 VQA;论文称在 10 个 IQA、5 个 VQA benchmark 上达到 SOTA。 | 论文声明 code/model available (arXiv) |
| 5 | VQA²: Visual Question Answering for Video Quality Assessment | 虽然是 ACM MM 2025,但非常值得补。它是把视频质量评估正式做成 VQA 指令问答范式 的代表,代码和数据都比较完整,适合复现。 | 官方代码和数据集开源 (GitHub) |
更多推荐




所有评论(0)