视频问答数据集(Video QA Evaluation Datasets)

概述

本主题聚焦视频问答(VideoQA)评测数据集,重点是「原生中文 query」资源的 2025 年格局与空白分析。核心结论:原生中文 VideoQA 评测集仍稀缺但正快速涌现;大量主流 Video-LLM 基准问题文本是英文;最大空白在时序定位、多跳推理、超长视频与开放式生成式中文 QA。

原生中文 VideoQA 数据集分级

第一优先级(可立即用于中文 VideoQA 评测)

数据集机构/年份中文规模任务/获取
VideoVista-CulturalLingo哈工大深圳 / ACL 20251,446 题14 任务/4 大类,含时序定位;HuggingFace apache-2.0(⚠️ 2025-11-17 起约 80% 答案被竞赛遮蔽)
OmniEval华为诺亚 / 2025-061,104 QA开放式+多选,含 Grounding 时序定位(342 题);CC BY 4.0 公开
WorldSense字节跳动等 / 2025双语 3,172 题全模态(音+视+文)多选;GitHub 活跃

第二优先级(关注/申请获取)

  • ChineseVideoBench(字节跳动,arXiv 2511.18399):6,507 题全中文多选(4 选 1),9 名母语标注员三阶段构建,8 大主类 12 子类含时序定位;Gemini 2.5 Pro 77.9% 最高、InternVL-38B 最强开源。⚠️ v1 无公开下载链接
  • Youku-mPLUG(阿里达摩院):从 4 亿原始视频筛出 1,000 万中文视频-文本对、45 类——预训练资源(检索/字幕/分类,非传统 QA 对)。
  • ChinaOpen(人大 AIMC):Bilibili 短视频,ChinaOpen-50k 训练 + 1k 人工标注测试。

主流英文 query 基准(国内机构主导但题目英文)

Video-MME、MVBench、MMBench-Video、TempCompass、CG-Bench、LVBench、VideoVista(原版)、OmniVideoBench、FAVOR-Bench、EgoSchema/NExT-QA/MSRVTT-QA 等——为对标国际采用 YouTube 视频,不满足「中文 query」硬性要求;LVBench/CG-Bench 在长视频与时序线索定位上设计先进,若放宽语言可参考。

评测生态五大空白

  1. 时序定位:原生中文仅 OmniEval(342 题) 与 VideoVista-CulturalLingo(部分子任务),缺 moment retrieval/IoU 风格基准。
  2. 多跳/多步推理:几乎无专门中文多跳推理视频基准。
  3. 超长视频(>30 分钟):缺口最大——LVBench/CG-Bench 均英文,ChineseVideoBench 视频仅约 1 分钟。
  4. 开放式生成式 QA:中文多为多选题以方便 accuracy 自动评测;原生中文开放式评测主要见于 OmniEval。
  5. 领域覆盖:影视/综艺/新闻/监控等中文特有内容的原生 QA 基准不足,多依赖 Bilibili/小红书短视频。

相邻:儿童视频语料的版权边界

deep-research-report 以《小猪佩奇》为例揭示了一类视频语料构建的通用约束:技术上可建统一双语台词/字幕库(canonical episode ID + cue 级数据模型 + source_tier 分层 + 时间重叠对齐),但公开分发逐字正文受版权/平台条款约束(Hasbro/Netflix/YouTube)。这与 VideoQA 基准「多不拥有原始视频版权、仅提供 YouTube ID」的可获取性瓶颈同源。

开放问题

⚠️ 矛盾 [2026-07-25] ActivityNet-QA「中文母本」说法存争议(arXiv 版称中文→翻译为英文,AAAI 正式版未提及),使用前须向作者核实。ChineseVideoBench 论文有「开放式 vs 全多选」自相矛盾描述;OmniEval 存在多版本,引用须注明版本。

触发调整阈值:ChineseVideoBench 公开释放 → 升第一优先级;OmniVideoBench 数据卡确认含中文 → 补入音视频推理类。

相关页面

wiki/topics/RAG评测数据集 · AI-Agent-Evaluation · ByteDance · Huawei · Alibaba