GST-Bench:视频理解中的全局空间智能基准

HuggingFace Daily Papers(社区热门论文)2026-08-06 16:00

GST-Bench 提出用于视频理解全局空间智能的 VQA 基准,含 6,790 分钟合成视频生成的 2,762 个人工验证问题,要求模型从新视角推理并映射到全局俯视图。对 22 个 SOTA VLM 的评估显示,最强零样本模型 Gemini-3-Pro 仅得 42.68 分,远低于人类基线 79.08;研究还提供 GST-Train 数据集以促进后续研究。

ai