ChronoVision:通过潜在状态重建实现时序推理
ChronoVision 提出多模态框架,通过监督微调中的 Reconstructive Visual Head 预测最终变换状态的潜在表征,并借助 ROI Attention Locating 模块聚焦关键视觉证据,后训练阶段采用带隐式过程对齐的强化学习。在 Vbvr-VQA 上取得 74.8% 域内和 71.6% 域外准确率,在 IntPhys2 上达到 55.0%。
ai
ChronoVision 提出多模态框架,通过监督微调中的 Reconstructive Visual Head 预测最终变换状态的潜在表征,并借助 ROI Attention Locating 模块聚焦关键视觉证据,后训练阶段采用带隐式过程对齐的强化学习。在 Vbvr-VQA 上取得 74.8% 域内和 71.6% 域外准确率,在 IntPhys2 上达到 55.0%。