最新快讯
追踪 AI、机器人与新兴科技公司的最新产品、融资、岗位和商业化信号。
全部ai
DeepAmbigQA:用于评测 LLM 答案完整性的歧义多跳问答基准苹果研究团队推出 DeepAmbigQA,一个用于评测大语言模型答案完整性的歧义多跳问答基准。该基准聚焦"同名电影《盗火线》中哪位演员获得过奥斯卡奖"这类复杂问题,要求模型同时区分同名实体并跨大量实体进行多跳推理。研究团队还发布了自动数据生成流程 DEEPAMBIGQAGEN,以构建此类评测数据。Apple Machine Learning Research(RSS)2026-08-06 16:00查看详情>>CalibForge:用对抗性求解器校准扩展可学习终端任务CalibForge 提出一种自主终端任务合成系统,通过多求解器校准和对比校准,将任务构建为受约束的对抗性作者-求解器循环,使候选任务处于可证明可解但未被统一求解的"可学习区"。HuggingFace Daily Papers(社区热门论文)2026-08-06 16:00查看详情>>AgentOPSD:面向智能体强化学习的递归自蒸馏方法AgentOPSD 提出一种免评论家的递归回合级信用分配方法,将 token 级师生对数概率差聚合为回合级证据,并在 log-odds 空间递归更新贝叶斯信念状态,将稀疏结果监督转化为回合级信用信号。HuggingFace Daily Papers(社区热门论文)2026-08-06 16:00查看详情>>GST-Bench:视频理解中的全局空间智能基准GST-Bench 提出用于视频理解全局空间智能的 VQA 基准,含 6,790 分钟合成视频生成的 2,762 个人工验证问题,要求模型从新视角推理并映射到全局俯视图。对 22 个 SOTA VLM 的评估显示,最强零样本模型 Gemini-3-Pro 仅得 42.68 分,远低于人类基线 79.08;研究还提供 GST-Train 数据集以促进后续研究。HuggingFace Daily Papers(社区热门论文)2026-08-06 16:00查看详情>>多语言数学推理中的 On-Policy Delta Distillation(OPD2)研究一项针对 Qwen3 的研究发现,On-Policy Delta Distillation(OPD2)在多语言数学推理中持续优于原始 OPD,尤其在韩语和日语上提升显著,并普遍缩小了英语与韩语的性能差距。研究还显示,仅用英语数据的 OPD 虽能提升韩语和日语表现,但常使回答偏向英语,凸显了多语言数据对保持目标语言回答的重要性。HuggingFace Daily Papers(社区热门论文)2026-08-06 16:00查看详情>>UniME-R1:基于失败学习的检索中心思维链统一多模态检索UniME-R1 提出一种 embedder-adviser 框架,通过挖掘硬负样本模拟检索失败,让 adviser 基于初始检索结果生成检索中心思维链(RC-CoT),以纠正嵌入器对细微判别线索的混淆。若目标出现在初始 top-k 集合中则直接重排,否则生成 RC-CoT 调整检索方向并执行全库重检索。在 MMEB-V2 及多个通用多模态检索基准上,UniME-R1 持续优于强基线。HuggingFace Daily Papers(社区热门论文)2026-08-06 16:00查看详情>>ChronoVision:通过潜在状态重建实现时序推理ChronoVision 提出多模态框架,通过监督微调中的 Reconstructive Visual Head 预测最终变换状态的潜在表征,并借助 ROI Attention Locating 模块聚焦关键视觉证据,后训练阶段采用带隐式过程对齐的强化学习。在 Vbvr-VQA 上取得 74.8% 域内和 71.6% 域外准确率,在 IntPhys2 上达到 55.0%。HuggingFace Daily Papers(社区热门论文)2026-08-06 16:00查看详情>>HarnessOpt-Bench:评估大语言模型的 Harness 优化能力HarnessOpt-Bench 发布,用于在昂贵且随机的评估条件下衡量前沿 LLM 的端到端编排优化能力。优化器需在固定评估预算内编辑目标智能体的 harness 并提名最终候选,最终得分基于在不可访问的测试集上相对 seed 的归一化增益。HuggingFace Daily Papers(社区热门论文)2026-08-06 16:00查看详情>>DyPES-VLA:学习共享动力学先验与具身特定控制,实现跨具身操作DyPES-VLA 提出一种跨具身视觉-语言-动作模型,通过未来预测目标训练 VLM 学习共享动力学先验,并利用具身特定的 MoE 动作头直接在原生动作空间生成控制,无需手动对齐异构动作。作为通用策略,它在 LIBERO 上达到 98.0% 成功率,在 RoboCasa-GR1 上为 59.25%,在 RoboTwin 2.0 上为 89.02%,在仿真和真实世界评估中均取得 SOTA 性能。HuggingFace Daily Papers(社区热门论文)2026-08-06 16:00查看详情>>最新资讯频道_行业热点_全面覆盖_资讯频道_36氪暂无36kr.com2026-05-09 00:37查看详情>>
