Epoch AI 新基准测试 Opus 5 得分 59%
我们推出了一项新的"游戏谜题"基准测试,与我们的国际象棋谜题基准类似,但使用的是另一款未公开游戏的谜题。这有助于我们在推理密集型任务上测试 AI,而这些任务中的内容模型可能并未经过后训练。目前的最高纪录保持者是 Opus 5,得分 59%。
ai
我们推出了一项新的"游戏谜题"基准测试,与我们的国际象棋谜题基准类似,但使用的是另一款未公开游戏的谜题。这有助于我们在推理密集型任务上测试 AI,而这些任务中的内容模型可能并未经过后训练。目前的最高纪录保持者是 Opus 5,得分 59%。