跳到正文
10月6日周二
  1. arXiv 游戏 AI 检索42

    SPEEDRUNBENCH 发布,用 9 款游戏速通评测前沿 LLM 智能体的策略形成能力

    论文提出 SPEEDRUNBENCH,一个在 9 款不同游戏上评测前沿 LLM 智能体的速通基准。智能体需要在长程动作中反复改进策略、复盘自身表现并利用已获得的知识,做到比过去的自己和他人更快。实验显示,前沿智能体在简单的平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类表现,作者认为该基准可长期作为研究智能体策略形成能力的测试平台。

    推荐理由:论文用 9 款游戏的速通任务考察智能体策略形成能力,实验显示其在简单平台跳跃游戏上接近人类世界纪录,长流程复杂游戏仍落后。

  2. arXiv 游戏 AI 检索51

    PlaySuite:覆盖超过 5K 款开源游戏的交互视觉智能大规模基准

    作者提出 PlaySuite,一个基于超过 5K 款开源游戏、用于评估交互视觉智能的大规模基准,游戏来自 PyWeek 与 itch.io,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。

    推荐理由:该基准覆盖多引擎开源游戏并给出统一评测协议,可用于比较不同模型在动态视觉环境中的持续行动表现。