跳到正文
今天10月9日周五2 条
  1. arXiv 游戏 AI 检索56

    MultiWorldBench:独立控制的多个视角能否描述同一个共享世界

    作者提出 MultiWorldBench,一个诊断性 Minecraft 基准,用来检验多人世界模型中独立控制的视角是否与同一个持续共享的世界保持一致,包含 495 组用例配置、七个任务套件和十项能力。

    推荐理由:论文用 495 组配置对比三款生成式世界模型与参考 Engine GT 的十项能力,可据分数差距判断当前短板。

  2. arXiv 游戏 AI 检索49

    AI 智能体能否靠学习登顶?AAArena 评估长期游戏竞赛中的启发式学习

    论文提出 AAArena 基准,用 12 款真实对抗游戏和 1920 份存档人类程序,评测智能体在长期竞赛中的学习能力。在评估的模型与工具配置中,Opus5.5 搭配 Claude Code 拿到 6 枚金牌,没有配置能攻下其余 6 条人类天梯。

    推荐理由:AAArena 把 12 款对抗游戏和 1920 份人类程序组织成竞赛式评测,可用来观察智能体在有限样本下改进策略的边界。

10月7日周三
  1. arXiv 游戏 AI 检索47

    论文提出 Recursive Game Creator,用四组件递归迭代提升生成游戏体验

    论文提出 Recursive Game Creator,一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件递归迭代,把粗略游戏原型推进为更耐玩的作品。

    推荐理由:论文给出四组件递归流程和两项基准结果,GameASG-Bench 严格任务成功率 53.2%,较同模型基线提升 34.1%。

10月5日周一