MultiWorldBench:独立控制的多个视角能否描述同一个共享世界
作者提出 MultiWorldBench,一个诊断性 Minecraft 基准,用来检验多人世界模型中独立控制的视角是否与同一个持续共享的世界保持一致,包含 495 组用例配置、七个任务套件和十项能力。
推荐理由:论文用 495 组配置对比三款生成式世界模型与参考 Engine GT 的十项能力,可据分数差距判断当前短板。
作者提出 MultiWorldBench,一个诊断性 Minecraft 基准,用来检验多人世界模型中独立控制的视角是否与同一个持续共享的世界保持一致,包含 495 组用例配置、七个任务套件和十项能力。
推荐理由:论文用 495 组配置对比三款生成式世界模型与参考 Engine GT 的十项能力,可据分数差距判断当前短板。
论文提出 AAArena 基准,用 12 款真实对抗游戏和 1920 份存档人类程序,评测智能体在长期竞赛中的学习能力。在评估的模型与工具配置中,Opus5.5 搭配 Claude Code 拿到 6 枚金牌,没有配置能攻下其余 6 条人类天梯。
推荐理由:AAArena 把 12 款对抗游戏和 1920 份人类程序组织成竞赛式评测,可用来观察智能体在有限样本下改进策略的边界。
论文提出 Recursive Game Creator,一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件递归迭代,把粗略游戏原型推进为更耐玩的作品。
推荐理由:论文给出四组件递归流程和两项基准结果,GameASG-Bench 严格任务成功率 53.2%,较同模型基线提升 34.1%。
论文提出受人类共同注意启发的多智能体强化学习方法 MATE(Mutual Attention for zero-shot TEaming),让智能体在交互中对齐对场景显著物体的视觉注意,从而与陌生伙伴完成零样本协作。