AI 智能体能否靠学习登顶?AAArena 评估长期游戏竞赛中的启发式学习
论文提出 AAArena 基准,用 12 款真实对抗游戏和 1920 份存档人类程序,评测智能体在长期竞赛中的学习能力。在评估的模型与工具配置中,Opus5.5 搭配 Claude Code 拿到 6 枚金牌,没有配置能攻下其余 6 条人类天梯。
推荐理由:AAArena 把 12 款对抗游戏和 1920 份人类程序组织成竞赛式评测,可用来观察智能体在有限样本下改进策略的边界。
论文提出 AAArena 基准,用 12 款真实对抗游戏和 1920 份存档人类程序,评测智能体在长期竞赛中的学习能力。在评估的模型与工具配置中,Opus5.5 搭配 Claude Code 拿到 6 枚金牌,没有配置能攻下其余 6 条人类天梯。
推荐理由:AAArena 把 12 款对抗游戏和 1920 份人类程序组织成竞赛式评测,可用来观察智能体在有限样本下改进策略的边界。
论文提出 AgentGarten 框架,把模拟器与游戏引擎同共享的神经渲染器耦合,构建可实时交互的虚拟环境。模拟后端维护持久世界状态并执行程序定义的交互规则,渲染器从通过统一接口导出的结构化条件生成视觉观察;神经渲染器由预训练视频模型改造为几何条件输入,采用提出的 Adversarial Forcing 蒸馏并针对实时交互优化推理。
推荐理由:论文把模拟器与游戏引擎接入同一个神经渲染器,并给出智能体 4 轮经验对比数百万轮强化学习的学习效率结果。
我很兴奋地分享 Erik 的工作!《Mastering Atari 2600 Games with Discovered Options》:我们提出了一种通用选项发现方法,能在高维观测、从零开始(tabula rasa)的条件下,仅用单条经验流学习,表现优于 DreamerV3、Rainbow 和 IQN!1/9 看起来非常有前景!
论文提出受人类共同注意启发的多智能体强化学习方法 MATE(Mutual Attention for zero-shot TEaming),让智能体在交互中对齐对场景显著物体的视觉注意,从而与陌生伙伴完成零样本协作。