Mine Odyssey 提出含 180 项任务的智能体空间智能基准,用 Minecraft 重建 30 个真实地点
Yuxuan Cao 等人提出 Mine Odyssey 智能体空间智能基准,用 Minecraft 重建五大洲 20 个国家与地区的 30 个真实地点,包含 180 项自然语言任务,其中 20 个为室外场景、10 个为室内场景。
推荐理由:论文用 Minecraft 重建 30 个真实地点并设 180 项任务,可对比八个模型的空间智能差距。
Yuxuan Cao 等人提出 Mine Odyssey 智能体空间智能基准,用 Minecraft 重建五大洲 20 个国家与地区的 30 个真实地点,包含 180 项自然语言任务,其中 20 个为室外场景、10 个为室内场景。
推荐理由:论文用 Minecraft 重建 30 个真实地点并设 180 项任务,可对比八个模型的空间智能差距。
论文提出 AAArena 基准,用 12 款真实对抗游戏和 1920 份存档人类程序,评测智能体在长期竞赛中的学习能力。在评估的模型与工具配置中,Opus5.5 搭配 Claude Code 拿到 6 枚金牌,没有配置能攻下其余 6 条人类天梯。
推荐理由:AAArena 把 12 款对抗游戏和 1920 份人类程序组织成竞赛式评测,可用来观察智能体在有限样本下改进策略的边界。
论文提出 AgentGarten 框架,把模拟器与游戏引擎同共享的神经渲染器耦合,构建可实时交互的虚拟环境。模拟后端维护持久世界状态并执行程序定义的交互规则,渲染器从通过统一接口导出的结构化条件生成视觉观察;神经渲染器由预训练视频模型改造为几何条件输入,采用提出的 Adversarial Forcing 蒸馏并针对实时交互优化推理。
推荐理由:论文把模拟器与游戏引擎接入同一个神经渲染器,并给出智能体 4 轮经验对比数百万轮强化学习的学习效率结果。
Epic 为 Unreal Engine 推出 Unreal Model Context Protocol(MCP),官方支持把常用的智能体 LLM 工具直接接入 Unreal Engine。该协议基于开放的 MCP 标准构建,让智能体借助各编辑器暴露的能力在项目中执行操作。开发者可使用兼容的智能体编程工具,也可围绕自身创作方式构建集成、技能与工作流,文档见 https://epic.gm/ue-mcp-docs。
推荐理由:原文交代 Epic 官方支持基于 MCP 标准把智能体工具接入编辑器,读者可据此判断自研集成与工作流能否复用。
Epic 在 Unreal Engine 5.8 中推出 Unreal MCP(Unreal Model Context Protocol),为智能体 LLM 工具提供官方支持的接入方式。
同一新闻,精选展示《Epic 为 Unreal Engine 推出 Unreal MCP,官方支持智能体 LLM 工具接入编辑器》
论文提出并随论文开源了通用物理 AI 数据策展工具包 Kuration SDK,用数据策展来应对动作条件世界模型训练中的 Virtual2Real 差距。作者在 CounterStrike 玩法数据上训练和评估扩散世界模型,确认 FVD、LPIPS、JEDi 等指标与定性的可玩性并不对应,认为在训练开始前策展原始玩法数据并测量多种诊断属性是更可靠的信号。
推荐理由:论文用 CounterStrike 玩法数据训练扩散世界模型,指出 FVD、LPIPS 等视觉相似度指标与可玩性不对应,并提出数据策展思路。
论文提出 Recursive Game Creator,一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件递归迭代,把粗略游戏原型推进为更耐玩的作品。
推荐理由:论文给出四组件递归流程和两项基准结果,GameASG-Bench 严格任务成功率 53.2%,较同模型基线提升 34.1%。
论文提出 SPEEDRUNBENCH,一个在 9 款不同游戏上评测前沿 LLM 智能体的速通基准。智能体需要在长程动作中反复改进策略、复盘自身表现并利用已获得的知识,做到比过去的自己和他人更快。实验显示,前沿智能体在简单的平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类表现,作者认为该基准可长期作为研究智能体策略形成能力的测试平台。
推荐理由:论文用 9 款游戏的速通任务考察智能体策略形成能力,实验显示其在简单平台跳跃游戏上接近人类世界纪录,长流程复杂游戏仍落后。
研究者提出 Attacca,通过在完整的搜寻到交互轨迹上训练视觉目标条件策略,让长时程具身智能体在前一任务留下的位置、朝向和世界状态下继续推进下一个任务。该方法使用上下文解耦的目标采样,把每条演示与另一个世界中类别兼容的掩码目标图像配对,并通过目标掩码预测头提供动作模仿之外的监督,同时引入区分 Search、Approach、Interact 三个阶段的行为阶段条件化。
推荐理由:论文把状态连续的长时程执行纳入评测,并给出相对最强基线的成功率与完成度对比。
作者提出 PlaySuite,一个基于超过 5K 款开源游戏、用于评估交互视觉智能的大规模基准,游戏来自 PyWeek 与 itch.io,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。
推荐理由:该基准覆盖多引擎开源游戏并给出统一评测协议,可用于比较不同模型在动态视觉环境中的持续行动表现。
Unity 发布教程视频,演示如何通过 Unity CLI 让 AI 智能体从概念图和简短需求出发,在 Unity 编辑器内直接搭建出一个可用的主菜单界面。
推荐理由:原文完整演示了从概念图到可运行主菜单的智能体协作流程,命令行测试与截图反馈的做法可迁移到自己的项目。
我很兴奋地分享 Erik 的工作!《Mastering Atari 2600 Games with Discovered Options》:我们提出了一种通用选项发现方法,能在高维观测、从零开始(tabula rasa)的条件下,仅用单条经验流学习,表现优于 DreamerV3、Rainbow 和 IQN!1/9 看起来非常有前景!
论文提出受人类共同注意启发的多智能体强化学习方法 MATE(Mutual Attention for zero-shot TEaming),让智能体在交互中对齐对场景显著物体的视觉注意,从而与陌生伙伴完成零样本协作。
Wei Wu 提出 Code2Games,一个让编码智能体在同一游戏意图生成的 Blender 世界基础上构建结构化游戏世界的智能体框架。该框架通过共享的场景与玩法表示协调场景分析、玩法规划、受限游戏世界生成和引擎定制,并在适配 Unreal Engine 5 时用编译诊断、运行时反馈和玩法测试结果做执行引导的重构。
推荐理由:论文用共享的场景与玩法表示协调各生成环节,并以含十项固定游戏提示的基准比较生成质量,便于对照现有方案。
AI and Games 基于 EA 随《命令与征服 重制版》公开、并可在 GitHub 获取的源码,梳理了《命令与征服》与《红色警戒》的 AI 实现。
推荐理由:借由 EA 公开的重制版源码,文章拆解了两款早期 RTS 的单位任务、指挥官状态与寻路实现。
Forza Motorsport 的 AI 被从底层重做,Drivatar 系统不再以人类游玩数据为依据。AI and Games 在视频中提出,重做后的 Drivatar 呈现给玩家的并非其真实运作方式。
推荐理由:视频解释了 Forza Motorsport 从底层重做的 Drivatar 为何不再依赖人类游玩数据,并点出其行为与玩家所见之间的差异。
Forza 中的 Drivatar Bot「BowieKnife99」成为玩家社区热议的新对手,以激进驾驶风格著称,会冲撞路上车辆、频繁做出极限切弯。它是眼下社区讨论度最高的 AI。
AI and Games 在第 85 期视频中解释 Forza Horizon 6 里的 Drivatar「Bowie Knife99」为何既成了社区梗、又成为线上比赛的公敌,并将这一现象与 Turn 10 在 2023 年《Forza Motorsport》中对 AI 车手行为的改动联系起来。
推荐理由:梳理 Bowie Knife99 走红与 Turn 10 在 2023 年《Forza Motorsport》中改动车手 AI 行为的关联,可与旧版 Drivatar 机制对照。