跳到正文
今天10月9日周五5 条
  1. arXiv 游戏 AI 检索40

    Mine Odyssey 提出含 180 项任务的智能体空间智能基准,用 Minecraft 重建 30 个真实地点

    Yuxuan Cao 等人提出 Mine Odyssey 智能体空间智能基准,用 Minecraft 重建五大洲 20 个国家与地区的 30 个真实地点,包含 180 项自然语言任务,其中 20 个为室外场景、10 个为室内场景。

    推荐理由:论文用 Minecraft 重建 30 个真实地点并设 180 项任务,可对比八个模型的空间智能差距。

  2. arXiv 游戏 AI 检索49

    AI 智能体能否靠学习登顶?AAArena 评估长期游戏竞赛中的启发式学习

    论文提出 AAArena 基准,用 12 款真实对抗游戏和 1920 份存档人类程序,评测智能体在长期竞赛中的学习能力。在评估的模型与工具配置中,Opus5.5 搭配 Claude Code 拿到 6 枚金牌,没有配置能攻下其余 6 条人类天梯。

    推荐理由:AAArena 把 12 款对抗游戏和 1920 份人类程序组织成竞赛式评测,可用来观察智能体在有限样本下改进策略的边界。

  3. arXiv 游戏 AI 检索45

    AgentGarten:面向持续演化智能体的代码世界框架

    论文提出 AgentGarten 框架,把模拟器与游戏引擎同共享的神经渲染器耦合,构建可实时交互的虚拟环境。模拟后端维护持久世界状态并执行程序定义的交互规则,渲染器从通过统一接口导出的结构化条件生成视觉观察;神经渲染器由预训练视频模型改造为几何条件输入,采用提出的 Adversarial Forcing 蒸馏并针对实时交互优化推理。

    推荐理由:论文把模拟器与游戏引擎接入同一个神经渲染器,并给出智能体 4 轮经验对比数百万轮强化学习的学习效率结果。

  4. Unreal Engine65

    Epic 为 Unreal Engine 推出 Unreal MCP,官方支持智能体 LLM 工具接入编辑器

    Epic 为 Unreal Engine 推出 Unreal Model Context Protocol(MCP),官方支持把常用的智能体 LLM 工具直接接入 Unreal Engine。该协议基于开放的 MCP 标准构建,让智能体借助各编辑器暴露的能力在项目中执行操作。开发者可使用兼容的智能体编程工具,也可围绕自身创作方式构建集成、技能与工作流,文档见 https://epic.gm/ue-mcp-docs。

    推荐理由:原文交代 Epic 官方支持基于 MCP 标准把智能体工具接入编辑器,读者可据此判断自研集成与工作流能否复用。

10月7日周三
  1. arXiv 游戏 AI 检索45

    Kuration SDK:通过数据策展应对世界模型的 Virtual2Real 差距

    论文提出并随论文开源了通用物理 AI 数据策展工具包 Kuration SDK,用数据策展来应对动作条件世界模型训练中的 Virtual2Real 差距。作者在 CounterStrike 玩法数据上训练和评估扩散世界模型,确认 FVD、LPIPS、JEDi 等指标与定性的可玩性并不对应,认为在训练开始前策展原始玩法数据并测量多种诊断属性是更可靠的信号。

    推荐理由:论文用 CounterStrike 玩法数据训练扩散世界模型,指出 FVD、LPIPS 等视觉相似度指标与可玩性不对应,并提出数据策展思路。

  2. arXiv 游戏 AI 检索47

    论文提出 Recursive Game Creator,用四组件递归迭代提升生成游戏体验

    论文提出 Recursive Game Creator,一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件递归迭代,把粗略游戏原型推进为更耐玩的作品。

    推荐理由:论文给出四组件递归流程和两项基准结果,GameASG-Bench 严格任务成功率 53.2%,较同模型基线提升 34.1%。

10月6日周二
  1. arXiv 游戏 AI 检索42

    SPEEDRUNBENCH 发布,用 9 款游戏速通评测前沿 LLM 智能体的策略形成能力

    论文提出 SPEEDRUNBENCH,一个在 9 款不同游戏上评测前沿 LLM 智能体的速通基准。智能体需要在长程动作中反复改进策略、复盘自身表现并利用已获得的知识,做到比过去的自己和他人更快。实验显示,前沿智能体在简单的平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类表现,作者认为该基准可长期作为研究智能体策略形成能力的测试平台。

    推荐理由:论文用 9 款游戏的速通任务考察智能体策略形成能力,实验显示其在简单平台跳跃游戏上接近人类世界纪录,长流程复杂游戏仍落后。

  2. arXiv 游戏 AI 检索41

    Attacca:面向长时程具身智能体的状态连续目标导向控制

    研究者提出 Attacca,通过在完整的搜寻到交互轨迹上训练视觉目标条件策略,让长时程具身智能体在前一任务留下的位置、朝向和世界状态下继续推进下一个任务。该方法使用上下文解耦的目标采样,把每条演示与另一个世界中类别兼容的掩码目标图像配对,并通过目标掩码预测头提供动作模仿之外的监督,同时引入区分 Search、Approach、Interact 三个阶段的行为阶段条件化。

    推荐理由:论文把状态连续的长时程执行纳入评测,并给出相对最强基线的成功率与完成度对比。

  3. arXiv 游戏 AI 检索51

    PlaySuite:覆盖超过 5K 款开源游戏的交互视觉智能大规模基准

    作者提出 PlaySuite,一个基于超过 5K 款开源游戏、用于评估交互视觉智能的大规模基准,游戏来自 PyWeek 与 itch.io,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。

    推荐理由:该基准覆盖多引擎开源游戏并给出统一评测协议,可用于比较不同模型在动态视觉环境中的持续行动表现。

  4. Unity67

    Unity 演示用 CLI 和 AI 智能体从概念图原型化 UI Toolkit 主菜单

    Unity 发布教程视频,演示如何通过 Unity CLI 让 AI 智能体从概念图和简短需求出发,在 Unity 编辑器内直接搭建出一个可用的主菜单界面。

    推荐理由:原文完整演示了从概念图到可运行主菜单的智能体协作流程,命令行测试与截图反馈的做法可迁移到自己的项目。

10月5日周一
10月4日周日
  1. arXiv 游戏 AI 检索39

    Code2Games:让编码智能体从自然语言生成可玩游戏世界

    Wei Wu 提出 Code2Games,一个让编码智能体在同一游戏意图生成的 Blender 世界基础上构建结构化游戏世界的智能体框架。该框架通过共享的场景与玩法表示协调场景分析、玩法规划、受限游戏世界生成和引擎定制,并在适配 Unreal Engine 5 时用编译诊断、运行时反馈和玩法测试结果做执行引导的重构。

    推荐理由:论文用共享的场景与玩法表示协调各生成环节,并以含十项固定游戏提示的基准比较生成质量,便于对照现有方案。

9月15日周二
7月5日周日
  1. AI and Games38

    Forza Motorsport 新版 Drivatar 在对玩家说谎

    Forza Motorsport 的 AI 被从底层重做,Drivatar 系统不再以人类游玩数据为依据。AI and Games 在视频中提出,重做后的 Drivatar 呈现给玩家的并非其真实运作方式。

    推荐理由:视频解释了 Forza Motorsport 从底层重做的 Drivatar 为何不再依赖人类游玩数据,并点出其行为与玩家所见之间的差异。

7月4日周六
6月30日周二
  1. AI and Games49

    为什么 Bowie Knife99 是《极限竞速》Drivatar 系统的一个 Bug

    AI and Games 在第 85 期视频中解释 Forza Horizon 6 里的 Drivatar「Bowie Knife99」为何既成了社区梗、又成为线上比赛的公敌,并将这一现象与 Turn 10 在 2023 年《Forza Motorsport》中对 AI 车手行为的改动联系起来。

    推荐理由:梳理 Bowie Knife99 走红与 Turn 10 在 2023 年《Forza Motorsport》中改动车手 AI 行为的关联,可与旧版 Drivatar 机制对照。