Mine Odyssey 提出含 180 项任务的智能体空间智能基准,用 Minecraft 重建 30 个真实地点
Yuxuan Cao 等人提出 Mine Odyssey 智能体空间智能基准,用 Minecraft 重建五大洲 20 个国家与地区的 30 个真实地点,包含 180 项自然语言任务,其中 20 个为室外场景、10 个为室内场景。
推荐理由:论文用 Minecraft 重建 30 个真实地点并设 180 项任务,可对比八个模型的空间智能差距。
Yuxuan Cao 等人提出 Mine Odyssey 智能体空间智能基准,用 Minecraft 重建五大洲 20 个国家与地区的 30 个真实地点,包含 180 项自然语言任务,其中 20 个为室外场景、10 个为室内场景。
推荐理由:论文用 Minecraft 重建 30 个真实地点并设 180 项任务,可对比八个模型的空间智能差距。
作者提出 MultiWorldBench,一个诊断性 Minecraft 基准,用来检验多人世界模型中独立控制的视角是否与同一个持续共享的世界保持一致,包含 495 组用例配置、七个任务套件和十项能力。
推荐理由:论文用 495 组配置对比三款生成式世界模型与参考 Engine GT 的十项能力,可据分数差距判断当前短板。
论文提出 AAArena 基准,用 12 款真实对抗游戏和 1920 份存档人类程序,评测智能体在长期竞赛中的学习能力。在评估的模型与工具配置中,Opus5.5 搭配 Claude Code 拿到 6 枚金牌,没有配置能攻下其余 6 条人类天梯。
推荐理由:AAArena 把 12 款对抗游戏和 1920 份人类程序组织成竞赛式评测,可用来观察智能体在有限样本下改进策略的边界。
论文提出 AgentGarten 框架,把模拟器与游戏引擎同共享的神经渲染器耦合,构建可实时交互的虚拟环境。模拟后端维护持久世界状态并执行程序定义的交互规则,渲染器从通过统一接口导出的结构化条件生成视觉观察;神经渲染器由预训练视频模型改造为几何条件输入,采用提出的 Adversarial Forcing 蒸馏并针对实时交互优化推理。
推荐理由:论文把模拟器与游戏引擎接入同一个神经渲染器,并给出智能体 4 轮经验对比数百万轮强化学习的学习效率结果。
论文提出并随论文开源了通用物理 AI 数据策展工具包 Kuration SDK,用数据策展来应对动作条件世界模型训练中的 Virtual2Real 差距。作者在 CounterStrike 玩法数据上训练和评估扩散世界模型,确认 FVD、LPIPS、JEDi 等指标与定性的可玩性并不对应,认为在训练开始前策展原始玩法数据并测量多种诊断属性是更可靠的信号。
推荐理由:论文用 CounterStrike 玩法数据训练扩散世界模型,指出 FVD、LPIPS 等视觉相似度指标与可玩性不对应,并提出数据策展思路。
论文提出 Recursive Game Creator,一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件递归迭代,把粗略游戏原型推进为更耐玩的作品。
推荐理由:论文给出四组件递归流程和两项基准结果,GameASG-Bench 严格任务成功率 53.2%,较同模型基线提升 34.1%。
研究提出 ResNet-BiLSTM 模型,用游戏录像画面做多标签感知 Bug 检测,在基准数据集上取得 85.78% 的 F1 分数,并与 Inflated 3D ConvNet、3D ResNet 等视频分类模型进行了对比。
推荐理由:论文给出 ResNet-BiLSTM 的 F1 85.78%,并与 Inflated 3D ConvNet 等视频分类模型做了同任务对比。
论文提出 SPEEDRUNBENCH,一个在 9 款不同游戏上评测前沿 LLM 智能体的速通基准。智能体需要在长程动作中反复改进策略、复盘自身表现并利用已获得的知识,做到比过去的自己和他人更快。实验显示,前沿智能体在简单的平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类表现,作者认为该基准可长期作为研究智能体策略形成能力的测试平台。
推荐理由:论文用 9 款游戏的速通任务考察智能体策略形成能力,实验显示其在简单平台跳跃游戏上接近人类世界纪录,长流程复杂游戏仍落后。
研究者提出 Attacca,通过在完整的搜寻到交互轨迹上训练视觉目标条件策略,让长时程具身智能体在前一任务留下的位置、朝向和世界状态下继续推进下一个任务。该方法使用上下文解耦的目标采样,把每条演示与另一个世界中类别兼容的掩码目标图像配对,并通过目标掩码预测头提供动作模仿之外的监督,同时引入区分 Search、Approach、Interact 三个阶段的行为阶段条件化。
推荐理由:论文把状态连续的长时程执行纳入评测,并给出相对最强基线的成功率与完成度对比。
论文提出 SALFT(Selective Affective Layer Fine-Tuning)框架,用基于层参数 L2 范数变化的选择准则微调 Video Vision Transformer,从游戏画面识别玩家唤醒度变化。
推荐理由:论文以层参数 L2 范数变化作为选择准则,给出只更新约 8% 参数即可接近全量微调的做法,可对照自家玩家情绪识别流程的算力成本。
作者提出 PlaySuite,一个基于超过 5K 款开源游戏、用于评估交互视觉智能的大规模基准,游戏来自 PyWeek 与 itch.io,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。
推荐理由:该基准覆盖多引擎开源游戏并给出统一评测协议,可用于比较不同模型在动态视觉环境中的持续行动表现。
Wei Wu 提出 Code2Games,一个让编码智能体在同一游戏意图生成的 Blender 世界基础上构建结构化游戏世界的智能体框架。该框架通过共享的场景与玩法表示协调场景分析、玩法规划、受限游戏世界生成和引擎定制,并在适配 Unreal Engine 5 时用编译诊断、运行时反馈和玩法测试结果做执行引导的重构。
推荐理由:论文用共享的场景与玩法表示协调各生成环节,并以含十项固定游戏提示的基准比较生成质量,便于对照现有方案。