跳到正文
今天10月9日周五4 条
  1. arXiv 游戏 AI 检索40

    Mine Odyssey 提出含 180 项任务的智能体空间智能基准,用 Minecraft 重建 30 个真实地点

    Yuxuan Cao 等人提出 Mine Odyssey 智能体空间智能基准,用 Minecraft 重建五大洲 20 个国家与地区的 30 个真实地点,包含 180 项自然语言任务,其中 20 个为室外场景、10 个为室内场景。

    推荐理由:论文用 Minecraft 重建 30 个真实地点并设 180 项任务,可对比八个模型的空间智能差距。

  2. arXiv 游戏 AI 检索56

    MultiWorldBench:独立控制的多个视角能否描述同一个共享世界

    作者提出 MultiWorldBench,一个诊断性 Minecraft 基准,用来检验多人世界模型中独立控制的视角是否与同一个持续共享的世界保持一致,包含 495 组用例配置、七个任务套件和十项能力。

    推荐理由:论文用 495 组配置对比三款生成式世界模型与参考 Engine GT 的十项能力,可据分数差距判断当前短板。

  3. arXiv 游戏 AI 检索49

    AI 智能体能否靠学习登顶?AAArena 评估长期游戏竞赛中的启发式学习

    论文提出 AAArena 基准,用 12 款真实对抗游戏和 1920 份存档人类程序,评测智能体在长期竞赛中的学习能力。在评估的模型与工具配置中,Opus5.5 搭配 Claude Code 拿到 6 枚金牌,没有配置能攻下其余 6 条人类天梯。

    推荐理由:AAArena 把 12 款对抗游戏和 1920 份人类程序组织成竞赛式评测,可用来观察智能体在有限样本下改进策略的边界。

  4. arXiv 游戏 AI 检索45

    AgentGarten:面向持续演化智能体的代码世界框架

    论文提出 AgentGarten 框架,把模拟器与游戏引擎同共享的神经渲染器耦合,构建可实时交互的虚拟环境。模拟后端维护持久世界状态并执行程序定义的交互规则,渲染器从通过统一接口导出的结构化条件生成视觉观察;神经渲染器由预训练视频模型改造为几何条件输入,采用提出的 Adversarial Forcing 蒸馏并针对实时交互优化推理。

    推荐理由:论文把模拟器与游戏引擎接入同一个神经渲染器,并给出智能体 4 轮经验对比数百万轮强化学习的学习效率结果。

10月7日周三
  1. arXiv 游戏 AI 检索45

    Kuration SDK:通过数据策展应对世界模型的 Virtual2Real 差距

    论文提出并随论文开源了通用物理 AI 数据策展工具包 Kuration SDK,用数据策展来应对动作条件世界模型训练中的 Virtual2Real 差距。作者在 CounterStrike 玩法数据上训练和评估扩散世界模型,确认 FVD、LPIPS、JEDi 等指标与定性的可玩性并不对应,认为在训练开始前策展原始玩法数据并测量多种诊断属性是更可靠的信号。

    推荐理由:论文用 CounterStrike 玩法数据训练扩散世界模型,指出 FVD、LPIPS 等视觉相似度指标与可玩性不对应,并提出数据策展思路。

  2. arXiv 游戏 AI 检索29

    LeCuration:一个作为数据筛选多用途工具的小型世界模型

    LeCuration 是一个小型世界模型,用来为另一个更大的下游模型做数据筛选。它以 LeWorldModel(LeWM)作潜在编码器与预测器,并加入 DiT 解码器,为自回归的游戏玩法推演补上画面;其嵌入向量可作异常检测信号和基于内容的聚类启发式,自回归预测游戏状态则可用于定性检查动作与状态是否一致。团队在 CS:GO 玩法数据上做了定性的概念验证,尚未给出量化筛选指标或下游训练结果。

  3. arXiv 游戏 AI 检索47

    论文提出 Recursive Game Creator,用四组件递归迭代提升生成游戏体验

    论文提出 Recursive Game Creator,一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件递归迭代,把粗略游戏原型推进为更耐玩的作品。

    推荐理由:论文给出四组件递归流程和两项基准结果,GameASG-Bench 严格任务成功率 53.2%,较同模型基线提升 34.1%。

  4. arXiv 游戏 AI 检索27

    面向 HoloLens 2 的空域无关视觉游戏分析工具:自适应空间重建与实时目标检测

    一款面向混合现实(MR)游戏开发的空域无关视觉游戏分析工具被提出,融合自适应空间重建与实时目标检测,运行于 Microsoft HoloLens 2 MR 头显。该工具针对 MR 游戏需整合现实与数字世界组件的复杂性、现有视觉分析工具难以实现空域无关泛化的问题而设计。研究者期望它能加深对玩家所处环境的理解,为 MR 游戏开发的视觉分析开辟新方向。

  5. arXiv 游戏 AI 检索36

    研究提出 ResNet-BiLSTM,从游戏录像检测多标签感知 Bug

    研究提出 ResNet-BiLSTM 模型,用游戏录像画面做多标签感知 Bug 检测,在基准数据集上取得 85.78% 的 F1 分数,并与 Inflated 3D ConvNet、3D ResNet 等视频分类模型进行了对比。

    推荐理由:论文给出 ResNet-BiLSTM 的 F1 85.78%,并与 Inflated 3D ConvNet 等视频分类模型做了同任务对比。

10月6日周二
  1. arXiv 游戏 AI 检索42

    SPEEDRUNBENCH 发布,用 9 款游戏速通评测前沿 LLM 智能体的策略形成能力

    论文提出 SPEEDRUNBENCH,一个在 9 款不同游戏上评测前沿 LLM 智能体的速通基准。智能体需要在长程动作中反复改进策略、复盘自身表现并利用已获得的知识,做到比过去的自己和他人更快。实验显示,前沿智能体在简单的平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类表现,作者认为该基准可长期作为研究智能体策略形成能力的测试平台。

    推荐理由:论文用 9 款游戏的速通任务考察智能体策略形成能力,实验显示其在简单平台跳跃游戏上接近人类世界纪录,长流程复杂游戏仍落后。

  2. arXiv 游戏 AI 检索41

    Attacca:面向长时程具身智能体的状态连续目标导向控制

    研究者提出 Attacca,通过在完整的搜寻到交互轨迹上训练视觉目标条件策略,让长时程具身智能体在前一任务留下的位置、朝向和世界状态下继续推进下一个任务。该方法使用上下文解耦的目标采样,把每条演示与另一个世界中类别兼容的掩码目标图像配对,并通过目标掩码预测头提供动作模仿之外的监督,同时引入区分 Search、Approach、Interact 三个阶段的行为阶段条件化。

    推荐理由:论文把状态连续的长时程执行纳入评测,并给出相对最强基线的成功率与完成度对比。

  3. arXiv 游戏 AI 检索31

    SENSE:状态感知的情感导航叙事引擎

    论文提出 SENSE,一个状态感知框架,用于生成可玩的分支视觉小说并支持多轨情感导航。该框架整合名为 MIND 的状态化叙事架构、结构分析器和路径感知上下文管理模块,可从少量高层输入生成多条交叉路线,同时保持角色一致性和叙事因果性。使用 LLM 评委、情感指标和视觉评估的评测显示 SENSE 在叙事多样性和资产整合稳健性上优于基线,初步人类试玩显示情感保真度有方向性提升,乐趣相当。

  4. arXiv 游戏 AI 检索35

    Emoception 提出 SALFT 框架,选择性微调视频 ViT 识别玩家唤醒度变化

    论文提出 SALFT(Selective Affective Layer Fine-Tuning)框架,用基于层参数 L2 范数变化的选择准则微调 Video Vision Transformer,从游戏画面识别玩家唤醒度变化。

    推荐理由:论文以层参数 L2 范数变化作为选择准则,给出只更新约 8% 参数即可接近全量微调的做法,可对照自家玩家情绪识别流程的算力成本。

  5. arXiv 游戏 AI 检索51

    PlaySuite:覆盖超过 5K 款开源游戏的交互视觉智能大规模基准

    作者提出 PlaySuite,一个基于超过 5K 款开源游戏、用于评估交互视觉智能的大规模基准,游戏来自 PyWeek 与 itch.io,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。

    推荐理由:该基准覆盖多引擎开源游戏并给出统一评测协议,可用于比较不同模型在动态视觉环境中的持续行动表现。

10月5日周一
10月4日周日
  1. arXiv 游戏 AI 检索39

    Code2Games:让编码智能体从自然语言生成可玩游戏世界

    Wei Wu 提出 Code2Games,一个让编码智能体在同一游戏意图生成的 Blender 世界基础上构建结构化游戏世界的智能体框架。该框架通过共享的场景与玩法表示协调场景分析、玩法规划、受限游戏世界生成和引擎定制,并在适配 Unreal Engine 5 时用编译诊断、运行时反馈和玩法测试结果做执行引导的重构。

    推荐理由:论文用共享的场景与玩法表示协调各生成环节,并以含十项固定游戏提示的基准比较生成质量,便于对照现有方案。