MultiWorldBench:独立控制的多个视角能否描述同一个共享世界
作者提出 MultiWorldBench,一个诊断性 Minecraft 基准,用来检验多人世界模型中独立控制的视角是否与同一个持续共享的世界保持一致,包含 495 组用例配置、七个任务套件和十项能力。
推荐理由:论文用 495 组配置对比三款生成式世界模型与参考 Engine GT 的十项能力,可据分数差距判断当前短板。
作者提出 MultiWorldBench,一个诊断性 Minecraft 基准,用来检验多人世界模型中独立控制的视角是否与同一个持续共享的世界保持一致,包含 495 组用例配置、七个任务套件和十项能力。
推荐理由:论文用 495 组配置对比三款生成式世界模型与参考 Engine GT 的十项能力,可据分数差距判断当前短板。
论文提出 AgentGarten 框架,把模拟器与游戏引擎同共享的神经渲染器耦合,构建可实时交互的虚拟环境。模拟后端维护持久世界状态并执行程序定义的交互规则,渲染器从通过统一接口导出的结构化条件生成视觉观察;神经渲染器由预训练视频模型改造为几何条件输入,采用提出的 Adversarial Forcing 蒸馏并针对实时交互优化推理。
推荐理由:论文把模拟器与游戏引擎接入同一个神经渲染器,并给出智能体 4 轮经验对比数百万轮强化学习的学习效率结果。
论文提出并随论文开源了通用物理 AI 数据策展工具包 Kuration SDK,用数据策展来应对动作条件世界模型训练中的 Virtual2Real 差距。作者在 CounterStrike 玩法数据上训练和评估扩散世界模型,确认 FVD、LPIPS、JEDi 等指标与定性的可玩性并不对应,认为在训练开始前策展原始玩法数据并测量多种诊断属性是更可靠的信号。
推荐理由:论文用 CounterStrike 玩法数据训练扩散世界模型,指出 FVD、LPIPS 等视觉相似度指标与可玩性不对应,并提出数据策展思路。
LeCuration 是一个小型世界模型,用来为另一个更大的下游模型做数据筛选。它以 LeWorldModel(LeWM)作潜在编码器与预测器,并加入 DiT 解码器,为自回归的游戏玩法推演补上画面;其嵌入向量可作异常检测信号和基于内容的聚类启发式,自回归预测游戏状态则可用于定性检查动作与状态是否一致。团队在 CS:GO 玩法数据上做了定性的概念验证,尚未给出量化筛选指标或下游训练结果。
中秋节期间,造梦次元的AI主播紫樱在直播间挑战限时营业任务,支撑她的实时互动模型是前不久发布的Vidu S2,当天直播间一度涌入2万人。紫樱没有固定流程,观众可点歌、投票选造型、送礼物,她要在互动中换装和表演,被打断后还得接回前面的内容。作者还实测了Vidu S2的Avatar和Editing,上传真人照片或动漫图片并补充设定即可创建数字人,开启摄像头后能在拍摄过程中实时换装、改画风和换背景。
推荐理由:以一场无固定流程的AI主播直播为样本,实测Vidu S2的实时互动与换装能力,并讨论其在游戏NPC上的落地可能。