arXiv 游戏 AI 检索· Yoshinari Fujinuma·· 3 天前精选AI 评分42
SPEEDRUNBENCH 发布,用 9 款游戏速通评测前沿 LLM 智能体的策略形成能力
SpeedrunBench: Challenging LLM Agents with Video Game Speedrunning
AI 导读
论文提出 SPEEDRUNBENCH,一个在 9 款不同游戏上评测前沿 LLM 智能体的速通基准。智能体需要在长程动作中反复改进策略、复盘自身表现并利用已获得的知识,做到比过去的自己和他人更快。实验显示,前沿智能体在简单的平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类表现,作者认为该基准可长期作为研究智能体策略形成能力的测试平台。
推荐理由
论文用 9 款游戏的速通任务考察智能体策略形成能力,实验显示其在简单平台跳跃游戏上接近人类世界纪录,长流程复杂游戏仍落后。
来源:arXiv 游戏 AI 检索 · arxiv.org