先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.25001
GameHorizon:按「时间尺度」考 AI 打 3A 游戏的数据与评测套件
GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
Yiran Wang,Xingyilang Yin,Junfu Pu,Guangzhi Wang 等 15 位作者 · 2026-09-21
从按键到战略,分层考模型打 3A 游戏
打开交互式解读 →三个要点
- 问题:电子游戏同时考验视觉理解、指令拆解、目标规划和精确操作,是衡量 AI 的好试验场。但已有数据集要么游戏种类窄、要么没有语言指令、要么依赖方差很大的在线试玩。
- 方法:GameHorizon 包含三部分——自动标注多时间尺度指令的流水线;21 款 3A 游戏、由 100 名人类高手录制、视频/操作/指令时间对齐的大规模数据集;以及可复现的离线评测(数千道标准化题目、三类主任务)加分步在线测试,用来检验离线分数是否反映真实游戏能力,并定位长任务中具体哪一步失败。
- 结果:作者用超过一百万次模型调用评测了 47 个模型,发现任务难度呈现清晰的层级,模型之间能力差异明显。数据、标注器和基准将会开源。
47 参与评测的模型数量
适合谁读:做游戏 AI、游戏测试自动化与具身智能评测的团队;关注「游戏作为通用 Agent 训练场」的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。