先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.27260
什么是好的 Agent 训练数据?用「准确—复杂—多样」框架看数据生成
What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
Xingshan Zeng,Zishan Xu,Boju Zhang,Yuzhou Wu 等 14 位作者 · 2026-08-27
核心不是生成更多数据,而是持续分配有效、有信息量、不重复的经验
打开交互式解读 →三个要点
- 问题:LLM Agent 越来越依赖生成的交互数据。与普通指令合成不同,Agent 数据要在环境、任务、交互和成功信号之间保持一致,产出的经验要有用而不只是多。现有工作按领域组织、评测口径不一,掩盖了共同的生成机制。
- 框架:把 Agent 数据表示为四元组:环境说明、任务信号、交互过程、可选的验证器;按主要锚点和依赖结构梳理正向与逆向生成管线。再用 ACE 视角把生成看作受约束的分布设计:准确性划定可行范围,复杂度相对学习者能力来分配学习量,多样性控制覆盖与冗余。
- 观察:文献正在转向「以执行为依据的准确性」「相对学习者的复杂度」,以及超越表面变化和数据规模的多样性。这是综述观点,不是实验结论。
3 ACE 框架的三个维度
适合谁读:做 Agent 训练数据、RL 环境和数据标注的团队;评估 Agent 数据公司的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。