先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.08183
NeoHorse-1:用「路由外壳」的使用记录,让模型自己决定下一轮学什么
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
NeoHorse Team,Guoliang Cao,Guohao Dai,Tianyu Guo 等 12 位作者 · 2026-09-08
部署中的路由外壳本身就是数据飞轮:记录谁做不好,下一轮就练什么
打开交互式解读 →3 分钟版
问题 RSI 需要一个具体机制:系统能观察到自己会什么、不会什么,并把这些证据转成下一轮学习。现有 Agent 训练多把交互轨迹当静态监督数据,没有利用其中「模型哪里不行」的信号。
思路 异构模型池 + 智能路由:每一轮记录预测的能力需求、选中的服务档位和后续交互。这些记录被切成「用户轮次」训练样本(保留交错的推理、工具调用和外壳上下文),经结构校验、六维语义评估和子场景标注后进入训练数据池。路由分数被当作难度代理,组织三阶段课程式监督微调,并扩展到按同样顺序进行的在线蒸馏。最后,按能力的评测反馈决定下一轮训练的数据配比。
结果 十项基准(外壳型 Agent、工具调用、代码、指令遵循)上,4B 模型宏平均从 58.94 升到 64.87,9B 从 65.60 升到 69.04。在同样训练配方下,路由外壳数据比公开合成数据 Toucan 平均高 6.26 分(作者自报)。
所以呢 真实部署流量可以同时提供「练习题」和「成绩单」。作者也强调这只是走了一圈闭环,增益能否跨多轮持续累积尚未验证。
关键数字
- 64.87 NeoHorse-1-4B 十项宏平均(§5 · Table 1)
- 69.04 NeoHorse-1-9B 十项宏平均(§5 · Table 2)
- +6.26 路由外壳数据 vs 公开合成数据(五项平均)(§5.2 · Table 3)
- 88.46 NeoHorse-1-4B 的 τ²-Bench 得分(Table 1)
局限与疑问
- 只完成一轮闭环,跨多轮的持续累积尚未验证(作者自述)。
- 评测集中在 Agent、代码、工具和指令遵循,其他能力未评测。
- 对比模型与评测设置由作者选定,结果为作者自报。
- 路由外壳数据来自作者自己的部署,外部团队难以复现同样的数据源。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。