先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.08183

NeoHorse-1:用「路由外壳」的使用记录,让模型自己决定下一轮学什么

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
NeoHorse Team,Guoliang Cao,Guohao Dai,Tianyu Guo 等 12 位作者 · 2026-09-08

部署中的路由外壳本身就是数据飞轮:记录谁做不好,下一轮就练什么

打开交互式解读 →

3 分钟版

问题 RSI 需要一个具体机制:系统能观察到自己会什么、不会什么,并把这些证据转成下一轮学习。现有 Agent 训练多把交互轨迹当静态监督数据,没有利用其中「模型哪里不行」的信号。

思路 异构模型池 + 智能路由:每一轮记录预测的能力需求、选中的服务档位和后续交互。这些记录被切成「用户轮次」训练样本(保留交错的推理、工具调用和外壳上下文),经结构校验、六维语义评估和子场景标注后进入训练数据池。路由分数被当作难度代理,组织三阶段课程式监督微调,并扩展到按同样顺序进行的在线蒸馏。最后,按能力的评测反馈决定下一轮训练的数据配比。

结果 十项基准(外壳型 Agent、工具调用、代码、指令遵循)上,4B 模型宏平均从 58.94 升到 64.87,9B 从 65.60 升到 69.04。在同样训练配方下,路由外壳数据比公开合成数据 Toucan 平均高 6.26 分(作者自报)。

所以呢 真实部署流量可以同时提供「练习题」和「成绩单」。作者也强调这只是走了一圈闭环,增益能否跨多轮持续累积尚未验证。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。