先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.10715

NCP-ArchPreview:除了预测下一个词,也预测下一个「概念」

NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
NCP Team,Jiaqi Cao,Chiyu Chen,Shuang Cheng 等 12 位作者 · 2026-09-09

只用一半训练 token,就追上 OLMo-3-7B 的最终损失

打开交互式解读 →

3 分钟版

问题 标准预训练只在 token 层面学习。作者认为模型内部隐状态本身可以成为预测目标,从而引入更有挑战、更抽象的学习信号。

思路 骨干分三段:Token 编码器、概念模块、Token 解码器。编码器的隐状态每 4 个一组做平均池化,形成连续概念表示;用乘积量化(VQ)学一个离散的概念词表。概念模块在压缩后的序列上预测下一个概念,预测结果再注入解码器指导下一个 token。NTP 与 NCP 端到端联合训练,层间加入分层残差连接。

结果 8.9B 参数、在 Dolma-3 的 5.73T token 上训练。用 51.3% 的 token 达到 OLMo-3-7B 的最终预训练损失;完整预训练后下游宏平均高 2.45 分,GSM8K 高 5.99 分;用 85% 的计算量接近参数对齐的 8.9B 基线。

所以呢 概念层在压缩序列上运行,因此算力开销远低于同等参数的普通层。但中期训练后下游优势缩小到 0.59 分,损失优势如何转化为能力仍需观察。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。