先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.09888
BDH-CQ:不说出推理过程,在隐空间里循环思考的小模型
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
Björn Engdahl,Adrian Kosowski,Jan Chorowski,Zuzanna Stamirowska 等 9 位作者 · 2026-08-10
150M 参数,ARC-AGI-1 每题成本 $0.0007
打开交互式解读 →3 分钟版
问题 思维链让推理和「逐 token 叙述」绑在一起,推理越长,成本和延迟越高;而在隐空间里推理的紧凑求解器,又往往要靠在评测任务上做优化才能学会新任务,不能只从示例中学。
思路 沿用自家「Dragon Hatchling(BDH)」架构:示例逐个写入循环记忆(不增长 KV 缓存、推理时不更新参数),之后在结构化的隐空间工作区里迭代多轮,最后只解码输出网格。
结果 ARC-AGI-1 公开评测集 400 题:pass@2 29.5%,每题约 0.85 H200 GPU 秒、折算 $0.00070;按 ARC Prize 7 月数据约比 GPT 5.6 Luna(Low)便宜 57 倍(作者自报,经合著方黑盒复现)。
所以呢 「不说出来的推理」在小模型上已经能给出很低的单位成本,为推理成本竞争提供了 Transformer 思维链之外的选项;但能力边界明显:排序、嵌套和组合操作都会失效。
关键数字
- 29.5% ARC-AGI-1 公开评测集 pass@2(Table 1)
- 0.85 每题 H200 GPU 时长(§5)
- 57× 相对 GPT 5.6 Luna(Low)的成本优势(§5)
- 96/96 颜色映射任务全部答对(§6.3)
局限与疑问
- 架构与训练细节专有,只能黑盒复现。
- 成本比较口径不一致。
- 绝对准确率仍不高。
- 排序、嵌套深度、组合操作存在明显边界。
- 规模扩展只有定性描述。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。