先手 SENTE · 周报阅读清单 · 速读 · arXiv 2610.08463
UNREAL:用同一个模型的「内部视角」既做检索又读长文
UNREAL: Unifying Retrieval and Long-Context with a Single Model
Edan Kinderman,Elad Hoffer,Yochai Blau,Brian Chmiel 等 7 位作者 · 2026-10-06
让冻结的大模型自己挑证据:检索与长文共用一套机制
打开交互式解读 →三个要点
- 思路:长上下文推理和 RAG 本质都是「从一堆材料里挑出证据」,只是规模不同。UNREAL 直接用冻结大模型的内部表示来编码文本块、生成检索查询,只新增不到 50 万个可训练参数,主干不动。
- 检索结果:在 30 亿 token、2100 万文本块的维基百科索引上,四种 UNREAL 配置都超过了当前最强的「检索器 + 重排器」系统;最好的模型把 HotpotQA 召回率从 49.1% 提到 73.2%,2WikiMultiHopQA 从 31.7% 提到 60.1%。
- 长文结果:同一机制先剔除干扰内容再生成,在 128K 长度的 NoLiMa 上准确率从 1.0% 提到 24.83%;从约 32K token 起,计算量与首字延迟都低于全文推理,文本越长优势越大。
49.1% → 73.2% HotpotQA 召回率(对比最强检索 + 重排系统)
适合谁读:做企业搜索、知识库问答(RAG)与长文档分析的团队;关注推理成本与长上下文竞争的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。