先手 SENTE · 周报阅读清单 · 速读 · arXiv 2610.04047
Periscope:不训练,让模型「读」远超上下文窗口的长文
Periscope: Extending Frozen Language Models Beyond Their Context Window
Mohamed Eltahir,Anas Obayd,Raed Rashid,Abdulrahman Alghamdi 等 8 位作者 · 2026-10-02
把长文切块排成方阵,用短探针拼出「证据地图」
打开交互式解读 →三个要点
- 思路:很多长文任务其实是「在有限选项里选」——哪份文档相关、哪个选项被支持。Periscope 把 N 个文本块排成 K×K 方阵,对每一行(连续片段)和每一列(跨全文跳着取样)分别问冻结模型同一个问题,读取每个答案的对数几率。无需训练。
- 副产品是一张「证据地图」:给每个块按它所在的两个片段打分,峰值就是答案背后的那段原文。只读地图排名最高的约 9K token,就能追平同一模型在 32K 到 1M 窗口下的最佳全文阅读;在中位长度 150K 的 InfiniteBench 上还领先 5 分。
- 成本:每次调用只缓存一个探针,27B 模型在单张 80GB GPU 上读 450 万 token 的上下文,而单次全量读取需要 296GB 缓存。作者的说法是:长文阅读需要的是「装得下模型」的 GPU,而不是「装得下文本」的 GPU。
4.5M token / 80GB 27B 模型在单张 80GB GPU 上可读的上下文长度
适合谁读:做长文档分析、法律/金融尽调、代码库问答的团队;关心推理硬件成本的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。