先手 SENTE · 周报阅读清单 · 速读 · arXiv 2610.01762
OneStreamer:流式视频模型边看边记、该说时再说
OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
Xiangyu Zeng,Yuandong Yang,Zhiqiu Zhang,Yuhan Zhu 等 24 位作者 · 2026-10-01
边看视频边写「笔记」,答题时翻笔记而不是翻画面
打开交互式解读 →三个要点
- 问题:直播助手、可穿戴设备、安防监控里的视频是源源不断的流,模型不知道哪一帧以后会有用;保留太多历史视觉 token 会挤占当前画面的上下文,削弱实时感知。
- 方法:OneStreamer 让模型在看视频时主动生成两层带时间戳的文字记录——局部细节描述和已完成事件的摘要(PHCM),回答问题时用这些文字记录加上最近的画面窗口,而不用回看历史视觉特征;PSTL 只挑选代表性的「状态变化/状态保持」token 来监督,避免大量「继续等待」标签主导训练。作者还合成了超过一百万条记录的 OneStreamer-1M 数据集。
- 结果:4B 模型在作者比较的八个流式视频理解基准上全部取得最好成绩,相对 Qwen3-VL 基线平均相对提升 25.0%,相对每个基准上最强的对手平均 6.1%;PSTL 只监督 27.5% 的状态 token 就优于全量监督。
25.0% 相对 Qwen3-VL 基线的平均相对提升
适合谁读:做实时视频助手、智能眼镜、安防与直播分析的团队;关注端侧多模态 Agent 的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。