先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.26005
VoiceMem:给实时语音助手装上「左右脑」记忆
VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
Zhifei Xie,Jiaqi Lang,Ze An,Yifan Zhao 等 10 位作者 · 2026-08-26
左脑记事实、右脑记情绪,检索只要 134 毫秒,藏在对话停顿里
打开交互式解读 →3 分钟版
问题 双工语音模型等对话系统缺少流式、准确、有共情的记忆。检索候选多(如前 100 条)会撑爆语音模型有限的上下文,只取前 5 条又容易漏掉相关记忆;传统记忆管线 2–3 秒的延迟也破坏自然的轮流对话。
思路 左脑:在 Mem0 存储之上建一个轻量的两级语义索引(schema 做粗路由、实体定位具体的人和事),让很小的检索预算也能拿到语义密集的候选。右脑:用独立与跨实体的人设节点建模「这个人」,并做短期与长期的情感归因。流式检索分四阶段:用户说话时实时转写并匹配实体;静默 200 毫秒时预判要回复并扩展图;最后只剩后端检索。
结果 文本对话的信息类任务平均 76.39,比其存储后端 Mem0 高 24.12 分;人设类比最强基线 MemOS 高 1.89 分。在作者构建的长时程语音助手记忆基准 ChatMem-Bench 上平均 68.73,MemOS 为 53.95。检索耗时 134 毫秒,在常见 500 毫秒语音活动检测阈值内。
所以呢 收益来自「更密集的候选池」而不是「更大的候选池」。记忆后端可替换,便于与现有记忆引擎组合部署。
关键数字
- 134 ms 双脑检索耗时(§3.3)
- 76.39 文本对话信息类任务平均分(§5.2)
- 68.73 ChatMem-Bench 平均分(语音助手长时程记忆)(§5.3 · Table 3)
- +1.89 人设类任务相对最强基线的提升(§5.2)
局限与疑问
- 主要语音评测由作者构建,大模型裁判打分。
- 训练语料基于合成用户,真实分布可能不同。
- 未披露真实部署的规模和效果数据。
- 人设类提升幅度较小(+1.89)。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。