先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.26005

VoiceMem:给实时语音助手装上「左右脑」记忆

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
Zhifei Xie,Jiaqi Lang,Ze An,Yifan Zhao 等 10 位作者 · 2026-08-26

左脑记事实、右脑记情绪,检索只要 134 毫秒,藏在对话停顿里

打开交互式解读 →

3 分钟版

问题 双工语音模型等对话系统缺少流式、准确、有共情的记忆。检索候选多(如前 100 条)会撑爆语音模型有限的上下文,只取前 5 条又容易漏掉相关记忆;传统记忆管线 2–3 秒的延迟也破坏自然的轮流对话。

思路 左脑:在 Mem0 存储之上建一个轻量的两级语义索引(schema 做粗路由、实体定位具体的人和事),让很小的检索预算也能拿到语义密集的候选。右脑:用独立与跨实体的人设节点建模「这个人」,并做短期与长期的情感归因。流式检索分四阶段:用户说话时实时转写并匹配实体;静默 200 毫秒时预判要回复并扩展图;最后只剩后端检索。

结果 文本对话的信息类任务平均 76.39,比其存储后端 Mem0 高 24.12 分;人设类比最强基线 MemOS 高 1.89 分。在作者构建的长时程语音助手记忆基准 ChatMem-Bench 上平均 68.73,MemOS 为 53.95。检索耗时 134 毫秒,在常见 500 毫秒语音活动检测阈值内。

所以呢 收益来自「更密集的候选池」而不是「更大的候选池」。记忆后端可替换,便于与现有记忆引擎组合部署。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。