先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.25165
Ovis-Embedding:文本、图像、视频、音频共用一个向量空间
Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
Embedding Team · 2026-09-21
一套骨干做全模态嵌入,任意模态互搜
打开交互式解读 →三个要点
- 问题:通用检索需要把文本、图像、视频、音频放进同一个向量空间。常见做法是拼接各模态的独立编码塔,导致模态割裂。
- 方法:以预训练的 Qwen-omni 模型为骨干,用低秩初始化做对比学习;构建覆盖多模态和图文交错数据的语料,用「同源采样」组成任务一致的 batch 以获得更有信息量的负样本;训练时用 focal loss 强调难例、用基于相似度的蒸馏从多个专家迁移细粒度结构;推理时用低秩分解得到维度可调的紧凑向量。
- 结果:作者报告在 MMEB-v3、MMEB-v2、MVEB、MAEB、RTEB 上达到最优。Omni-3B 在 MMEB-v3 总分 58.46,并在六个模态组的汇总分上都排第一;VL-9B 在 MMEB-v2 五个任务组中领先四个。
58.46 Ovis-Embedding-Omni-3B 的 MMEB-v3 总分
适合谁读:做企业搜索、RAG、多模态内容库与推荐的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。