先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.14973
PhysBrain 1.5:从视觉语言模型到「物理基础模型」
PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models
DeepCybo Team,Yu Bin,Haipeng Cao,Zheng Chang 等 54 位作者 · 2026-09-14
看懂环境、生成动作、预测下一帧,一个 8B 模型全包
打开交互式解读 →三个要点
- 思路:围绕「观察—交互—环境变化」的物理闭环,把三种能力放进同一个学习框架。从通用视觉语言模型出发,把语言回答、末端执行器运动和稠密视觉目标都编码成离散序列,用自回归下一 token 预测统一训练。
- 数据:预训练中的具身监督完全来自人类交互视频,以任务为中心切分片段,把语义与空间上下文和恢复出的运动、后续观察配对;再用人类示范、机器人轨迹和仿真经验的混合数据做监督微调。
- 结果:在 28 个具身理解基准上,8B 模型平均 72.5 分,作者称刷新开源最优,与 GPT-6-Astra、Gemini 3.6 Flash 等闭源模型相当,并在 14 个基准上取得开源最好成绩。动作生成和未来场景预测目前只给出定性示例。
72.5 28 个具身理解基准平均分(8B 模型)
适合谁读:做机器人「大脑」模型、具身数据与家用/工业机器人的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。