先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.16157
FreeToken:在个人电脑上跑前沿规模的 MoE 模型
FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
Shuo Yang,Xiaoze Fan,Melissa Pan,Haocheng Xi 等 11 位作者 · 2026-08-17
一张工作站显卡跑 753B:把整台机器当成弹性推理平台
打开交互式解读 →三个要点
- 问题:前沿开放权重模型越来越多,但部署仍默认依赖数据中心。Agent 负载的执行模式不断变化,个人机器的 CPU、GPU、内存比例又各不相同,固定的卸载策略很难适配。
- 方法:围绕模型布局与加载、专家驻留、CPU—GPU 协同执行、Agent 状态复用和运行时内存管理协同设计整套服务栈,持续把计算和模型状态映射到当前实际可用的资源上。
- 结果:支持 20 多个 MoE 模型,从 8 GB 笔记本显卡跑 35B、游戏台式机跑 284B,到单张工作站显卡跑 753B 的 GLM-5.2。在 RTX 5090 上解码吞吐比现有端侧方案高 1.5–2.3 倍,多轮 Agent 负载下速率保持在单轮的 12% 以内(作者自报)。
753B 单张工作站显卡可运行的模型规模(GLM-5.2)
适合谁读:做本地 AI、私有化部署和开放权重分发的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。