先手 SENTE · 周报阅读清单 · 速读 · arXiv 2610.12137
如何证明「你的模型是蒸馏我的」:蒸馏推断初探
Poster: A Preliminary Study of LLM Distillation Inference
Edward Chen,Yuntao Du · 2026-10-08
用影子模型做假设检验,给「被偷蒸馏」出具 p 值
打开交互式解读 →三个要点
- 问题:有人用你的闭源大模型的输出训练自己的模型(未授权蒸馏)。2026 年 2 月 Google 与 Anthropic 都报告此类攻击激增。现有方法只给相似度打分或排名,给不出执法需要的统计保证。
- 方法:把它变成假设检验——训练两组「影子模型」:一组学教师的推理过程(模拟蒸馏),一组只学参考答案(模拟独立训练);看嫌疑模型预测教师推理文本的能力更像哪一组,并换算成校准过的 p 值。关键是把整套审计集的证据聚合成一个统计量,单条样本的信号太弱(AUC 仅 0.67)。
- 结果(初步):教师 Qwen2.5-7B、嫌疑模型基于 Llama-3.2-3B,显著性水平 0.02 下检出全部蒸馏模型、从未误判独立模型。局限:需训练大量影子模型,并假设审计集在嫌疑方训练数据里、训练方式与影子相同。
1.0 真阳性率(显著性水平 0.02)
适合谁读:闭源模型厂商的法务与安全团队、模型 IP 保护与审计创业公司;关注「蒸馏争议」对中国基座模型估值影响的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。