先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.01591

StudentSim:为每个学生训练一个「数字分身」,用来训练 AI 家教

StudentSim: Training LLM-based Student Simulators
Ke Yang,Chenglong Wang,Michel Galley,Chandan Singh 等 7 位作者 · 2026-09-01

既要像这个学生,也要听得进老师的话:两项都超过 GPT-5.4 扮演

打开交互式解读 →

3 分钟版

问题 现有学生模拟器只覆盖一半需求:知识追踪类模型能拟合学生行为,但消化不了老师的解释和纠正;提示大模型扮演学生能流畅回应指导,却不能可靠复现被模仿学生的真实水平。

思路 两阶段训练:阶段 1 在某领域所有学生的汇总数据上训练一个基础模拟器,学共性(常见错误、回答格式、从指导到改正的路径);阶段 2 从基础模拟器出发,只用某个学生自己的记录做专门化,每人一个模拟器。用行为保真度 F(像不像这个学生)和指导响应度 R(听了指导会不会改)两项指标评测。

结果 在覆盖三个领域 60 名学生的 StudentSimEval 上,逐人模拟器两项指标都超过 GPT-5.4。象棋中 F=0.51、R=0.91,GPT-5.4 为 0.23 和 0.72。用它做奖励训练的象棋家教,专家评定的准确率 90.5%,无 RL 基线 75.7%,GPT-5.4 模拟器奖励 71.6%。

所以呢 一个忠实且会响应的用户模拟器,可以直接变成训练产品的奖励信号。目前只建模「一步更新」,学生长期的学习与遗忘过程尚未覆盖。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。