HyperAIHyperAI

Command Palette

Search for a command to run...

LLM
模型训练

StudentSim:训练基于大语言模型的学生模拟器

Ke Yang Chenglong Wang Michel Galley Chandan Singh Jeevana Priya Inala ChengXiang Zhai Jianfeng Gao

摘要

当 AI 导师能够根据每位学生的优势、不足和偏好的指导方式做出自适应回应时,其效用最大,但哪种指导对哪类学生有效是一个稀疏信号,从真实学生中收集既缓慢又昂贵。学生模拟器可以作为代理提供该信号,然而现有模拟器仅能满足部分需求:状态追踪模型能拟合学生的行为方式,却难以消化导师的解释或纠正;而被提示扮演目标学生的大语言模型虽能流畅地遵循导师指导,却无法可靠地复现所模仿学生的能力水平。我们提出 STUDENTSIM,一个训练框架,通过“集中训练后接个体学生专项微调”的两阶段流水线,将稀疏的个体学生数据转化为每位学生的个性化模拟器,使模拟器既能反映学生自身的回答,又能在导师指导下更新这些回答。为公平衡量这两种能力,我们构建了 STUDENTSIMEVAL,一个标准化评测协议,涵盖国际象棋、英语作为第二语言写作和数学三个领域共 60 名学生,数据源自公开学习者数据集,其去标识化的学生记录已共享用于研究。该协议对每种方法在行为保真度(F ↑,即模拟器匹配学生自身回答的程度)和指导响应度(R ↑,即模拟器在导师指导下更新回答的意愿)上进行评分,基于相同记录拟合方法并在相同留出记录上评分,使结果可直接比较;我们公开了构建和评测代码,以便他人能在同一基准上评测新方法并加以扩展。在所有三个领域中,我们的个体学生模拟器在这两项指标上均优于 GPT-5.4。例如在国际象棋中,STUDENTSIM 的 F 值达到 0.51、R 值达到 0.91,而 GPT-5.4 分别为 0.23 和 0.72,技能条件化的象棋走法预测模型 Maia2 则分别为 0.45 和 0.27。作为该框架亦能支持 AI 导师改进的概念验证,将训练好的 STUDENTSIM 用作导师模型强化学习的奖励,所得到的象棋导师被人类专家评价为比无强化学习基线和以 GPT-5.4 模拟器奖励进行强化学习训练的导师更准确、指导性更强且更具个性化。我们的代码可在 https://github.com/microsoft/StudentSim 获取。

一句话总结

微软研究院与伊利诺伊大学厄巴纳-香槟分校提出 STUDENTSIM,一种两阶段训练框架,首先汇集稀疏的个体学生数据,然后进行个性化特化,生成能够超越 GPT-5.4 和 Maia2 的个体化模拟器,在国际象棋、写作和数学任务上表现出更高的行为保真度和指导响应性,并且可以作为强化学习的奖励信号来改进 AI 导师。

核心贡献

  • STUDENTSIM 是一种两阶段训练框架,先汇集跨学生的数据用于共享预训练,再针对每个个体进行特化,从稀疏记录中生成每个学生的模拟器,实现高行为保真度和指导响应性。
  • STUDENTSIMEVAL 是一个标准化评估协议,涵盖 60 名学生,横跨国际象棋、第二语言英语写作和数学三个领域;在相同的留出记录上测量行为保真度(F)和指导响应性(R),使得任何学生模拟器都能进行公平比较。
  • 在强化学习训练导师时,使用训练好的 STUDENTSIM 作为奖励模型,得到的国际象棋导师被人类专家评估者评为比使用 GPT-5.4 模拟器奖励训练的导师或无 RL 的基线导师更准确、指导更好且更个性化。

引言

能够适应个体学习者的 AI 导师需要在多样化的学生交互上进行训练,但招募真实学生既昂贵又缓慢。学生模拟器可以提供可扩展的代理反馈,然而现有方法各自缺失一个关键需求:状态追踪模型能够捕捉学生的行为模式,但没有接收导师指导的输入通道;而基于 LLM 提示的模拟器能够响应指导,却无法可靠地复现特定学生的典型错误和优势。作者通过 STUDENTSIM 解决了这一缺口,该框架首先汇集许多学习者的记录来学习共享的领域模式,然后在每个个体的稀疏数据上进行特化。由此产生的模拟器既忠实于学生自身的回答(行为保真度),又能响应导师的纠正(指导响应性)。作者还引入了 STUDENTSIMEVAL,一个覆盖 60 名学生的标准化评估协议,涵盖国际象棋、第二语言英语写作和数学,并展示了其模拟器在两个维度上均优于状态追踪和提示 LLM 基线,并且可以作为奖励模型通过强化学习改进 AI 导师。

方法

作者通过两阶段训练来解决每个用户数据稀疏的挑战。

第一阶段涉及汇集训练。作者在所有学生汇集的数据上训练一个领域特定的基础模拟器。这一阶段学习跨学生的共享特征,例如常见的错误模式、领域内预期的回答格式,以及从自然语言导师指导到改变后的回答的路径。输出是每个领域一个单一的基础模拟器,展现出广泛的学生式行为,但尚未针对任何个体进行特化。

第二阶段聚焦于每个学生的个性化特化。这一阶段从第一阶段的基础模拟器初始化,并仅使用该学生自己的记录回答和导师指导交互来适应特定学生。每个学生接受独立的特化,产生每个学生一个模拟器 MiM_iMi。这一阶段捕捉个体特定的特征,例如特定学生倾向于犯哪些错误,以及他们的行为如何响应特定形式的导师指导。两阶段方法确保学生行为的共享结构从汇集数据中可靠地学习,同时在不导致稀疏的个体学生记录过拟合的情况下捕捉个体特质。

为了优化 AI 导师,作者利用训练好的学生模拟器作为导师强化学习的奖励模型。

在此设置中,每个回合从真实学生记录中抽取一个国际象棋问题 QQQ 和学生记录的走错棋步 AprevA_{\mathrm{prev}}Aprev。导师策略提出指导,冻结的学生模拟器发出修正后的棋步 ArevA_{\mathrm{rev}}Arev。奖励来源于棋步质量的提升,通过预计算的 Stockfish 查找 ArevA_{\mathrm{rev}}Arev 相对于 AprevA_{\mathrm{prev}}Aprev 来计算。所有条件共享相同的导师策略和监督微调起点,使用 GRPO 进行优化。

作者的奖励模型使用汇集的第一阶段学生模拟器,该模拟器捕捉群体层面的学生行为,确保导师被优化以改进对一般学生的指导。此外,两个可扩展的奖励头被挂载在同一模拟器骨干上。个性化头评分解释是否遵循预期的教学风格,感知头惩罚错误描述棋盘的棋局状态的解释。这两个头作为棋步质量项的乘法门控。由于训练好的模拟器骨干已经编码了学生行为和棋局状态,这些轻量级线性探针能够有效地评分导师的事实基础和教学风格,使奖励在 AI 导师优化中切实有效。

实验

评估在国际象棋、第二语言英语写作和数学领域实例化学生模拟器框架,使用真实学生数据训练每个学生的模拟器,涵盖单轮行为和多轮指导响应性。行为保真度实验表明,训练好的模拟器通过捕捉个体学生独特的回答模式,优于所有基线;而指导响应性实验表明,模拟器能够有效地遵循导师指导,特别是在大型封闭模型失败的开放式推理模式下。随后,一个国际象棋概念验证使用模拟器作为导师强化学习的奖励模型,一项专家人类研究发现,该奖励产生的导师在准确性、指导质量和个人化方面比使用前沿 LLM 作为学生或无 RL 的基线评分更高,突显了忠实且响应性强的学生模拟器的实用价值。

各领域的训练数据规模差异显著:国际象棋使用 100,000 个汇集的第一阶段实例和 30 名第二阶段学生,每名学生 1,000 个实例;而第二语言写作和数学使用较少的第二阶段学生(15 名)和远更小的每名学生实例集(73 和 153 个实例)。所有领域共享 0.2 的多轮比例,每名学生的留出评估集在国际象棋中远更大(5,000 单轮,4,000 多轮),而第二语言写作(26,40)或数学(平均 66,59)则小得多。国际象棋有 30 名第二阶段学生,每名 1,000 个实例;而第二语言写作和数学仅有 15 名学生,每名学生不足 160 个实例。每名学生的留出单轮记录范围从国际象棋的 5,000 到第二语言写作的仅 26,反映了可用学生数据的领域差异。

训练好的 STUDENTSIM 模拟器在所有三个领域均实现了最高的行为保真度,优于领域特定的朴素基线和大型语言模型。在国际象棋中,它更准确地预测棋手走法;在第二语言写作中,它更好地匹配学习者的错误特征;在数学中,它更频繁地选择学生给出的确切答案,展示了对每个学生行为的捕捉。STUDENTSIM 的国际象棋走法预测准确率超越了专门的 Maia2 基线,并远超 GPT-4o 和 GPT-5.4,后者难以捕捉个体棋手风格。在数学中,STUDENTSIM 比 GPT-5.4 更频繁地选择学生的实际多项选择答案,而未训练的朴素基线则远远落后。

训练好的 STUDENTSIM 模拟器在国际象棋、第二语言写作和数学中均实现了最高的指导响应性,大幅超越朴素基线和大型闭源模型。在需要从问题或原理进行推理的开放式指导模式下优势最大,正如国际象棋苏格拉底式案例所示,只有训练好的模拟器推断出正确的棋步。这种响应性源于多轮训练,教会了真正的指导遵循,而不仅仅是复制提示。STUDENTSIM 在所有三个领域均优于 GPT-4o 和 GPT-5.4,在国际象棋和数学中优势最大。朴素基线在第二语言写作中表现出接近零的响应性,在国际象棋纠正中也有限,突显了在没有领域训练或语言输入的情况下任务的难度。在一个留出的国际象棋苏格拉底式场景中,一个 4B 训练模拟器从一系列引导性问题中正确推断出引擎最佳棋步,而 GPT-5.4 选择了一个错误的格子。导师通过问题提示推理的开放式指导模式揭示了 STUDENTSIM 与基线之间最大的差距。数学答案纠正中,STUDENTSIM 相比朴素基线大幅提升了响应性,展示了在导师推理后修正数值答案的强大能力。

在一个留出的国际象棋局面中,棋手用兵推进犯了错误,一个苏格拉底式提示暗示了一个强制性的后将军,但没有指明目标格子。STUDENTSIM 模型正确输出了引擎最佳棋步 f8b4,而 Maia2 复现了错误,GPT-5.4 提出了另一个不正确的后走法。在整个指导遵循测试集上,STUDENTSIM 达到了 0.91 的相关性,大幅优于 GPT-4o(0.77)、GPT-5.4(0.72)和 Maia2(0.27)。STUDENTSIM 遵循开放式指导并走出正确的 f8b4,而 Maia2 和 GPT-5.4 分别以 g5g6 和 f8f4 失败。在整个测试集上,STUDENTSIM 达到 0.91 的指导遵循相关性,远高于 Maia2 的 0.27 和 GPT-5.4 的 0.72。

使用训练好的学生模拟器作为 RL 奖励模型,得到的国际象棋导师在准确性、指导质量和个人化方面相比仅监督的基线和基于前沿语言模型作为学生模拟器的奖励均有大幅提升。相比之下,GPT-5.4 奖励产生了比无 RL 导师更严重的事实错误和更低的准确性,表明一个忠实、响应性强的模拟器是导师优化中实用且有效的奖励信号。STUDENTSIM 奖励达到了 90.5% 的准确率,相比无 RL 基线(75.7%)和 GPT-5.4 奖励(71.6%)有大幅提升,意味着误导性事实错误大大减少。指导质量在 STUDENTSIM 下最高(5 分制 3.31),而 GPT-5.4 奖励相比无 RL 仅有边际提升(3.08 对比 2.99)。个人化评分在 STUDENTSIM 下几乎翻倍(3.93),相比无 RL(2.80)和 GPT-5.4 奖励(2.42),反映了对苏格拉底式教学风格更好的适应。GPT-5.4 模拟器奖励相比无 RL 基线恶化了事实准确性和个人化,受到严重事实错误率显著更高的拖累。所有条件共享相同的导师策略、监督起点和 GRPO 优化,因此性能差异直接追溯到奖励模型的选择。

评估横跨国际象棋、第二语言写作和数学,具有领域特定的训练数据规模和留出集。STUDENTSIM 始终如一地实现最高的行为保真度,准确捕捉个体棋手走法、学习者错误特征和学生答案选择。它还展示了强大的指导响应性,特别是在开放式苏格拉底式场景中,它遵循推理链产生正确动作,而基线则失败。当用作强化学习的奖励模型时,训练好的模拟器产生了一个在准确性、指导质量和个人化方面大幅改进的国际象棋导师,而前沿语言模型奖励则降低了性能。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供