Command Palette
Search for a command to run...
DeepTutor:迈向智能体驱动的个性化辅导
DeepTutor:迈向智能体驱动的个性化辅导
Bingxi Zhao Jiahao Zhang Xubin Ren Zirui Guo Tianzhe Chu Yi Ma Chao Huang
DeepTutor 个人学习助手
摘要
教育是大语言模型(LLM)最具前景的现实应用领域之一。然而,当前的 LLM 依赖静态的预训练知识,缺乏对个体学习者的适应能力,而现有的检索增强生成(RAG)系统在提供个性化、引导式反馈方面存在不足。为弥合这一差距,我们提出了 DeepTutor,一个完全开源的智能体框架,将基于引文支撑的问题辅导与难度校准的题目生成统一起来。其混合式个性化引擎将静态知识锚定与动态学习者记忆相结合,使每次交互都能持续适应学生不断变化的需求。同一套个性化基础进一步扩展到自适应学习工作流、交互式教材和主动式多渠道辅导智能体。为评估个性化辅导,我们引入了 TutorBench,一个交互式基准,其中包含基于五个领域大学水平课程定制的学习者画像。我们还提出了一种基于 LLM 的第一人称交互评估协议,通过画像驱动的学生模拟器进行评估。在既有基准上的补充评估,结合人类对齐和消融研究,证实了该框架的稳健性和通用性。结果表明,DeepTutor 将个性化指标平均提升了 10.8%,并在五个骨干模型上将通用智能体推理能力增强了 29.4%。
一句话总结
香港大学的研究者提出 DeepTutor,一个开源 agentic 框架,通过混合个性化引擎将基于引文的问题辅导与难度校准的题目生成统一起来,该引擎耦合了静态知识锚定与动态学习者记忆,将个性化指标提升 10.8%,并在五个骨干模型上将 agentic 推理能力提升 29.4%。
核心贡献
- DeepTutor 是一个开源 agentic 辅导框架,通过混合个性化引擎将基于引文的问题辅导与难度校准的题目生成统一起来,该引擎耦合了静态知识锚定与基于轨迹森林的动态学习者记忆。
- TutorBench,一个以学生为中心的基准,包含有源材料锚定的学习者画像和第一人称交互模拟器,在五个大学学科的多轮对话中评估个性化辅导。
- DeepTutor 将个性化辅导质量平均提升 10.8%,并在五个骨干模型上将通用 agentic 推理能力提升 29.4%,人类对齐和消融研究证实了知识锚定与学习者记忆的互补作用。
引言
有效的人类辅导将诊断、支架式解释和针对性练习整合为一个持续的反馈循环。当前基于 LLM 的教育系统将问题辅导和题目生成视为分离的、任务局部的工作流。它们缺乏对学习者的细粒度、不断演化的模型,只追踪粗略的技能清单,而非揭示学生如何犯错的推理轨迹。这种碎片化意味着辅导轨迹不会影响下一个练习项目,而练习结果也不会更新未来的解释。作者引入 DeepTutor,一个 agentic 框架,通过共享的个性化引擎将问题辅导和题目生成统一起来。DeepTutor 使用轨迹森林,一种将交互历史提炼为不断演化的学习者画像的层次化记忆,形成一个闭环,其中每次交互都使下一次交互个性化。作者还构建了 TutorBench,一个以学生为中心的基准,包含跨五个大学学科的第一人称交互评估,以端到端地测试自适应行为。
数据集
作者引入 TutorBench,一个为交互式辅导评估设计的数据集,其中每个条目将一个详细的学习者角色与基于源材料的知识缺口配对。
数据集组成与来源
- TutorBench 利用了五个学科的 30 个知识库:人文学科、科学、工程、商业和前沿研究。
- 源材料包括大学水平的教科书和研究论文,它们被索引到一个双表示知识库中,并组织成一个领域层次结构。
每个子集的关键细节
- 对于每个知识库,使用初级、中级和高级作为起点实例化三个学习者画像,共产生 90 个画像。
- 每个画像都锚定在教育背景、学习目的和细粒度的逐主题掌握状态:熟知、部分了解、未知。
- 对于每个画像,从源页面中抽样生成三种类型的锚定知识缺口:误解、不完全理解和缺失知识。
- 每个缺口包括一个表现(学生如何展示它)和正确的理解(保留用于评估)。
- 经过拒绝采样后,每个画像保留恰好三个交互任务,总共产生 270 个任务。
- 任务涵盖概念理解、问题解决、应用和比较导向的格式。
- 所有条目都带有三个源锚定的知识缺口,每个缺口都锚定在源材料的具体页面上。
处理与过滤
- 交互任务围绕选定的缺口使用拒绝采样生成,该过程验证缺口连贯性、任务-缺口对齐和对话自然性。
- 所有生成的画像和任务在纳入前都经过最终的人工审核,标注者检查事实正确性、画像合理性、缺口-任务一致性和教学自然性。
论文如何使用数据
- 在评估期间,所有辅导系统都接收相同的任务接口和对相同源知识库的访问。
- 学习者画像和缺口表现初始化一个学生模拟器,而正确的理解则对辅导系统隐藏,仅用于评判。
方法
作者提出 DeepTutor,一个通过共享的混合个性化引擎将问题辅导和题目生成统一起来的框架。该引擎将课程知识 K 与不断演化的学习者画像 D=(Ds,Dw,Dr) 耦合,在每个 agent 步骤之前组装一个个性化上下文 Cmem。问题辅导通过调查、引导式求解和迭代写作进行,而题目生成则将想法选择与验证构建分开。
混合个性化引擎依赖于两种互补的上下文形式:领域专业知识与学习者感知。为了支持异构的课程材料,作者实现了静态知识锚定(SKG),将源文档分解为原子内容单元。这些单元通过双索引检索基底进行索引。知识图谱 G 组织结构和上下文关系,而稠密编码器将单元投影到嵌入索引 B 中。在查询时,图遍历和稠密搜索候选集通过倒数秩融合进行融合,以产生领域锚定 Crag。
同时,动态个人记忆(DPM)通过轨迹森林 F 捕获学习者参与。森林中的每棵树将一个辅导交互记录为一个多分辨率工件,组织为三个层次:会话级摘要、中间规划单元和细粒度执行记录。一个程序化的 TraceToolkit 允许 agent 搜索、列出和读取轨迹。专门的记忆 agent 主动查询此工具包以更新学习者画像 D,该画像由会话历史 Ds、有证据支持的弱点清单 Dw 和教学自我反思 Dr 组成。
对于个性化问题辅导,作者将过程分解为三个阶段以管理上下文和推理深度。在个性化调查阶段,一个规划器将学生问题分解为元问题,并从 K 和 F 中收集证据。它产生一个辅导计划 P=⟨s1,…,sK⟩,由针对学习者缺口的具体子目标组成。在逐步引导式求解阶段,一个求解器分析每个子目标 sk 并使用共享工具套件执行操作。自我笔记和层次压缩等机制管理推理上下文,如果计划证明不充分,则进行自适应重新规划。最后,在基于证据的迭代写作阶段,一个写作者提取结构化证据,并通过精炼轮次构建答案。学习者上下文 Cmem 将解释深度引导至学习者的最近发展区。
个性化题目生成管道将想法选择与构建分开。在个性化想法生成阶段,一个想法 agent 映射围绕某个主题的概念景观,以 Crag 和 Cmem 为条件。它产生指定目标概念和格式的候选想法,一个评估器将其过滤为结构化模板。在评论引导的生成阶段,一个生成器产生问题-答案-解释三元组 (qi,ai,ei)。一个结构分离的验证器检查事实正确性和教学合理性。失败的配对会收到诊断反馈并重新生成。
这些组件形成一个自我强化的循环,其中交互更新轨迹森林和画像 D。辅导期间诊断出的弱点传播到 Dw 以塑造未来的题目生成,而在生成题目上的表现则细化 Ds 和 Dr。
作者进一步扩展此架构,将混合个性化引擎视为可复用的基底,用于更广泛的自适应学习。
此基底支持一个单一的 agent 循环,驱动诸如 Chat、Solve 和 Mastery Path 等能力。它利用跨表面记忆、可插拔知识库引擎、可安装技能和可咨询的子 agent。诸如 Deep Research、Visualize 和 Co-Writer 等扩展复用此共享基础设施,而不是实例化单独的学习者模型。这种设计确保合成、表示、练习和表达保持耦合到相同的学习者感知上下文,使系统能够从局部辅导轮次扩展到全面的自适应学习过程。
实验
评估采用第一人称交互协议,使用模拟学生和个性化评分标准,在十个维度上评估多轮辅导,结果显示 DeepTutor 优于基线辅导系统,在个性化、生动性和逻辑深度方面增益最为显著。跨领域分析显示各学科质量一致,而人类偏好研究证实了自动评估与人类判断之间的高度对齐。消融实验表明,静态知识锚定和动态个人记忆发挥互补作用,锚定提供证据基础,记忆实现学习者适应。最后,调查-求解-写作支架泛化到 agentic 问题解决,即使没有个性化,也能提升跨不同基准的性能。
个性化基底通过复用共享的 agent 循环、跨表面记忆和可插拔知识引擎,使多样化的系统扩展成为可能,避免了碎片化的学习者模型。扩展涵盖能力运行时,如深度研究和可视化,长期学习表面,如掌握路径和协同写作,以及通过伙伴 agent 的多渠道部署。这种统一架构允许每个扩展继承锚定和个性化,而无需构建并行系统。Deep Research、Visualize 和 Subagent 能力复用与核心辅导循环相同的查询分解、工具执行和对话上下文。Mastery Path 和 Co-Writer 表面利用共享的学习者画像、弱概念追踪和知识库锚定,而不是维护单独的学生模型。Book Engine 通过复用基底的输入快照和概念图,将先前的交互、源探索和能力输出组合成交互式书籍。伙伴 agent 将能力扩展到网络之外的主动渠道,同时共享相同的人物角色、技能和调度基础设施。
DeepTutor 显著优于所有基线辅导系统,在整体质量上相对于 Naive Tutor 实现了 10.76% 的相对提升。其他系统——CoT、Self-Refine 和 ReAct——与 Naive Tutor 相比仅产生微小差异,整体质量变化在 ±1.13% 以内。增益在生动性、个性化和锚定性方面最为显著,反映了自适应个性化和知识锚定的影响。DeepTutor 达到最高的整体质量得分(3.91)和最大的相对增益(+10.76%),而基线辅导系统保持在 Naive Tutor 的 1.13% 以内。生动性显示出最大的差距:DeepTutor 得分为 4.81,远高于次佳基线(3.94),表明解释更具吸引力。所有基线的练习质量指标都明显较低,锚定性约为 2.5,但 DeepTutor 将锚定性提升至 2.96,并改善了所有练习维度。消融分析显示,移除静态知识锚定会降低来源忠实度和锚定性,而移除动态个人记忆会降低个性化和适配度,证实了它们的互补作用。
将调查-求解-写作支架添加到多个骨干模型上,在 STEM 推理、通用 agent 任务和长上下文基准上一致地提升了 agentic 问题解决能力,即使个性化模块被禁用。相对增益平均在 26% 到 32% 之间,证明了该支架在个性化辅导之外的通用效用。最大的绝对提升出现在 LiveBench 和 GAIA 上,包括在最难的 GAIA 难度级别上的增益。该支架在所有测试的骨干模型上产生一致的相对提升,平均增益范围从 25.69% 到 32.03%。性能提升广泛,提升了每个基准的得分;最显著的绝对跳跃发生在 LiveBench 和 GAIA 上,整体准确率和最难级别性能均大幅上升。
评估首先验证了一个统一的个性化基底,让多样化的扩展(深度研究、掌握路径、协同写作、伙伴 agent)从共享循环中继承锚定和学习者记忆,避免了碎片化的模型。人类评估随后显示,构建于此基底之上的 DeepTutor 显著优于朴素和基线辅导系统,在生动性、个性化和锚定性方面增益最大;消融证实静态知识锚定和动态个人记忆发挥互补作用。最后,调查-求解-写作支架在多个骨干模型上针对 STEM、agent 和长上下文基准进行了测试,即使没有个性化,也展示了一致的 26–32% 相对提升,证明了其对 agentic 问题解决的通用效用。