Command Palette
Search for a command to run...
K12-KGraph:面向教育大语言模型基准评测与训练的课程对齐知识图谱
K12-KGraph:面向教育大语言模型基准评测与训练的课程对齐知识图谱
Hao Liang Qihan Lin Zhaoyang Han Xiaochen Ma Zhen Hao Wong Meiyi Qiang Linzhuang Sun Wentao Zhang
摘要
大语言模型(LLM)正越来越多地部署于 K–12 教育场景,然而现有基准(如 C-Eval、CMMLU、GaokaoBench 和 EduEval)仅衡量模型能否回答考试题目,即事实性回忆。有效的教育人工智能还需要课程认知:对知识如何被组织并以可视化方式呈现的结构化理解,包括先修关系链、概念分类体系、实验与概念之间的关联以及教学序列。当前的基准既未探测课程认知,当前的指令微调数据也未显式教授课程认知。为弥合这一缺口,我们提出了 K12-KGraph,一个从人民教育出版社官方教材中抽取的课程对齐知识图谱,覆盖小学、初中和高中的数学、物理、化学和生物学科,包含九种节点类型(Book、Chapter、Section、Concept、Skill、Experiment、Exercise、Figure、VisualElement)和十四种关系类型,横跨课程结构与视觉基础。基于这一单一图谱,我们衍生出两种互补资源:K12-Bench,一个包含 23,640 道多选题的基准,涵盖五个图谱衍生的任务族(Ground、Prereq、Neighbor、Evidence 和 Locate),共同探测课程认知;以及 K12-Train,一个知识图谱引导的有监督微调语料库,包含 7,335 个样本(K12-Train-Full),其中含 2,267 个纯文本问答对(K12-Train-Text)和 5,068 个多模态视觉问答对(K12-Train-MM)。实验揭示了一个明显的差距和一条明确的补救路径:在 K12-Bench 上,即使强大的闭源模型(Gemini-3-Flash)也仅达到 57% 的精确匹配率,强大的开源模型(Gemma-4-31B-IT)仅为 46%,其中 Prereq 和 Neighbor 任务难度最高;然而,我们的训练实验表明,来自 K12-Train 的领域特定监督能够有效解决这一局限。对于 LLM,在严格匹配的 2,300 样本有监督微调预算下,K12-Train-Text 在 GaokaoBench 和 EduEval 上均一致优于八个主流指令微调语料库(OpenHermes、Infinity、UltraChat、WizardLM、DataFlow、LMSYS、SmolTalk、Tulu-3)的等规模子集,展示了结构化课程数据的样本效率。对于 VLM,K12-Train-Full 在使用比完整 DataFlow 和 WizardLM 基线更少样本的情况下,在 Gaokao-MM、MDK12-medium 和 K12Vista 上取得了所有对比训练配置中的最佳整体性能,并一致优于 K12-Train-Text 和 K12-Train-MM,显示了文本与视觉监督的互补性。我们发布了该图谱、基准、训练数据及完整的构建流程。
一句话总结
北京大学等机构提出了 K12-KGraph,一个从人教版教材中提取的、与课程体系对齐的知识图谱,覆盖小学、初中、高中的数学、物理、化学、生物四个学科,包含九种节点类型(Book, Chapter, Section, Concept, Skill, Experiment, Exercise, Figure, VisualElement)和十四种关系类型;同时发布了 K12-Bench,一个包含 23,640 道多选题的基准测试,通过五类任务族(Ground、Prereq、Neighbor、Evidence 和 Locate)评估课程认知能力;以及 K12-Train,一个由知识图谱引导的、包含 7,335 个样本(2,267 个纯文本样本和 5,068 个多模态样本对)的微调语料库。实验表明,即使是强大的闭源和开源模型,在 K12-Bench 上的精确匹配准确率也分别仅达到 57%(Gemini-3-Flash)和 46%(Gemma-4-31B-IT),其中 Prereq 和 Neighbor 任务最具挑战性。然而,在 GaokaoBench 和 EduEval 上,使用来自 K12-Train 的领域特定监督始终优于使用同等大小的八个主流指令微调语料库(OpenHermes, Infinity, UltraChat, WizardLM, DataFlow, LMSYS, SmolTalk, Tulu-3)子集进行微调的效果。对于视觉语言模型,K12-Train-Full 在 Gaokao-MM、MDK12-medium 和 K12Vista 上取得了最佳综合性能,证实了具有结构基础的课程数据的样本效率和互补性。
核心贡献
- 该论文提出了 K12-KGraph,一个从中国官方 K-12 教材中提取的、与课程体系对齐的知识图谱,编码了跨四个学科的结构性关系,如先修链条、概念分类法和视觉基础,包含九种节点类型和十四种关系类型。
- 该工作构建了 K12-Bench,一个包含 23,640 道多选题的基准测试,通过五个源自图谱的任务族评估课程认知能力。实验表明,即使是强大的模型也获得了较低的精确匹配分数(例如,Gemma-4-31B-IT 为 46%),其中先修和邻居任务尤其具有挑战性。
- 该论文开发了 K12-Train,一个由知识图谱引导的有监督微调语料库(包含纯文本和多模态划分的 7,335 个样本),并展示了其样本效率:在严格匹配的 2,300 个样本预算下,其纯文本子集在 GaokaoBench 和 EduEval 上的性能优于八个主流指令微调语料库,而完整语料库在多模态教育基准上超越了规模更大的通用数据集,揭示了文本和视觉监督的互补价值。
引言
大型语言模型在 K-12 考试基准上的表现已达到或超过人类水平,但这些基准仅评估事实回忆能力。它们忽略了课程认知,即一位经验丰富的教师所具备的结构化理解:为何一个主题必须在另一个之前学习,实验如何与理论相联系,以及每个概念在章节和教科书中的位置。这一差距导致当今的教育 AI 无法复现支撑真正辅导的教学推理。作者通过构建 K12-KGraph(一个从中国官方 K-12 教材中提取的大规模、多模态知识图谱)来解决这个问题。基于这个单一图谱,作者构建了一个基准测试(K12-Bench),用于衡量跨五个任务族的课程推理能力,以及一个训练集(K12-Train),用于显式教授结构化知识。实验表明,即使当前最强大的模型在课程认知方面的表现也仅达到中等水平,而图谱引导的微调具有显著的样本效率,在下游教育测试中表现优于主流指令微调语料库。
数据集
作者从 K-12 教材中构建了一个异质知识图谱 K12-KGraph,随后衍生了两个下游资源:一个多选基准测试(K12-Bench)和一个有监督微调数据集(K12-Train)。
K12-KGraph:基础知识图谱
- 来源: 来自教材 PDF 的、经过 OCR 解析的结构化 Markdown。目录用于将内容分割成按章节划分的文件;每张图片与其章节文本相关联。
- 模式: 9 种节点类型(包括 Concept, Skill, Experiment, Exercise, Figure, VisualElement, Book)和 14 种边类型。节点带有类型化属性:例如,一个 Concept 包含名称、定义、重要性以及可选的公式/别名;一个 Experiment 包含仪器、学生操作标识、过程、现象和结论。容器节点(Chapter, Section)及其关系是结构性的,不包含在汇总统计中。
- 构建流程: 五个自动化阶段。
- 基于 OCR 的解析,生成 Markdown。
- 章节分割和图文对齐。
- GPT-5.2 以 JSON 格式提取节点和边,附带证据引用和置信度分数。
- 自底向上合并:在书籍层面去重同名的 concepts/skills 并重映射边,然后在学科层面进行调和(例如,不同年级的“速度”)。经过轻量级名称标准化匹配后进行专家审查,以解决跨书籍的别名问题。
- 对
is_a和prerequisites_for子图进行深度优先的循环检测;通过人工解决确保形成有效的有向无环图。
- 质量控制: 所有三元组均由 12 位领域专家进行人工审核(Fleiss’ κ = 0.84)。收集了边的置信度字段和指向教材摘录的证据反向链接。提取提示将输出限制为“真正重要、清晰呈现”的知识,并主动抑制幻觉。
K12-Bench:多选课程基准
- 设计: 23,640 道多选题,涵盖五个任务族(9 个子任务):知识定位 (Knowledge Grounding)、先修推理 (Prerequisite Reasoning)、邻居推荐 (Neighbor Recommendation)、实验证据链 (Experiment Evidence Chain) 和跨章节索引 (Cross-Chapter Indexing)。每道题列出四个候选项,模型必须输出完整正确的标签集合(基数为 1 到 3)。问题和干扰项确定性地从 K12-KGraph 子图中派生;正确答案是真实的图谱邻居,干扰项从结构上邻近但非答案的节点中采样(例如,2 跳邻居或分类学上的兄弟节点)。
- 质量过滤: 字符级 3- gram 余弦相似度用于移除表面形式上的近似重复项;GPT-5.2 教学过滤器丢弃与任何正确答案同义的干扰项。分层抽查发现 98.4% 的采样项目完全正确。因为 K12-Bench 直接派生自经过验证的图谱,基准质量与图谱质量紧密耦合。
- 使用方式: 模型仅接收问题文本(没有图谱上下文),以探查其参数化的课程知识。
K12-Train:知识图谱引导的有监督训练数据
- 生成路径:
- 基于节点的问答:Qwen3-235B-A22B 根据节点的类型化属性(例如,Concept 的定义/公式,Skill 的操作步骤,Exercise 的题干和推理)生成问答对。监督内容教导节点内容。
- 基于边的问答:相同的 LLM 在特定关系模板(例如,对于
prerequisites_for是“为什么必须在学习 B 之前学习 A?”)的提示下,生成阐述该关系的问答对。监督内容教导图谱结构。 - 练习评估问答:对于
tests_concept和tests_skill边,直接填充确定性模板,确保完全的事实基础。
- 裁剪与过滤: 每个节点的属性集被裁剪为仅包含与目标问答类型相关的字段。在提示生成前,置信度低于指定阈值的边会被过滤,以防止 LLM 偏离到不相关的属性上。
- 划分与组成:
- K12-Train-Text(2,267 对):纯文本问答对,通过从知识图谱派生的池中进行随机下采样实现来源平衡。包括 450 个 Exercise 示例(带逐步推理)、356 个测试边样本、695 个基于节点的问答对(来自 Concept/Skill/Experiment)和 766 个基于关系的问答对(来自
is_a、prerequisites_for、relates_to、verifies)。 - K12-Train-MM(5,068 对):需要视觉输入的基于关系的问答对,涵盖
illustrates、refers_to、requires_figure和supports_edge,基于边置信度进行选择(前三者为 1.0,requires_figure为 0.8)。此划分控制了数据质量,并缓解了原始知识图谱池中的自然偏差。
- K12-Train-Text(2,267 对):纯文本问答对,通过从知识图谱派生的池中进行随机下采样实现来源平衡。包括 450 个 Exercise 示例(带逐步推理)、356 个测试边样本、695 个基于节点的问答对(来自 Concept/Skill/Experiment)和 766 个基于关系的问答对(来自
- 验证: 每个问答对都经过 JSON 结构、非空字段和语言一致性的检查。
- 使用方式: 两个子集都用于教育 LLM 的有监督微调;尽管规模不大,但纯文本分支因其结构性基础而显示出高效性。
方法
作者通过包含人在环中质量控制的五阶段自动化流程构建了 K12-KGraph。
首先,基于 OCR 的解析器将 K-12 教材 PDF 转换为结构化的 Markdown 文件,保留标题层级、数学公式、原始文本和图像资源。接着,目录解析器处理生成的 Markdown 文件以生成清单,并将内容分割成按章节划分的文件,将每张图片与对应的章节文本关联起来。
在核心知识提取阶段,作者通过包含模式感知指令的提示,引导大型语言模型为每个章节输出结构化的 JSON 节点和边。模型被要求从原始教材句子中输出证据引用,并为每条边提供置信度分数。提取提示明确抑制幻觉,将输出限制为真正重要且清晰呈现的知识。
提取完成后,按章节的图谱会自底向上合并。在书籍层面,分配全局唯一 ID,去重同名 concepts 和 skills,并重映射边。在学科层面,协调同一学科内不同书籍间的实体。最后,作者对 is_a 和 prerequisites_for 子图进行深度优先循环检测,以确保结构有效性,并人工解决任何违规情况,为分类和先修关系生成有效的有向无环图。所有提取的三元组都经过领域专家的人工验证,分级去重则利用轻量级名称标准化匹配后进行专家审查,以调和跨书籍的别名情况。
实验
评估首先在 K12-Bench 上对一系列开源和闭源 LLM 进行基准测试。K12-Bench 源自课程知识图谱的多选题集。结果显示,即使是最强大的模型也难以应对结构化的课程理解,尤其是在先修关系和邻居关系方面,而小型模型的表现接近随机。微调实验表明,在 K12-Train(一个涵盖基于节点和边推理的知识图谱引导数据集)上进行有监督训练,能在文本和多模态设置中持续提升模型在教育基准(如 GaokaoBench 和 EduEval)上的表现,并优于同等规模的通用指令微调数据集。这些提升源于结构化基础和课程对齐,其赋予的是可迁移的推理能力,而非单纯的事实记忆,这通过模型在非训练学科上的进步得到了证明,且纯文本和多模态监督来源是互补的。
图谱的文本部分涵盖数学、物理、化学和生物共 48 本教材。Concept 是所有学科中最常见的节点类型,而先修边、关联边和分类边构成了关系的主要部分。跨学科的 leads_to 边总数远超学科内的 leads_to 边总和,且实验节点仅出现在三个理科学科中,数学中不存在。Concept 在节点集中占主导地位,在每个学科中都远超 skills、exercises 和 experiments 的数量。先修边是最常见的关系类型,其次是关联边和分类边。数学子图中完全没有实验节点,而三个理科学科中均有。leads_to 边的总数主要来自跨学科,因为学科内总和不足 100。习题更频繁地与 concepts 链接,而非 skills,测试 concept 的边数量远超测试 skill 的边。
多模态知识图谱在数学学科中规模最大,包含的节点和边远超物理、化学或生物学。Concept-to-visual-element 边是所有学科中最丰富的关系类型,而引用边则在某些学科中极少或完全不存在。涉及 figure 和 visual-element 节点的边存在大量重叠,表明文本概念与视觉材料之间存在着密集的相互联系。数学占多模态组件中节点和边总数的一半以上,反映了其对图形和图表的更多使用。Concept-to-visual-element 边在多模态关系中占主导地位,构成了所有学科层面边总数的绝大部分。引用边极为稀疏;物理和生物完全没有,而数学和化学各自仅有几十条。与 figure 节点和 visual-element 节点相关的边的总和超过了边的总数,这表明大多数边同时涉及一个 figure 和一个 visual element。化学虽在各学科中拥有最少的节点数,却记录了最高的 illustrates 边数量,甚至超过了数学。
即使是最强大的闭源模型,在 K12-Bench 上也仅达到 57% 的精确匹配率,而开源模型则大幅落后,最佳开源模型也仅达到 46%。先修任务和邻居任务始终是最困难的,所有开源模型在这两项上的精确匹配分数均低于 19%,表明其缺乏对课程关系的结构性推理能力。总体 F1 分数相对较高,最高约达 73%,这说明模型经常能产生部分正确的答案集,但难以完全捕捉到正确的选项组合。随机基线的总体精确匹配率为 6.7%,为多选题猜测提供了一个下限。LLaMA-3-8B-Instruct 的总体精确匹配率仅为 7.2%,几乎与随机基线无异,表明其不具备课程知识。先修任务和邻居任务最具挑战性:最佳开源模型在这两项任务上的精确匹配率均低于 19%,远低于其在证据和定位任务上的表现。Ministral-3-14B-Instruct 以 37.5% 的总体精确匹配率和 67.4% 的 F1 分数领先开源模型,表明其经常做出部分正确的选择。最强的开源模型 Gemma-4-31B-IT 达到了 46.4% 的精确匹配率,但仍远低于最佳闭源模型的 57.1%。所有模型的总体 F1 分数最高约达 73%,这表明即使精确匹配率较低,模型也经常能识别出部分正确标签,但难以生成完整的正确答案集。
K12-Train-Text 在两个基础模型上都取得了最高的 GaokaoBench 总分,显著领先于最佳基线模型。经过课程结构化的训练提高了客观题和主观题的表现,而其跨学科迁移能力——即在无直接监督的情况下提升了语文和文数等学科的成绩——表明模型获得了可泛化的推理风格,而非仅仅是内容记忆。K12-Train-Text 在 Qwen3-4B-Base(1009.96)和 Llama3.1-8B-Base(625.49)上均取得了最高的总体总分,分别超过最强基线 +24.1 和 +32.4 分。在 Qwen3-4B-Base 上,K12-Train-Text 获得了最佳客观题得分率(81.8%)和主观题得分率(89.5%)。仅由数学、物理、化学和生物学子图合成的 K12-Train 进行有监督微调后,模型在语文和文数上取得了最高分,这证明了结构化推理的可迁移性。在同样 2,300 样本的预算下,这些收益在两个基础模型上保持一致,展示了课程结构化训练带来的稳健改进。
仅使用 2,300 个样本进行有监督微调后,K12-Train-Text 就在 EduEval 上为 Qwen3-4B-Base 和 Llama3.1-8B-Base 两个骨干模型取得了最高的总体平均分数,超越了最强基线,并在 Qwen3-4B-Base 上取得了最佳的 Ethics 表现。增益幅度虽小于在 GaokaoBench 上观察到的,但在不同架构间保持了一致性,证明了课程结构化训练的稳健迁移能力。在 Qwen3-4B-Base 上,K12-Train-Text 获得了最高的平均分数(66.76),略微领先于 WizardLM(66.70),并在所有配置中取得了最强的 Ethics 结果。在 Llama3.1-8B-Base 上,K12-Train-Text 达到了最高的平均分数(40.90),在相同训练预算下以近一分的优势超越了 OpenHermes(40.05)。这种改进模式在两个基础模型上均成立,表明即使在绝对收益小于 GaokaoBench 的情况下,课程结构化训练也能一致地迁移。
一个由 48 本数学和理科学科教材构建的课程知识图谱评估结构化推理能力,其中其文本部分由 concept 和 prerequisite 边主导,多模态部分由 concept-to-visual-element 边主导。在 K12-Bench 上,开源模型在先修任务和邻居任务上的表现接近随机,而即使是最佳的闭源模型也仅达到 57% 的精确匹配率,凸显了该基准的难度。在一小部分课程结构化训练样本(K12-Train)上进行微调,会在 GaokaoBench 和 EduEval 上带来一致的提升,包括对语文和文数的跨学科迁移,这表明模型获得了可泛化的推理风格,而非仅仅是内容记忆。