JOTO
联系我们
← AI 智库
知识图谱

北大等开源 K12-KGraph:从小学到高中的教材全部整合成知识图谱,既做bench又能训练

2026 年 7 月 27 日 · 知识图谱 · 10 分钟阅读

北大团队整合K12教材构建知识图谱,填补课程认知评测缺口,少量微调即提升教育大模型能力。 核心内容: 1. 现有教育大模型课程认知能力不足 2. K12-KGraph知识图谱构建方式与组件 3. 衍生评测与训练资源及应用效果

一句话讲清楚👉🏻 北大团队从人教版数理化生教材抽出课程结构知识图谱 K12-KGraph ,并据此做成评测集与训练数据:模型在「先学什么、和谁相关、实验验证什么」上明显偏弱;只用约 2300 条文本问答做微调,就能在高考与教育能力基准上超过等量主流微调语料。

  • 论文标题:K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

  • 论文链接:https://arxiv.org/abs/2605.09635

  • Github 链接:https://github.com/haolpku/K12-Dataset

  • 数据集链接:https://huggingface.co/datasets/lhpku20010120/K12-KGraph

  • 项目链接:https://haolpku.github.io/K12-KGraph-page/

大模型已经很会做 K-12 考题。 C-Eval 、 CMMLU 、 GaokaoBench 、 EduEval 上,前沿模型常能逼近甚至超过优秀考生。若只看分数,教育场景好像快被做完了。

课辅产品里更常见的卡点是:模型会解「求方程的解」,却排不出「这周该先补算术运算还是直接上方程」,也说不清某道题到底在考哪几个概念、哪套实验在验证哪条规律。论文把这类能力称为课程认知:理解知识如何组织、如何排序、如何被实验与插图支撑,而不只是记住孤立事实。

现有基准几乎不测这一点,主流指令微调数据也很少显式教这一点。缺口不在「再堆一堆题」,而在缺少一份能同时支撑评测与训练的课程结构资源。

一张课程结构图,同时支撑评测和训练

团队的做法是:直接从人教版小学到高中的数学、物理、化学、生物教材 PDF 出发,建成多种节点、多种连线的知识图谱 K12-KGraph 。图分两块:

■文本组件:概念、技能、实验、习题,以及节、章、书等容器;边刻画分类、先修、关联、实验验证、习题考查、出现位置、章节顺序等。■多模态组件:新增插图节点与视觉元素节点,边覆盖图内组成、视觉指称、图示解释、习题对图的依赖,以及「图为某条关系提供视觉证据」。

整图共 9 类节点、 14 类关系。因为边和节点都能追溯到教材原文,团队用同一张图派生两套资源:

1.K12-Bench : 23,640 道多选题,考查课程结构理解;2.K12-Train : 7,335 条监督微调样本(其中文本 2,267 、多模态视觉问答 5,068 )。

Figure 1 : K12-KGraph 五阶段流水线: OCR 解析、按目录切节、按预定结构抽取、自下而上合并、拓扑校验与人工复核。

构建流程也按教材真实形态设计。 MinerU 把 PDF 转成保留层级与公式的 Markdown ;目录解析切成节级文件并挂上插图;再对每一节用带结构约束的提示(论文使用 GPT-5.2 )抽出节点、边,以及证据句或置信度;随后在书级、学科级做去重与别名对齐;最后对分类边与先修边做环检测,保证这两类关系不能绕圈。抽取提示明确要求「只保留教材里真正重要、表述清楚的内容」,边上尽量带回原文证据;全部三元组再经学科合格标注员复核。

图里到底有什么

文本侧覆盖 48 册教材:合并去重后约有概念 6,579 、技能 1,364 、实验 652 、习题 1,171 ;先修边就有 3,705 条。数学没有实验节点,因此「实验验证」类边为 0 。这是课程本身的结构,不是采样漏了。

Table 1 :文本组件按学科统计。化学概念与先修边最密,数学实验为空。

多模态侧另有插图节点约 7,388 、视觉元素约 10,203 。几何图、实验装置、习题附图经常直接给出定义、证据或解题条件。

Table 2 :多模态组件统计。数学插图与视觉元素最多,与教材图示密度一致。

质量上, 12 名学科合格标注员的整体一致性较高( Fleiss’ κ = 0.84 ); K12-Bench 分层抽检中, 98.4% 的样本被判定为完全正确。题目对不对,最终落回图对不对。这比「再让模型写一批选择题」更容易定位错误边。

五种题,专测结构而不是回忆事实

直观一点:学「一元一次方程」前必须先会哪些内容?某道习题在考哪些概念?某实验在验证哪个概念? K12-Bench 用五类题把这些问题问死,并补上「知识点第一次出现在哪一章」。

题目与干扰项都由程序按图规则生成,不是让大模型自由编题。模型只看到题干和四个选项,看不到知识图谱,因此测的是闭卷时是否真懂课程结构。每题正确选项数在 1–3 之间,输出必须和标准答案集合完全一致;少选、多选都算错,所以 exact match (完全匹配,下称 EM )很严。 57% 的 EM 并不等于「差不多对了一半选项」。

五个任务族各自对应一类关系:

任务族在问什么
Ground (考点锚定)这道习题考查哪些概念/技能,或某个概念对应哪些习题
Prereq (先修推理)学某概念前必须掌握的一串前置知识,或它的直接后继
Neighbor (相关概念)与某概念直接分类相关或语义相邻的概念
Evidence (实验验证)哪些实验验证某概念,或某实验验证哪些概念
Locate (章节定位)知识点首次出现在哪些章,或某章的先修章

干扰项优先从「图上隔一步能走到的节点」、同一大类下的并列知识点、同节同章候选里抽,再去掉文字过于相似的选项,并用教学标准过滤「看起来也对」的假干扰项。目标是:看起来像会混,但在课程结构上绝不该入选。

Figure 2 :(A) 同一条先修子图如何落成 Prereq 多选题;(B) 同一关系如何改写成训练用问答。

强模型也会在「结构题」上掉队

零样本、只许输出选项字母时,十个开源与闭源模型的结果很清楚。

Table 3 : K12-Bench 主结果。看 Overall 的 EM :闭源最佳 57.1%,开源最佳 46.4%; Prereq 与 Neighbor 全面最难。

先看总体: Gemini-3-Flash 总 EM 57.1%, F1 约 73%;开源最强 Gemma-4-31B-IT 为 46.4% EM 。一半以上题目,模型给不出完整正确选项集合。

再看最难的两类:即便 Gemini-3-Flash ,先修题 EM 仅 34.8%,相关概念题仅 33.4%。这两类要求分清「谁依赖谁、周围一圈怎么连」,和背结论不是一回事。章节定位相对容易,头部模型可以到约 80% EM :大致记得出现在哪一章,比完整排出一串前置知识轻松得多。考点锚定与实验验证也相对好一些,教辅和实验手册里这类对应关系出现更密。

小模型几乎等于乱猜: Meta-LLaMA-3-8B-Instruct 总 EM 7.2%,随机基线是 6.7%。瓶颈在关系推理,不在背章节名。

训练数据:不大,但咬住结构

对外对比时用的是文本子集 K12-Train-Text ( 2,267 条);完整集 K12-Train-Full 含多模态共 7,335 条。标题里说的「约 2300 条」,指的就是这个文本子集。

K12-Train 把图转成监督信号,走三条路径:

1.围绕节点写问答(大模型生成):概念定义/公式、技能步骤、实验仪器与结论、习题推理链;2.围绕关系写问答(大模型生成):强制回答「为何 A 属于 B 」「为何必须先学 A 」「实验如何验证概念」「插图如何解释或支撑某条关系」等;3.习题考查问答(模板填充):对考查概念/技能的边直接套模板,避免模型改写事实关系。

文本子集里含 450 道带步骤习题、 356 道考查边、 695 道节点问答、 766 道关系问答;多模态子集 5,068 条全部依赖插图或视觉元素,并按边置信度筛选。生成前会裁掉无关属性、过滤低置信边,生成后再做格式与非空校验,降低把图里噪声写进训练集的风险。

对比实验故意把样本量压到同一量级:从 OpenHermes 、 Infinity 、 UltraChat 、 WizardLM 、 DataFlow 、 LMSYS 、 SmolTalk 、 Tulu-3 各随机抽约 2,300 条,与 K12-Train-Text 对齐,在 Qwen3-4B-Base 与 Llama3.1-8B-Base 上做全参数微调,学习率与训练轮次完全一致。

Table 4 :等量约 2300 条 SFT 后的 GaokaoBench 。两行「 K12-Train-Text 」在 Total 上均为同组最高。

在 GaokaoBench 上:

■Qwen3-4B-Base + K12-Train-Text 总分 1009.96,超过最强基线 DataFlow ( 985.91 )+24.1;客观题得分率 81.8%,主观题 89.5%,也是同组最高。■Llama3.1-8B-Base + K12-Train-Text 总分 625.49,超过最强基线 WizardLM ( 593.08 )+32.4;客观题得分率 41.0% 同样最高。

相对两家官方 Instruct 变体,增益更大(论文报告 +114.6 / +221.0 ),说明「通用指令风格」补不上课程结构监督。 EduEval 上方向一致:两个骨干的平均分也都是等量配置里最高( 66.76 / 40.90 ),只是涨幅小于高考卷。

旁证是跨学科表现:训练数据只来自数理化生子图,语文却拿到同组最高分( 120.18 ),人文数学也是最高( 132.00 )。语文卷更依赖阅读与表达结构,并不依赖数理化事实;更可能是学会了「按关系组织答案」,而不是背到了语文知识点。

多模态:文本与视觉要一起喂

视觉-语言模型实验改用 Qwen3.5-2B-Base ,比较完整集、只训文本、只训多模态,以及完整体量的 DataFlow (约 1 万)与 WizardLM (约 14 万)。评测轴是 Gaokao-MM 、 MDK12-medium 、 K12Vista 。

Table 6 : Gaokao-MM 。 K12-Train-Full 总体 39.9%,高于 Text/MM 单模态,也高于基座与 Instruct 。

Gaokao-MM 上, K12-Train-Full 总体准确率 39.9%,相对基座 +7.5 个百分点,相对官方 Instruct +3.8 ;并同时高于只训文本或只训多模态的变体。 MDK12-medium 上完整集平均 52.94 ,超过最强非 K12 基线 DataFlow 约 1.66 分。

Table 8 : K12Vista 。基座已有 79.72 的高分;只有 K12-Train-Full 微调后继续升到 79.95 ,且选择题/填空/问答三种题型均最好。

K12Vista 很挑刺:未微调的基座已经很强(平均 79.72 )。多数通用微调反而掉点;只有完整集小幅升到 79.95 ,并在选择、填空、开放问答三种格式上同时最好。单训文本或单训多模态都会伤到这套已有能力:文字里的课程结构,和插图里的对象对应关系,需要一起学。

论文把有效原因归结为两点:每条样本都写明知识点之间的关系,而不只是孤立事实句;训练内容的顺序与关系又和人教版一致,和下游教育基准更合拍。边界也清楚:资源锚定中国人教版数理化生;评测时不给模型看图谱,考的是闭卷是否真懂结构;多模态增益主要在小参数视觉-语言模型上验证,换骨干与换教材体系仍需另证。

图谱、基准、训练数据与完整构建流水线均已开源。对想做课辅、自适应学习路径或教材级检索的人来说,值得先跑一遍 K12-Bench :如果模型连「学 B 之前必须先会哪些」都凑不齐,再堆刷题数据,多半只会更会用技巧答题,还是不懂知识点怎么串起来。


本文由 JOTO AI 智库整理。

原始来源:授权原文

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
致电我们
+86 (021) 6566 1628
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。