JOTO
Contact us
← AI 智库
知识图谱

北大等开源 K12-KGraph:从小学到高中的教材全部整合成知识图谱,既做bench又能训练

2026 年 7 月 27 日

北京大学等团队开源K12-KGraph,基于人教版K-12数理化生教材构建多模态知识图谱,含9类节点、14类关系;同步发布K12-Bench(23,640道结构理解题)与K12-Train(7,335条监督样本),实证显示主流大模型在课程结构推理(如先修关系、概念邻接)上表现薄弱,而针对性微调可显著提升GaokaoBench等教育基准得分。

课程认知缺口:模型会解题,但不懂知识如何组织

大模型已经很会做 K-12 考题。C-Eval、CMMLU、GaokaoBench、EduEval 上,前沿模型常能逼近甚至超过优秀考生。若只看分数,教育场景好像快被做完了。

课辅产品里更常见的卡点是:模型会解「求方程的解」,却排不出「这周该先补算术运算还是直接上方程」,也说不清某道题到底在考哪几个概念、哪套实验在验证哪条规律。论文把这类能力称为课程认知:理解知识如何组织、如何排序、如何被实验与插图支撑,而不只是记住孤立事实。

现有基准几乎不测这一点,主流指令微调数据也很少显式教这一点。缺口不在「再堆一堆题」,而在缺少一份能同时支撑评测与训练的课程结构资源。

一张课程结构图,同时支撑评测和训练

团队的做法是:直接从人教版小学到高中的数学、物理、化学、生物教材 PDF 出发,建成多种节点、多种连线的知识图谱 K12-KGraph。图分两块:

  • 文本组件:概念、技能、实验、习题,以及节、章、书等容器;边刻画分类、先修、关联、实验验证、习题考查、出现位置、章节顺序等。
  • 多模态组件:新增插图节点与视觉元素节点,边覆盖图内组成、视觉指称、图示解释、习题对图的依赖,以及「图为某条关系提供视觉证据」。

整图共 9 类节点、 14 类关系。因为边和节点都能追溯到教材原文,团队用同一张图派生两套资源:

  1. K12-Bench:23,640 道多选题,考查课程结构理解;
  2. K12-Train:7,335 条监督微调样本(其中文本 2,267、多模态视觉问答 5,068)。
K12-KGraph 构建流程示意图
Figure 1:K12-KGraph 五阶段流水线:OCR 解析、按目录切节、按预定结构抽取、自下而上合并、拓扑校验与人工复核。

构建流程也按教材真实形态设计。MinerU 把 PDF 转成保留层级与公式的 Markdown;目录解析切成节级文件并挂上插图;再对每一节用带结构约束的提示(论文使用 GPT-5.2)抽出节点、边,以及证据句或置信度;随后在书级、学科级做去重与别名对齐;最后对分类边与先修边做环检测,保证这两类关系不能绕圈。抽取提示明确要求「只保留教材里真正重要、表述清楚的内容」,边上尽量带回原文证据;全部三元组再经学科合格标注员复核。

图里到底有什么

文本侧覆盖 48 册教材:合并去重后约有概念 6,579、技能 1,364、实验 652、习题 1,171;先修边就有 3,705 条。数学没有实验节点,因此「实验验证」类边为 0。这是课程本身的结构,不是采样漏了。

K12-KGraph 文本组件统计表
Table 1:文本组件按学科统计。化学概念与先修边最密,数学实验为空。

多模态侧另有插图节点约 7,388、视觉元素约 10,203。几何图、实验装置、习题附图经常直接给出定义、证据或解题条件。

K12-KGraph 多模态组件统计表
Table 2:多模态组件统计。数学插图与视觉元素最多,与教材图示密度一致。

质量上,12 名学科合格标注员的整体一致性较高(Fleiss’ κ = 0.84);K12-Bench 分层抽检中,98.4% 的样本被判定为完全正确。题目对不对,最终落回图对不对。这比「再让模型写一批选择题」更容易定位错误边。

五种题,专测结构而不是回忆事实

直观一点:学「一元一次方程」前必须先会哪些内容?某道习题在考哪些概念?某实验在验证哪个概念?K12-Bench 用五类题把这些问题问死,并补上「知识点第一次出现在哪一章」。

题目与干扰项都由程序按图规则生成,不是让大模型自由编题。模型只看到题干和四个选项,看不到知识图谱,因此测的是闭卷时是否真懂课程结构。每题正确选项数在 1–3 之间,输出必须和标准答案集合完全一致;少选、多选都算错,所以 exact match(完全匹配,下称 EM)很严。57% 的 EM 并不等于「差不多对了一半选项」。

五个任务族各自对应一类关系:

任务族在问什么
Ground(考点锚定)这道习题考查哪些概念/技能,或某个概念对应哪些习题
Prereq(先修推理)学某概念前必须掌握的一串前置知识,或它的直接后继
Neighbor(相关概念)与某概念直接分类相关或语义相邻的概念
Evidence(实验验证)哪些实验验证某概念,或某实验验证哪些概念
Locate(章节定位)知识点首次出现在哪些章,或某章的先修章

干扰项优先从「图上隔一步能走到的节点」、同一大类下的并列知识点、同节同章候选里抽,再去掉文字过于相似的选项,并用教学标准过滤「看起来也对」的假干扰项。目标是:看起来像会混,但在课程结构上绝不该入选。

K12-Bench 题目生成示例
Figure 2:(A) 同一条先修子图如何落成 Prereq 多选题;(B) 同一关系如何改写成训练用问答。

强模型也会在「结构题」上掉队

零样本、只许输出选项字母时,十个开源与闭源模型的结果很清楚。

K12-Bench 主结果对比表
Table 3:K12-Bench 主结果。看 Overall 的 EM:闭源最佳 57.1%,开源最佳 46.4%;Prereq 与 Neighbor 全面最难。

先看总体:Gemini-3-Flash 总 EM 57.1%,F1 约 73%;开源最强 Gemma-4-31B-IT 为 46.4% EM。一半以上题目,模型给不出完整正确选项集合。

再看最难的两类:即便 Gemini-3-Flash,先修题 EM 仅 34.8%,相关概念题仅 33.4%。这两类要求分清「谁依赖谁、周围一圈怎么连」,和背结论不是一回事。章节定位相对容易,头部模型可以到约 80% EM:大致记得出现在哪一章,比完整排出一串前置知识轻松得多。考点锚定与实验验证也相对好一些,教辅和实验手册里这类对应关系出现更密。

小模型几乎等于乱猜:Meta-LLaMA-3-8B-Instruct 总 EM 7.2%,随机基线是 6.7%。瓶颈在关系推理,不在背章节名。

训练数据:不大,但咬住结构

对外对比时用的是文本子集 K12-Train-Text(2,267 条);完整集 K12-Train-Full 含多模态共 7,335 条。标题里说的「约 2300 条」,指的就是这个文本子集。

K12-Train 把图转成监督信号,走三条路径:

  1. 围绕节点写问答(大模型生成):概念定义/公式、技能步骤、实验仪器与结论、习题推理链;
  2. 围绕关系写问答(大模型生成):强制回答「为何 A 属于 B」「为何必须先学 A」「实验如何验证概念」「插图如何解释或支撑某条关系」等;
  3. 习题考查问答(模板填充):对考查概念/技能的边直接套模板,避免模型改写事实关系。

文本子集里含 450 道带步骤习题、356 道考查边、695 道节点问答、766 道关系问答;多模态子集 5,068 条全部依赖插图或视觉元素,并按边置信度筛选。生成前会裁掉无关属性、过滤低置信边,生成后再做格式与非空校验,降低把图里噪声写进训练集的风险。

对比实验故意把样本量压到同一量级:从 OpenHermes、Infinity、UltraChat、WizardLM、DataFlow、LMSYS、SmolTalk、Tulu-3 各随机抽约 2,300 条,与 K12-Train-Text 对齐,在 Qwen3-4B-Base 与 Llama3.1-8B-Base 上做全参数微调,学习率与训练轮次完全一致。

GaokaoBench 微调效果对比表
Table 4:等量约 2300 条 SFT 后的 GaokaoBench。两行「K12-Train-Text」在 Total 上均为同组最高。

在 GaokaoBench 上:

  • Qwen3-4B-Base + K12-Train-Text 总分 1009.96,超过最强基线 DataFlow(985.91)+24.1;客观题得分率 81.8%,主观题 89.5%,也是同组最高。
  • Llama3.1-8B-Base + K12-Train-Text 总分 625.49,超过最强基线 WizardLM(593.08)+32.4;客观题得分率 41.0% 同样最高。

相对两家官方 Instruct 变体,增益更大(论文报告 +114.6 / +221.0),说明「通用指令风格」补不上课程结构监督。EduEval 上方向一致:两个骨干的平均分也都是等量配置里最高(66.76 / 40.90),只是涨幅小于高考卷。

旁证是跨学科表现:训练数据只来自数理化生子图,语文却拿到同组最高分(120.18),人文数学也是最高(132.00)。语文卷更依赖阅读与表达结构,并不依赖数理化事实;更可能是学会了「按关系组织答案」,而不是背到了语文知识点。

多模态:文本与视觉要一起喂

视觉-语言模型实验改用 Qwen3.5-2B-Base,比较完整集、只训文本、只训多模态,以及完整体量的 DataFlow(约 1 万)与 WizardLM(约 14 万)。评测轴是 Gaokao-MM、MDK12-medium、K12Vista。

Gaokao-MM 微调效果对比表
Table 6:Gaokao-MM。K12-Train-Full 总体 39.9%,高于 Text/MM 单模态,也高于基座与 Instruct。

Gaokao-MM 上,K12-Train-Full 总体准确率 39.9%,相对基座 +7.5 个百分点,相对官方 Instruct +3.8;并同时高于只训文本或只训多模态的变体。MDK12-medium 上完整集平均 52.94,超过最强非 K12 基线 DataFlow 约 1.66 分。

K12Vista 微调效果对比表
Table 8:K12Vista。基座已有 79.72 的高分;只有 K12-Train-Full 微调后继续升到 79.95,且选择题/填空/问答三种题型均最好。

K12Vista 很挑刺:未微调的基座已经很强(平均 79.72)。多数通用微调反而掉点;只有完整集小幅升到 79.95,并在选择、填空、开放问答三种格式上同时最好。单训文本或单训多模态都会伤到这套已有能力:文字里的课程结构,和插图里的对象对应关系,需要一起学。

论文把有效原因归结为两点:每条样本都写明知识点之间的关系,而不只是孤立事实句;训练内容的顺序与关系又和人教版一致,和下游教育基准更合拍。边界也清楚:资源锚定中国人教版数理化生;评测时不给模型看图谱,考的是闭卷是否真懂结构;多模态增益主要在小参数视觉-语言模型上验证,换骨干与换教材体系仍需另证。

图谱、基准、训练数据与完整构建流水线均已开源。对想做课辅、自适应学习路径或教材级检索的人来说,值得先跑一遍 K12-Bench:如果模型连「学 B 之前必须先会哪些」都凑不齐,再堆刷题数据,多半只会更会用技巧答题,还是不懂知识点怎么串起来。

JOTO 企业落地观察

  • 课程结构知识图谱的构建方法论(如教材 OCR→结构化抽取→拓扑校验→人工复核)可直接迁移至企业内部制度文档、SOP 或产品手册的知识工程流程,尤其适用于需严格遵循层级与依赖关系的合规性知识管理场景。
  • 将知识图谱同时用于评测与训练的设计,提示企业在构建领域 RAG 系统时,不应仅关注向量召回精度,还需配套结构化验证机制——例如用图谱生成的逻辑一致性测试题,定期检验检索增强回答是否违背业务规则依赖链。
  • K12-KGraph 中「先修边」「实验验证边」等强语义关系的显式建模,对企业智能体(Agent)的任务分解能力具有直接参考价值:当 Agent 需执行多步骤操作时,其规划模块必须识别并尊重前置条件约束,而非仅依赖语言模型的隐式推断。
  • 多模态组件强调插图与视觉元素的语义锚定,对企业部署工业设备维修、医疗影像辅助诊断等图文协同场景提出关键提醒:纯文本知识图谱无法支撑视觉证据链推理,需在知识建模阶段即统一纳入图像区域标注与跨模态关系定义。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.