制造业

教育:数据驱动的个性化学习路径(第二部分)

个性化学习之所以成效不彰,较少因为算法不强,更多因为缺少学生到底懂什么的底层模型。自适应系统需要三样东西才能工作:一套知识领域的表示、一个学习者在该领域内当前状态的估计,以及一条选择下一步的规则。大多数项目建了第三样、买了第二样,却跳过了第一样——然后纳闷为什么推荐在教师看来是任意的、在学生看来是无意义的。本系列第一部分讨论过这个机会,这一部分讲机制。

把它做对很重要,因为上行空间是真实的。Bloom 著名的「两个标准差」发现——接受一对一辅导的学生,表现比传统班级教学的学生好两个标准差——虽被反复重访与修正,但其底层结论"一对一辅导体量级的提升"是站得住的。工程上的问题是:这部分增益中有多少可以由系统而非人类恢复?而诚实的证据表明,其中相当可观的一部分是可以的。

为什么大多数个性化学习项目成效不彰?

四个反复出现的原因,而且它们至少同样多是组织性的,而非技术性的。

没有知识模型。系统基于完成度和得分来推荐下一项,而不是基于概念与前置关系的地图。没有这张地图,一个在分数题上答错的学生,就无法被路由到他所缺失的那个具体前置概念上,于是系统只能给他更多分数题。

把参与度误认为学习。投入时长、观看的视频数、完成的模块数,都易于度量,却与"持久的学习"只有弱相关。以参与度为优化目标的系统,产出的是忙碌的学生,而不是懂得更多的学生。

绕过教师。一条教师看不见、看不懂、也无法推翻的推荐,会被忽略,然后被悄悄关掉。这是自适应系统最终沦为昂贵内容库的最常见原因。

数据孤岛。测评、出勤、作业与行为数据分散在不同系统里,标识符各不相同。没有集成,系统只看到信号的一小部分,而教师看到的是一个与自己观察相矛盾的工具。

一条学习路径究竟需要什么数据?

三层,而第三层才是让前两层变得有用的那一层。

交互数据。题目级作答记录:哪道题、它考察哪些概念、对或错、用时、是否用了提示、尝试次数,以及答案是否被修改过。这是估计知识状态的原材料,而且必须在题目级采集,而不是汇总成分数——因为汇总会摧毁诊断信号。

学习者情境。既往成绩、语言背景、出勤情况,以及——在谨慎使用的前提下——参与度模式。情境能解释单看作答记录无法解释的方差:一个跨学习场次作答不稳定的学生,可能是知识有缺口,也可能只是没有认真作答。

知识模型。领域结构:概念、概念之间的前置关系,以及从测评题目到概念的映射。没有这一层,前两层只是数字;有了它,一个错误答案就变成一个具体诊断,而路径也就成了"一条序列",而不只是一个队列。

两条实操规则。在交互发生的当下采集数据,而不是放到夜间批处理——在课堂上做出的自适应决策,必须反映那节课上发生的事。并且把"题目到概念"的映射纳入版本管理,因为课程大纲变动频繁,而一份过期的映射会静默地污染每一个下游估计。

如何构建一套奏效的知识模型?

这是最难的部分,而且它是课程工作,不是数据科学。四个步骤:

1. 以合适的粒度定义概念。太粗则无法诊断,太细则没有足够的测评覆盖每个概念。对学校数学而言,一条可用的经验法则是:一个概念应当能在一节课内教完,并能用三到五道题目来测评。预期每学年每科有 80 到 200 个概念。

2. 显式映射前置关系。对每个概念,写明学生必须已经掌握什么。这正是让一条路径成为"路径"的结构:当一个学生做错长除法时,前置地图会告诉你缺口是在乘法口诀、位值概念,还是除法程序——而三者各有不同的补救方案。

3. 把每道测评题标注到概念上。理想情况下一题对应多个概念并带权重。这份映射是数据与决策之间的铰链,也正是质量成败之处。请对样本做双重标注并度量标注者间一致率;低于约 0.7,这份映射就是噪声。

4. 对照现实做验证。检查模型预测的难度排序是否与观测到的题目难度相符,以及被模型判定为「已掌握」的学生是否真的能通过考察该概念的更难题目。一套从未被验证过的知识模型,是一套带着用户界面的假说。

诚实地编列预算:对于一门学科、一个年级,预期需要一位课程专家与一位数据人员工作四到八周。这是整个项目中最大的单项成本,也是最常被漏掉的一项。

路径推荐应该用哪些算法?

从简单开始,只有当复杂版本确实在度量上胜过简单版本时,才增加复杂度。

知识追踪——主力工具。贝叶斯知识追踪按概念估计学生已掌握它的概率,并基于每次作答、以学习率与失误率参数更新它。它可解释、成本低、且被充分理解。更新的变体——包括深度知识追踪——拟合数据更好,但更难向教师解释清楚;而在大多数部署中,可解释性比那点准确率增益更重要。

带阈值的精熟学习。当掌握概率超过阈值时学生前进,低于阈值时则接受前置概念补习。简单、可辩护,而且与教师既有的思维方式一致。这是正确的默认选项。

用多臂老虎机做内容选择。当多个资源都能合理地教授同一概念时,bandit 算法把学生分配到不同资源上,并学习哪个对谁更有效。它有用,但前提是你有足够的流量让这种分配在统计上有意义——而对大多数单一机构而言,在跨校汇总之前都不具备。

用间隔重复保持留存。基于遗忘曲线安排复习,证据充分且实现成本低。它常常是整个系统中回报最高的组件,因为大部分学习损失来自遗忘,而不是从未学会。

不该做的事:不要一开始就在原始交互日志上做深度学习。它需要大多数机构不具备的数据量,它产出的推荐没人能解释,而且它会在第一天就输掉与教师的那场争论。

如何度量学习是否真的改善了?

度量正是个性化学习项目最常被抓住软肋的地方,因为容易得到的指标往往是错的。

  • 学习增益,而非活动量。在同一构念上做前测与后测,并把增益与对照组比较。完成的题目数不是学习指标。
  • 延迟后的留存。四到十二周后再测一次。在即时后测上表现优异的项目,常常在延迟测试中显示不出优势,因为它们优化的是练习期间的临场表现,而非持久的改变。
  • 迁移。学生能否在新情境中应用这个概念?这是最难度量的,也是最有意义的。
  • 达到精熟所需时间。效率指标:这条路径能否让学生更快地达到同一标准?这常常是最有力的商业论证,因为时间正是教师真正感受到的约束。
  • 结果的公平性。把以上各项按既往成绩、语言背景与社经群体拆分。一个抬高均值却拉大差距的项目,不是改进。
  • 教师在诊断上节省的时间。为整个项目提供资金的运营回报:批改与诊断的每周工时,前后对比。

请把它当实验来跑。在可行的范围内按班级或学生随机化,预先登记指标,并公布结果——包括无效结果。从不公布无效结果的项目,不是循证的项目。

如何避开监控陷阱?

学习者数据敏感,主体常常是未成年人,而个性化与监控之间的区别更多在于治理,而非技术。五条原则:

为明确的目的采集,且只用于该目的。为支持学习而采集的行为数据,不应被改用于纪律处分、分层编班或营销。请把这条写下来,并在技术层面强制执行,而不只是写在政策里。

在聚合视图足够时就优先用它。教师需要知道「有六个学生没掌握这个概念」,而很少需要一份逐个学生的参与度排行榜。

让学习者看到的视图是建设性的。学生应当看到自己的进展与下一步,而不是一个相对排名。比较式看板会稳定地加剧焦虑,并降低后进学生的努力程度。

设定留存期限与删除路径。交互日志应有明确的留存期,离校应触发删除。

让家长与学生参与设计。同意是底线,不是上限。与家庭共同设计的项目,既更合乎伦理,在实践中也远更持久。

教师留在环路中究竟意味着什么?

不是给算法的推荐盖个橡皮图章。四项具体能力:

看得见推理过程。教师能看到学生卡在哪个概念上、哪些证据支持这个结论,以及前置分析说了什么。不透明的推荐会被推翻——而且理应被推翻。

一次操作即可推翻。布置不同的作业、把某个概念标记为已掌握、或安排一次人工讲解,每一项都应在几秒内完成。如果推翻很慢,教师就会停止推翻,系统随之退化。

在正确的时刻收到信号。课中的一条通知是有用的;一份周报太晚了。自适应数据的价值衰减很快。

向模型贡献。教师的推翻是「系统为何出错」这一问题上可获得的最佳标签。请把它们作为反馈采集下来、每月复盘,并用它们来修正题目标注与前置链接。

请先为教师设计,其次才为学生设计——因为学生能否看到它,由教师决定。

如何处理未成年人隐私与合规?

各辖区在细节上有差异,但在原则上一致。无论你在哪里运营,请按最严格的适用体制来假设。

  • 合法依据与同意。教育供给或许能覆盖核心用途,但超出其外的一切——研究、产品改进、向第三方共享——都需要具体依据,而对未成年人通常还需要家长参与。
  • 数据最小化。不要采集你无法据以采取行动的行为遥测。你持有的每个字段,都是你必须保护和给出正当理由的字段。
  • 处理与存储的位置。许多辖区限制学生数据可存放的地点。请按国家逐一核查,并且要核查次级处理方链条,而不只是核查供应商。
  • 默认不使用学生数据做训练。在合同层面确认学习者的交互不会被用于训练供应商模型,且任何用于改进的用途都是聚合的、去标识化的、且需选择加入。
  • 访问控制与审计。谁在何时、为何查看了哪位学生的记录。请记录并复核它。
  • 一位具名的可问责人。机构内部要有人拥有这份登记表、留存时间表与事件响应流程。

一次现实的实施长什么样?

第一阶段——为一门学科、一个年级构建知识模型(4–8 周)。课程专家加数据工程师。概念、前置关系、题目标注,以及一轮验证。交付物:一张教师认可的知识地图——这是唯一重要的验收标准。

第二阶段——数据集成(2–4 周)。以题目级粒度接入测评、作业与出勤系统,并完成学生标识符解析。交付物:对每个学生、按概念的掌握度实时估计。

第三阶段——路径引擎与教师控制台(4–6 周)。精熟阈值、前置路由、间隔复习,以及带一键推翻的教师视图。交付物:教师愿意据此采取行动的推荐。

第四阶段——带度量的试点(一个学期)。随机或准实验设计,预先登记指标,包含延迟留存与公平性拆分。交付物:一份已公布的结果,无论正负。

第五阶段——扩展。每增加一门学科都复用这条流水线与控制台。第二门学科的成本只是第一门的一小部分,因为最难的部分是学会如何构建那张地图。

在访问层,蜂启咨询(Beehive Strategy)通过 MCP 连接器与语义层接入测评、出勤与作业系统,使教育工作者能够用自然语言提问——「哪些学生还没有掌握本周主题的前置概念,他们的出勤模式如何?」——并在教职员工日常使用的即时通讯工具里获得按权限限定范围的答案。以托管服务方式约两周部署,并具备行级安全:教师看到自己的班级,年级主任看到自己的年级。

有哪些失效模式?

在建好地图之前就买了平台。平台无法补偿缺失的知识模型;它只会把内容组织得更糟。

优化参与度。产出的是活动,不是学习。请度量学习增益。

变相分层编班。悄悄把学生分流进固定轨道的自适应路径,会固化不平等。请保持路径可回溯,并把标准可见化。

题目标注腐坏。大纲变化,映射漂移。请纳入版本管理,并每学期重新验证。

在评估中夸大。与历史同期学生群体比较而不控制群体差异,是项目说服自己最常见的方式。

忽视教师。二十年教育科技的一致发现是:教师决定结果。为他们设计,否则这个工具只是装饰。

常见问题

个性化学习路径,是为单个学生依据他当前懂什么的估计、而非依据其年龄或班级位置,所选择的一串学习活动序列。它需要三个组件:一套表示领域概念与前置关系的知识模型;一个学习者在该模型内掌握状态的估计;以及一条选择下一步的规则。大多数项目建了第三样、买了第二样,却跳过了第一样——这正是推荐在教师看来显得任意的原因。

三层。题目级的交互数据,记录所答题目、考察的概念、对错、用时、是否使用提示与尝试次数;学习者情境,如既往成绩、语言背景与出勤;以及关键的知识模型,即概念、前置关系与题目到概念的映射——没有这一层,前两层无法产生诊断。数据必须在交互发生的当下采集,而非夜间批处理,因为课堂中的自适应决策必须反映那节课上发生的事。

从简单、可解释的选项开始。贝叶斯知识追踪按概念估计掌握概率并随每次作答更新,成本低且可解释;带阈值的精熟学习在学生掌握概率超过阈值时让其前进、低于阈值时路由到前置概念,这是正确的默认选项;再叠加间隔重复以保持留存,它常常是回报最高的组件;只有当流量足以让分配在统计上有意义时,才考虑用 bandit 算法做内容选择。

度量对照对照组的前后测学习增益,而非活动量;四到十二周延迟后的留存,因为针对练习表现优化的项目常在延迟测试中失去优势;向新情境的迁移;达到精熟所需时间,这通常是最有力的商业论证;按既往成绩与背景拆分的结果公平性,因为抬高均值却拉大差距并非改进;以及教师在诊断上节省的工时。

为明确的目的采集且只用于该目的,并在技术层面强制执行;在聚合视图足够时优先使用聚合视图,而非逐个学生的排行榜;向学生展示自身进展而非相对排名,因为比较式看板会加剧焦虑并降低后进者的努力;设定留存期限与离校删除路径;让家长与学生参与设计;并在合同层面确认学习者的交互默认不会被用于训练供应商模型。

对一门学科、一个年级而言,到带度量的试点大约需要一个学期:四到八周由课程专家构建知识模型;两到四周完成题目级数据集成与学生标识符解析;四到六周构建路径引擎与带一键推翻的教师控制台;再用一个学期做随机或准实验试点、预先登记指标。此后每增加一门学科都复用同一条流水线,成本只是第一门的一小部分。

通常因为推荐看不见、看不懂、也无法推翻。教师需要看到学生卡在哪个概念上、哪些证据支持该结论;需要能一键推翻、几秒内完成;需要在课中而非周报里收到信号;并且需要让自己的推翻被采集为反馈以修正模型。不透明的推荐会被推翻,而且理应如此;如果推翻很慢,系统就会退化成一个内容库。

预约个性化演示

准备好改变您的数据策略了吗?

了解蜂启咨询的对话式分析平台如何在整个运营中解锁实时洞察——从上游数据到下游决策。

预约演示 了解解决方案
3x
典型首年 ROI
78%
更快解决查询
92%
6 个月内采用率
50+
数据连接器