AI 家教从演示视频走进真实课堂,往往要面对一个更朴素的问题:它真的有用吗?

发生了什么

据 Hacker News 上的一条讨论,可汗学院(Khan Academy)的 AI 辅导工具 Khanmigo 在一所学校开展了为期两年的实验。这条帖子本身热度不高,但它指向的是一类正在积累的实证材料:不是发布会的功能演示,而是把 AI 辅导放进日常教学节奏后,持续两个学年的观察。

需要说明的是,目前公开的信息只有标题与简短摘要,具体的实验设计、样本规模、评估指标与结论尚未在片段中展开。因此本文不做数字层面的推断,只讨论这件事为什么值得被认真对待。

为什么重要

Khanmigo 的定位一直很明确:不是替学生写作业,而是扮演一个随时在线的引导者——用提问推动学生自己思考,而不是直接给答案。这个定位与市面上大量「解题神器」形成对照,也决定了它的价值必须用学习效果而非使用量来衡量。

两年是一个有分量的时间尺度。教育场景里的 AI 工具,第一学期的兴奋期往往掩盖问题:学生觉得新鲜,老师愿意配合,数据好看。真正的考验出现在新鲜感消退之后——学生是否还愿意用,老师是否还愿意把它排进课堂流程,工具在遇到教学大纲、考试节奏、班级差异时是否还能站得住。能撑过两个学年的项目,本身就过滤掉了相当一部分「演示型产品」。

另一个背景是,AI 辅导的效果证据一直偏薄。多数结论来自短期实验、受控环境或自愿参与的样本,而自愿参与者通常本身就更主动。学校层面的长期实验,是补上这块短板的方式之一。

影响与看点

对教育科技从业者来说,这类实验的真正产出往往不是「有效/无效」的二元结论,而是失败模式:AI 在哪些环节被绕过,老师为什么最终不用它,学生在什么情况下会把它当搜索引擎而非导师。这些细节比总体分数更有指导意义。

对更广泛的 AI 产品而言,Khanmigo 的处境有代表性——它的核心能力依赖通用大模型,但产品价值取决于教学法、课程对齐和教师工作流的整合。这意味着教育 AI 的护城河不太可能来自模型本身,而来自对场景的理解深度。

值得关注的点有三个:实验如何定义「学习效果」,是考试成绩、完成率还是学习行为;教师在其中扮演什么角色,是使用者还是被替代者;以及成本结构,长期一对一辅导的推理开销能否被学校预算承受。

我的判断是:AI 辅导的瓶颈不在模型能力,而在课堂的组织方式。谁能把 AI 嵌进老师已有的工作节奏,而不是要求老师为 AI 改变节奏,谁才更可能跑完第二个学年。