返回首页
2025.08.11 03:19 约 12 分钟 全球动态 1.5万 阅读

对教育界人工智能保持谨慎乐观

本文信息来源:contrary

纵观历史,新技术的引入很快就会引发人们对其可能影响学习的担忧。在美国,迄今为止本世纪关于教育的担忧更多集中在学习成果而非中断上。提升教育成果有一些已知的解决方案,比如一对一辅导,但这些历史上一直难以实现。而人工智能或许正在改变这一点。

纵观历史,新技术的出现总是伴随着对其可能影响学习的担忧。公元前 370 年,苏格拉底哀叹写作这一技术本身会削弱记忆的必要性与力量,并使人们即便不真正理解事物也能显得聪明,他说:

“因为这种发明会使学会使用它的人心生健忘,因为他们不会去锻炼记忆……你们发明的不是记忆之药,而是提醒之剂;你们给学生的是智慧的表象,而非真正的智慧……”

类似的恐惧在几个世纪中反复出现,人们曾担心印刷术  计算器  和互联网可能对人们的学习能力及认知能力的充分发展产生负面影响。

然而,在美国,迄今为止对21世纪教育的担忧更多集中在结果而非变革上。

美国的数学成绩在 2009 达到顶峰,随后在接下来的十年里持续下滑。9-13 岁学生的阅读和数学成绩在 20 世纪末到 21 世纪初有所上升,但在 2010 年代初期左右停滞 ,此后持续下降。总体而言,自 2020 年学校停课以来,美国的教育成果大幅下滑。

一项元分析报告称,COVID-19 大流行期间全球学习损失相当于 0.11–0.14 个标准差,基本上相当于关键学科损失了 4–7 个月的学习时间。全国教育进展评估(NAEP)表示,学生阅读成绩达到了该组织自 1992 年开始记录以来的最低评分。根据这些结果,“整整三分之一的孩子无法展示其年龄组应具备的‘基本’阅读技能。”2019 年至 2022 年的教育损失相当于抹去了数十年的教育进步 

尽管教育质量持续下降,现实是几十年来人们对一个明确的解决方案已有所认识。但这个解决方案,直到最近,只对少数人可用。

布卢姆的问题

1984 年,教育心理学家 Benjamin Bloom 撰写了一篇题为《双西格玛问题》的论文 。Bloom 证明,采用精通学习的一对一辅导能使学生成绩提高两个标准差 。精通学习意味着学生在掌握某一概念之前不会继续学习下一个概念,必须先证明已真正掌握该概念。成绩提高两个标准差代表了显著进步;相当于把处于第 50 百分位的人提升到第 98 百分位。

在该论文中,Bloom 将常规教育、精通学习和辅导式教学进行了比较 。虽然精通学习带来了可测量的提升,但一对一辅导产生的改善远为显著。

对教育界人工智能保持谨慎乐观

来源:Benjamin Bloom

这些显著的改进并非仅在成绩最好的学生身上显现。Bloom 的研究表明,1 对 1 辅导改善了研究群体中 80% 学生的学习成果。结果似乎表明,几乎任何学生都可能在某一特定主题上达到精通,阻碍他们的唯一因素是无法获得正确的教学方法,而不是内在能力的不足。

如此卓越的结果引发了一个问题:为什么 Bloom 的发现没有被普遍实行?为什么 Bloom 的论文被称为“2 西格玛问题”而不是“2 西格玛解决方案”?正如 Bloom 在其论文中 解释 的那样,与其广泛采用辅导式学习,他的研究结果更倾向于寻找“比一对一辅导更为实用和现实的条件,因为一对一辅导对于大多数社会来说在大规模实施时成本过高。”

尽管通过一对一辅导实现的个性化教育取得了压倒性成功,但其成本和复杂性使辅导难以有效扩展。直到人工智能出现,情况才发生改变。

人工智能的解法

个别辅导历来是一项艰巨任务。辅导者需要了解个体的学习状况与学科内容的背景,还需能将教学计划阐述为一个连贯的结构。

能够为 5000 万名学生逐一做到这一点,曾被视为科幻。尼尔·斯蒂芬森 1995 年的小说《The Diamond Age》例如描绘了一种名为“启蒙器”的装置, 被描述为“一个互动的、类智能驱动的个性化教育装置,提供随着读者成长和发展而变化的故事、谜题和课程。[该装置]将其主人内尔——一位单亲母亲的下层阶级儿童——转变为她自己氏族或部落的领袖。”个性化教育人工智能曾是一个梦;并非我们现实世界中能够拥有的东西。

但越来越多的科幻正在成为科学事实。如今,人工智能正好适合那种在布鲁姆研究中促成快速教育进步的个性化一对一辅导。它速度快、成本低,通过智能手机和笔记本电脑广泛可及,其知识库涵盖了人类知识总和。

尽管数据仍处于早期,2025 年 5 月一项对 2022 年 11 月至 2025 年 2 月期间发表的 51 项实验和准实验的元分析发现,使用诸如 ChatGPT 之类工具对学习表现具有总体显著影响,提升了 0.87 个标准差;当 ChatGPT 作为教学的一部分被使用时,对学习者的感知和高阶思维也有较小但积极的影响。

虽然这还未达到布鲁姆所说的两个标准差的改进水平,但接触人工智能才刚刚起步。随着 AI 辅导产品的改进和教育项目更充分地使用它们,相关数据将越来越丰富。不过在人工智能能在教育中发挥任何潜在影响之前,它首先必须通过教育纯洁性测试。

教育纯洁性抬头了

面对人工智能将在各个生活层面带来巨大颠覆的前景,我们又开始听到类似苏格拉底式的担忧。正如人们曾担心文字会削弱记忆、印刷术会削弱手稿之美、计算器会削弱心算能力、互联网会削弱注意力,现在人们担心人工智能会削弱教育的有效性。正如以往每个时代一样,教育现状的拥护者对此深感忧虑。

例如,2024 年皮尤调查发现,25% 的公立 K-12 教师表示在 K-12 教育中使用人工智能工具弊多于利,而只有 6% 认为利大于弊。批评者担心学校会利用人工智能来取代教师、导致猖獗的作弊 ,并最终损害学生学习。

“人工智能将取代教师。”

对人工智能的本能反应之一是担心它会威胁到教师的工作能力。有人担心人工智能可能会取代教师的工作,即便其并不比教师更优秀。从缺乏个人共情到倾向于散布错误信息和偏见,支持人类教育者而非人工智能的论点有很多。

但现实是,教师是导致教育成果不佳的重要瓶颈。兰德公司在 2024 年的一项研究发现,60%的 K-12 教师正在经历倦怠,59%经常感到压力,而 25%正在考虑辞职。因此,学校不得不转向其他来源来补充教育人员。2023 年,有 37%的教师是缺乏经验、跨领域任教或未获认证的。

“人工智能会让学生作弊。”

在教育领域早期一波人工智能应用就是大学论文写作。一份报告发现 2024 年有超过 7K 起“AI 作弊”案例。通过检测软件特洛伊木马来维护学术诚信的尝试很快被证明行不通,因为学生会在社交媒体上互相提醒 。将所有评估改为完全线下进行是不可行的,这让教授们感到挫败,他们表达了像“我希望学生在这个过程中仍然在学习”这样的心声 

然而,对作弊的指责更多是对现有教育范式的控诉,而不是对人工智能本身的谴责——从充斥着隐性偏见的评估体系,到反馈和评分上的不一致。

关于由人工智能引发的“作弊”,教育者曾提出反 AI 荣誉守则,或只评分开卷、课堂内或口头考试。但正如 Tyler Cowen 在解释的那样,这些做法都没有抓住问题的要点:

“所有这些补救措施的问题在于,它们隐含地坚持我们必须尽一切可能维持那些低效的教学方式。现行体系在学生未来所需技能上存在误导,并且提供了错误的激励与学生质量排名。”

“人工智能会让学生变得更笨。”

即便人工智能可能缓解教师短缺或揭示不充分的评估体系,关于人工智能可能对人类认知能力产生负面影响的担忧依然存在。2024 年一项针对土耳其 1000 名高中生的研究比较了三个不同组别的学习体验:(1)无人工智能访问的对照组;(2)GPT Base,提供标准的 ChatGPT 界面;(3)GPT Tutor,提供带有教师提供的解答并要求仅给出循序渐进提示而非完整答案的聊天界面。在各组的学习环节结束后,进行了闭卷期末考试。

当学生被布置练习题时,与基线相比,GPT Base 提升了 48%,而 GPT Tutor 提升了 127%。但在闭卷考试中,GPT Base 组的成绩比对照组下降了 17%,而 GPT Tutor 组没有改善。

另一项研究表明,学生使用 LLMs 的方式会影响他们的理解。用 LLMs 替代部分学习活动的学生(例如让其为练习题生成解答)虽然增加了他们能接触到的主题数量,但每个主题的理解反而下降。相反,用 LLMs 补充学习活动的学生(例如请求解释)虽然未增加主题覆盖面,却提高了对主题的理解。这为 LLMs 在被正确使用时能够赋能学习者、而被滥用时会使学习者处于不利地位提供了证据。

很容易想象这样一个世界:学生把太多思考外包给 AI,变得过度依赖它,从而导致推理和批判性思维能力萎缩。有些人担忧 AI 会让人“智力上变得久坐不动”,损害他们的心理素质,就像工业革命后体力劳动减少使人更久坐、平均体能下降一样。

对教育界人工智能保持谨慎乐观

来源:X

本周一篇走红的论文标题为“你的大脑与 ChatGPT:在使用 AI 助手进行论文写作任务时认知债务的累积”。论文的结论实际上是,AI 使个体在认知上变得更弱。但尽管 AI 确实可能成为一种拐杖, 对该论文的批评指出,变量众多,保证的唯一真实结论是“让学生从 LLMs 复制/粘贴论文与学生自己写论文相比,会减少他们从作业中学到的东西”。还有人指出 ,该论文甚至没有衡量“学习”,而只是衡量了一次“写作冲刺”的结果。

毫无疑问,从计算器到互联网再到人工智能,任何工具都有可能成为智力上的拐杖。但现实也同样存在:计算器、互联网和人工智能都可能剥夺学习体验中某些并非对学习者有益的环节。更重要的是,AI 原生教育的承诺并不是取代人类学习,而是能够为其注入强大动力。

AI 原生教育的承诺

尽管人们对人工智能可能对学习造成的影响提出了诸多担忧,现实是未来仍然高度不确定。同一项皮尤调查显示,25% 的 K-12 公立教师认为人工智能弊大于利,但有 67% 的受访者要么不确定人工智能对教育的影响,要么认为利弊会相互抵消。这明显表明大多数人认为未来尚未写定。

人工智能已经更容易被部署到那些源于较新一轮创新的教育项目中。例如,Khan Academy 在 2023 年 3 月推出了 Khanmigo,旨在通过苏格拉底式提示帮助学生,而不是仅仅提供答案,并且可以调用网站的全部内容库。尽管尚无关于此类项目有效性的正式研究,但该产品已在超过 400 个美国学区进行试点。

其他公司则从更广泛的教育技术领域扩展到人工智能。MagicSchool AI 起初为教师提供一套生成教案、评分标准及其他教师工作流程的人工智能工具。该公司在 2023 年推出,据报道在约 1.2 万所学校拥有超过 500 万教师账户,覆盖 160 个国家,几乎涵盖了所有美国学区。随后该公司在 2025 年扩展到 AI 辅导,推出了 MagicSchool for Students。从以教师为导向的资源机器人到历史人物的角色聊天机器人、面向项目的研究助手以及学习伙伴机器人,MagicSchool 正试图将人工智能融入学习旅程的每一个环节。

对教育界人工智能保持谨慎乐观

来源:MagicSchool

Kira Learning,由 Google Brain 团队创始人 Andrew Ng 担任主席,经历了类似的发展轨迹。它于 2021 年作为一个教师支持平台上线,帮助教师创建课程并自动批改作业等,并在全国范围内扩展到数百个学区。2025 年 4 月,它还推出了一款直接为学生提供实时一对一指导的 AI 导师。根据一份报告 ,“人工智能代理会根据每个学生的进度和掌握程度进行调整,同时实现自动批改并提供即时反馈——让教育工作者有时间专注于教学。”

从 Mathpresso 的 MathGPT 到 SocratiQ(用于苏格拉底式学习的自适应 STEM 框架),再到 Synthesis 的超人级 AI 数学导师 。利用 AI 推动教育的努力正如火如荼。

但一些最好的成果来自于彻底重新构想教育结构的学校。Alpha School 就是一个例子。该校由 MacKenzie Price 于 2014 年创办,学生每天参与两小时由 AI 导师主导的课堂。人类教师被重新命名为 guides,提供指导并作为学生项目的倾听与反馈者。学生每天的其余时间则专注于此类基于项目的学习。与最初的布鲁姆(Bloom)研究类似,Alpha School 践行精通学习(mastery-learning)方法,学生按自己的节奏学习,只有通过精通测试后才能进入下一步。

Alpha School 宣称其学生通常位于年级前 1-2%。此外,Alpha School 还宣称其学生在全国标准化的 MAP 测试上进步速度比同龄人快 2.6 倍 ,该测试衡量学生全年相对于起点的进步情况。

对教育界人工智能保持谨慎乐观

来源:Alpha School

再次强调,衡量人工智能在教育中影响的所有努力都还处于早期阶段。对 Alpha School 的一些批评是,他们的学生之所以得分如此之高,可能并非因为人工智能和掌握式学习模式的优势,而是因为他们筛选了最优秀的学生。每一个试图证明人工智能教育质量的项目都需要进行严格的衡量和审查,以确保高质量的结果。但这正是好事!这正是你对创新教育所期望的——可被衡量并能在其他地方复制的成果。如果我们在这么早的阶段就已经看到成功的迹象,那就是值得谨慎乐观的一个原因。

审慎乐观的理由

对更高质量教育的渴望显而易见。教育成果下降和似乎无可修复的教育体系让人们急需解决方案。我们以前也见过这种渴望。2010 年代初,大规模在线开放课程(MOOCs)风靡一时。2012 年,可汗学院创始人萨尔·可汗预测,“教室有一天会由‘20 到 30 名学生组成,他们各自做着不同的事情,按自己的节奏前进,老师只是‘管理混乱’。”

但无论是慕课还是课堂笔记本电脑,教育技术总是伴随着宏大的承诺和有限的成果。然而,LLMs 与个性化一对一辅导之间的契合度实在太高,无法忽视。确实,人工智能不会自动解决布鲁姆“2σ问题”。如果学生认为 AI 可以替他们思考,它的效果也不会比认为只看十几个可汗学院视频就能学会某些东西好多少。

但作为辅助工具而非拐杖,AI 比近代任何教育技术都更有可能改善学生学习。

了解 RecodeX-立足新加坡,洞察全球 AI 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读