ChatGPT 提高了作业分数,但 Bocconi 研究没有衡量学习
一项涉及 1,053 名学生的试验发现,ChatGPT 提高了经过评分的建议质量,但其原创性指标是计算得出的,研究也没有衡量之后的学习。
让学生使用 ChatGPT 提高了他们在一项严格规定的商业作业中的质量分数。一个简短的因果推理练习产生了不同的结果:它让学生提出更多样的想法,但作业的标准评分量表并不奖励这些想法。
这就是一项涉及 1,053 名一年级学生的新实验所提供的有用结果。但它并不是 ChatGPT 改善学习的证据。试验衡量的是一次在约 45 分钟内完成的、获得辅助的输出;它没有测试学生理解了什么、保留了什么,或在没有模型的情况下能否将知识迁移到之后的任务。
实际的教训在于测量方式。只记录最终答案的评估可以奖励传统意义上的润色,却错过原创性、推理和独立理解。教育工作者,以及评估 AI 辅助知识工作的团队,需要为这些结果分别设置衡量方式。
ChatGPT 批判性思维研究随机分配了什么
8 月工作论文描述了一项于 2025 年 11 月进行、预先注册的 2×2 随机对照试验。研究人员将三个学位项目中的 13 个完整班级分配到四种条件之一。这是以班级为单位的集群随机化,而不是对个人进行随机分配。
| 组别 | N | 干预 | 结果 |
|---|---|---|---|
| 对照组 | 249 | 安慰游戏;不使用 ChatGPT | 基线 |
| 因果训练 | 256 | 推理游戏;不使用 ChatGPT | 想法更多样;评分量表分数没有提高 |
| ChatGPT | 197 | 可使用 GPT-4o | 估计评分量表分数提高 0.862 分 |
| 两者都有 | 351 | 训练和 GPT-4o 均可使用 | 保留了各自不同模式中的很大一部分 |
随后,所有学生都收到同一个商业案例:用约 180 个词提出建议,说明如何提高校友对该大学周边商品店的认知度和使用率。20 名受过培训的硕士生为每份回答评分,每份提交由三名评分者根据五分制量表评分;该量表源自两个营销概念——认知度和使用率。三名领域专家也提供了参考建议。
作业单元很重要。随机分配的不是 1,053 名个体学生,而是 13 个班级。作者对标准误进行了聚类处理,并针对未通过平衡检查的变量加入控制,但与标题所暗示的学生数量相比,这种设计的独立分配单元仍然少得多。在获得 GPT 访问权限的参与者中,90.5% 报告称遵守了分配给自己的处理条件。
OpenAI 的报道和Bocconi 的报告确认这所大学是 Bocconi。论文则称其为一所欧洲领先大学,并隐去了校名和美国经济学会试验注册号,以保持匿名。附录后来包含了 Bocconi 特有的任务文本。这是文档和可复现性方面的缺口,不是试验地点不同的证据。
0.862 分的提升属于一种评分量表
相对于估计的对照组分数 2.09,ChatGPT 访问权限让估计的认知度与使用率分数提高了 0.862 分。在五分制上,对于所测试的任务而言,这是一个相当大的效果。ChatGPT 辅助的建议也更接近三份专家文本。
论文的统计分析认为,部分提升来自更多想法、更清晰的逻辑和其他文本特征。在加入最完整的一组文本控制变量后,约三分之一的效果仍然存在。研究人员将这部分剩余效果解释为建议实质的改善,而不仅仅是呈现方式的改善。
这一发现仍有明确边界:这里的“实质”是指在实验所使用的认知度与使用率评估下,更强的建议。试验没有测试事实回忆、持久的商业知识、移除 ChatGPT 后的独立推理,或面对新类型问题时的表现。更高的作业分数不能承载这些主张。
干预还通过 ChatGPT Edu 使用了 GPT-4o。一个模型、账户环境、课程和作业的结果,不应在没有另一项测试的情况下迁移到更新的模型或其他学科。
原创性是计算出的距离,不是创造力评分
因果推理练习教学生构建因果链,陈述可以证伪提案的条件,并识别使提案有效的机制。接受这项训练的学生使用了更多基于机制、可证伪的推理。他们在每个答案内部提出的想法也更多样,并且与其他学生的想法差异更大。
标准营销评分量表没有奖励这些变化。在论文的模型中,答案越远离典型解答空间,可能得到越低的分数。这解释了为什么训练可以改变推理和想法集合,却没有提高标题所说的作业成绩。
“原创性”需要单独加以限定。人工评分者没有直接对创造性价值打分。附录描述了一条多阶段计算流程:
- GPT-5.2 在三种提示词变体下反复提取候选想法。
- 对重复运行的结果进行协调,其中不确定的匹配由 GPT-5.2 和 Claude Opus 4.6 判断。
- 使用 OpenAI 的
text-embedding-3-large模型对确认的想法生成嵌入。 - 通过余弦距离衡量想法在提交内部和提交之间的相互距离。
这是一个有披露、相当复杂的语义多样性操作性指标。它可以检测文本中的差异,但不能证明某个想法有用、可行、对领域专家来说出人意料,或在该班级之外真正新颖。由于 OpenAI 模型参与了提取、判断和嵌入流程,独立复现还应测试结果能否在使用不同模型和人工原创性评分时保持。
实验是否显示学生学到了更多?
没有。它显示 ChatGPT 访问权限提高了在特定评分量表下完成的建议质量,而因果推理训练改善了该建议的其他已测属性。
学习需要在辅助结束后进行另一次观察。例如,评估者可以要求学生解释自己的因果模型、批评一个不熟悉的提案、在延迟后复现推理,或在没有 ChatGPT 的情况下解决结构不同的问题。Bocconi 实验没有做这些事情。
这一缺失阶段很重要,因为获得辅助的表现和学习可能朝不同方向发展。在另一项涉及高中数学的独立同行评审现场实验中,研究人员发现,GPT-4 访问权限提高了练习表现,但使用不受限制助手的学生在之后一项无辅助考试中的得分比对照组低 17%。一个被设计成提供提示而非答案的辅导程序在很大程度上缓解了这种损失。PNAS 论文测试的是不同年龄段、学科、工具设计和结果,因此不是复现或反驳。它说明了为什么获得辅助的成果不能替代之后的学习衡量。
这项新研究目前是通过 OpenAI 渠道发布的工作论文。8 月 28 日的来源扫描没有发现同行评审发表或独立复现。Next AI Press 的另一份重建分析得出了相同的主要范围警告:结果涉及单项任务和计算指标,而不是一门课程中的学习。
OpenAI 也参与了这项研究。作者名单包括现任 OpenAI 研究人员、一位在受雇于 OpenAI 期间参与该项目的贡献者,以及一名获得 OpenAI 付费的承包商。这些关联并不会使实验失效,但会让独立复现和公开的预注册记录尤其有价值。
研究最重要的结果是缺失的学习衡量
这项试验对输出质量、因果推理和计算得出的原创性指标进行了足够的区分,显示这些处理以不同方式改变了它们。但它没有观察 ChatGPT 被移除后学生能够保留或迁移什么。
这一缺失并不会使报告的 0.862 分输出提升失效,它将主张限制在一种根据单项评分量表产生的、获得辅助的成果上。延迟后、陌生且无辅助的任务会回答另一个教育意义更重的问题。
因此,这项研究支持一个适度的结论:在这一环境中,ChatGPT 帮助学生提出更强的建议,而因果推理干预改变了主要评分量表没有奖励的工作特征。它没有显示任何一组学生都成为了更好的独立思考者。