你可能听说过很多关于人工智能能够批改论文的说法。确实,各大科技公司都在宣传他们的模型可以替代人类教师进行快速评分,节省大量时间。
但现实情况可能让你大吃一惊。最新研究揭示了AI评分的严重问题,这些结果可能会改变你对自动评分工具的信任度。
研究人员测试了两个版本的AI模型,对50篇生物科学专业本科生的论文进行评分。评分标准包括7项具体要求,AI尝试了4种不同的提示方式来完成这项任务。
结果显示,AI给出的平均分与人工评分的最大差距达到16.1分。更令人担忧的是,单篇论文的最高差距竟然达到了40分。这样的误差在任何正规教育评估中都是不可接受的。
研究发现了一个更值得警惕的现象。AI模型倾向于压低高分论文的成绩,同时抬高低分作业的成绩。这种做法导致评分结果系统性地向中间集中。
这意味着使用AI评分,你的优势可能被埋没,而表现较差的学生可能获得虚高的分数。这种偏差会直接影响学生的学业记录和最终评价。

卡迪夫大学的威廉·凯博士指出,只看总分时AI与人工评分的差异相对较小。然而,一旦细化到每个评分标准和每一篇具体论文,差距就变得非常明显。
这说明AI只能识别表面模式,无法像人类教师那样深入理解论文的论证逻辑和学术价值。对于主观性较强的书面作业,AI的评判能力远远达不到人类水平。
未经学生明确同意就将其作业提交给AI工具评分,这本身就涉及到严重的隐私和伦理问题。学生的学术成果不应被随意交给技术系统处理。
更重要的是,大模型不应该、也不能够被依赖来对学生的长篇书面作业进行评分。教育评估关系到学生的未来,必须保持严格的把关标准。
虽然现在有些教育科技公司极力推广AI批改服务,承诺提高效率、减轻教师负担。但这项研究明确指出,现阶段AI并不适合承担这项重任。
作为教育工作者,你应该如何保护学生利益?在面对各种AI教育工具的推广时,你会采取什么措施来确保评分的公正性和准确性?