九州大学 山田研究室

ChatGPT在英语写作评分中的准确性如何?——与教师评分的比较

2025年07月14日

大家好。
我来介绍一下在最近的英语文献研讨会上阅读的一篇论文。

论文标题: Exploring ChatGPT as a writing assessment tool
期刊: Innovations in Education and Teaching International
出版年份: 2024年
作者: Junifer Leal Bucol, Napattanissa Sangkawong


概要

本研究探讨了在泰国大学的英语课堂中,将ChatGPT作为自动写作评价(Automated Writing Evaluation; AWE)工具的应用潜力。研究利用ChatGPT,根据预先准备的提示词(Prompt)和评分量表(Rubric)对学生的作文进行评分,并将其与人工评分员的结果进行了比较。此外,通过对教师在评价过程中的反思进行定性分析,揭示了ChatGPT作为评价工具的优势与不足。

1. 引言
写作是语言习得过程中的重要环节,但如何对学生的写作进行评价并提供反馈,一直是教育工作者面临的长期挑战。随着班级人数的增加和时间限制,对客观且高效的写作评价系统的需求日益增长。传统的教师评价容易受到主观因素影响,导致评分标准不一,因此引入标准化量表或AWE作为提高评价一致性、公平性和效率的手段受到了广泛关注。

AWE的评价:优势与挑战
AWE的优势包括:为学生提供即时反馈和评分、促进重复学习、便捷高效、提高学生对写作和修改的参与度,以及提升写作准确性等。然而,一些AWE软件无法完全复刻人类评分员细致的评分能力,也难以完全模拟批判性思维和创造力。此外,还存在评价准确性受质疑以及引入成本等挑战。有观点认为,AWE应与教师反馈结合使用以实现效果最大化,不应作为替代手段。
研究缺口主要体现在以下两点:
• 关于AWE的研究虽多,但将ChatGPT作为AWE进行验证的实证研究较少。
• 几乎没有研究使用定制化量表将ChatGPT与人工评价进行比较。

2. 研究问题
本研究旨在比较ChatGPT与人工评分员在学生写作评价能力上的差异,并识别将ChatGPT作为评价工具时的优势与挑战,设定了以下研究问题:
RQ1: ChatGPT在使用预先设计的分析性量表评估短文时,与人工评分员相比准确度如何?
RQ2: 将ChatGPT作为写作评价工具的优缺点是什么?

3. 方法论
本研究采用了结合定量与定性方法的探索性研究方法。定量数据来源于ChatGPT和人工评分员(10名在泰国大学任教的EFL讲师)对10名学生(CEFR A2-B1水平)作文(主题:“我最喜欢的地方”,字数90-250词)的评分。教师被分为以下两组:
① 第一组(5名使用ChatGPT进行评价的教师)
② 第二组(5名人工评分员)
双方均基于包含5个定制评价标准(任务完成度、语法使用、词汇选择、逻辑性、机制)的量表进行评价。评分结果通过SPSS进行了信度检验和相关性分析。作为定性数据,参与教师记录了使用ChatGPT进行评价过程中的观察结果。

4. 结果与讨论
除个别情况外,ChatGPT与人工评分员的评分存在一定差异,但ChatGPT生成的评分相对较高,且表现出一致的趋势。
在评估数据集整体内部一致性的Cronbach’s alpha系数分析中,ChatGPT的评分为α = .980,人工评分员的评分为α = .926,整体为α = .954,均显示出较高数值,表明评分者之间的综合评分具有一致性和可靠性。
组内相关系数(ICC)分析结果显示p值小于.001,证实了评分者之间存在统计学上显著且一致的关系。皮尔逊相关分析也显示,特别是ChatGPT生成的评分之间存在强正相关。值得注意的是,“ChatGPT之间”的评分一致率最高,其次是“ChatGPT与人工”,最后是“人工之间”。
通过教师观察获得的定性数据,也揭示了ChatGPT在评价过程中的挑战。
例如:
・虽然能够基于量表进行一致性评价,但存在忽略细节要素的情况。
・在文本理解方面,虽然擅长把握主题和论点,但在理解复杂内容方面存在挑战。
・在纠错反馈方面,虽然能指出错误并提供改进建议,但对错误根本原因的说明较少。
・能够实现快速评价和持续反馈,但需要定期监控和调整。

本研究结果表明,尽管ChatGPT的评分存在一定波动,但其表现出的高内部一致性和评分者间的显著相关性,显示了ChatGPT作为可靠评价工具的潜力。其可扩展性(Scalability)带来的高效批量评分优势也得到了证实。然而,由于AI在评分时可能表现出宽容倾向,教师在使用该技术时需保持谨慎。此外,AI倾向于忽视量表标准中的具体要求,且在解释错误原因方面信息匮乏,这些都是亟待解决的问题。

5. 结论
ChatGPT展现了作为AWE评估写作的能力,在效率、一致性、速度和可扩展性等方面具有应用价值。同时,也必须认识到ChatGPT的局限性,如在解释作文中的特定信息时出现错误、理解复杂和创造性文体的能力不足、提供的评论未能涵盖写作的所有方面等。本研究的局限性在于参与评分的人数和作文样本较少,且仅限于短文评估。未来需要针对更复杂的任务,探讨AI与人类协作评价的相关研究。
将自动评价与人工审阅相结合的方法,特别是在需要详细评估的写作任务中,可以提高评价的准确性。通过整合ChatGPT与人类的专业知识,可以有效补充评价过程,为提升学生的写作能力提供有益支持。

6. 感想
本研究是一次探索将ChatGPT作为AWE工具的实践性尝试,无需特殊技术设备,教师个人层面即可开展。分析结果证实了人类与AI评价的一致性,从提高评分效率和可靠性的角度来看,其有用性得到了体现。另一方面,我认为本研究存在一些局限性。
首先,研究重点仅放在了评分者层面的效率和整合性上,缺乏如何将评价反馈给学习者并应用于后续学习的视角。此外,虽然使用了定制量表,但公开的部分评价标准中包含基于字数的定量要素(例如:“任务响应”中,100词以下的作文=0.5分,200词以上=2分)。在这种标准下,AI可能会在不考虑作文质量要素的情况下,仅根据字数判断分数。在AWE中使用量表时,我认为有必要充分验证其效度和适用性。
此外,AI与人工评分员的一致率仅基于量表的“总分”进行分析,并未明确指出在哪些维度(例如:语法、逻辑性)上出现了不一致。为了提升AWE的质量,我认为有必要进行更细致的维度分析。

文责: 田中早代

PAGE TOP