九州大学 山田研究室

CoT如何支持教师进行形成性评价?

2025年07月22日

大家好。我是研究生李。
我想介绍一下在最近的英语文献研讨会中阅读的一篇论文,并分享我的感想。

论文标题:A Chain-of-Thought Prompting Approach with LLMs for Evaluating Students’ Formative Assessment Responses in Science
出版年份: 2024
作者: Clayton Cohn, Nicole Hutchins, Tuan Le, Gautam Biswas
期刊: In Proceedings of the AAAI Conference on Artificial Intelligence
卷号:第38卷
页码 :23182-23190

近年来,随着STEM教育的发展,准确评估学生对科学概念的理解和解决问题的能力变得愈发重要。特别是形成性评价(Formative Assessment),作为把握学生学习状况并及时提供反馈的手段非常有效,但对于教师而言,评分负担沉重,且存在评价偏差的风险。另一方面,近年来备受关注的大型语言模型(Large Language Models, LLM)通过自然语言处理技术,在自动评分和反馈生成方面的应用前景广阔。然而,针对科学领域中短文自由回答的评估以及评分理由说明生成的研究仍然有限。

本研究以初中地球科学课程中的形成性评价为对象,结合了基于GPT-4的思维链提示(Chain-of-Thought Prompting, CoT)与主动学习方法,开发并评估了针对短文自由回答的自动评分及反馈生成方法。

形成性评价不仅支持学生的学习过程,也是教师把握学生理解情况的重要契机。然而,针对自由回答形式的短文评分耗时耗力,在实际教学现场难以实施。在自然语言处理领域,自动评分研究虽有进展,但对象多偏向数学或计算机科学等结构化形式,对于科学教育中伴随多样化表达的自由回答形式尚无法充分应对。此外,学习数据不足或类别不平衡等问题也阻碍了自动化的进程。

本研究尝试利用LLM对评估科学概念和推理的自由回答短文进行评分,并生成符合学习目标的推理说明。同时,为克服数据不足的挑战,引入了主动学习框架,旨在实现模型的高效改进。
研究对象为美国公立初中的270名学生,在为期3周的地球科学单元学习后,让他们参与了“如何减少校内径流”的重新设计任务。题目由以下3部分构成,并分别为其设定了明确的评价标准(评分量表):
1. “回答图中箭头大小的含义”
2. “列举图中在科学上解释得较好的两个点”
3. “指出图中包含的两个错误”

270名学生的回答全部被收集,并由教师根据评分量表进行了评分。
本研究使用的是当时最新的LLM——GPT-4。评估提示词中包含了4至5个典型的学生回答示例、评价标准及得分依据,构成了让GPT-4推导扣分或加分理由的结构。此外,在主动学习框架下,由人工分析模型容易误判的案例(例如推理错误或评价标准误用),并将包含这些案例的新提示词加入其中,用于再学习。通过这种方式,即使在标注数据有限的情况下,也能高效地提升模型精度。

数据集被划分为80%的训练集和20%的测试集。在训练数据进行初步评估时,发现LLM与人工评分结果存在显著差异的案例,并将这些视为“LLM的评估失误”。例如,在第3题中,对于“应该改变所有箭头”这一错误回答,模型给出了满分。针对此类错误,通过添加强调“仅应改变径流箭头”这一正确答案示例的提示词,逐步改善了模型的推理精度。该过程不断重复,直到在测试数据中无法确认性能提升或精度反而下降为止,最终完成了最优的提示词设计。结果表明,通过结合思维链(CoT)与主动学习,整体评估精度得到了提升,特别是在概念理解相关的项目上,改善效果显著。

另一方面,本研究也揭示了模型因过度响应特定词汇或过于详细的推理而产生过拟合的问题。此外,LLM的评估也成为了发现题目或评分量表模糊性的线索,显示出其改善教育现场任务设计的潜力。同时,模型在给出评分结果时,有时未能提供充分理由,这也是未来需要改进的课题。

本研究通过利用GPT-4及思维链(CoT),为初中科学教育中形成性评价的自动化展示了有前景的成果。引入该方法,不仅能把握学生的理解程度,还被认为能够提供促进下一阶段学习的有益反馈。今后,有必要进一步深化与教师的合作,持续开展将LLM应用于教育现场的实证研究。此外,对于隐私、偏见以及模型幻觉(Hallucination)等LLM固有的伦理问题,仍需谨慎考量。另外,关于CoT推理如何影响模型的判断,目前尚未获得明确的见解,将作为未来的研究课题。同时,在评估项目较为简单的情况下,基于规则的方法可能比LLM更有效,这也再次暗示了根据用途选择方法的重要性。

以下是我对本论文的感想。目前,许多研究者往往直接利用现有LLM(大型语言模型)的API,而从零开始设计模型或进行微调的研究并不多见。在此背景下,本论文结合了上次介绍的思维链(CoT)推理提示与主动学习(Active Learning)方法,显著提升了LLM在科学教育领域针对学生自由回答短答题的评估精度与解释能力,这一点值得特别关注。这种方法创新性强,在教育现场的实用价值也非常高,因此我认为值得推荐。此外,本研究采用了实际初中的地球科学课程(SPICE)作为具体的实验环境,研究内容与现场的教育实践紧密结合。因此,其研究结果对于教育现场的教师及教育支持技术开发者而言具有很高的参考价值,有助于课堂上的评估活动及为学生提供个性化反馈。此外,本论文通过主动学习方法,有效地应对了教育数据中常见的数据不足及数据分布不平衡的问题。该方法在其他教育评估场景中也具有广泛的应用潜力,有望促进人工智能技术在教育领域更深层次的应用与更广泛的推广。

PAGE TOP