九州大学 山田研究室

CoT如何支持教师的形成性评价?

2025年07月22日

大家好。我是研究生李。
我想介绍一下在最近的英语文献研讨会中阅读的一篇论文,并分享我的感想。

论文标题:A Chain-of-Thought Prompting Approach with LLMs for Evaluating Students’ Formative Assessment Responses in Science
出版年份: 2024
作者: Clayton Cohn, Nicole Hutchins, Tuan Le, Gautam Biswas
期刊: In Proceedings of the AAAI Conference on Artificial Intelligence
卷号:第38卷
页码 :23182-23190

近年来,随着STEM教育的发展,科学地评估学生对科学概念的理解及解决问题的能力变得愈发重要。特别是形成性评价(Formative Assessment),作为把握学生学习状况并提供适时反馈的手段非常有效,但对于教师而言,评分负担沉重,且存在产生误判的风险。另一方面,近年来备受关注的大型语言模型(Large Language Models, LLM)通过自然语言处理技术,在自动评分和反馈生成方面的应用前景广阔。然而,特别是在科学领域,针对短文自由回答的评估以及评分理由说明生成的研究仍然有限。

本研究针对初中地球科学课程中的形成性评价,结合了基于GPT-4的思维链提示(Chain-of-Thought Prompting, CoT)与主动学习方法,开发并评估了针对短文自由回答的自动评分及反馈生成方法。

形成性评价是支持学生学习过程,同时也是教师把握学生理解情况的重要机会。然而,针对自由回答形式的短文评分耗时耗力,在实际教学现场难以实施。在自然语言处理领域,虽然自动评分研究有所进展,但对象多偏向数学或计算机科学等结构化形式,难以充分应对科学教育中伴随多样化表达的自由回答形式。此外,学习数据不足或类别不平衡等问题也阻碍了自动化的实现。

本研究尝试利用LLM对评估科学概念和推理的自由回答短文进行评分,并生成符合学习目标的推理说明。此外,为了克服数据不足的问题,引入了主动学习框架,旨在实现有效的模型改进。
作为研究对象,以美国公立初中的270名学生为对象,在为期3周的地球科学单元学习后,让他们完成“如何减少校内径流”的重新设计任务。题目由以下3部分构成,并分别为其设定了明确的评价标准(评分量表)。
1. “回答图中箭头大小的含义”
2. “列举图中在科学上解释得较好的两点”
3. “指出图中包含的两处错误”

270名学生的回答全部被收集,并由教师根据评分量表进行了评分。
本研究使用的是当时最新的LLM——GPT-4。评估提示词中包含了4-5个代表性的学生回答示例、评价标准及得分依据,构成了让GPT-4推导扣分或加分理由的结构。此外,在主动学习框架中,由人工分析模型容易误判的案例(例如推理错误或评价标准误用),并添加包含这些案例的新提示词用于再学习。通过这种方式,即使在标注数据有限的情况下,也能高效地提高模型精度。

数据集被划分为80%的训练集和20%的测试集。在训练数据上进行初步评估时,发现存在LLM与人工评分结果显著差异的案例,并将这些案例视为“LLM的评估失误”。例如,在第3题中,针对“应该改变所有箭头”这一错误回答,模型给出了满分。针对此类错误,通过添加强调“仅应改变径流箭头”这一正确答案示例的提示词,逐步改善了模型的推理精度。这一过程反复进行,直到在测试数据中无法确认性能提升或精度反而下降为止,最终完成了最优的提示词设计。结果表明,通过结合思维链(CoT)与主动学习,整体评估精度得到提升,特别是在概念理解相关的项目上确认了显著改善。

另一方面,本研究也揭示了模型因对特定词汇或过度详细的推理反应过度而产生过拟合的问题。此外,LLM的评估也成为了发现题目或评分量表模糊性的线索,显示出其可能有助于改善教育现场的课题设计。此外,模型在呈现评分结果时,偶尔会出现未提供充分理由的情况,这也是未来需要改进的课题。

本研究通过利用GPT-4及思维链(CoT),在初中科学教育的形成性评价自动化方面取得了有前景的成果。引入该方法,不仅可以把握学生的理解程度,还被认为能够提供促进下一阶段学习的有益反馈。今后,有必要进一步深化与教师的合作,持续开展将LLM应用于教育现场的实证研究。同时,对于隐私、偏见以及模型幻觉(Hallucination)等LLM固有的伦理课题,仍需谨慎探讨。此外,关于CoT推理如何影响模型的判断,目前尚未获得明确的见解,这将是未来的研究课题。另外,在评估项目较为简单的情况下,基于规则的方法可能比LLM更有效,这也再次暗示了根据用途选择方法的重要性。

以下是我对本论文的感想。目前,许多研究者往往直接利用现有LLM(大型语言模型)的API,而从零开始设计模型或进行微调的研究并不多见。在此背景下,本论文结合了上次介绍的思维链(CoT)推理提示与主动学习(Active Learning)方法,显著提高了LLM在科学教育领域针对学生自由回答短答题的评估精度和解释能力,这一点值得特别关注。这种方法新颖性高,在教育现场的实用价值也非常高,我认为值得推荐。此外,本研究采用了实际初中的地球科学课程(SPICE)作为具体的实验环境,研究内容与现场的教育实践紧密结合。因此,其研究结果对于教育现场的教师及教育支持技术的开发者也具有很高的参考价值,有助于课堂上的评估活动及为学生提供个性化反馈。此外,本论文通过主动学习方法,有效应对了教育数据中常见的数据不足及数据分布不平衡的问题。该方法在其他教育评估场景中也具有广泛的应用潜力,有望促进人工智能技术在教育领域的更深层次应用及广泛推广。

PAGE TOP