九州大学 山田研究室

学习者的反思能否通过捕捉语境来预测学习成果?

2025年09月01日

大家好。

本文将介绍我在英语文献研讨会上阅读的论文及其感想。

 

论文标题:Predictive Student Modeling in Game-Based Learning Environments with Word Embedding Representations of Reflection

作者: Geden, M., Emerson, A., Carpenter, D., Rowe, J., Azevedo, R., & Lester, J.

卷号页码: 31(1), 1-23.

出版年份:2021

期刊: International Journal of Artificial Intelligence in Education

 

背景

本研究旨在验证:通过将学生在游戏化学习过程中撰写的简短反思(Reflection)文本进行包含语言语境的数值化处理,并结合学习日志和前测成绩,是否能够从早期阶段预测后测成绩。在课堂或游戏中,支持的时机对学习效果影响巨大。如果能尽早判断“对谁、提供何种支持、提供到什么程度”,教师就能更准确地做出提示或调整分组等决策。以往的研究主要基于点击次数、移动轨迹、对话等行为日志或先验知识进行判断,而本研究挑战在于利用“学生自己的语言”进行语境化表达,以提高预测的及时性和稳定性。

 

方法

研究对象为美国的初中生(k-8),分析了使用科学探究游戏“CRYSTAL ISLAND”的课堂数据。游戏中会自动记录移动、与人物对话、查阅资料、任务达成等行为日志,并要求学生在故事节点用短文描述“学到了什么”和“接下来要做什么”作为反思。

收集的数据包括:①前测与后测得分,②游戏行为日志,③关于学习的情感与价值问卷,④反思文本。文本经过预处理后,通过两种嵌入法进行数值化。一种是“静态捕捉词语接近度的‘GloVe’”,另一种是“能够捕捉词义随语境变化特点的‘ELMo’”。研究将各反思的向量取平均值,并将从游戏开始到任意时刻的累积平均值作为“该时刻的语言特征”。预测每2分钟更新一次,利用所有可用数据(截至该时刻的行为日志、前测、反思)对后测成绩的高低进行分类。

 

结果

使用ELMo进行语境化表达的反思模型,在学习的早期阶段就表现出了稳定的预测能力;特别是在与简单的判定规则(线性SVM)结合时,能够在早期实现稳定的预测。此外,采用结合多个模型结果进行判断的“多数表决”方法(集成学习),比单一模型预测的结果波动更小,稳定性进一步提高。

另一方面,使用GloVe时,效果有时仅与不使用反思的情况相当,这暗示了在包含短文和多样化表达的反思中,考虑“阅读语境”具有显著优势。

总的来说,研究结论认为,即使是简短的自由文本,通过语境表达也能增加行为日志和前测难以捕捉的线索,从而实现更早、更自信的教学支持决策。

此外,关于评价指标,本次使用了F1分数(精确率、召回率)和Accuracy(准确率)等多种指标,但各指标下的最优模型有时并不一致。这表明预测的“及时性”与“可靠性”之间存在权衡,暗示了使用多样化指标进行评价的重要性。

 

 

考察

本研究的意义在于,将学习日志和前测难以获取的学习者语言,通过深入语境进行数值化,并将其与早期的可靠预测联系起来。即使是简短的反思,只要使用像ELMo这样能“阅读语境”的表达方式,就能成为有效的线索,提升预测的及时性和准确性。特别是结合多个模型的集成学习方法提高了初期阶段的稳定性,而使用线性SVM则在最终精度上表现稳健,这种分工在教育现场使用时非常直观。

在评价设计方面,除了Accuracy、F1、AUC等“预测准确度”外,同时使用“何时达到稳定判断(标准化收敛点)”和“稳定程度(收敛率)”这一点非常重要。在实践层面,这有助于尽早识别出预计在单元前半部分表现不佳的学习者,从而更易于采取资料引导、提示、调整分组等具体干预措施。

另一方面,由于存在一定数量早期预测不稳定的学习者,因此需要设计叠加学习日志等额外因素进行综合判断。总而言之,本研究为将预测模型从课后的事后评估重新定位为“课堂中教师决策的驱动力”提供了实践指南。

 

局限

本研究存在以下局限性:

首先,由于将后测成绩二值化,未能充分反映进步幅度或部分理解等要素。未来期望采用将得分作为连续值进行回归预测等方法。

其次,由于使用平均向量来表示反思,丢失了语序和论述展开等序列信息。由于越短的句子语序信息越重要,因此也应考虑能够处理顺序的模型(如卷积神经网络等)。

第三,自由文本容易受到动机和词汇量的影响,对于撰写短文或套话较多的学习者,信息量不足。需要设计考虑学习动机及其他影响因素的研究方案。

第四,在模型可解释性方面,难以看出“哪些表达对预测有效”。虽然使用嵌入表达可以无需人工进行标注,但无法判别预测精度的提升是源于捕捉到了“反思的本质特征”,还是仅仅考虑了“所用词汇的难度或句子长度”等表面特征。

 

以下是我的感想。

我阅读这篇论文是因为对“如何评价反思与学习成果之间的关系”这一课题很感兴趣。作为形成性评价,不仅利用小测验分数,还将反思定量化并用于预测学习成果,从而更全面地把握学习者状况并进行支架式教学,这一点在课堂设计上很有参考价值。如果要在实际现场实施,我认为可以结合学习日志和小测验分数等,长期验证教师如何利用反思进行课堂决策,这是一个值得期待的有趣领域。

另一方面,本次研究使用的是简短反思,且是在2-3课时的短期课堂中进行的实践,我对于句子长度或长期课堂中结果会如何受到影响存有疑问。例如,在单元总结时进行学习反思,这与下一单元的学习成果有何关联等,对于更长期的学习,是否依然能辅助成绩预测和教师决策,我对此很感兴趣。

此外,本次虽然是针对生物学知识习得的游戏学习,但如果想将其应用于“生涯教育”、“探究学习”等评价标准(即学习成果)更为复杂的领域,我认为反思的利用还有更多可能性。将反思用于评价,其最大的优点不仅在于简单的数值化,还在于能够捕捉语义特征,将分数等学习成果背后的学习者思考可视化。由于质性分析方法已经有很多,我希望未来能保持多样化的视角,拓宽知识面,以便能多角度地利用反思。

 

文责:尾崎康平

PAGE TOP