大家好。我是博士课程一年级的田中。
我来介绍一下在最近的英语文献研讨会上阅读的论文。
论文标题: Large language models fall short in classifying learners’ open-ended responses
期刊: Research Methods in Applied Linguistics
出版年份: 2025年
作者: Atsushi Mizumoto, Mark Feng Teng
1. 引言
大型语言模型(Large Language Model: LLM)作为能够像人类一样生成和分析文本的工具,已被应用于各个领域。在应用语言学领域,将其用于分析自由回答和访谈数据也正在推进。近年来,LLM展现出的高语言处理能力,使得人们开始尝试将其引入分类和编码等工作中。另一方面,由于其在理解语境和把握概念间关系方面存在局限性,人们也指出了与人类协作的必要性。本研究旨在通过将LLM对自由回答的分类精度与人类的判断进行比较,明确LLM在质性研究中应用的潜力和课题。
2. 理论框架
在质性研究中对自由回答数据进行分类时,需要通过明确的类别定义、严谨的训练以及人类编码员之间反复达成共识,来确保信度和效度。研究者在分配代码时,会考虑语境和表达的细微差别,并基于编码手册和理论模型进行分析。本研究将自我调节学习(SRL)中元认知层面的“计划”、“监控”、“评估”这三个过程,按照Teng等人(2022)的问卷进行了分类。
3. 研究课题
本研究的研究课题是:“LLM能多准确地分类自由回答数据?”。具体而言,旨在通过与人类编码员的比较,验证LLM在基于“计划”、“监控”、“评估”定义的分类任务中的分类精度。
4. 研究方法
本研究的对象是日本私立大学英语专业的143名一年级学生(CEFR B1~B2水平)。我们收集了学生用一句话描述“在用英语写作文时,是如何进行写作的”的自由回答。回答由两名拥有应用语言学博士学位的研究者进行英译和分类,并实施了回译。分类遵循Zimmerman(2000)的SRL理论中的“计划”、“监控”、“评估”这3个类别。如果包含多个要素,则根据最显著的过程进行分类;若存在意见分歧,则由第一作者加入并达成共识。
LLM分析
本研究使用了7种LLM(GPT-4o、GPT-o1、GPT-o3mini、Llama3.3–70B、Gemini2.0-Flash、Claude3.5-Sonnet、DeepSeek-V3)。通过API访问各模型,并执行相同的分类任务。指示模型将143名学生的自由回答分类为“计划”、“监控”、“评估”中的任意一项。
LLM分类的准确性通过“简单一致率”和“Cohen的Kappa系数”进行评估。
提示词设计
起初尝试了仅提示定义的零样本(zero-shot)分类,但精度不足,因此创建了包含类别定义和具体示例的结构化提示词。提示词包含以下3点:
① 各类别的明确定义
② 具体的回答示例
③ 输出格式的指定(仅类别名称)
通过这种结构,提高了分类精度和输出的一致性。
5. 结果
模型间比较
・与人类编码员一致率最高的是DeepSeek-V3,一致率为83.2%,κ = 0.68。
・其次是Llama3.3–70B(κ = 0.61)和GPT-o3mini(κ = 0.60),表现出中等程度的一致性。
・GPT-4o、GPT-o1、Gemini2.0-Flash、Claude3.5-Sonnet的κ值在0.37~0.49之间,被判定为弱一致性。
・开源模型(DeepSeek-V3、Llama3.3–70B)的精度超过了商用模型。
误分类倾向
主要的误分类模式如下:
① 计划与监控的混淆
例:“全部写出来后再检查”→ 本应属于监控,但许多模型将其分类为计划。
② 对“修改”的模糊解释
“写作中的修改”与“写作后的检查”被混淆,倾向于仅凭“修改”一词将其分类为评估。
③ 对句法的过度依赖
若出现“first… then…”等表达,容易被自动判定为计划。
6. 讨论
本研究验证了LLM在多大程度上能按照预定义的类别准确分类自由回答。结果显示,虽然DeepSeek-V3(κ = 0.68)和Llama3.3–70B(κ = 0.61)表现出中等程度的一致性,但并未达到被视为高信度分类标准的κ ≥ 0.8。这表明,目前的LLM在自由回答这种依赖语境的分类任务中,很难做出与人类同等的判断。另一方面,LLM可以进行一致的初步分类,通过与后续的人工复核相结合,有望实现高效且可靠的质性分析。
LLM与人类判断的区别
LLM与人类分类判断的明确区别在于,人类会基于语境和常识来解读学习者的意图,而LLM则基于表层的语言模式进行判断。例如,若出现“写完后确认”这样的表达,无论内容如何,都容易被分类为“评估”。此外,“first… then…”之类的句法也倾向于被自动解读为“计划”。
提示词改进方向
作为今后的改进,可以考虑以下几点:
・少样本提示(Few-shot prompting):除典型示例外,还提示容易误分类的示例。
・思维链提示(Chain-of-thought prompting):分阶段引导分类的思考过程。
・对比示例(Contrastive examples):展示即使句子相似但分类不同的示例。
・利用置信度得分:针对模糊的判断,促使人类进行二次确认。
模型间性能差异的原因
开源模型精度高于商用模型的原因,被认为与最新的架构、高质量的训练数据以及Mixture-of-experts等设计有关。另一方面,这也表明即使是像Claude3.5-Sonnet这样擅长生成解释和对话的模型,在结构化的分类任务中也可能并不适用。
7. 启示与未来展望
本研究在将LLM应用于质性分析时,提供了以下实践性启示:
・作为辅助工具的有用性:特别是在大规模数据集中,可以减轻工作负担。
・需要预先验证:LLM的分类结果必须与人工编码进行比较确认。
・确保透明度:必须明确使用了LLM,以确保可重复性。
・对表层判断的依赖:LLM比文意更容易受表达形式的影响,在模糊的情况下,人类的判断不可或缺。
今后的研究可以考虑以下方向:
・高级提示词设计(引入few-shot、chain-of-thought、对比示例等)
・通过置信度得分识别模糊判断
・针对特定领域对模型进行微调
・在多样化的数据集和分类框架中进行性能比较
通过这些研究,期待构建出LLM与人类协作的混合型分类支持系统。
8. 感想
选择这篇论文的原因是,为了在将LLM应用于语言教育时获得设计更高精度提示词的实证见解,以及加深对自由回答式回答进行质性编码的方法论理解。本研究比较了7种LLM模型,对于把握生成式AI的最新动态也很有帮助。此外,研究中使用的数据和提示词等均已公开,也为研究的透明度和可重复性做出了贡献。我认为本研究为理解在教育现场和研究实践中应用LLM的现状,以及明确今后应解决的课题,提供了重要的见解。
作为课题,本研究中作为编码对象的自由回答都被限制为“一句话”。由于这一限制,LLM的输出容易依赖于“if”或“then”等词序模式等表层语言线索,认为对于基于语境的语义理解和判断的准确性尚未得到充分验证。在实际的教育现场,学习者的自由回答通常由复句或段落构成,因此我认为今后有必要验证LLM对于包含隐含意义和复杂结构的描述的分类精度。




