大家好,我是研究生Cho。
在此向大家介绍我在前几天的英语文献研讨会中阅读的论文及其感想。
论文标题: VizChat: Enhancing Learning Analytics Dashboards with Contextualised Explanations using Multimodal Generative AI Chatbots
期刊:Artificial Intelligence in Education
出版年份:2024
作者:Lixiang Yan, Linxuan Zhao, Vanessa Echeverria, Yueqiao Jin, Riordan Alfredo, Xinyu Li, Dragan Gaševi’c & Roberto Martinez-Maldonado
以下是论文内容概要。
概要
随着技术的发展,教育数据的应用日益深入。用于可视化这些数据的仪表板被称为学习分析仪表板(LAD)。LAD不仅能让学生监控自己的学习状况并促进自主学习,还具备让教师掌握学生学习情况的功能。然而,随着多模态学习分析和教育数据挖掘的进步,文本、音频、图像、视频等多样且复杂的数据收集工作正在推进。由于这些数据的格式和特性差异巨大,必须采用各自适宜的方法进行可视化。因此,将这些数据以简洁易懂的形式进行统一可视化变得十分困难。
人们担心,当可视化变得复杂时,会增加学习者和教育者的认知负担。特别是对于不擅长理解图表的人来说,LAD的实用性可能会降低。因此,如何为这些人提供支持成为了一个课题。本研究开发了一款名为“VizChat”的软件。该软件通过生成文本来解释复杂的LAD,旨在帮助不擅长理解图表的教师和学习者提高对LAD内容的理解。
本研究设定的研究问题如下:
1. 该软件向读者呈现什么样的内容才是合适的?
2. 同时处理视觉数据(LAD)和文本数据需要什么样的技术?
针对问题1,作者提出了“数据叙事(Data Storytelling)”的方法。数据叙事是指基于复杂数据和分析构建引人入胜的故事,从而将想要传达的内容有效地传达给特定受众的概念。通过使用这种方法,可以将文本与可视化相结合,为使用LAD的人们提供适当的支持,从而加深对整个LAD的理解。
针对问题2,为了处理复杂的模态数据并生成适当的数据叙事,自然语言处理(此处指如GPT-4V这类能够处理多模态数据的大型语言模型)成为了解决方案。这些模型能够基于可定制且预定义的学习内容,提供准确且符合语境的解释,并确保其信息丰富且与学习内容相关。针对大型语言模型生成错误信息的问题,本研究采用了RAG(检索增强生成)技术来解决。RAG是一种为生成式AI模型增加信息检索能力的技术。通过该技术,模型在回答用户问题时会参考指定的一系列文档,从而补充其自身海量训练数据中的信息。通过设置专用数据库,可以防止错误生成。
系统设计
VizChat的原型是作为Chrome扩展程序构建在基于Web的LAD之上的,具备屏幕截图捕获和用户聊天功能。
数据库:创建一个包含所有相关上下文信息的知识数据库,对于最大限度地降低生成式AI提供可能误导学习者或教育者的幻觉或不当解释的风险至关重要。
LAD的管理员和教育者可以上传与LA相关的文档,例如课程或任务说明。
案例研究
本研究的案例研究“本科护理教育中临床模拟单元的设计”实际展示了VizChat如何在LAD中被应用。通过三个对话示例,说明了VizChat如何支持学生理解可视化数据并进行反思。
VizChat能够记忆用户的问题并提供具体的解答。此外,它还可以整合多种可视化工具,解释数据收集和分析的过程。这些示例选自学生在使用LAD时遇到的困难,展示了VizChat的潜力。
虽然并非正式评估,但由于VizChat以开源形式提供,使得后续研究变得更加容易。在实际使用中,VizChat作为Chrome扩展程序显示在LAD界面上,支持学生的反思。LAD系统被用于本科护理教育的临床模拟中,通过时间轴、优先级图表、病房地图、社交网络图等可视化工具,帮助学生理解实际应用中复杂的视觉信息。
感想与问题
总的来说,VizChat是一款利用大型语言模型和RAG来支持LAD的软件,提供了许多有趣的功能。这篇论文提到了当前LAD中视觉识别困难的问题,并指出这会影响LAD的实际效用,我认为这是一个非常重要的观点。
这与我的研究也有关联,论文中提到的某些局限性问题,在我的研究中也很可能会遇到。例如,像ChatGPT-4这类付费模型的成本问题,以及在提供RAG数据库时文本质量至关重要等点。因此,我选择了这篇论文。
这篇论文并未对该软件进行评估或实验,虽然创意很棒,但我认为仍存在许多疑问。
首先,原文中将不擅长理解图表的对象称为“可视化素养低的人”。但问题在于,什么是“可视化素养”,其定义是如何界定的。我认为这是一个非常重要的问题。如果不能准确判断使用者的可视化素养,就很难准确推荐后续功能。在我自己的研究中,也存在“什么样的LAD推荐对使用者最优化”的疑问。如果错误地向可视化素养较高的教师或学生进行不恰当的推荐,该软件反而可能会妨碍他们的判断。因此,我认为有必要设计一种机制,在推荐之前过滤掉不需要这些提示的人。然而,我认为在实际教育现场实现这一点相当困难。他们必须经过筛选才能使用,这可能会导致许多用户放弃使用该软件。
关于生成式AI,虽然大致提到了RAG,但我很想知道如何创建更具体的RAG数据库。此外,我也很在意如何确保该数据库所使用数据的质量,以及其筛选标准是什么。这需要明确的标准,否则无法从根本上解决大型语言模型生成内容的问题,也可能导致生成不准确的内容。
最后,这篇论文中仅讨论了GPT的使用,例如没有与LLaMA等其他本地开源模型进行比较。我认为这种比较是有必要的,因为作者作为局限性提到的大型语言模型成本问题依然存在。




