评估中的人机协同融合:重新思考 SAT005 课程中的多模态作业

摘要

 

生成式 AI 使教育评估中一个长期存在的假设变得不再稳固:学生提交的作品能够清楚地反映其个人思考。本文回顾了西交利物浦大学 SAT005“新兴技术导论”课程视频论文评估的重新设计。该课程要求学生将“本人原声口述内容”与至少一个 AI 生成配音片段结合起来,让人类创作痕迹与 AI 生成内容在同一项多模态任务中同步呈现。这项实操性作业规划逐渐发展为更广义的评估理念,即人机协同融合(Human-AI Syntegration)。本文提出的理论框架以三个原则为核心:人类判断、AI 增强和伦理披露。该框架主张:在 AI 深度渗透学习场景的当下,评估的核心目的并非将 AI 隔绝在学生作品之外,而是设计能够促使学生全程承担决策、信息核验、内容表达和作品归属权责任的任务。

 

关键词:生成式 AI;评估设计;多模态评估;混合智能;学术诚信;学生判断

 

1. 生成式 AI 时代的评估再思考

 

长期以来,语言与学术能力培养的评估体系建立在一套简洁的底层逻辑之上:学生产出的作业可以被视为其思考过程的直接佐证。学生固然会借助教材、网站、同伴讨论和教师反馈开展学习,但观点生成、梳理和表达的核心环节仍被认定为可清晰区分的人类自主行为。

 

生成式 AI 彻底打破了这一固有预设。短短数年间,学生已经能够借助各类工具一键生成摘要、写作提纲、概念解读、文稿脚本、图像素材、配音甚至完整多模态作品。随着这些工具逐渐进入日常学习实践,评估不能再将 AI 使用视作偶发、违规的特殊情况。更有意义的问题是:AI 正在如何重塑学生的观点生成、决策制定、信息甄别和认知表达方式。

 

这一矛盾在写作评估中尤为明显。传统论文长期作为衡量学生学业知识、批判性思维和学术表达能力的核心载体。如今,学生只需给出简短的提示词,就可能在数分钟内得到一篇较为完整的文章。这并不意味着写作能力不再重要,但它确实模糊了书面成果与学生真实学习成效之间的对应关系,也同时引出了作品作者归属、独立思辨能力、信息核验和责任划分的现实问题。

 

关于教育领域中 AI 的讨论,往往陷入二元对立的误区:要么全面限制 AI使用 以维护传统评估体系,要么在几乎不改变评估方式的情况下拥抱 AI。这两种立场都存在明显局限性。既然 AI 已经成为学生学习环境的一部分,评估设计就不能只停留在“允许”或“禁止” AI 使用上,而需要明确哪些人类核心能力具备不可替代性,以及如何通过任务设计直观呈现学生的自主思考成果。

 

人机协同体系中的互补性理论可提供有效研究切入点。McDowell(2025)转述了 Spiess 关于 AI 设计应考虑人类决策者的观点;McLaughlin 和 Spiess(2024)进一步指出,当 AI 能够在充满不确定性的场境中为人类提供支持,同时把最终判断和决策权保留在人类手中时,AI 才能真正创造价值。这一视角将关注点从“人类、机器孰优孰劣”转向“人类与人工智能如何在共同过程中发挥不同优势”。

 

将互补性理论落地到评估场景中可得出结论:评估的目标并非剔除作业中的AI元素,而是在 AI 支持的学习过程中保留有完整的、有实质意义的人类主观能动性。AI 可以提供更高的产出速度、内容规模、创意生成能力和制作支持;但学生必须自主定义研究问题、做出内容取舍、核验信息真伪、评判内容质量、阐释决策逻辑,并对最终提交的作品负责。

 

本文的研究实践正是源于这一核心问题意识。探索一套基于人机协同融合的全新评估模式:通过任务设计,引导学生以负责任、批判性和透明的方式与 AI 协作。相较于单纯研究如何通过评估遏制 AI不当使用,本框架更关注如何借助考核任务,让学生在真实AI辅助学习流程中充分展现自身思辨判断力。

 

 

2. 引言与背景:SAT005

 

这些问题出现在 SAT005“新兴技术导论”课程中。该课程是面向一年级本科生、在进入专业学习前修读的第一阶段预备课程。2025-2026 学年,该课程共有 243 名学生,来自不同学科背景。这使其成为一个有价值的场域,用于观察学生如何接触新兴技术,以及如何向他人表达这些技术的影响。

 

该课程设置了三个核心学习目标:学生需要梳理与新兴技术相关核心议题,涵盖技术带来的社会、经济和技术层面多重影响;熟练运用数字工具完成内容规划与创作;并能够用英语清晰有效地表达观点。这些成果刻意将技术理解、数字能力和学术沟通结合在同一学习体验中。

 

生成式 AI 使这些学习成果的评估更加复杂。传统论文虽能反映部分文献调研和书面论证能力,但无法完整覆盖课程对数字内容制作、受众导向表达和技术实际使用的重视。理解一种新兴技术并不仅仅是写出关于它的文字。学生还需要自主筛选案例,以可理解的方式解释技术概念,分析更广泛的影响,并使用数字工具组织出连贯的信息。

 

因此,该课程将个人视频论文设置为核心课程作业。学生围绕一项自选新兴技术,结合真实案例,制作一段五分钟的讲解视频。该任务要求学生分析技术基础和更广泛的社会影响,同时整合研究、脚本撰写、叙述、视觉设计、剪辑和口头表达全流程。

 

视频论文的形式也契合学生在课堂外主流的知识传播习惯。当下的知识传播经常通过语言、图像、数据可视化、剪辑和特定平台媒介规范的组合来实现。因此,该评估要求学生跨模态表达,而非简单地把一篇论文转换成视频。

 

该设计也与西交利物浦大学“教育 + AI”战略框架相一致。该框架主张人类智能与数字智能的协同融合,同时将情境智慧、伦理辨识和人类判断置于核心位置。SAT005 并没有把 AI 视为评估设计完成后才需要处理的外部问题,而是把评估本身作为思考如何纳入 AI、同时保持学生学习可见性的场域。

 

 

3. 方法:实施混合叙述模型

 

在确定视频论文形式之后,下一个问题是如何以兼具教育价值、全程透明且符合课程培养目标的方式引入 AI工具。AI 可以帮助学生头脑风暴、起草脚本、生成图像、制作配音和剪辑视频。但无约束的AI使用,会彻底掩盖学生自身的理解和沟通能力水平。

 

为平衡这一关系,SAT005 教学团队在最终视频论文评估中采用了混合口述模型。学生必须至少在视频 50% 的时长中出镜,且出镜部分需要与其“学生真实声音”叙述重合。此外,学生还必须加入至少一个独立的 AI 生成语音片段。

 

该规则具备多重教学价值:学生真实声音使口头表达继续成为任务核心,使学生能够展示英语表达的流利度、清晰度和个人理解。AI 生成语音片段则要求学生直接接触新兴制作技术,而不是只在抽象层面讨论这些技术。两种叙述方式共同使作品中的人类维度和 AI 维度变得可见。

 

选择“声音”作为焦点是经过针对性考量的设计。在视频评估中,声音是划分创作主体最直观的标识:学生叙述体现个人参与、理解和沟通控制;AI 叙述则展示数字工具在制作过程中的使用。通过同时要求两者,任务既避免隐藏 AI 使用,也避免产出完全由自动化工具生成的成品。

 

这一规则同步明确披露要求:学生需要识别 AI 生成元素,并说明制作过程中使用了哪些工具。其目标并不是“抓住”学生,而是把透明性和责任意识常态化为 AI 支持学术工作的组成部分。

 

最初,50/50 时长配比仅出于实操层面的评估设计考量,用于平衡语言表达考核、数字素养培养、合规使用 AI 和学术诚信。然而,在后续 EASE 项目的发展过程中,其承载的深层价值逐渐显现。关键并不在于50%本身,而在于它所建立的人类创作与 AI 生成内容之间的关系。

 

作业的观点构思、决策取舍、信息核验和成品定稿权责,全部归属于学生。AI 仅作为生成、迭代和制作支持工具的辅助工具。一个课程作业的硬性规则逐渐发展为更广义的设计原则:评估应当使人类创作内容清晰可见, AI 使用全程透明,并使二者之间的协作可供反思复盘。

 

 

4. 人机协同融合框架

 

人机协同融合框架正是基于上述设计思路的迭代升级产物。本文中的“协同融合”特指一种评估方式:在透明的工作流程中有意识结合人类判断与 AI 能力。学生可以借助AI 支持学习和制作,但仍保有对观点、决策、核验和责任的所有权。

 

该框架由三个相互关联的原则构成:人类判断、AI 增强和伦理披露。

 

 

 

图 1. 人机协同融合框架。

 

 

原则 学生责任 AI角色 示例
人类判断 界定焦点、评价证据、作出决策,并对结论负责。 提供建议或替代方案。

有些学生将物联网作为宽泛主题,并选择医疗健康作为具体案例。当他们不清楚物联网、AI 和机器人技术之间的区别时,会要求 AI 提供每种技术的具体例子,并对拟定案例给出建议。随后,学生会评价这些建议、权衡证据,并作出自己的最终决定。

AI 增强

设定目的、判断适配性,并整合输出。

支持起草、媒体制作和工作流程。

AI 增强 设定目的、判断适配性,并整合输出。 支持起草、媒体制作和工作流程。 在研究阶段,许多学生会找到支持项目论点的原始数据。他们先明确使用 AI 的目的(例如生成清晰图表),再用 AI 加快并优化数据可视化。之后,他们会批判性地判断 AI 生成视觉材料是否准确、相关,再将其整合进最终流程。
伦理披露 解释使用了什么,以及为什么重要。 使贡献可追踪、可讨论。 当学生使用 AI 工具(如豆包)生成图像时,作品通常会带有水印,我们鼓励学生保留并展示水印。同样,对于图表,如果学生使用 AI 协助生成,也需要清楚说明所用 AI 工具和原始数据来源。例如:“表 2 使用 Canva 生成,并包含规范的数据来源引用。”

 

 

 

人类判断

 

学生必须是学习过程中核心的思考主体。AI 工具可以提出思路建议、批量生成内容、总结或改写,但界定研究问题、锁定研究重点、甄别资料可信度、搭建论证逻辑并批准最终提交,全部是学生的核心职责。从评估视角看,这一原则至关重要:学习成果不仅体现在最终产出中,更体现在塑造产出的决策过程中。

 

 

AI 增强

 

AI 可以在构思、起草、媒体制作、视觉设计和流程管理中成为得力的工具。该框架并不会默认AI 支持均存在学术风险。关键区别在于,AI 应扩展学生的生产能力,而不是取代学生的思考。AI 提供工具与产能,学生提供创作目标、内容导向和质量判断。

 

 

伦理披露

 

AI 使用痕迹必须清晰可查,方便教师和学生能够诚实讨论。课程鼓励学生主动标注 AI 生成内容、说明所用工具,并解释这些工具如何参与最终作品。这一原则将学术诚信与学习设计联系起来:披露不仅是合规要求,也是帮助学生反思自身工作过程的方式。

 

 

将协同融合转化为评估设计

 

理论框架只有落地实践才有价值。在协同融合式评估流程中,选题和研究问题界定主要由学生主导。学生决定要研究什么、使用什么案例以及探究方向。AI 可以帮助他们探索可能性,但不应替他们决定研究焦点。

 

在研究阶段,AI 工具可以支持初步信息收集、总结和观点生成。但学生仍需自主核验文献来源、判断信息相关性并识别信息缺口。这是重要的学习环节之一,因为 AI 可能使质量较弱的信息显得流畅而自信。学生的责任是放慢节奏,交叉核验,并决定哪些信息可以信任。

 

在内容撰写阶段,人机协作属性最强。学生可以使用 AI 测试提纲、尝试不同表述、生成例子或考虑不同视角。但论证、结构以及内容与受众之间的匹配仍由学生负责。

 

在制作阶段,AI 可以支持语音合成、图像生成、剪辑、字幕和其他媒体元素。但视频最终的整合、连贯性和沟通效果仍由学生负责。流程应以核验、反思和披露结束,以确保责任在整个评估周期中保持可见。

 

这一模型并不依赖固定的数字比例。50/50 口述规则适用于 SAT005,是因为它契合视频论文的目标;其他课程可能需要不同的平衡方式。更广泛的目标,是设计一种评估任务,使人类判断和 AI 支持同时存在、同时可见,并且同时被纳入评分维度。

 

 

图 2. 协同融合式内容创作流程。

 

5. 初步反思与未来方向

 

该框架不仅受到评估理论的影响,也源于 SAT005 实施过程中的一线教学观察。这些观察并非正式研究结果,而是帮助我们厘清学生在哪些方面能从 AI 支持中受益,以及在哪些方面仍需要指导的实践反思。

 

一个清晰的规律是,绝大多数学生都能够较快适应 AI 支持的制作工具。他们愿意主动尝试头脑风暴工具、图像生成器、语音合成和视频剪辑支持。技术门槛低于预期;只要任务给出明确使用理由,学生往往能够自主学习新的工作流程。

 

学生面临的核心难点极少来自技术操作层面。学生更常需要在选择合适案例、缩小宽泛主题、判断资料质量、构建连贯论证和理解评估要求方面获得支持。AI 可以加快制作过程,但不能消除批判性思维、情境理解和学术判断的需求。

 

这一现象进一步印证了协同融合框架的核心假设:AI 赋能评估中的主要教育挑战,或许并不是学生是否会使用 AI 工具,而是他们能否在 AI 支持的工作流程中持续保持判断力。有意义的学习仍依赖于评价信息、说明选择、清晰沟通并对最终作品负责的能力。

 

实施过程也提出了多项待研究问题。学生如何理解自身创作与 AI 生成内容之间的平衡?在 AI 辅助作品中,什么才算有实质意义的作品所有权?如何设计披露要求,使其支持反思,而不仅仅成为额外的合规步骤?人机协作本身能否成为学习评估的一个维度?

 

这些问题推动了 EASE 资助项目“设计协同融合蓝图:面向多模态评估的可扩展 50/50 混合智能框架”的发展。该项目把工作从初步评估设计推进到系统性完善与评价。它不只是询问学生是否使用 AI,而是关注学生如何在学习过程中理解、协商和反思与 AI 的合作。

 

该项目的价值也突破单门课程范畴。尽管SAT005 使用了具体的叙述要求,但该框架可以适配不同学科、评估形式和教育层级。其长期贡献可能在于帮助教师设计评估任务,使人类贡献可见、AI 使用透明,并使学生判断处于核心位置。

 

 

6. 面向 AI 增强评估设计的实践建议

 

SAT005 的经验为正在回应生成式 AI 而重新设计评估的教师提供了若干实践建议。

 

第一,应明确任务中哪些部分必须保持清晰的人类贡献。根据不同课程,这可能是口头解释、现场决策、来源评价、对选择的反思,或将理论与具体情境相连接的能力。一旦明确了这一人类贡献,AI 使用就可以围绕它进行设计,而不是被视为模糊风险。

 

第二,使 AI 使用可以被讨论。当任务为学生提供解释自己如何使用 AI 的语言时,学生更可能负责任地使用 AI。简单的披露要求是有帮助的,但不应只停留在列出工具。可以要求学生说明流程中哪些部分得到了 AI 支持、他们接受或拒绝了什么,以及如何核验输出质量。这样,披露就从结尾处的形式要求转化为学习活动。

 

第三,评估判断,而不仅是评估产出。在 AI 支持的工作流程中,精致的最终作品可能掩盖薄弱的推理。因此,评估标准需要识别产品背后的选择:案例的相关性、资料来源的可信度、解释逻辑、媒介选择与受众之间的匹配,以及学生反思局限的能力。这些标准帮助学生理解,AI 可以支持制作,但不能承担学术判断的责任。

 

最后,为学生提供足够结构,以支持负责任的尝试。SAT005 中的 50/50 叙述规则之所以有效,是因为它让期待变得可见,同时仍为创造性制作留出空间。其他课程可能需要不同形式的平衡。关键设计问题不是比例是否完全相等,而是任务是否建立了学生贡献与 AI 支持之间可见且有意义的关系。

 

从这个意义上说,人机协同融合并不是叠加在既有评估之上的额外层次,而是一种使评估设计更明确的方法。它要求教师澄清他们需要什么样的学习证据、AI 可以在何处有效支持流程,以及学生如何展示自己仍对提交作品负责。

 

本文讨论的一个局限是,它基于早期教学反思,而非已经完成的实证研究。未来仍需更多证据来理解学生如何体验 50/50 模型、他们在多大程度上能够持续披露 AI 支持的工作,以及该框架在不同课程和学科中的适用情况。

 

 

结论

 

生成式 AI 挑战了教育评估中的长期假设。随着 AI 成为学生常规学习流程的一部分,关于作者身份、透明性、责任归属和学习证据的问题将变得更加复杂。回应方式不应局限于排除 AI 或无结构地允许 AI。评估需要被重新设计,使负责任的 AI 参与与有意义的人类贡献能够同时被看见。

 

本文通过 SAT005“新兴技术导论”课程中多模态视频论文评估的重新设计,描述了人机协同融合框架的发展。一个实践性要求,即学生真实声音与 AI 生成语音的结合,成为了更广义评估理念的起点。这一理念基于人类判断、AI 增强和伦理披露三个原则。

 

该框架并不是一个完成的解决方案,也不是一个可直接复制的单一模式。它是一种在 AI 深度介入的教育环境中提出更好评估问题的方式。如果人类与人工智能越来越多地并肩工作,那么评估的未来可能取决于教师能否设计出让判断、创造力、责任和学习保持可见的任务。

 

 

生成式 AI 使用声明

 

本文在稿件整合、语言编辑以及两幅图示的视觉开发过程中使用了生成式 AI 工具,包括 OpenAI 的 ChatGPT 和 Gemini。作者对所有 AI 辅助产出进行了审阅、修订和确认,并对本文的论点、准确性、参考文献和最终内容负责。

 

 

参考文献

 

McDowell, M. (2025) 'Designing AI That Keeps Human Decision-Makers in Mind', Stanford Graduate School of Business Insights. Available at: https://www.gsb.stanford.edu/insights/designing-ai-keeps-human-decision-makers-mind (Accessed: 17 June 2026).

 

McLaughlin, B. and Spiess, J. (2024) Designing Algorithmic Recommendations to Achieve Human-AI Complementarity. arXiv preprint arXiv:2405.01484. Available at: https://arxiv.org/abs/2405.01484 (Accessed: 17 June 2026).


作者
徐蕊 语言讲师
学术语言能力中心
西交利物浦大学

姚雪 副语言讲师
学术语言能力中心
西交利物浦大学

日期
2026年07月27日

相关文章