香港科技大学张军教授、孟子立教授团队主导一项实验,测试搭载ChatGPT-5.2模型的AI眼镜在《计算机网络原理》本科期末考试中的实际表现。
研究团队对市面上12款主流智能眼镜进行评估,最终选定乐奇Rokid AI眼镜作为硬件平台,因其SDK生态完善、开发自由度高,且具备内置摄像头与集成显示屏。
在复刻真实考试条件下,AI眼镜通过摄像头拍摄试卷题目,经“眼镜—手机—云端”链路将图像传输至远程大模型推理,生成答案后反向返回并显示于镜片屏幕,供使用者抄录。
该系统在30分钟内完成整套试卷作答,最终得分92.5分,在百余位考生中位列前五,超过95%的人类学生。
在多项选择题和单页短答题部分,AI眼镜获得满分;面对跨页短答题(SAQ),其亦展现出较强的上下文理解与逻辑连贯性,中间推导步骤完整,仅在最复杂计算环节偶有偏差。
实验揭示当前商业AI眼镜的技术瓶颈:持续高分辨率图像传输导致功耗显著,30分钟内电量从100%降至58%;镜头清晰度、反光及拍摄角度影响图像输入质量,进而降低答题稳定性。
此次测试反映出传统教学评估体系面临的挑战——以标准答案为核心的考核方式恰好处于AI优势区间,而人类学生的记忆、计算、步骤推导能力在AI面前失去差异化优势。
此前英国雷丁大学研究显示,AI生成答卷可混入考试题库且94%未被识别,平均成绩高于真实学生,进一步凸显评估机制滞后问题。
教育评估正面临从“交答案”向“交思路”的转型压力,需更多关注提出问题、信息判断、方案权衡与情境理解等难以量化的高阶能力。
纽约大学Stern商学院已尝试引入AI辅助口试评估,要求学生现场解释决策逻辑,由Claude、Gemini、ChatGPT对口试转录独立评分并交叉审核,以检验真实理解水平。
部分海外高校开始采用展示型作业、口头答辩等形式,推动学习过程显性化。
本次实验并非针对作弊行为本身,而是揭示当工具能稳定完成知识提取与标准作答时,课堂教学与测评体系是否仍能有效区分不同层次的思维过程,已成为亟待回应的现实课题。
免责声明:本文内容由开放的智能模型自动生成,仅供参考。



