外观
AI 辅助与人类技能形成的分离测量
摘要
该研究用“无 AI—可按成本请求 AI—再次无 AI”的三阶段逻辑题实验,区分辅助期间的即时表现和撤除辅助后的技能。最终样本为 124 名居住在美国、至少具有本科学历的英语成年人;低成本组(43 人)平均请求 6.67 次,高成本组(39 人)为 3.33 次,单侧 Welch 检验仅达到 p < 0.10。
使用过 AI 的参与者在最终无辅助阶段平均每分钟正确对象数为 3.42,未请求者为 3.86;用辅助阶段表现预测后续无辅助表现时,AI 使用者的奖励率平均被高估 0.22 个单位。结果提示认知卸载风险,但不证明 AI 使用本身必然导致长期技能退化。
核心特点与评估范围
实验通过随机化每次求助的积分成本改变使用频率,并用始终正确的模拟 AI 排除模型质量差异。研究重点是短期、任务特定的技能形成,而不是教育成绩、职业能力或长期认知变化。
评估方法与实际过程
参与者先完成八分钟无辅助基线,再在 20 分钟阶段进入无 AI、低成本或高成本条件,最后完成同结构无辅助复测。贝叶斯潜在能力模型联合准确率和响应时间,估计初始能力、后测能力及个体技能变化,并比较独立思考占比与请求次数。
关键结果与风险解释
独立思考占比与潜在能力增长正相关,后验均值为 0.125,95% 可信区间 [0.002, 0.246];请求次数的系数接近零,区间跨零。每多保留一分钟独立思考,模型预测后测准确率提高 1.5%、响应时间缩短 2.5%。风险焦点因此是辅助是否替代必要练习,而非简单限制调用次数。
局限与待验证问题
独立思考占比不是随机处理,相关性不能解释为因果;样本规模较小且限于受过本科教育的美国参与者、短时逻辑题和 100% 正确的模拟助手。需在真实模型、长期学习和专业任务中复核。