评测
ChatGPT 让作业更像专家,批判性思维让想法更独特:1000+ 学生随机实验说明了什么?
OpenAI 在 2026 年 8 月 27 日公布了一项与 Bocconi University 研究者合作的随机实验:1000 多名大一学生完成一个真实营销案例,并被随机分为四组——可使用 ChatGPT(GPT‑4o)、接受因果推理训练、两者都有、两者都没有。结果很有意思:ChatGPT 组在五分制人工评分中平均接近高出 1 分,答案更丰富、逻辑更清晰,也更接近专家建议;因果推理训练却在传统评分中没有明显提升,但学生提出的想法范围更广、更不雷同,也更会说明为什么一个方案可能有效或失败。两者结合时,学生同时保留了 AI 带来的成品质量和批判性训练带来的思考宽度。这对学校和企业培训都有一个共同启示:未来不能只看“最终答案写得多漂亮”,还要评估原创性、推理过程和多方案探索。
# ChatGPT 让作业更像专家,批判性思维让想法更独特:1000+ 学生随机实验说明了什么?
## 文章摘要
OpenAI 在 2026 年 8 月 27 日公布了一项与 Bocconi University 研究者合作的随机实验:1000 多名大一学生完成一个真实营销案例,并被随机分为四组——可使用 ChatGPT(GPT‑4o)、接受因果推理训练、两者都有、两者都没有。结果很有意思:ChatGPT 组在五分制人工评分中平均接近高出 1 分,答案更丰富、逻辑更清晰,也更接近专家建议;因果推理训练却在传统评分中没有明显提升,但学生提出的想法范围更广、更不雷同,也更会说明为什么一个方案可能有效或失败。两者结合时,学生同时保留了 AI 带来的成品质量和批判性训练带来的思考宽度。这对学校和企业培训都有一个共同启示:未来不能只看“最终答案写得多漂亮”,还要评估原创性、推理过程和多方案探索。
---
关于 AI 和教育,讨论经常被简化成一句话:
> 学生用了 ChatGPT,到底是学得更好了,还是更懒了?
这个问题本身就太粗糙。
因为“学习效果”至少包含:
- 成品质量;
- 知识迁移;
- 原创性;
- 逻辑;
- 问题拆解;
- 反思;
- 多方案探索。
Bocconi 的这项随机实验刚好把其中几件事拆开来看。
## 一、实验不是让学生做选择题
参与者是:
> 1000 多名大一学生。
任务也不是:
> 回答一个知识点。
而是一个真实业务案例:
> 为学校 Merchandise Store 提出营销建议。
这类任务更接近:
- 商业分析;
- 产品思考;
- 咨询;
- 写方案。
因此结果对企业知识工作也有参考价值。
## 二、四个随机组怎么分?
学生被按课堂随机分配到:
### A:ChatGPT
可以使用 GPT‑4o。
### B:因果推理训练
不针对 AI,而是训练:
> 因果关系、为什么方案会有效、什么时候会失败。
### C:ChatGPT + 因果推理
两者都有。
### D:Control
两者都没有。
这种设计可以分别观察:
> AI 的作用、思维训练的作用,以及二者叠加的作用。
## 三、ChatGPT 最大的提升:成品更专业
研究中,允许使用 ChatGPT 的学生:
- 得分更高;
- 想法更多;
- 逻辑更清晰;
- 与专家建议更相似。
在五分制评分中:
> 平均接近高出 1 分。
这是非常明显的差距。
可以理解为:
> AI 帮新手缩小了“怎么组织一个像样答案”的专家差距。
## 四、这不等于学生把作业完全交给 AI
实验要求学生仍然需要:
- 决定问什么;
- 判断回答;
- 选择哪些建议;
- 整理最终提交。
所以更接近:
```text
Student
↓
AI as Cognitive Tool
↓
Final Work
```
而不是:
```text
AI
↓
Copy / Paste
```
当然,真实课堂里的作弊方式可能不同。
但这个实验测试的是:
> 有规范地允许 AI 后,输出会发生什么变化。
## 五、最有意思的是:批判性思维训练没有提高传统分数
因果推理训练组的学生:
> 在传统 Rubric 上并没有明显更高分。
如果只看成绩,可能得出:
> 训练没用。
但文本分析发现了另一件事。
这些学生:
- 解释方案为什么有效更清楚;
- 更会讨论失败条件;
- 提出的想法更分散;
- 与同学的答案更不雷同。
也就是:
> **思考更宽了,但传统评分没把它完整测出来。**
## 六、这暴露了一个非常现实的评估问题
如果 Rubric 主要奖励:
```text
完整
清晰
符合标准目标
```
那么 AI 非常擅长。
但 Rubric 可能忽略:
- 有没有原创方向;
- 有没有挑战默认假设;
- 有没有提出别人没想到的方案;
- 有没有讨论反例。
结果就是:
> 学生的真实思考变化,没有反映在分数里。
## 七、AI 时代“只交最终答案”的作业正在失效
过去老师可以从一篇 Essay 判断:
> 学生会不会写。
以后 AI 可以把很多人的答案都提高到:
> 结构清晰、语言流畅、像专家。
那“最终文本”对能力的识别度就下降了。
这和企业招聘完全一样。
如果所有候选人都能用 AI 写出:
> 很漂亮的商业分析,
面试就不能只看 PDF。
## 八、应该增加什么评价维度?
### 原创性
有没有提出不同路径?
### 因果解释
为什么这个方案会有效?
### 反例
在什么情况下会失败?
### 过程证据
学生如何从问题到结论?
### 方案比较
有没有至少比较两个可行方案?
### 修正能力
收到反对意见后能否调整?
## 九、AI + 批判性思维为什么是互补关系?
ChatGPT 帮助的是:
```text
答案质量
组织
想法数量
逻辑清晰度
```
因果推理训练帮助的是:
```text
想法多样性
解释深度
质疑假设
失败条件
```
两者不完全重合。
所以研究中:
> 同时得到 AI 和思维训练的学生,在最广的一组指标上表现出收益。
这比“AI 替代思考”或“禁止 AI 才能思考”都更接近真实情况。
## 十、对学校意味着什么?
未来课程可能从:
```text
禁止 AI
```
逐渐转向:
```text
允许 AI
+
改变评价方式
```
例如:
### 作业 1
允许 AI 完成商业方案。
### 作业 2
要求学生解释:
- 为什么选这个方案;
- 哪个 AI 建议被拒绝;
- 什么证据会让你改变结论。
### 口头答辩
老师随机追问:
> 如果成本翻倍怎么办?
这样评估的就是:
> 真正理解。
## 十一、对企业培训同样适用
很多公司今天的 AI 培训是:
> 教 Prompt。
但真正高价值的培训应该是:
```text
AI Tool Skill
+
Domain Knowledge
+
Critical Thinking
+
Verification
```
例如新人写市场方案。
AI 可以帮:
- 查资料;
- 生成结构;
- 扩展想法。
员工必须负责:
- 判断假设;
- 识别数据缺口;
- 验证因果;
- 做最终选择。
## 十二、企业 KPI 也可能“奖励错误能力”
如果员工只被考核:
> 报告写得漂亮不漂亮,
AI 会让所有人迅速变好。
但真正重要的是:
- 决策质量;
- 业务结果;
- 创新;
- 风险识别。
所以 AI 时代很多企业评价制度,也会遇到和学校一样的问题。
## 十三、可以设计“AI 使用轨迹”评价
例如提交方案时附:
```text
原始问题
关键 Prompt
AI 的三个建议
你拒绝了哪个
为什么
最终选择
```
目的不是监控学生。
而是评估:
> 他有没有真正做判断。
## 十四、不要把“与专家更相似”误解成“更有创造力”
这是这项研究最值得提醒的一点。
ChatGPT 组的作品:
> 更接近专家答案。
这通常代表:
- 更专业;
- 更规范;
- 更符合常见最佳实践。
但:
> 与专家更像,不等于更原创。
批判性思维训练带来的想法多样性,反而是另一个维度。
## 十五、这对内容创作者也有直接启示
今天 AI 写文章最容易出现:
> 很完整,但都很像。
为什么?
因为模型很擅长:
> 生成“专家平均答案”。
如果想降低 AI 味,需要额外加入:
- 反例;
- 冲突;
- 边界;
- 不同假设;
- 非主流路径;
- 明确判断。
也就是:
> 用批判性结构对抗“平均答案”。
## 十六、一个更好的 AI 学习流程
```text
先独立想 5 分钟
↓
写初始假设
↓
问 AI 扩展方案
↓
找反例
↓
比较方案
↓
解释因果
↓
形成最终答案
```
而不是:
```text
打开 ChatGPT
↓
把题目粘进去
↓
完成
```
## 十七、AI Literacy 不只是“会用 ChatGPT”
真正完整的 AI Literacy 应该包括:
### Prompting
会提出问题。
### Evaluation
会判断结果。
### Verification
会找证据。
### Counterargument
会反驳 AI。
### Causal Reasoning
知道相关不等于因果。
### Ownership
最终决定由人负责。
## 最终判断
这项 1000+ 学生随机实验没有支持任何一个简单口号。
它既没有说明:
> AI 让学生停止思考。
也没有说明:
> 有了 AI 就不需要思维训练。
更接近的结论是:
> **AI 和思维训练优化的是不同能力维度。**
ChatGPT 让新手更快得到:
- 更完整;
- 更专业;
- 更有逻辑;
的成品。
批判性思维训练则让他们:
- 提出更多不同方向;
- 更会质疑假设;
- 更会解释成败条件。
未来教育真正需要改变的,不只是:
> 是否允许 AI。
而是:
> **当“漂亮答案”越来越便宜以后,我们到底要奖励什么能力?**
这个问题同样适用于学校、企业培训、招聘和知识工作。
想继续了解 AI 教育、ChatGPT 和知识工作方式变化,可以访问 **智元选**:https://www.zyentorpicks.com/。