人们为什么会对人工智能(AI)时而“厌恶”、时而“欣赏”?一项综合了163项研究的大规模分析,为我们揭开了这个谜题。本教程将深入解读这项研究提出的“能力-个性化框架”,帮助你理解当人们面对AI和人类时,究竟是在什么情境下更偏爱谁。
一、核心矛盾:为什么人们对AI的态度两极分化?
随着AI技术进入医疗、招聘、金融等各个领域,公众对其态度的分歧也日益显著。一方面,你有理由相信AI在数据分析或棋类游戏中能打败人类;另一方面,当AI被用于诊断疾病或评估员工潜力时,你又很难完全信任它。这种看似矛盾的现象,传统上被分为两类:
- AI厌恶 (AI A version):更倾向于人类决策,而不是AI。
- AI欣赏 (AI Appreciation):更倾向于AI决策,而不是人类。
为什么会这样?过去的研究多从单一角度切入,例如只关注能力或只关注伦理,缺乏一个统一的解释。为了调和这些矛盾,研究者们提出了一个全新的理论框架——“能力-个性化框架”。
二、能力-个性化框架:解释AI欣赏与厌恶的关键
“能力-个性化框架”认为,人们在决定依赖AI还是人类时,会同时评估两个核心维度:
- AI的感知能力: AI在这个具体任务上,是否比人类更有能力?
- 情境中对个性化的需求: 这个决策是否需要考虑到每个人的独特性、个性和情感?
这两个维度组合起来,就会产生四种截然不同的情境,从而决定了人们是“欣赏”还是“厌恶”AI。
| 维度 | 定义 | 理论依据 |
| 感知能力 | AI在特定任务中,相比人类的客观能力优势。 | 功能态度理论(Eagly & Chaiken, 1993):态度服务于实用需求。 |
| 个性化需求 | 决策是否需要考虑到个体情感、独特性和背景。 | 独特性需求理论(Snyder & Fromkin, 1980):人类有保持独特性的基本心理需求。 |
小提示:你可以把这个框架想象成一个二维坐标轴。能力是横轴,个性化需求是纵轴。不同领域落在这四个象限里,就决定了人们对AI接受度的不同。
2.1 四个核心象限:AI何时受欢迎,何时令人厌恶
通过13名编码员对93个决策场景的独立评估,研究者将测试场景分为了四种类型:
- 高能力 + 低个性化:AI欣赏。例如:股票趋势预测、艺术品真伪鉴定。AI在纯数据分析和规律发现上比人类强,且不需要考虑个人情感。
- 高能力 + 高个性化:AI厌恶。例如:医疗诊断(虽然AI识别某些肿瘤的准确率高于医生,但患者仍希望由人类医生做出最终决策)。
- 低能力 + 高个性化:AI厌恶。例如:恋爱建议、心理咨询。AI显然不具备理解人类复杂情感的能力,且必须完全个性化。
- 低能力 + 低个性化:AI厌恶。例如:实验室基础操作,AI不如人类灵活,且操作本身也不需太多个性化。

图:基于AI厌恶与AI欣赏的能力-个性化框架的四个象限
三、研究方法:如何验证这个框架?
为了验证这个理论,研究者采用了一种非常严谨的科学研究方法——系统性文献检索与元分析。简单来说,就是把所有相关研究的结果综合起来,找到一个更可靠的结论。
3.1 文献检索与筛选
研究团队在Web of Science、APA PsycInfo、IEEE Xplore、ACM Digital、Engineering Village等数据库,结合Google Scholar,检索了大量文献。筛选流程非常严格:
- 初步检索:共发现9,089篇文献。
- 剔除重复:剩余7,394篇。
- 严格筛选:基于PRISMA 2020标准,最终只纳入了83篇论文,包含163项独立研究和82,078名参与者。
关键排除标准:
- 没有直接比较AI与人类决策的研究。
- 没有提供可以计算效应量数据的定性研究。
3.2 变量编码与评估
13名独立编码员对每个研究场景的“AI能力”和“个性化需求”进行了打分(1-6分制):
- AI能力:评估“AI是否比人类更有能力”。
- 个性化需求:评估“该任务是否需要个性化考量”。
他们的评分一致性非常高(rwg > 0.85),说明分类很可靠。最终以3.5分(6分量表的中点)作为划分高/低能力与高/低个性化需求的标准。
3.3 统计分析方法
- 效应量:将所有结果统一转换为Cohen's d。正值表示倾向AI,负值表示倾向人类。
- 模型选择:采用随机效应模型,因为不同研究之间肯定存在差异。
- 处理依赖:使用稳健方差估计(RVE)处理同一篇论文中多个效应量的依赖问题。
- 偏倚检验:通过漏斗图、Egger检验等,未发现显著出版偏倚。
小提示:元分析是社会科学里的“黄金标准”之一,能让我们超越单个研究的局限性,看到更宏观、更可靠的结论。这项研究包含了8万多人,结论非常扎实。
四、主要发现:哪些因素影响了AI的偏好?
4.1 核心发现:框架得到验证
研究结果完美地支持了“能力-个性化框架”:
- AI欣赏(效应量 d=0.27)仅在高能力 + 低个性化需求的情境中间出现,比如数据分析和棋类游戏。
- AI厌恶(效应量 d=-0.50)在其他三种情境中都非常显著,尤其是在高个性化需求的领域,比如医疗诊断和招聘。有趣的是,即使AI的客观能力更强(例如,算法在皮肤癌识别上的准确率是90.2%,而医生只有77.5%),人们依然厌恶AI。
常见问题:为什么AI在诊断上比医生准,大家还是讨厌它?
答案:因为医疗诊断是一个“高个性化”场景。人们需要的不仅是准确的结果,更是背后的关怀、解释和情感支持。患者希望被当作一个独特的个体来对待,而不是一个数据集。即使AI能给出更精确的建议,人类医生的“陪伴感”和“同理心”是AI无法替代的。
4.2 哪些因素会放大“AI欣赏”或“AI厌恶”?
1. AI的形态
- 实体机器人 vs. 无形算法: 人们更喜欢实体机器人(如扫地机器人、导购机器人)而不是无形的算法(如某个推荐系统)。实体机器人能带来更强的“社会存在感”,更易获得信任。效应量差异为d=0.53。
2. 测量方式
- 态度 vs. 行为: 通过问卷测量的“态度”(如信任度)比观察实际“行为”(如点击率)显示出更强的AI欣赏。这说明人们在认知上可能对AI抱有更大的期待,但在实际行动时会更保守,存在“认知-行为差距”。
3. 国家背景
- 高失业率国家: 人们对AI的欣赏会减弱,因为这可能引发对“饭碗被抢”的担忧。
- 高教育水平和互联网使用率高的国家: AI厌恶现象可能更强。这可能是因为这些国家的人更注重个性化服务,对AI潜在的“非人性化”后果更敏感。
| 调节变量 | AI欣赏增强的条件 | AI厌恶增强的条件 |
| AI形态 | 实体机器人(vs. 无形算法) | 无显著影响 |
| 测量方式 | 态度指标(vs. 行为指标) | 无显著影响 |
| 国家特征 | 低失业率国家 | 高教育水平 & 高互联网使用国家 |
五、理论与实践启示:我们该如何用好这个发现?
5.1 给AI开发者的实用建议
- 识别任务类型:如果你的AI应用在低个性化任务(如物流调度、库存管理、数据报表),可以大胆部署,因为用户很可能会喜欢它。
- 提升可解释性:对于高个性化任务,即使AI能力很强(如医疗、财务建议),也绝不能直接甩结论。应该通过可解释性设计,比如清晰地展示决策逻辑,让用户“知其然也知其所以然”,从而降低厌恶感。
- 增加拟人化交互:通过拟人化设计(如使用语音、表情、眼神接触的机器人)来提升情感接受度,尤其是在服务行业。
常见问题:我只想开发一个推荐算法,要怎么让它不那么让人讨厌?
答案:首先,分析你的推荐场景个性化需求高不高。如果只是推荐电影或商品,属于“低个性化”(能力高+需求低),用户会欣赏。但如果是推荐心理咨询师或保险方案,就属于“高个性化”。此时,你需要让算法决策看起来更“人性化”,比如加一句“基于你的情况和这个方案,我们还为您推荐了以下三位专家,其中人类的专家A特别擅长处理您这种情况”。
5.2 给政策制定者的启示
- 关注经济影响:在高失业率地区推广AI时,必须配套就业保障政策(如再培训、社会保障),以缓解公众的“AI替代焦虑”。
- 引导社会认知:对于教育水平和互联网普及程度高的国家,需要加强公众对AI“能力边界”的科普,帮助人们理解AI在“高个性化”任务中的不足,并引导他们理性看待AI。
5.3 研究的局限与未来方向
- 数据时效性:所有研究均发表于ChatGPT(2022年)之前,所以当前流行的“生成式AI”(如大语言模型)的影响还有待验证。
- 文化差异:大部分样本来自欧美(WEIRD国家),未来需更多来自亚洲、非洲等非西方背景的研究。
- 动态感知:AI技术飞速迭代,用户对AI能力的感知也在不断变化,未来需要长期的纵向研究来追踪。
通过“能力-个性化框架”,我们终于有了一个强有力的工具来解释人们面对AI时的矛盾心理。记住,人们不讨厌AI,人们讨厌的是在不该用它的地方使用它。
