游乐游手机版
首页/AI热点日报/热点详情

AI厌恶与欣赏:基于能力-个性化框架的元分析综述

类型:热点整理2026-07-22
一项涵盖163项研究的元分析验证了“能力-个性化框架”:当AI能力高且个性化需求低时,人们表现出AI欣赏;在其他情境下,尤其是高个性化需求时,即使AI能力更强,仍出现AI厌恶。AI形态、测量方式及国家特征等因素也会影响偏好。

人们为什么会对人工智能(AI)时而“厌恶”、时而“欣赏”?一项综合了163项研究的大规模分析,为我们揭开了这个谜题。本教程将深入解读这项研究提出的“能力-个性化框架”,帮助你理解当人们面对AI和人类时,究竟是在什么情境下更偏爱谁。

一、核心矛盾:为什么人们对AI的态度两极分化?

随着AI技术进入医疗、招聘、金融等各个领域,公众对其态度的分歧也日益显著。一方面,你有理由相信AI在数据分析或棋类游戏中能打败人类;另一方面,当AI被用于诊断疾病或评估员工潜力时,你又很难完全信任它。这种看似矛盾的现象,传统上被分为两类:

  • AI厌恶 (AI A version):更倾向于人类决策,而不是AI。
  • AI欣赏 (AI Appreciation):更倾向于AI决策,而不是人类。

为什么会这样?过去的研究多从单一角度切入,例如只关注能力或只关注伦理,缺乏一个统一的解释。为了调和这些矛盾,研究者们提出了一个全新的理论框架——“能力-个性化框架”。

二、能力-个性化框架:解释AI欣赏与厌恶的关键

“能力-个性化框架”认为,人们在决定依赖AI还是人类时,会同时评估两个核心维度:

  1. AI的感知能力 AI在这个具体任务上,是否比人类更有能力?
  2. 情境中对个性化的需求 这个决策是否需要考虑到每个人的独特性、个性和情感?

这两个维度组合起来,就会产生四种截然不同的情境,从而决定了人们是“欣赏”还是“厌恶”AI。

维度 定义 理论依据
感知能力 AI在特定任务中,相比人类的客观能力优势。 功能态度理论(Eagly & Chaiken, 1993):态度服务于实用需求。
个性化需求 决策是否需要考虑到个体情感、独特性和背景。 独特性需求理论(Snyder & Fromkin, 1980):人类有保持独特性的基本心理需求。

小提示:你可以把这个框架想象成一个二维坐标轴。能力是横轴,个性化需求是纵轴。不同领域落在这四个象限里,就决定了人们对AI接受度的不同。

2.1 四个核心象限:AI何时受欢迎,何时令人厌恶

通过13名编码员对93个决策场景的独立评估,研究者将测试场景分为了四种类型:

  • 高能力 + 低个性化AI欣赏。例如:股票趋势预测、艺术品真伪鉴定。AI在纯数据分析和规律发现上比人类强,且不需要考虑个人情感。
  • 高能力 + 高个性化AI厌恶。例如:医疗诊断(虽然AI识别某些肿瘤的准确率高于医生,但患者仍希望由人类医生做出最终决策)。
  • 低能力 + 高个性化AI厌恶。例如:恋爱建议、心理咨询。AI显然不具备理解人类复杂情感的能力,且必须完全个性化。
  • 低能力 + 低个性化AI厌恶。例如:实验室基础操作,AI不如人类灵活,且操作本身也不需太多个性化。

图:基于AI厌恶与AI欣赏的能力-个性化框架的四个象限

三、研究方法:如何验证这个框架?

为了验证这个理论,研究者采用了一种非常严谨的科学研究方法——系统性文献检索与元分析。简单来说,就是把所有相关研究的结果综合起来,找到一个更可靠的结论。

3.1 文献检索与筛选

研究团队在Web of Science、APA PsycInfo、IEEE Xplore、ACM Digital、Engineering Village等数据库,结合Google Scholar,检索了大量文献。筛选流程非常严格:

  • 初步检索:共发现9,089篇文献
  • 剔除重复:剩余7,394篇。
  • 严格筛选:基于PRISMA 2020标准,最终只纳入了83篇论文,包含163项独立研究82,078名参与者

关键排除标准

  • 没有直接比较AI与人类决策的研究。
  • 没有提供可以计算效应量数据的定性研究。

3.2 变量编码与评估

13名独立编码员对每个研究场景的“AI能力”和“个性化需求”进行了打分(1-6分制):

  • AI能力:评估“AI是否比人类更有能力”。
  • 个性化需求:评估“该任务是否需要个性化考量”。

他们的评分一致性非常高(rwg > 0.85),说明分类很可靠。最终以3.5分(6分量表的中点)作为划分高/低能力与高/低个性化需求的标准。

3.3 统计分析方法

  • 效应量:将所有结果统一转换为Cohen's d。正值表示倾向AI,负值表示倾向人类。
  • 模型选择:采用随机效应模型,因为不同研究之间肯定存在差异。
  • 处理依赖:使用稳健方差估计(RVE)处理同一篇论文中多个效应量的依赖问题。
  • 偏倚检验:通过漏斗图、Egger检验等,未发现显著出版偏倚

小提示:元分析是社会科学里的“黄金标准”之一,能让我们超越单个研究的局限性,看到更宏观、更可靠的结论。这项研究包含了8万多人,结论非常扎实。

四、主要发现:哪些因素影响了AI的偏好?

4.1 核心发现:框架得到验证

研究结果完美地支持了“能力-个性化框架”:

  • AI欣赏(效应量 d=0.27)仅在高能力 + 低个性化需求的情境中间出现,比如数据分析和棋类游戏。
  • AI厌恶(效应量 d=-0.50)在其他三种情境中都非常显著,尤其是在高个性化需求的领域,比如医疗诊断和招聘。有趣的是,即使AI的客观能力更强(例如,算法在皮肤癌识别上的准确率是90.2%,而医生只有77.5%),人们依然厌恶AI。

常见问题:为什么AI在诊断上比医生准,大家还是讨厌它?
答案:因为医疗诊断是一个“高个性化”场景。人们需要的不仅是准确的结果,更是背后的关怀、解释和情感支持。患者希望被当作一个独特的个体来对待,而不是一个数据集。即使AI能给出更精确的建议,人类医生的“陪伴感”和“同理心”是AI无法替代的。

4.2 哪些因素会放大“AI欣赏”或“AI厌恶”?

1. AI的形态

  • 实体机器人 vs. 无形算法: 人们更喜欢实体机器人(如扫地机器人、导购机器人)而不是无形的算法(如某个推荐系统)。实体机器人能带来更强的“社会存在感”,更易获得信任。效应量差异为d=0.53

2. 测量方式

  • 态度 vs. 行为: 通过问卷测量的“态度”(如信任度)比观察实际“行为”(如点击率)显示出更强的AI欣赏。这说明人们在认知上可能对AI抱有更大的期待,但在实际行动时会更保守,存在“认知-行为差距”。

3. 国家背景

  • 高失业率国家: 人们对AI的欣赏会减弱,因为这可能引发对“饭碗被抢”的担忧。
  • 高教育水平和互联网使用率高的国家: AI厌恶现象可能更强。这可能是因为这些国家的人更注重个性化服务,对AI潜在的“非人性化”后果更敏感。

调节变量 AI欣赏增强的条件 AI厌恶增强的条件
AI形态 实体机器人(vs. 无形算法) 无显著影响
测量方式 态度指标(vs. 行为指标) 无显著影响
国家特征 低失业率国家 高教育水平 & 高互联网使用国家

五、理论与实践启示:我们该如何用好这个发现?

5.1 给AI开发者的实用建议

  • 识别任务类型:如果你的AI应用在低个性化任务(如物流调度、库存管理、数据报表),可以大胆部署,因为用户很可能会喜欢它。
  • 提升可解释性:对于高个性化任务,即使AI能力很强(如医疗、财务建议),也绝不能直接甩结论。应该通过可解释性设计,比如清晰地展示决策逻辑,让用户“知其然也知其所以然”,从而降低厌恶感。
  • 增加拟人化交互:通过拟人化设计(如使用语音、表情、眼神接触的机器人)来提升情感接受度,尤其是在服务行业。

常见问题:我只想开发一个推荐算法,要怎么让它不那么让人讨厌?
答案:首先,分析你的推荐场景个性化需求高不高。如果只是推荐电影或商品,属于“低个性化”(能力高+需求低),用户会欣赏。但如果是推荐心理咨询师或保险方案,就属于“高个性化”。此时,你需要让算法决策看起来更“人性化”,比如加一句“基于你的情况和这个方案,我们还为您推荐了以下三位专家,其中人类的专家A特别擅长处理您这种情况”。

5.2 给政策制定者的启示

  • 关注经济影响:在高失业率地区推广AI时,必须配套就业保障政策(如再培训、社会保障),以缓解公众的“AI替代焦虑”。
  • 引导社会认知:对于教育水平和互联网普及程度高的国家,需要加强公众对AI“能力边界”的科普,帮助人们理解AI在“高个性化”任务中的不足,并引导他们理性看待AI。

5.3 研究的局限与未来方向

  • 数据时效性:所有研究均发表于ChatGPT(2022年)之前,所以当前流行的“生成式AI”(如大语言模型)的影响还有待验证。
  • 文化差异:大部分样本来自欧美(WEIRD国家),未来需更多来自亚洲、非洲等非西方背景的研究。
  • 动态感知:AI技术飞速迭代,用户对AI能力的感知也在不断变化,未来需要长期的纵向研究来追踪。

通过“能力-个性化框架”,我们终于有了一个强有力的工具来解释人们面对AI时的矛盾心理。记住,人们不讨厌AI,人们讨厌的是在不该用它的地方使用它。

来源:https://www.53ai.com/news/LargeLanguageModel/2025081878209.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。