过去几年里,程序员们纷纷投靠 ChatGPT 来帮忙写代码,这个趋势直接冲击了老牌问答社区 Stack Overflow,以至于去年不得不裁员将近三分之一。然而,普度大学的研究团队在计算机-人类交互会议上发布了一项令人警醒的结果:ChatGPT 生成的编程问题答案中,居然有 52% 是错误的。

图源备注:图片由AI生成,图片授权服务商Midjourney
对于编程这种容不得马虎的领域来说,这个数字实在惊人。它也再次印证了其他行业用户(比如作家、教师)早就头疼的问题:像 ChatGPT 这样的 AI 平台,经常凭空捏造出完全错误的答案。研究人员仔细回顾了 517 个 Stack Overflow 上的问题,详细分析了 ChatGPT 的回答质量。结果发现,52% 的答案包含错误信息,77% 的答案比人类写的答案更冗长,78% 的答案与人类答案存在不同程度的不一致。
团队还对随机抽取的 2000 条 ChatGPT 答案做了语言分析,发现这些回答“更正式、分析性更强”,同时“负面情绪更少”——这恰好是 AI 那种单调又温和的典型语气。更值得关注的是,不少人类程序员反而更喜欢 ChatGPT 的答案。研究过程中,普度大学对 12 名程序员进行了测试,结果发现他们以 35% 的比例更倾向于选择 ChatGPT 生成的答案,而且在 39% 的情况下完全没察觉出其中的错误。
为什么会这样?原因可能有点讽刺——ChatGPT 比真人更有礼貌。研究人员在后续的半结构化访谈中发现,礼貌的语言、教科书般文雅的回答方式以及全面性,是 ChatGPT 答案看起来更具说服力的关键因素。参与者因此放松了警惕,忽略了不少隐藏的错误信息。
这项研究清楚表明,ChatGPT 依然存在重大缺陷。对于被 Stack Overflow 裁掉的员工,或者不得不返工修正 AI 代码错误的程序员来说,这无疑是一盆冷水,但也恰恰说明:依赖 AI 编程,远没到高枕无忧的时候。
