游乐游手机版
首页/AI热点日报/热点详情

人类考试已无法有效测试AI水平

类型:热点整理2026-07-19
人工智能在考试领域的表现迎来里程碑,Grok-4在“人类最后的考试”中准确率达50 7%,首次突破50%大关,普通人仅能答对5%。该考试涵盖超100个学科、3000道高难度题。从围棋到高考,AI已全面超越人类水平。

人工智能在考试领域的表现正迎来一个里程碑式的时刻。从最初在围棋上击败人类顶尖棋手,到如今在“人类最后的考试”中取得惊人分数,AI的智力水平正以超乎想象的速度提升。本教程将为你详细梳理这一突破历程,剖析Grok-4在各高难度考试中的具体表现,并解读“人类最后的考试”究竟意味着什么。

一、从围棋到高难度考试:AI的智力进化之路

2017年5月,一个标志性事件改变了人类对AI的认知。当时,世界围棋排名第一的柯洁惨败于AlphaGo。在“机器是否会比人类更聪明”这个事关全人类尊严的问题上,人类第一次得到了确定性的答案。而一年前,尚且能赢一局的李世石,成为了人类棋手在AI面前最后的夕阳。

面对这种局面,人类善于寻找理由,将智力转换为更复杂且难以解释的“智慧”,从而显得自己还在“赢”。人类可以既做选手又做裁判,制定一套套测试标准。AI超过了人类水平,那是人类推动的科技进步;AI没有超过人类,那人类依然胜券在握。但“青出于蓝而胜于蓝”的速度,当快得像“迎面而来的一阵冰雹猛地砸到脸上”时,绝大多数人还是会感到不适和震惊。

最初,我们轻松地用游戏来测试AI;现在,人类能参与的最难考试,也即将无法用来考验AI了。

来源:https://www.53ai.com/news/LargeLanguageModel/2025071820346.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。