近期,多家AI企业密集发布新一代大模型产品。SpaceX旗下xAI发布Grok 4.6,DeepSeek推出V4 Pro 0813,谷歌上线Gemini 3.7 Flash,OpenAI则展示了每秒750个token的“UltraFast”超高速模式。

Grok
评测机构Artificial Analysis(AA)发布的分析报告显示,Grok 4.6的综合智能指数已达到61分,与GPT-5.6 Sol并列第三,较上一代大幅提升23分。更重要的是,其价格并未上涨,仍维持每百万token输入2美元、输出6美元;若放在同分数模型中对比,这一定价也明显低于GPT-5.6 Sol。
在智能体任务表现方面,Grok 4.6同样十分亮眼。其GDPval-AA v2得分62%,仅次于Claude Opus 5;在τ3-Banking金融测试中,则与阿里巴巴求文Max 3.8并列第一,被普遍认为具备超越单纯单价比较的结构性成本优势。

AA智能指数
DeepSeek V4 Pro 0813的AA智能指数为53分,在本次评测中位列第七。更受市场关注的是,它的单任务成本仅需6美分,在全部104个模型中排名第二,放在同价位AI模型中,性价比优势非常明显。不过,随着其宣布上调API费用,市场情况也随之发生变化:高峰时段缓存命中输入费用将接近上涨12倍。业界普遍认为,这一价格调整很可能会影响其“低成本实用型AI”的市场定位。

AA的Agentic指数
谷歌推出的Gemini 3.7 Flash,AA智能指数为56分。其最大亮点在于生成速度——每秒可输出340个token,较GPT 5.6 Tera快接近3倍。此外,该模型相比上一代产品,定价也便宜了一半。
OpenAI则为GPT 5.6 Sol模型新增“UltraFast”模式,通过与Cerebras合作实现每秒750个token的输出速度,较标准处理模式最高提升14倍,并宣称“在保持智能无损的前提下实现高速运算”。

在这轮AI大模型混战中,Anthropic暂时保持沉默。虽然有传言称Fable 5.1已经完成开发,但按照Anthropic今年4至8周的发布节奏来看,8月下旬至9月初仍有较大概率推出新品。
