游乐游手机版
首页/AI热点日报/热点详情

谷歌发布最新AI模型被批史上最差,Gemini 3.5 Pro宣布延期

类型:热点整理2026-07-22
谷歌最新发布Gemini3 6Flash等三款模型,但其前端生成与空间推理表现极差,被用户狠批为‘史上最差’。与此同时,Gemini3 5Pro正式版发布再度延期,而Gemini4已开始大规模预训练,这一消息令业界对谷歌AI路线产生深深的疑虑。

从未见过如此糟糕的AI模型表现!

Gemini 3.5 Pro正式版迟迟未至,反倒是Gemini 3.6 Flash、3.6 Flash Lite等Gemini 3.6系列「精简版」抢先发布了!

就在昨夜,谷歌DeepMind正式宣布推出三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber。

在Vertex AI平台上线后,谷歌最新发布的Gemini 3.6 Flash口碑遭遇了滑铁卢,用户反馈普遍不佳。

早期实测显示,该模型在前端界面生成与空间推理方面表现极差,被众多开发者戏称为「史上最差」模型。

好消息是,Gemini 3.6 Flash在性能上超越了Gemini 3.1 Pro和Gemini 3.1 Pro,主打「性价比」路线。

然而网友们更关心的是:我们期待已久的Gemini 3.5 Pro究竟在哪里?

谷歌「史上最差」AI模型正式发布!

谷歌新模型一经上线,便被用户骂作「史上最差」。

从前端生成到空间推理,该模型几乎收获了所有领域的负面评价。

先看前端生成能力。

Gemini-3.6 Flash的前端能力全线崩溃,在前端代码竞技场中不敌Claude Fable 5、GPT-5.6 Sol等热门模型,甚至落后于Meta的Muse Spark 1.1。

开发者使用2-shot测试方法评估Gemini 3.6 Flash的界面生成能力,而这原本是Flash系列最擅长的场景之一。

结果公布后,大家直接愣住了。

输出的界面代码逻辑混乱,组件嵌套严重错误,交互逻辑断裂,完全无法投入实际使用。

「这是我迄今为止见过的最差结果。」

这句话配合截图,在开发者社区中迅速传播开来。

再看空间推理能力。

有测试者专门录制了视频,逐帧测试Gemini 3.6 Flash在空间关系理解上的表现。

测试结果同样令人失望:模型频繁出错,对基础位置关系和方向判断的准确率,相比3.5 Flash出现了明显退步。

测试者只能自我安慰,或许是因为没有开启高性能模型「high thinking」模式。

遗憾的是,即便开启了该模式,也没有得到满意的结果。另一位网友使用了高推理强度,第一印象依旧不佳。

木纹纹理看起来勉强还行,但没什么特别之处。

大理石近距离观察反射效果尚可,但存在明显 bug。

第二印象甚至更差:

在CursorBench基准测试中,Gemini 3.6 Flash的表现甚至不如Cursor的Composer 2.5。

谷歌官方发布的测试结果也显示,Gemini 3.6 Flash在代码任务上被其他模型超越,仅在视觉和上下文基准测试中保持了领先水平。

但在第三方综合测评平台Artificial Analysis上,Gemini 3.6 Flash的得分与3.5 Flash完全相同,整体表现不如Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra等模型。

有网友发现,该模型的知识截止日期并未真正更新到它所声称的时间,直言:

这是一个尚未完成的模型。

它声称知识截止于2026年3月,但实际上对2026年甚至2025年的大部分内容一无所知,其实际知识似乎停留在2025年1月。

Gemini 3.5 Flash-Lite则主打速度优势,每秒可输出350个token。

速度确实提升了,但快有什么用?快速给出一个错误答案,等于用更高的效率浪费用户的时间。

更何况,与竞争对手相比,它价格更贵,效果却更差!

此外,谷歌这次还发布了网络安全专用模型Gemini 3.5 Flash Cyber。

谷歌:Gemini 3.5 Pro延期,Gemini 4已开始预训练

在算力紧缺的时代,发布一个逻辑混乱的模型,是否也是一种渎职?

有用户讽刺称,DeepMind这种浪费算力的行为,还不如直接将资源转让给Moonshot等竞争对手。

这番言论背后,反映出开发者对谷歌「版本号游戏」策略的深层厌恶。

谷歌似乎陷入了某种「官僚主义的指标狂热」:为了在财报和发布会上展示更高的版本号、更快的推理速度,他们牺牲了AI最本质的东西——真实效用。

在3.6 Flash的发布公告中,谷歌提到,Gemini 3.5 Pro尚未完全准备好,而Gemini 4已开始「目前最雄心勃勃的预训练」,并「对取得的进展感到非常振奋」。

推测来看,近期3.5 Pro的开发进展并不理想,因此谷歌启动了全新的预训练课程。

据CNBC报道,这是谷歌「有史以来规模最大的预训练项目」。

这次谷歌步子迈得确实太大了。

谷歌这种赶鸭子上架、自毁口碑的做法,到底图什么呢?

谷歌还能在AGI竞赛中保住一席之地吗?

来源:https://36kr.com/p/3906060964353160

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。