从未见过如此糟糕的AI模型表现!
Gemini 3.5 Pro正式版迟迟未至,反倒是Gemini 3.6 Flash、3.6 Flash Lite等Gemini 3.6系列「精简版」抢先发布了!
就在昨夜,谷歌DeepMind正式宣布推出三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber。


在Vertex AI平台上线后,谷歌最新发布的Gemini 3.6 Flash口碑遭遇了滑铁卢,用户反馈普遍不佳。
早期实测显示,该模型在前端界面生成与空间推理方面表现极差,被众多开发者戏称为「史上最差」模型。

好消息是,Gemini 3.6 Flash在性能上超越了Gemini 3.1 Pro和Gemini 3.1 Pro,主打「性价比」路线。

然而网友们更关心的是:我们期待已久的Gemini 3.5 Pro究竟在哪里?

谷歌「史上最差」AI模型正式发布!
谷歌新模型一经上线,便被用户骂作「史上最差」。
从前端生成到空间推理,该模型几乎收获了所有领域的负面评价。
先看前端生成能力。
Gemini-3.6 Flash的前端能力全线崩溃,在前端代码竞技场中不敌Claude Fable 5、GPT-5.6 Sol等热门模型,甚至落后于Meta的Muse Spark 1.1。
开发者使用2-shot测试方法评估Gemini 3.6 Flash的界面生成能力,而这原本是Flash系列最擅长的场景之一。
结果公布后,大家直接愣住了。

输出的界面代码逻辑混乱,组件嵌套严重错误,交互逻辑断裂,完全无法投入实际使用。
「这是我迄今为止见过的最差结果。」

这句话配合截图,在开发者社区中迅速传播开来。
再看空间推理能力。
有测试者专门录制了视频,逐帧测试Gemini 3.6 Flash在空间关系理解上的表现。
测试结果同样令人失望:模型频繁出错,对基础位置关系和方向判断的准确率,相比3.5 Flash出现了明显退步。
测试者只能自我安慰,或许是因为没有开启高性能模型「high thinking」模式。
遗憾的是,即便开启了该模式,也没有得到满意的结果。另一位网友使用了高推理强度,第一印象依旧不佳。
木纹纹理看起来勉强还行,但没什么特别之处。
大理石近距离观察反射效果尚可,但存在明显 bug。
第二印象甚至更差:

在CursorBench基准测试中,Gemini 3.6 Flash的表现甚至不如Cursor的Composer 2.5。

谷歌官方发布的测试结果也显示,Gemini 3.6 Flash在代码任务上被其他模型超越,仅在视觉和上下文基准测试中保持了领先水平。

但在第三方综合测评平台Artificial Analysis上,Gemini 3.6 Flash的得分与3.5 Flash完全相同,整体表现不如Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra等模型。

有网友发现,该模型的知识截止日期并未真正更新到它所声称的时间,直言:
这是一个尚未完成的模型。
它声称知识截止于2026年3月,但实际上对2026年甚至2025年的大部分内容一无所知,其实际知识似乎停留在2025年1月。

Gemini 3.5 Flash-Lite则主打速度优势,每秒可输出350个token。
速度确实提升了,但快有什么用?快速给出一个错误答案,等于用更高的效率浪费用户的时间。
更何况,与竞争对手相比,它价格更贵,效果却更差!

此外,谷歌这次还发布了网络安全专用模型Gemini 3.5 Flash Cyber。
谷歌:Gemini 3.5 Pro延期,Gemini 4已开始预训练
在算力紧缺的时代,发布一个逻辑混乱的模型,是否也是一种渎职?
有用户讽刺称,DeepMind这种浪费算力的行为,还不如直接将资源转让给Moonshot等竞争对手。
这番言论背后,反映出开发者对谷歌「版本号游戏」策略的深层厌恶。

谷歌似乎陷入了某种「官僚主义的指标狂热」:为了在财报和发布会上展示更高的版本号、更快的推理速度,他们牺牲了AI最本质的东西——真实效用。
在3.6 Flash的发布公告中,谷歌提到,Gemini 3.5 Pro尚未完全准备好,而Gemini 4已开始「目前最雄心勃勃的预训练」,并「对取得的进展感到非常振奋」。

推测来看,近期3.5 Pro的开发进展并不理想,因此谷歌启动了全新的预训练课程。

据CNBC报道,这是谷歌「有史以来规模最大的预训练项目」。

这次谷歌步子迈得确实太大了。

谷歌这种赶鸭子上架、自毁口碑的做法,到底图什么呢?

谷歌还能在AGI竞赛中保住一席之地吗?
