游乐游手机版
首页/AI热点日报/热点详情

K3与GPT同款考题实测Gemini 3.6 Flash前端

类型:热点整理2026-07-24
本次评测中,谷歌Gemini3 6Flash在七道前端考题里基础能力不低,拖拽看板与创意动效两个环节尤为出色,但设计品味和复杂场景稳健性不足,3D浮岛项目遭到物体遮挡,影响整体视觉效果,最终表现不及KimiK3和GPT-5 6Sol,排名靠后。

谷歌在前端技术领域的深厚底蕴,早已无需任何人来证明。

Material Design奠定了Android世界的设计语言,Chrome DevTools是每位前端工程师每日必用的工具,而Web Vitals则直接重塑了整个行业衡量网页体验的标准。从设计规范、开发工具到性能基准,谷歌在这条技术链路的每一个环节,都扮演着标准制定者的角色。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

因此,当Gemini 3.6 Flash在2026年7月21日发布后,开发者社区随即给它贴上了「谷歌史上最差模型」的标签时,你很难不感受到一种微妙的荒诞感。一家定义了「优秀前端」应有样貌的公司,其主力模型的弱项,竟然恰恰是前端界面生成。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

口说无凭,我们精心设计了7道考题,从SaaS落地页到K3和GPT都曾挑战过的3D浮岛,对Gemini 3.6 Flash的前端能力进行了一次全方位的深度评测。

谷歌究竟发布了什么

7月21日,Google DeepMind一口气推出了三个模型。其中,C位出道的Gemini 3.6 Flash被定位为「主力工作模型」。

官方公布的数据显示,其性能增长主要集中在后端与Agent场景:DeepSWE v1.1从37%提升至49%,MLE-Bench从49.7%跃升至63.9%,OSWorld-Verified从78.4%提高到83.0%,GDPval-AA v2的得分也从1349上升至1421。此外,Token消耗比前代减少了17%,在DeepSWE任务上甚至降低了65%。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

显而易见,官方强调的优势是速度快、成本低、后端能力强,全文没有任何一处提及前端设计生成能力的提升。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

同时,官方确认了两项重要信息:被期待了大半年的Gemini 3.5 Pro仍在测试中,「准备好了就发布」;而Gemini 4的预训练已经启动,这被描述为「迄今最雄心勃勃的一次训练」。Pro版本跳票,Gemini 4还在路上,3.6 Flash显然是用来支撑当前局面的主力。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

然而,独立评测并不给面子。在Artificial Analysis的Intelligence Index上,3.6 Flash的得分仅为50,与3.5 Flash完全持平,可以说毫无提升。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

在Design Arena的非Agent Web开发榜单上,其Elo得分仅为1322,比Grok 4.5还低一分,落后于Claude Fable 5(1339)、GLM 5.2(1341)和Kimi K3(1407)。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

Roboflow的视觉评测则更为扎心:尽管3.6 Flash被描述为「测试过最好的视频理解模型」,但其物体检测能力明显倒退,经常偷懒到只返回一个大框,且JSON格式时常解析失败。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

最后,Roboflow也给出了较为中肯的建议。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

这7道题是如何设计的

出题之前,我们参考了业内两个主流的前端评测体系。

Design Arena是全球首个采用盲测+真人投票方式评价AI前端生成质量的平台,其非Agent榜单分为6类:Website、UI组件、游戏开发、数据可视化、3D设计、图片转网站。

Frontend Code Arena则增加了品牌营销、数据看板、游戏等7个Agent分类。Kimi K3在七月登顶时,总分达到1679分,并拿下了6个单项第一。

从这两个体系中,我们精选了7个评测维度:L1至L6为单文件HTML一次性输出,对标Design Arena的非Agent模式;L7则是一个完整的React + Three.js项目搭建,在Gemini CLI中执行。

L1 SaaS落地页,L2数据仪表盘:基准表现不俗

L1要求生成一个完整的SaaS Landing Page,包含Hero区、功能卡片、三档定价、sticky毛玻璃导航以及CSS Grid布局。

Gemini 3.6 Flash首次生成的页面即可直接运行,配色采用了偏暖的橙色系,与市面上泛滥的蓝紫渐变形成了鲜明对比。SVG产品示意图为其自行绘制,hover时有上浮微交互动效,定价区层级清晰。生成速度不到一分钟,整体像模像样,确实具备一个AI工具官网应有的样子。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

L2是一个深色主题的「AI模型使用量监控仪表盘」,包含4个KPI卡片、折线图、环形图、柱状图以及数据表格,并使用了Chart.js CDN和基于Grid的三断点响应式设计。

所有4个图表均正常渲染,折线图显示的Token消耗数据体现了真实的工作日/周末波动,侧边栏在移动端能正确隐藏,三个断点均能准确触发。该仪表盘与市面上常见的中转站布局非常相似,放在真实环境中也毫不违和,AI味并不重。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

这两个开局测试表明:Gemini 3.6 Flash在单页面的基础前端任务上,拥有一个不低的基准水平。它并非完全「不会做前端」。

L3像素级还原:色号全对,但设计感不足

L3是一张需要精确到色号的个人作品集页面。

6个色号全部正确,3列网格布局也准确无误。但页面整体看起来寡淡无味,缺乏视觉张力,就像一个前端新手做出来的作品。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

这正是其核心矛盾所在:它能精准执行指令,但缺乏设计品味。你告诉它Hex色号,它不会用错;但当你让它自由发挥时,它却只能僵硬地照本宣科。对比GPT-5.6 Sol,后者被Design Arena指出「明确学会了规避AI味设计反模式」,而Gemini 3.6 Flash显然还没上过这堂关于审美品味的课。

L4拖拽看板:又快又稳,全场最佳表现

L4是一个三列Kanban看板,需要实现HTML5原生Drag and Drop功能,支持添加、删除、拖拽卡片,并具备响应式降级能力。

这是7个测试中表现最好的一个:拖拽功能正常、卡片计数更新正常、Modal表单添加卡片并正确插入目标列、删除功能正常、手机端三列自动变为纵向堆叠、拖拽时卡片半透明效果与目标列蓝色高亮这两个视觉反馈也均已实现。

这个项目充分体现了Gemini前端能力的稳定性,这才是其真实水平。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

拖拽是前端原生API中最难正确实现的功能之一,设计环节环环相扣,漏掉一环就会导致「看着能动但实际上不对」。Gemini 3.6 Flash在这个维度上几乎拿到了满分。对于一个被骂作「史上最差」的模型,这无疑是一次漂亮的反击。

L5电商页,L6创意动效:一个bug,一个惊喜

L5是一个移动端优先的电商详情页,所有功能维度均通过了测试:轮播图正常、颜色规格高亮正确、版本切换联动价格更新、Tab切换正常、三个断点布局全部适配。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

但存在一个逻辑bug:加入购物车后,在选购界面切换版本,已加入购物车的商品版本也会随之改变。这是典型的「全局状态污染」问题,购物车里的对象与选购区指向了同一个引用。代码做了,但考虑不够周全。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

L6是为「Nova」圆形智能音箱设计的一个沉浸式产品展示页面,包含全屏脉冲光环动画、Intersection Observer滚动滑入效果以及时间线发光等元素。

脉冲动画表现正常,Observer功能正常,3种缓动函数也均达标。

但真正令人意外的是其叙事节奏:从第一屏的光环,到卡片滑入,再到时间线亮起,直至结尾的CTA,整个页面并非单纯向下滚动,而是一条完整的视觉乐章。它不再是传统的功能列表,而更像是一次产品发布会的keynote演示。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

L5和L6放在一起,恰好暴露了Gemini 3.6 Flash的两种不同面孔:在严格的规则面前,表现保守甚至略显寡淡;而在抽象的目标面前,反而展现出创造力。它怕死规矩,但不惧抽象。

L7 3D浮岛:走进K3和GPT的考场

这是分量最重的一个环节。我们直接复用了为Kimi K3和GPT-5.6家族设计的同款Prompt,要求模型使用React + Three.js从零搭建一个3D浮岛作品集网站。

先看此前四个模型的同期对比:

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

现在来看Gemini 3.6 Flash的表现。

整体完成度不低,浮岛主体、草地、小树以及基础的瀑布效果都已呈现。四章节的运镜逻辑也存在,当场景静止时会缓慢自转(这是其他模型没有的细节)。天空配色饱和度偏高,场景过渡流畅。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

但它并不完美,最大的问题在于:浮岛草地上方覆盖了一层不明物体,导致4个本应高亮展示的交互物件消失了。这并非渲染错误,而是被半透明overlay遮挡了。hover发光放大和点击推进特写的功能依然存在,但用户看不见它们。这与GPT-5.6 Sol「点击物件时背景被错误虚化」的bug属于同一种类型:底层功能是存在的,但渲染逻辑有偏差,导致用户体验出现断裂。

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

还有一个值得注意的数据:Gemini 3.6 Flash是这个项目里生成速度最快的,遥遥领先。但在3D场景中,「快」与「对」从来不是等价交换。

将它与四位对手放在擂台上比较,Gemini 3.6 Flash的位置大约是:优于GPT-5.5,略逊于GPT-5.6 Sol,远不及K3。

八、尚未到最终判决时刻

Gemini 3.6 Flash并非一个「前端能力不行」的模型。L1、L2、L4、L6这四道题足以证明它拥有不低的基准水平,但它也面临着两块天花板。

第一块是设计品味。L3的色号还原全部正确,但页面寡淡,呈现出「精准执行+零审美判断」的特点。GPT-5.6 Sol和K3都在往更高品味方向修炼,而Gemini仍停留在「不犯错,但不加分」的阶段。

第二块是复杂场景下的稳健性。L7的交互物件被遮挡、L5的全局状态污染,根源相同:单一维度的能力足够,但在多维度协同时,一个小偏差就会导致用户体验的断裂。

回到开篇:谷歌知道如何做前端,但Gemini 3.6 Flash还记得多少?它记得大部分,但可能忘记了最重要的一点:不止要把事做对,更要把事做好。

谷歌用「workhorse model」来定义3.6 Flash,一匹干活的马,而非上台表演的马。这个定位非常精准,但同时也是一种自我设限。

当GLM 5.2以MIT开源协议做到Design Arena Elo 1341,当Kimi K3以开源身份在浮岛项目上击败所有闭源对手,当Grok 4.5用更快的速度和更低的成本与3.6 Flash的前端Elo持平,「Flash系列不是用来做前端的」这个解释,正变得越来越站不住脚。

毕竟,没有人会在意你是Flash还是Pro,人们只在乎AI做出来的页面,看上去是否值得点进去。

来源:https://www.aitntnews.com/newDetail.html?newId=27562

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。