最近AI圈来了个新玩家,Kimi K3,开源模型,参数规模直接干到2.8万亿级。发布当天就登顶Frontend Code Arena榜首,势头不小。但光看榜单数据不够直观,怎么才能让读者真真切切感受到这个模型和顶级闭源模型之间的差距?
直接跑进游戏里,复刻我们小时候玩过的经典游戏。这法子够直观,也能看出模型的真实工程能力。3D游戏开发本身就比普通前端页面难得多,渲染、碰撞、状态管理、实时交互,样样都得过关。搞这么一个测试,比单纯跑个代码生成评测要有说服力得多。
这次只选了GPT-5.6 Sol做横向对照,没测Claude Fable 5。原因很简单:一是贵,二是号被封了,没法稳定复测。所以,就锁定这两个模型,用完全相同的提示词,比一比谁能把童年经典游戏复刻得更像样。
Kimi K3是Moonshot最新开源的大参数模型,规模到了2.8万亿级。官方说整体表现还落后于Claude Fable 5和GPT-5.6 Sol这些最强闭源模型。这次只选GPT-5.6 Sol做横向对照,没测Claude Fable 5:一是太贵,二是号被封了,没法稳定复测。这次主要考察它在3D游戏开发上的水平。很多模型写普通前端已经不错了,但3D游戏涉及渲染、碰撞、状态管理、实时交互,是更难的场景,也更容易看出能力边界。
于是让它们做了5款童年经典游戏,和GPT-5.6 Sol用同样的提示词对照。录了视频、核了代码、比了成品感,最后发现:有的游戏能直接玩,有的已经接近成品,有的还差一截。
一、评价一个模型:从"能跑"到"能玩"
判断模型代码能力,常见的做法是让它生成单文件前端页面。这种方式成本低,但看不出复杂工程里的真实水平。
3D游戏开发是更好的试金石:它涉及渲染、碰撞、状态管理、实时交互,模型不只要写代码,还要根据页面视觉反馈反复调试。于是让两个模型用完全相同的提示词和视觉约束,各自复刻5款童年经典游戏,比谁能跑出可玩的成品。
但游戏只能比"谁更强",回答不了"K3自己能不能独立交付真实工程"。所以额外给K3加了一个非游戏类的全栈后端项目:从零搭数据库、写REST接口、跑通前端渲染,全程无人工介入。
Kimi K3走Kimi Code + WebBridge,GPT-5.6 Sol走Codex。唯一的变量是模型本身和对应的Agent工具链。
二、Kimi K3和GPT-5.6 Sol:5个童年经典逐个对比
1. 植物大战僵尸
Kimi K3的版本打开后能看到绿色草坪、僵尸推进、土豆雷爆炸。玩的时候会发现,它只有无尽波次,没有选关、没有暂停、没有星星评价,也没有胜场统计。GPT-5.6 Sol的版本除了核心对战,还做了选关界面、星星评价和胜负统计。
从代码结构看,Kimi K3单文件内联全部系统,存档直接读写。GPT-5.6 Sol拆成多个模块,额外加了默认存档逻辑和数据校验。
Kimi K3打开就能玩,但玩过几局后缺少目标感和进度反馈。GPT-5.6 Sol的流程更长,有明确关卡和评价体系。
Kimi K3-植物大战僵尸
GPT-5.6 Sol-植物大战僵尸
2. 合金弹头
Kimi K3的版本能看到自定义角色渲染,但敌人种类比GPT-5.6 Sol少两种。玩的时候最明显的区别是死亡后直接结束,不能续关。GPT-5.6 Sol做了检查点,死亡后可以从断点继续。
从代码结构看,Kimi K3用圆形碰撞判断,文件组织偏紧凑。GPT-5.6 Sol用矩形碰撞箱,结构上更接近标准游戏架构。
Kimi K3的画面有自己的风格,但容错率低,死亡成本高。GPT-5.6 Sol的敌人更丰富,容错更高,更像街机原版体验。
Kimi K3-合金弹头
GPT-5.6 Sol-合金弹头
3. 拳皇97
K3版有角色选择和难度选择,必杀技反馈密集,人物渲染细节比GPT-5.6 Sol的方块人更好。但缺舞台选择、血量/时间/伤害倍率等规则调整,设置项也没有持久化。
GPT-5.6 Sol把这些选项做全了,规则可以保存,更像能反复调整着玩的格斗游戏。
Kimi K3-拳皇97
GPT-5.6 Sol-拳皇97
4. 魂斗罗
K3版打开就能玩,射击和移动正常,但缺标题画面、选关、暂停和继续;悬浮陆地只有视觉效果,人物站不上去。
GPT-5.6 Sol做了完整街机流程,平台碰撞生效,更接近完整街机体验。
Kimi K3-魂斗罗
GPT-5.6 Sol-魂斗罗
5. 坦克大战
K3版基地保护、升级、地雷等核心机制都在,但缺菜单、暂停、关卡返回和关卡管理。
GPT-5.6 Sol有完整菜单系统、暂停菜单、结算界面和关卡配置校验,更像能长期打开的游戏。
Kimi K3-坦克大战
GPT-5.6 Sol-坦克大战
三、从5个游戏看Kimi K3
判断维度就五个:能不能直接玩、画面完成度、操作手感、规则完整性、聪明程度。
K3的优势:5个游戏都能直接打开玩,核心机制成立;植物大战僵尸和拳皇97视觉氛围强,高光反馈密集;能在提示词之外主动加星星升级、武器切换等内容;某些单点(如角色渲染)甚至优于GPT-5.6 Sol。
K3的短板:规则完整性普遍不足。大多数游戏缺菜单、暂停、选关、存档校验等外围流程;部分游戏死亡惩罚过重、容错率低;单款游戏UI精致度参差不齐。
GPT-5.6 Sol的成品感更强,因为它把预算花在了玩家不会夸但缺了会出戏的地方:菜单层级、规则持久化、边界校验、屏幕特效。
效率上也有差距。GPT-5.6 Sol在Codex上合理利用子Agent并发,完成时间约为K3的25%,token消耗也更省。但GPT-5.6 Sol的API定价更高,加上跨境访问和支付门槛,国内个人开发者的实际使用成本反而更高。K3虽然单次任务消耗更多token,但国内可直接访问,进入门槛更低。
四、横向对比之外:纯K3做一个带数据库的全栈项目
游戏对比能直观展示两个模型的差异,但它有一个局限:场景相对单一,主要看前端表现力;而且前面5款游戏不管有没有后端,都没有把数据库部分作为呈现重点。还想知道,当任务从"写一个可玩的页面"切换到"非游戏类的真实全栈工程",需要数据库设计、REST接口、前端联调一起跑通时,Kimi K3能不能独立完成。
于是单独给K3布置了一个全栈项目:基于开源项目https://github.com/li-xiu-qi/paper-graph-manager(论文引用关系图谱管理系统),让它自己从零跑通后端、补齐接口、验证前端渲染。整个过程没有手动介入调试,全部由K3自己完成。
1. 环境启动与依赖修复
K3的第一步是安装依赖并启动服务。它正确识别了FastAPI后端需要的全部依赖并安装完成,随后执行uvicorn main:app --host 0.0.0.0 --port 8001启动服务。
启动过程中它连续遇到三个ModuleNotFoundError:dotenv、pyvis、kimi_agent_sdk。K3判断这些都是环境依赖问题,不是代码bug,逐个安装后服务成功跑在http://localhost:8001,健康检查返回ok。
2. 后端功能实现与接口验证
核心需求是给论文引用关系增加完整的后端能力。K3改动了三个文件:
• database.py:新增paper_references表,含复合主键、外键、索引;
• graph.py:新增build_reference_graph()和export_reference_html();
• main.py:新增4个引用端点 + 2个图谱端点。
为了验证交付质量,K3在全新端口8002上跑了8步端到端测试,全部通过:入库论文、添加引用、查询outgoing/incoming、获取graph、导出HTML、删除引用、删除后验证为空。新增测试36个全部通过;全量134 passed、2 failed,K3用git stash撤回自己的改动后这2个失败依然存在,证明是项目预存的legacy问题,与本次功能无关。
3. 前端联调与真实页面渲染
后端跑通后,K3继续处理前端。启动Vite时遇到路径别名报错:Failed to resolve import "@/lib/utils" from "src/components/ui/dialog.tsx"。这是典型工程化问题:前端能跑起来,但代码里残留了未正确配置的别名引用。
K3没有卡住,而是通过Kimi Code的WebBridge直接控制浏览器验证页面状态:注入JS探测rootLen,确认页面从0增长到30081,说明前端确实渲染出来了。
最终页面成功渲染。Paper Graph Manager仪表盘首页展示了总论文数、已标注数、笔记覆盖率、最近入库论文列表(如Mistral 7B、Verifiable Fully Homomorphic Encryption),以及论文管理、知识图谱、智能聊天、笔记管理等模块入口。
五、写在最后
Kimi K3在呈现效果、游戏逻辑和操作流畅度上表现出色。作为开源模型,能达到这个完成度已是少数能打的存在,是中国开源模型参数的里程碑。
但就在昨天,K3因算力不足已整体关闭购买渠道,这也说明Kimi比较在意老用户体验。感兴趣的小伙伴,可以等他们算力充足后再购买体验。
但把标准拉到"能直接发给玩家反复打开",K3在系统完整度、规则严谨性和包装层上还有明显差距。它更适合快速产出可玩原型,而不是一步到位的完整产品。
横向对比之外,全栈项目补上了另一层判断:K3能读懂已有项目结构,区分环境问题和代码问题,独立完成数据库设计、REST接口和前端联调,并通过浏览器自动化验证真实渲染。这说明它的能力边界不只有前端页面,真实后端工程也能端到端跑通。
说到底,K3到底值不值得用?它在核心玩法实现上已具备可玩性,在真实后端工程中能独立跑通,角色渲染、视觉表现等单点还有优势。但如果你要的是开箱即用的完整产品体验,它在系统完整度和工程规范上还有追赶空间。从游戏case完成度看,K3已接近顶级闭源模型90%以上的水平。
