8月14日消息,据快科技报道,CLUE团队最新发布了SuperCLUE-Terminal中文智能体终端编程测评榜单。其中,新版DeepSeek-V4-Pro-0813以51.52分的成绩位居全部参测模型第二,仅次于Kimi-K3。更受行业关注的是,这款模型的调用成本极低,整体性价比表现十分突出。

SuperCLUE-Terminal是专为国内开发者打造的实战型评测标准,全面采用本土真实编程任务,并统一基于Claude Code运行框架,对各大模型在中文需求理解、任务规划、工具调用、排错修复与代码改写等完整编程能力进行公平对比。
每道测试题都要求模型完成50至110轮交互,单题完整运行时间约为半小时到一个半小时,能够较为真实地还原日常软件开发中的复杂工作流程。
在本次榜单中,Kimi-K3以60.61分排名第一,DeepSeek-V4-Pro-0813紧随其后,其成绩也明显高于GLM-5.2的48.48分,以及老版DeepSeek-V4-Flash的46.46分。
更亮眼的是其成本控制能力,单题调用费用仅为1.42元,约为Kimi-K3的十四分之一、GLM-5.2的十六分之一,价格优势非常明显。
此次测评场景覆盖前端页面开发、3D游戏生成、工程脚本修改等真实编程需求。实测结果显示,它能够完整闭环游戏开发逻辑,碰撞检测、计分系统、结算功能均可正常运行,页面配色与交互反馈也明显摆脱了模板化的AI风格;不过在少数创意绘图类题目中,仍会出现一些结构上的小瑕疵,但整体完成度依然稳居第一梯队。
对于中小企业和独立开发者而言,这款模型在性能与成本之间实现了较好的平衡。头部高分模型虽然能力突出,但算力成本普遍较高,小规模团队长期使用压力不小,而DeepSeek-V4-Pro-0813则以更低价格提供接近顶级的代码生成与编程能力。
