DeepSeek近日在低调中完成了一次重大版本迭代,线上模型已悄然升级至V3.1版本。本次更新的核心亮点尤为突出:上下文长度直接扩展至128K,同时编程能力也有了肉眼可见的显著提升。尽管官方公告极为简短,但实际体验表明,这版模型确实隐藏了不少“大招”。
官方通告内容简明扼要:DeepSeek线上模型版本已升级至V3.1,上下文长度拓展至128K,用户可直接在官方网页、APP及小程序中体验,API接口调用方式保持不变。然而,版本号从V3直接跃升至V3.1,且官方未提及任何具体改进细节——这种沉默往往意味着背后有重大动作。

1. 天气卡片案例测试
测试提示词要求创建一个包含CSS和JavaScript的单个HTML文件,实现动画天气卡片。卡片需通过不同动画直观展示风、雨、晴、雪四种天气条件,并排显示所有卡片,且使用深色背景。所有HTML、CSS和JavaScript代码需要整合在一个文件中,同时包含一个在不同天气条件之间切换的机制。
实测结果表明,V3.1在卡片动态效果方面虽然与R1仍有差距,但这个差距已经大幅缩小。相比之前的V3版本,V3.1在代码编程能力和用户意图识别上确实有了明显进步,生成的卡片整体质量提升了一个档次。
2. 个人网站/公司网站的开发
提示词要求:“设计一个充满科技感的公司网站,公司名为伶问科技,业务是智能体开发和企业咨询,直接生成可用的网页。”从生成速度来看,R1明显比V3.1耗时更久,这符合两者架构设计的差异——R1是推理型模型,会在用户意图理解上花费更多时间;而V3.1作为非推理模型,响应速度明显更快。
对比两版生成结果,生成的公司网站整体水平相差不大。但V3.1与V3.0相比,生成的网页特效更丰富、布局更合理、排版也更美观。这意味着V3.1在前端代码生成和视觉设计理解方面确实做出了实质性改进。
3. 推理能力的提升
测试题是一道逻辑推理单选题:某办公室甲、乙、丙、丁四人预测先进工作者结果,只有一人说对,问哪项判断正确。四个选项分别对应甲、乙、丙、丁的当选或落选状态。
在这个逻辑推理测试中,V3.1虽然比豆包深度思考的推理时间更长,但两者最终都得出了正确答案。值得注意的是,V3.1本身属于非推理模型,但这次更新后它的逻辑推理能力确实有了明显提升,在复杂的逻辑判断场景中表现出了更强的竞争力。
4. 逻辑能力与构图能力的测试
几个基础算术题的测试中,DeepSeek V3.1都能给出正确答案,思考过程也变得更加简洁明了,不再像以前那样在简单问题上绕圈子。
流程图测试要求生成一个登录验证流程图:用户输入账号密码后,验证成功则进入网站,验证失败则返回输入步骤,失败超过10次就锁定网站禁止进入。对比V3.1与R1生成的流程图,两者在构图能力上存在明显差距——V3.1虽然能理解逻辑流程,但在流程图的可视化表达上明显弱于R1。
5. 需求理解并撰写的案例测试
这是最有趣的一项测试。提示词要求作为有30年经验的小红书文案专家,为兰蔻香水写一篇具有爆款元素的推广软文。V3.1生成的文案语气更加活泼、温暖,语言通俗且口语化,确实有几分小红书爆款文案的味道。如果不加标注,很难区分哪篇是V3.1写的,哪篇是R1写的——两款模型在文案生成上的风格差异已经微乎其微。
总结
V3.1相比V3版本确实有了较大提升,但与市面上的一些主流大模型相比,仍存在一定差距。作为非推理型模型,它的推理能力与R1的差距正在缩小,综合性价比来看,V3.1确实是一款相当有竞争力的模型。如果对编程能力和长文本处理有较高要求,这次的升级版值得认真体验一下。
