DeepSeek V3.1悄然登场,128K上下文窗口与代码能力升级成为亮点,整体表现稳健但惊喜有限。
抱歉断更了这么久,前几日一直在处理企业服务相关事务——前往河南调研并分享了几天的经验,返回北京后又与百度团队一同完成了「养猪吧少年—AI养猪」活动的复盘直播。
忙完这些再看这段时间AI领域的进展,真可谓AI一天,人间一年。阿里推出了Qwen-Image-Edit,智谱带来了AutoGLM,还有神秘的nano banana等等……正当整个AI社区翘首以盼,猜测DeepSeek传说中的推理模型R2何时能够“亮相”时,19号晚上七点,DeepSeek悄然上线了V3.1版本。
今天我们就来深入探讨DeepSeek V3.1的实际表现,先说结论:
- 上下文窗口扩展至128K,显著提升长文本处理能力
- 指令遵循能力略有增强(实际体验中提升并不显著)
- ToolUse与代码编写能力有所进步
- 文本创作方面的体验提升不明显。
一句话总结:此次更新符合+0.1版本的定位,除上下文窗口扩展外,整体效果提升有限,版本中尝试了混合推理及一些其他小改进。
没有铺天盖地的宣传,仅仅是一次版本号增加0.1的更新,却也在AI圈内激起了不小的涟漪。
那么问题来了,这次版本号仅增加0.1的更新,究竟带来了哪些实质性变化?
首先,UI界面最明显的变化是,深度思考(R1)中的「R1」字样被移除了……
我们来看看DeepSeek V3.1的实际能力,探究它在这次进化中究竟隐藏了哪些“真功夫”。
V3.1的核心更新速览
先来看这次更新的“官方说明书”以及社区中的第一波反馈。V3.1的核心升级点非常明确,主要集中在两个方面:
关键更新 1:上下文窗口翻倍至128k
如果说大模型的上下文窗口是它的“记忆力”,那么这次升级,相当于将DeepSeek的短期记忆从能记住一本杂志,提升到了能记住一部中篇小说的水平。
128k的上下文窗口,意味着模型可以一次性“阅读”并处理大约10万个汉字的内容。
实际测试结果也很准确:将一份约300万字的《十日终焉》发送给DeepSeek,请它帮忙总结内容。模型反馈称只能阅读前3%,也就是大约9-10万字的内容。
同时,它也给出了前10万字(即第1章至第43章)的内容总结。
这一点就不多赘述了,其他模型早已支持128k上下文,这算是一次常规更新,在多轮对话、长文档分析、代码库理解等场景中具有实际应用价值。
关键更新 2:编程与代码能力再度精进
这次更新在开发者社区中反响最热烈的,是其代码能力的又一次增强。
在Hugging Face和Reddit上,已有不少开发者发布了初步评测结果。
特别是在Aider这一专门评估AI代码能力的基准测试中,V3.1的表现也较为亮眼。有网友抢先测试,V3.1得分达到71.6%,在开源模型中表现突出。
当然,需要客观看待:基准测试成绩斐然,就像“考试状元”,但这并不完全等同于在真实、复杂的开发环境中的“实战能力”。
因此,它究竟是否真的那么能打,还需要亲自上手验证。
V3.1的实际场景表现
接下来,进入大家最喜欢的“talk is cheap, show me the case”环节,直接进行实测!
场景一:128k长文本处理能力
由于之前上传的《十日终焉》第一卷内容,DeepSeek只读取了前3%。这次我们截取前3%的内容,即前43章,字数大约10万字。
将文档上传给DeepSeek后,要求它概括内容,同时进行常规长文本“大海捞针”测试。
可以看到,这次V3.1的表现不错。它准确概括了文章的核心设定,章节的主要情节发展总结得也很到位。
这表明模型确实“读完”并“读懂”了整份长文档。
场景二:文本创作能力
小七姐之前开源过一个风格化迁移的prompt,用于提炼中文经典文学风格,然后将提炼结果提供给AI模型进行参考。结合DeepSeek长文本能力的提升,可以做出更多尝试。
这里沿用当时测评Qwen3的案例:“中文经典文学风格迁移测评”,来看看这次DeepSeek的表现。
提炼出来的风格化Json 「此处略」
基于上述文本风格,为我编写一篇3000字的小说(两回合),关键词:哪吒,敖丙,抽龙筋,闹海,自尽
注意:
直接生成文本内容,不要做任何标注和解释。
注意年代与叙事顺序符合史序
不要采用原风格中与西游记相关的特定人名、地名、特定修辞
仿照《西游记》的叙事风格,来写哪吒闹海的故事。
如果你之前看过小七姐的测评,就会知道,这次DeepSeek的表现与Qwen3的表现不相上下。
这里再看“大事件中的小人物刻画”prompt,文本风格和流畅度依然很不错。
场景三:常规编程任务
接下来,检验一下社区里被广泛称赞的“代码能力”。
案例1:“表情符号反应堆”
模拟一个真实的前端开发需求,让它实现一个之前用Qwen3做过的“表情符号反应堆”游戏。
先来看一下之前Qwen3的表现。
再将同样的提示词发送给DeepSeek,看看它的表现。
坦白说,DeepSeek在这个案例中生成的效果,比当时的Qwen3版本要略好一些。
首先,美观度上比Qwen3稍强;其次,它使用了Web Audio API生成了不同情况下的音效反馈;最后,在功能上实现了本地存储,通过localStorage保存最高分记录,还在玩法中加入了combo连击机制。
案例2:“情绪价值营销的大师”
再用“情绪价值营销的大师”卡片,测试一下DeepSeek v3.1的能力。
输入「国产3A游戏 黑神话:钟馗」,直接生成:
最终生成的卡片虽然美观度稍差,但对文本的理解能力还是不错的。
它用一句充满画面感、力量感和宿命感的话,直接唤醒了大家血液中的文化基因和英雄情结,与那些渴望变强、不惧挑战的玩家产生了共鸣。
案例3:文本杂志编排能力
这里用文本杂志排版prompt进行测试,直接将一段长文本提供给DeepSeek,然后让它基于文本内容给出设计方案。
确定格式方案后,它可以直接进行处理:
这样,一段文字就变成了一份杂志,排版舒适,样式精美。
今后对于长文本的展示,都可以采用这种方法。
场景四:常识与推理能力初探
再看看V3.1在处理一些融合了常识和逻辑的“陷阱”问题时表现如何。
这类问题往往更能考验一个模型是否只会“算术”,还是真的具备了一定的“世界知识”。
案例1: 每次模型更新时大家都热衷问的问题……
案例2: 再来看一道2025年高考全国一卷的数学题。
发送给DeepSeek后,它立即开始了证明过程。
最后给出了答案。
可以看出,V3.1展现出了基础的数学能力和推理能力。
在这之后,我也用之前编写的商业分析应用prompt逐一测试,效果相比前一个版本略有提升,但提升并不明显,这里就不展示了。
结语
综合测评下来,可以感受到DeepSeek V3.1的能力有所提升,但提升幅度并不显著。
关于代码层面难以给用户带来特别突出的体验,一方面是因为Qwen模型、K2模型以及智谱GLM-4.5的效果都很优秀,而Deepseek V3.1在这些模型中的表现并没有特别亮眼的地方。
V3.1并没有给市场带来特别大的预期,它更像是一次“承上启下”的稳健升级。
它在现有V3的优秀架构基础上,针对长文本处理和代码方向进行了“一些优化”,并且在这个迭代中,尝试将混合推理纳入其范畴,进行了一些探索。
这可能是DeepSeek的策略:在推出新模型(V4/R2)之前,先将现有基础模型的能力打磨到极致,巩固自己的优势领域,同时多做尝试,多进行探索。
如果说V3.1是在“术”的层面精益求精,
当然期待R2,能够在“道”的层面实现质变飞跃。
让我们保持耐心,
于无声处听惊雷,静待“R2”亮相时,
那时,DeepSeek能像年初那样,
再一次,
惊艳全世界。
