游乐游手机版
首页/AI热点日报/热点详情

DeepSeek V3.1体验评测 稳健升级但惊喜有限

类型:热点整理2026-07-22
DeepSeekV3 1低调上线,主要更新包括上下文窗口扩展至128K、代码能力提升及混合推理尝试,指令遵循略有改善。在多项基准测试中表现稳定,但整体效果提升不显著,属于稳健升级,为后续迭代积累经验。该版本重点优化了长文本处理与编程辅助场景。

DeepSeek V3.1悄然登场,128K上下文窗口与代码能力升级成为亮点,整体表现稳健但惊喜有限。

抱歉断更了这么久,前几日一直在处理企业服务相关事务——前往河南调研并分享了几天的经验,返回北京后又与百度团队一同完成了「养猪吧少年—AI养猪」活动的复盘直播。

忙完这些再看这段时间AI领域的进展,真可谓AI一天,人间一年。阿里推出了Qwen-Image-Edit,智谱带来了AutoGLM,还有神秘的nano banana等等……正当整个AI社区翘首以盼,猜测DeepSeek传说中的推理模型R2何时能够“亮相”时,19号晚上七点,DeepSeek悄然上线了V3.1版本。

今天我们就来深入探讨DeepSeek V3.1的实际表现,先说结论:

  • 上下文窗口扩展至128K,显著提升长文本处理能力
  • 指令遵循能力略有增强(实际体验中提升并不显著)
  • ToolUse与代码编写能力有所进步
  • 文本创作方面的体验提升不明显。

一句话总结:此次更新符合+0.1版本的定位,除上下文窗口扩展外,整体效果提升有限,版本中尝试了混合推理及一些其他小改进。

没有铺天盖地的宣传,仅仅是一次版本号增加0.1的更新,却也在AI圈内激起了不小的涟漪。

那么问题来了,这次版本号仅增加0.1的更新,究竟带来了哪些实质性变化?

首先,UI界面最明显的变化是,深度思考(R1)中的「R1」字样被移除了……

我们来看看DeepSeek V3.1的实际能力,探究它在这次进化中究竟隐藏了哪些“真功夫”。

V3.1的核心更新速览

先来看这次更新的“官方说明书”以及社区中的第一波反馈。V3.1的核心升级点非常明确,主要集中在两个方面:

关键更新 1:上下文窗口翻倍至128k

如果说大模型的上下文窗口是它的“记忆力”,那么这次升级,相当于将DeepSeek的短期记忆从能记住一本杂志,提升到了能记住一部中篇小说的水平。

128k的上下文窗口,意味着模型可以一次性“阅读”并处理大约10万个汉字的内容。

实际测试结果也很准确:将一份约300万字的《十日终焉》发送给DeepSeek,请它帮忙总结内容。模型反馈称只能阅读前3%,也就是大约9-10万字的内容。

同时,它也给出了前10万字(即第1章至第43章)的内容总结。

这一点就不多赘述了,其他模型早已支持128k上下文,这算是一次常规更新,在多轮对话、长文档分析、代码库理解等场景中具有实际应用价值。

关键更新 2:编程与代码能力再度精进

这次更新在开发者社区中反响最热烈的,是其代码能力的又一次增强。

在Hugging Face和Reddit上,已有不少开发者发布了初步评测结果。

特别是在Aider这一专门评估AI代码能力的基准测试中,V3.1的表现也较为亮眼。有网友抢先测试,V3.1得分达到71.6%,在开源模型中表现突出。

当然,需要客观看待:基准测试成绩斐然,就像“考试状元”,但这并不完全等同于在真实、复杂的开发环境中的“实战能力”。

因此,它究竟是否真的那么能打,还需要亲自上手验证。

V3.1的实际场景表现

接下来,进入大家最喜欢的“talk is cheap, show me the case”环节,直接进行实测!

场景一:128k长文本处理能力

由于之前上传的《十日终焉》第一卷内容,DeepSeek只读取了前3%。这次我们截取前3%的内容,即前43章,字数大约10万字。

将文档上传给DeepSeek后,要求它概括内容,同时进行常规长文本“大海捞针”测试。

可以看到,这次V3.1的表现不错。它准确概括了文章的核心设定,章节的主要情节发展总结得也很到位。

这表明模型确实“读完”并“读懂”了整份长文档。

场景二:文本创作能力

小七姐之前开源过一个风格化迁移的prompt,用于提炼中文经典文学风格,然后将提炼结果提供给AI模型进行参考。结合DeepSeek长文本能力的提升,可以做出更多尝试。

这里沿用当时测评Qwen3的案例:“中文经典文学风格迁移测评”,来看看这次DeepSeek的表现。

提炼出来的风格化Json 「此处略」

基于上述文本风格,为我编写一篇3000字的小说(两回合),关键词:哪吒,敖丙,抽龙筋,闹海,自尽

注意:
直接生成文本内容,不要做任何标注和解释。
注意年代与叙事顺序符合史序
不要采用原风格中与西游记相关的特定人名、地名、特定修辞

仿照《西游记》的叙事风格,来写哪吒闹海的故事。

如果你之前看过小七姐的测评,就会知道,这次DeepSeek的表现与Qwen3的表现不相上下。

这里再看“大事件中的小人物刻画”prompt,文本风格和流畅度依然很不错。

场景三:常规编程任务

接下来,检验一下社区里被广泛称赞的“代码能力”。

案例1:“表情符号反应堆”

模拟一个真实的前端开发需求,让它实现一个之前用Qwen3做过的“表情符号反应堆”游戏。

先来看一下之前Qwen3的表现。

再将同样的提示词发送给DeepSeek,看看它的表现。

坦白说,DeepSeek在这个案例中生成的效果,比当时的Qwen3版本要略好一些。

首先,美观度上比Qwen3稍强;其次,它使用了Web Audio API生成了不同情况下的音效反馈;最后,在功能上实现了本地存储,通过localStorage保存最高分记录,还在玩法中加入了combo连击机制。

案例2:“情绪价值营销的大师”

再用“情绪价值营销的大师”卡片,测试一下DeepSeek v3.1的能力。

输入「国产3A游戏 黑神话:钟馗」,直接生成:

最终生成的卡片虽然美观度稍差,但对文本的理解能力还是不错的。

它用一句充满画面感、力量感和宿命感的话,直接唤醒了大家血液中的文化基因和英雄情结,与那些渴望变强、不惧挑战的玩家产生了共鸣。

案例3:文本杂志编排能力

这里用文本杂志排版prompt进行测试,直接将一段长文本提供给DeepSeek,然后让它基于文本内容给出设计方案。

确定格式方案后,它可以直接进行处理:

这样,一段文字就变成了一份杂志,排版舒适,样式精美。

今后对于长文本的展示,都可以采用这种方法。

场景四:常识与推理能力初探

再看看V3.1在处理一些融合了常识和逻辑的“陷阱”问题时表现如何。

这类问题往往更能考验一个模型是否只会“算术”,还是真的具备了一定的“世界知识”。

案例1: 每次模型更新时大家都热衷问的问题……

案例2: 再来看一道2025年高考全国一卷的数学题。

发送给DeepSeek后,它立即开始了证明过程。

最后给出了答案。

可以看出,V3.1展现出了基础的数学能力和推理能力。

在这之后,我也用之前编写的商业分析应用prompt逐一测试,效果相比前一个版本略有提升,但提升并不明显,这里就不展示了。

结语

综合测评下来,可以感受到DeepSeek V3.1的能力有所提升,但提升幅度并不显著。

关于代码层面难以给用户带来特别突出的体验,一方面是因为Qwen模型、K2模型以及智谱GLM-4.5的效果都很优秀,而Deepseek V3.1在这些模型中的表现并没有特别亮眼的地方。

V3.1并没有给市场带来特别大的预期,它更像是一次“承上启下”的稳健升级。

它在现有V3的优秀架构基础上,针对长文本处理和代码方向进行了“一些优化”,并且在这个迭代中,尝试将混合推理纳入其范畴,进行了一些探索。

这可能是DeepSeek的策略:在推出新模型(V4/R2)之前,先将现有基础模型的能力打磨到极致,巩固自己的优势领域,同时多做尝试,多进行探索。

如果说V3.1是在“术”的层面精益求精,

当然期待R2,能够在“道”的层面实现质变飞跃。

让我们保持耐心,

于无声处听惊雷,静待“R2”亮相时,

那时,DeepSeek能像年初那样,

再一次,

惊艳全世界。

来源:https://www.53ai.com/news/LargeLanguageModel/2025082103625.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。