游乐游手机版
首页/AI热点日报/热点详情

DeepSeek v3.1版本更新实测:效果提升如何?

类型:热点整理2026-07-22
DeepSeek V3 1版本实测结果出炉:性能提升尚存疑问,但中英混杂推理能力确实有所增强 近日,DeepSeek悄然更新了V3 1模型,一如既往地未发布正式公告,但AI圈内已经率先热议。不过说实话,刚上手测试了几个问题,第一反应是——自己到底有没有被更新到?因为初步体验下来,变化并不明显。 在群

DeepSeek V3.1版本实测结果出炉:性能提升尚存疑问,但中英混杂推理能力确实有所增强

近日,DeepSeek悄然更新了V3.1模型,一如既往地未发布正式公告,但AI圈内已经率先热议。不过说实话,刚上手测试了几个问题,第一反应是——自己到底有没有被更新到?因为初步体验下来,变化并不明显。

在群里问了一圈才发现,确认已更新。之前开启深度思考时,回复必定是R1模型;现在再开启深度思考,返回的却是V3。这一对比差异非常明显。

初步判断,V3.1可能是一个混合推理模型,颇有意思。与Qwen3的混合推理方向似乎相反,不过一切猜测仍需等待开源后才能验证。

既然是DeepSeek的新版本,还是有必要认真测试一番。但说实话,实测下来有些失望——或许这也正是官方在更新时仅提到“长度拓展至128K”就没了下文的原因,并未明确说明哪些方面有提升。

[图片略]

先说一下测试的整体结论:我认为没有明显提升。我测试了6个维度,均未发现显著改进,甚至在某些推理任务上,表现还不如之前的版本。以下是几个典型测试案例,供大家讨论参考。

另外还注意到一个有趣的现象:V3.1思考过程中的中英文混杂变得更加明显,比R1时期要频繁得多。这可能与RLVR训练方式有关。最近有一篇相关论文《The Impact of Language Mixing on Bilingual LLM Reasoning》,结论是语言混杂反而能增强推理能力。

附一个中英混杂思考的测试实例。之前这种纯文本推理很少出现中英混用,只有数学代码场景才有,而新版本中这种情况变得非常常见。

以下是详细的测试对比(老版本模型通过硅基流动接口进行测试)。

常规测试

Prompt:将“I love DeepSeek-V3.1”这句话的所有内容反过来写

R1-0528结果:正确

V3.1结果:多了一个空格

知识理解

Prompt:如何理解“但丁真不会说中国话,但丁真会说中国话”

R1-0528结果:正确

V3.1结果:连回答里都出现了“perception”

角色扮演 & 创作

Prompt:用知乎风格写一段对比 DeepSeek-V3 和 DeepSeek-V3.1 的使用体验,语气轻松、略带吐槽。

R1-0528结果:整体感觉比V3.1强

V3.1结果:表现一般

逻辑推理:小红、老鹰与色盲

Prompt:小红有2个兄弟,3个姐妹,那么小红的兄弟有几个姐妹?

R1-0528结果:回答很全面

V3.1结果:回答正确,默认小红为女生

Prompt:未来的某天,李同学在实验室制作超导磁悬浮材料时,意外发现实验室的老鼠在空中飞……

R1-0528结果:错误

V3.1结果:错误

Prompt:女孩考了38分改成了88分,父亲看到后崩溃了……

R1-0528结果:答出了色盲,但未涉及伦理层面

V3.1结果:回答是父亲色盲,这显然不对

数学能力

Prompt:密码破译类逻辑题……

R1-0528结果:正确

V3.1结果:错误,这个R1做对了

Prompt:2025年高考全国一卷数学试题

R1-0528结果:前两问正确,最后一问错误

V3.1结果:前两问正确,最后一问错误

代码生成

Prompt:可爱风格五子棋游戏界面……

R1-0528结果:还不错,但人机对战时略显呆板,不如Qwen3-Coder


V3.1结果:人机对战时依旧呆板


Prompt:生成一个通过点击立方体的各个面逐渐展开为完整平面的交互动画……

R1-0528结果:不对


V3.1结果:更离谱

其他几个测试结果也类似,整体感觉不如Qwen3-Coder。

写在最后

V3.1版本仅提高了0.1个版本号,从目前的表现来看,没有重大提升,甚至部分任务还有所退步。需要注意的是,以上对比主要是V3.1与R1的对比,即使不开深度思考,V3.1与V3的差异也不大。

不过,仍然对R2抱有很高期待,不知道DeepSeek何时能发布。

来源:https://www.53ai.com/news/LargeLanguageModel/2025081973519.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。