游乐游手机版
首页/AI热点日报/热点详情

DeepSeek V3.1深度评测体验报告

类型:热点整理2026-07-22
DeepSeek V3 1 的这次更新颇具看点:Token 消耗量明显降低,上下文窗口从 64K 直接翻倍至 128K,而综合性能基本保持稳定。乍看之下像是“平替”版本,但在实际应用场景中,尤其是对 Token 消耗敏感的 Agent 任务里,这种“减量不减质”的优化其实暗藏玄机。 简短结论:减量不

DeepSeek V3.1 的这次更新颇具看点:Token 消耗量明显降低,上下文窗口从 64K 直接翻倍至 128K,而综合性能基本保持稳定。乍看之下像是“平替”版本,但在实际应用场景中,尤其是对 Token 消耗敏感的 Agent 任务里,这种“减量不减质”的优化其实暗藏玄机。

DeepSeek V3.1 测评

简短结论:减量不减质

基本情况:

DeepSeek 团队的更新风格一向保守——不够重磅的升级统称为“小更新”。这次官方甚至没有提及“小更新”,只是默默将上下文长度从 64K 提升至 128K。这明显释放了一个信号:性能方面不必抱过高期望。

实际测试下来,结果喜忧参半。好消息是,V3.1 的 Token 使用量相比 0324 版本下降了约 13%——在众多国产模型竞相输出长篇大论的浪潮中,这算是一股“逆流”。坏消息是,综合推理能力确实没有明显提升。但考虑到上下文翻倍为 Agent 类应用带来的潜力,一增一减之间,实际体验反而可能更优。

逻辑表现:

*表格为突出对比关系,仅展示部分可对照模型,并非完整排序。

**题目及测试方式,参见:大语言模型-逻辑能力横评 25-07月榜

***完整榜单更新在 Github (https://github.com/malody2014/llm_benchmark)

***本次测试基于8月题目,已新增#45、#46、#47题,因此所有模型的分数较7月有所变动。

以下将 V3.1 与上一迭代版本 0324(以下简称旧版)进行对比分析。

改进之处:

  • 长度控制:如前所述,Token 使用量确实显著下降。旧版还存在一个毛病:小概率出现死循环,或在某些复杂问题上不受控制地反复验算。V3.1 中暂时未发现这类问题。即使遇到无法解决的难题,它也会坦然承认自己搞不定,果断放弃,而不会盲目死磕。

  • 字符处理能力:在典型的字符能力测试中,V3.1 展现出可见的进步。例如 #9 单词缩写、#11 岛屿面积、#37 三维投影、#46 字母组合等题目,V3.1 的整体得分和稳定性均不低于旧版。不过,字符能力的提升并未同步传导到编程能力上——从精选的少量编程题来看,V3.1 变化不大。

不足之处:

  • 幻觉问题严重:幻觉是 V3 和 R1 系列的老问题,V3.1 自然没有改善的迹象。比如 #42 年报总结,V3.1 在关键信息摘录上全部出错,甚至不如旧版。在那些需要推理过程中生成大量中间数据的题目上(如 #4 魔方旋转、#40 代码推导),表现也明显逊于旧版。

  • 倾向于“偷懒”:V3.1 在许多问题上表现出一种“节省”倾向。例如 #24 数字规律,它推导了十几次,输出超过 3000 Token,然后突然宣布放弃:“由于时间关系,我直接给出常见答案。” #29 数学符号重定义也是短暂推理后直接认输。#39 火车票问题,因为提示要求不能写程序,V3.1 更是直言不讳:太麻烦,不会做,告辞。类似案例不少,很可能 DeepSeek 为了优化 Token 消耗而做出了某些取舍。

  • 中英混杂现象:旧版几乎不存在中英混杂的问题,即便你用英文提问,它也会老老实实回复中文。但在 V3.1 中,中英混杂随处可见——尤其是推理到一定长度后,大概率会切换到英文思考。而且 V3.1 的混杂问题比其他国产模型更严重:它在单词粒度上来回切换语言,读起来非常抓狂,对输出内容的理解造成了极大干扰。

赛博史官曰:

大家对 DeepSeek 的关注度,远超国内任何一家大模型团队。几乎恨不得让它单挑 OpenAI、Google、Anthropic、Grok 全家桶。但这显然不现实——技术发展有自己的节奏。从 V3.1 的变化中,我们能洞察 DeepSeek 团队的思考逻辑:他们发现了什么问题,做了哪些尝试,又得到了什么教训。这个过程,恐怕是任何一个瞄准 AGI 的团队都绕不开的必修课。

来源:https://www.53ai.com/news/LargeLanguageModel/2025081908472.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。