今天凌晨,全球知名的大模型开源平台DeepSeek悄然发布了DeepSeek V3.1-Base版本。没有官方公告,没有详细技术说明,甚至模型卡片也未曾配备——他们直接将模型权重上传至社区。结果可想而知:Hugging Face趋势榜上它已飙升至第四名,开发者社区瞬间沸腾。
这种“先发布再补票”的极客风格,在如今动辄长篇公告、直播发布的环境里,反而成为最硬核的风景线。
开源地址:https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Base/tree/main
Hugging Face联合创始人Clement Delangue特意发推祝贺,言语间满是赞赏:V3.1在毫无宣传的情况下发布,甚至没有附带模型卡片,却已登上趋势榜第四位——这实在太有趣了。他还补充道,“这就是在Hugging Face上拥有8万关注者的力量。”说白了,粉丝们见到新模型就像闻到血味的鲨鱼,根本不需要任何推广。
根据社区初步挖掘,这次升级版在速度和智能程度上均有显著提升,体感上已经能与GPT级别模型一较高下。该模型拥有6850亿参数,支持BF16、F8_E4M3、F32三种张量类型,采用Safetensors格式发布,推理效率更有保障,上下文窗口也得到扩展。这些硬核指标叠加在一起,难怪开发者们如此兴奋。
更令人感慨的是DeepSeek“先放权重,后补说明”的风格——不说废话,直接让社区动手测试。这种信任与坦诚,在当前开源圈中确实弥足珍贵。
有网友直言,“很高兴看到仍有公司在发布基础模型。”言下之意,如今许多厂商更热衷于应用层开发、商业化闭源,纯粹的基础模型开源反而成了稀缺资源。
还有分析认为,这个版本很可能是结合了V3和R1的产物。对话模板中包含一个思考参数,用于控制推理过程,这意味着模型在逻辑推理与生成质量上可能做了深度融合。
当然,也有用户尝试用4GB显卡加载这个685B的巨无霸,结果当场崩溃——这倒在意料之中,毕竟参数规模摆在那里,本地运行基本不现实。
那么问题来了:既然V3.1已经悄无声息地到来,传说中的R2到底还有没有戏?社区的期待值已经拉满。

