游乐游手机版
首页/AI教程/文章详情

梁文锋四小时发言刷屏背后展现克制

时间:2026-07-23 20:22
如果要说今天AI圈最值得关注的事,那大概就是梁文锋那场长达四个小时的投资者交流会议实录刷屏了。 DeepSeek用一种近乎苛刻的克制,真的蹚出了通往AGI的第二条路。 一个很重要的背景是,DeepSeek刚完成成立以来的首轮外部融资,总金额超过500亿元软妹币(约合74亿美元),投前估值约3675亿

如果要说今天AI圈最值得关注的事,那大概就是梁文锋那场长达四个小时的投资者交流会议实录刷屏了。

四小时发言实录刷屏背后,梁文锋的克制

DeepSeek用一种近乎苛刻的克制,真的蹚出了通往AGI的第二条路。

一个很重要的背景是,DeepSeek刚完成成立以来的首轮外部融资,总金额超过500亿元软妹币(约合74亿美元),投前估值约3675亿元(约543亿美元)。而在此之前,梁文锋对外一直坚持“不融资、不上市、不商业化”的三不原则。

这段长达4个小时的谈话实录,梁文锋详细阐述了DeepSeek的组织文化、开源逻辑、技术路线图,以及对整个行业竞争格局的看法。当然,需要说明的是,这份会议实录目前还没有得到他本人的确认。

“克制是一种战略”

翻看流传出的多个版本实录,会发现一个高频关键词反复出现:克制。

梁文锋花了很大篇幅对投资者强调,克制是一种战略。舍弃短期利益,砍掉非主线业务,不是为了显得清高,而是为了换取实现AGI的最大概率。其中一个版本提到,他说了非常多次的“不”:不是天才,不赚不合理的利润、不追求用户量、不闭源、不做3D/视频生成/世界模型,不做下一个超级App。

不少观点把梁文锋的“克制”,解读为资源不足时的无奈取舍。这确实很反常识——在追求效率、着眼商业化以兑现资本承诺的语境下,这家公司,几乎把资本的故事都抽离掉了。重点落在“为了AGI而克制”上,这很反常识。

当然,这固然是基于现实作出的判断,但恰恰是这种非主流的姿态,反而成了市场重估DeepSeek价值的新标尺。

如果把梁文锋的路线,放在全球AI竞争的坐标系里来看,更准确的理解或许是:在算力约束下,他为换取AGI最大概率而进行的一场精密计算。

他在谈及中美差距时,有一个非常直接的判断:“我们看到的所有区别,包括人才的区别、模型能力的区别、应用的区别,可以认为都是因为算力资源上的区别。”

那么,目前硅谷AI的范式是什么?是“资源溢出驱动涌现”。说白了,就是堆最多的卡,训最大的模型,做最全的AI能力,相信规模到了,智能自然会涌现。

这套逻辑在过去三年被验证有效,但也带来一个尖锐的问题:模型能力越强、上下文越长、用户调用越频繁,对推理算力的消耗就越高,算力成本也越来越贵。最新消息显示,OpenAI预计到2030年将在计算资源上投入约7500亿美元,比2026年早些时候提出的6000亿美元规划又高出一截。

与此同时,无边界扩张的副作用也开始显现。研发资源被分散,商业化动作变形,组织熵增加剧。以Meta为例,它在开源Llama系列赢得声誉的同时,内部却因为同时推进文本、多模态、元宇宙及机器人等多条战线,导致核心大模型团队的顶尖人才频繁流失,产品迭代节奏也被打乱了好几次。

Google这边呢,则是在搜索、云业务与AI实验室的多重目标拉扯下,一度陷入“创新者窘境”。明明手握最强技术储备,却在生成式AI的产品化落地中屡屡迟疑,错失了先发身位。

这些巨头的困境,很大程度上来自技术以外的“战略贪婪”。当一家公司同时押注多条AI路径,“什么都想做”的全能叙事,反而稀释了攻克AGI核心瓶颈所需要的专注度。

按照梁文锋的表述,DeepSeek的路线非常“克制”:当算力成为硬约束时,“做什么”远比“不做什么”更重要。极致聚焦主线任务,用工程能力弥补硬件代差,追求单位算力的产出效率而非绝对规模。

在技术路线尚未收敛的当下,少即是多。只有砍掉那些“看起来很美但偏离核心目标”的旁支业务,才能将有限的算力和人才集中在CoT(思维链)、Agent、持续学习等真正决定AGI成败的关键瓶颈上。DeepSeek-V3的训练成本远低于GPT-4o,但性能却逼近第一梯队,这就是一个很好的例证。

说到这儿,不由得让人想起MiniMax和它的创始人闫俊杰。他们一开始就把有限的资金、人员等资源,分散押注在文本、视频、语音、音乐四大模态上。如今,MiniMax的颓势让不少人为其捏一把汗。

通往AGI的第二条路

DeepSeek的路线,正在被Kimi K3验证。

作为月之暗面首款3万亿参数级MoE模型,K3总参数规模达到2.8万亿。按常规理解,这个规模的模型,每输出一次,算力都是指数级消耗。但凭借其独特核心架构,它达到了华&为在芯片领域提出的“韬定律”效果。

这个架构可以被视为一架超级引擎。它通过落地KDA(Kimi Delta Attention)混合线性注意力、注意力残差(Attention Residuals)和高稀疏度MoE三项关键技术,完成了一次对“模型生产效率”的重构。

根据月之暗面此前发布的技术报告,在实验模型上采用KDA与MLA混合比例,KV缓存占用最高削减了75%,100万上下文长度下的解码吞吐量提升至原来的6倍。配合注意力残差与高稀疏度MoE技术,训练效率提升约25%,而额外成本不到2%。

这意味着什么?同样一笔算力预算,过去只能跑1个任务,现在K3能跑4个,而且质量不打折。

SemiAnalysis的报告也指出,KDA将推理速度提升了300%,同时在长上下文处理上保持接近Transformer的性能。开发者社区的实测反馈也显示,在长流程Agent任务和代码生成方面,K3已经具备了与国际头部模型竞争的实力。

从根本上看,K3依然遵循Scaling Law,但它把刀挥向了粗糙的算法浪费。当硅谷AI企业还在不断囤卡时,Kimi通过重构算法链路、精简计算冗余,走出了一条“每瓦特智能产出比”最大化的路径。

也可以说,K3所采用的KDA混合线性注意力机制,正是AI领域的“韬定律”实践。硅谷主流的Transformer路线是“大力出奇迹”的燃油车,而KDA更像是追求“热效率极致”的混动引擎。

与此同时,企业用户和开发者也开始用脚投票。一部分开发者已经用上了“模型路由”服务,根据不同任务自动选择成本最低、效率最高的AI模型,这其中当然也包括Kimi在内的中国模型。

这个范式让华尔街的观察人士和投资者感到意外。他们像当初惊诧于DeepSeek一样,再度质疑硅谷数千亿美元投资AI是否能得到相应回报,同时也开始怀疑美国AI的领先优势是否被削弱。

2025年1月,DeepSeek的横空出世,冲击了硅谷AI的算力叙事。它表明,中国AI要追上世界领先模型的水平,未必需要投入同等量级的芯片与资金。

随着梁文锋版AGI路线图的明确,以及Kimi K3的落地,中国AI的效率范式轮廓也愈发清晰。

更关键的是,它已经在影响中国AI产业链的上下游。在算力供给侧,它倒逼国产芯片厂商不再盲目对标英伟达的峰值算力,转而优化编译器、互联带宽与系统级能效。在应用落地侧,它让大量原本被高昂推理成本挡在门外的中小企业、垂直行业开发者得以入场,医疗、教育、工业质检等场景的AI渗透率也因此加速提升。

可以说,DeepSeek、Kimi所代表的路线,正在催生一场效率革命,也在重塑整个中国AI产业的成本结构与价值分配方式。它让外界相信:通向AGI的道路,不必都挤在硅谷AI的赛道上。

不过,我们也必须认识到,克制是一种战略,也就意味着它要有边界。比如,基础科学研究、超大规模基础预训练等环节,依旧需要持续重金投入,不能盲目套用取舍逻辑。更不能神化DeepSeek、Kimi的发展路径,将克制教条化。

梁文锋这场长达四小时的交流,除了向投资者宣讲商业蓝图,其实也给AI行业提出了一个重要的问题:奔赴AGI的路上,我们能不能允许自己慢一点,少追逐一些边缘诱惑?

在普遍存在FOMO(错失恐惧症)情绪的当下,Sora火了就做视频,具身智能热了就造机器——聚焦一下,或许才是另外一种“快”。

参考资料:

  • 腾讯科技,《4小时、118个回答,梁文锋内部交流回应一切》
  • 唐辰同学,《Kimi“熔断”,杨植麟“摸高”》
来源:https://www.tmtpost.com/8077148.html
上一篇Agent商业化残酷坦白局:从对话到赚钱 WAIC2026 下一篇极佳视界凭什么冲击世界模型第一股
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
TalkVisions实时视频翻译应用,消除语言障碍
AI教程 · 2026-07-25

TalkVisions实时视频翻译应用,消除语言障碍

TalkVisions是一款实时视频翻译应用,能将视频中的口语实时转录为文本并翻译成用户所选语言,以字幕形式叠加在画面上,支持多语言、低延迟,还可保存录制视频,有效消除跨语言沟通障碍。

AI驱动的日历管理工具Ipso
AI教程 · 2026-07-25

AI驱动的日历管理工具Ipso

IpsoAI是一款专为专业人士及助手打造的AI日历管理工具,能够自动协调多方日程、智能草拟邮件,并通过快速安排会议、提供智能建议及自动化工作流程,显著减少琐碎操作,帮助用户高效管理时间、提升工作效率。

Spectate企业级专业高效监控与事故管理一体化平台
AI教程 · 2026-07-25

Spectate企业级专业高效监控与事故管理一体化平台

Spectate是一款高效监控和事故管理工具,能在30秒内检测故障并推送告警。它支持Slack、PagerDuty等主流集成,提供自定义状态页面和全球性能监控。系统自动更新状态并推送修复建议,帮助团队减少沟通成本,快速解决问题。

阿里云通义千问2.5大模型发布 多项能力赶超GPT-4
AI教程 · 2026-07-25

阿里云通义千问2.5大模型发布 多项能力赶超GPT-4

通义千问2 5大模型发布,多项能力宣称赶超GPT-4,中文语境下文本理解、生成、知识问答等表现优异。相比2 1版本,理解提升9%、逻辑推理提升16%、指令遵循提升19%。开源1100亿参数模型超越Llama-3-70B,获评开源最强。已服务超9万家企业,与小米、微博等达成合作。

万知个人AI工作站:一站式智能阅读创作分享平台
AI教程 · 2026-07-25

万知个人AI工作站:一站式智能阅读创作分享平台

万知是集成多种AI能力的个人工作站,支持自然语言交互、文档快速阅读与摘要生成、PPT自动设计与优化,覆盖学术研究、商务报告、写作辅助及日常问答等场景,全方位提升工作效率。