在过去的一年中,LLM领域经历了前所未有的突破性进展,从推理模型的惊艳登场到Agent应用的规模化落地,整个行业格局正在被重塑。本教程将带你系统回顾2024-2025年间的六大关键模型发布与技术突破,深入分析OpenAI、Google、Anthropic三巨头的角力态势,并展望音频生成、编程Agent等新兴应用场景的爆发式发展。

现在AI圈的迭代速度极快,“人的记忆不超过3个月”的现象在这里体现得淋漓尽致。本文内容较为专业,如果读者在某些地方遇到理解困难,建议借助GPT-5 Thinking进行解读补充以加深理解。
小提示: 阅读本文时,建议重点关注各模型发布的时间节点和技术特点,这将帮助你更好地理解LLM领域的发展脉络。
1、历史回顾
1.1、o1-preview 推理模型
可能很多人已经遗忘了一个重要的时刻:o1-preview 于 2024年9月12日 发布,至今刚好满一年。
与之前发布的 Claude 3.5 Sonnet 类似,公众(包括我在内)对于o1模型的能力认知经历了一个相对迟缓的过程。从最初看起来“效果有些改善,但很贵”的初步印象,直到12月o1正式发布时,我还在专门发文提醒大家:千万不要低估o1模型的能力。
到了 2025年1月20日,DeepSeek R1 完成了推理模型的首次用户普及教育,让大多数人都亲身体验到了推理模型的强大能力。
1.2、OpenAI Deep Research
OpenAI在 2025年2月2日 发布了首个基于 RL post-train 的Agent应用:Deep Research。这一发布标志着 端到端优化的Agentic应用 的正式崛起。
后续的OpenAI产品中,云端 Codex、o3+Search、ChatGPT Agent Mode 等都是这条技术路线的产物。
常见问题:
Q: RL post-train是什么意思?
A: RL post-train指的是在基础模型预训练完成之后,使用强化学习(Reinforcement Learning)对模型进行针对性训练和优化。Deep Research就是通过这种方式,让模型在特定任务(如深度研究)上表现更好,而不是简单地提升通用能力。
1.3、Gemini 2.5 Pro与Gemini Deep Think
2025年是模型公司重新洗牌的一年,一个显著的标志就是Google的 Gemini 2.5 Pro 的发布。Google对这个模型的发布非常谨慎,从 2025年3月25日 发布首个exp版本后,过了3个月才正式GA(一般可用)。
在 2025年8月1日,Gemini上线了 Deep Think 功能。这也是我目前认为 最出色的深度思考模型产品。
1.4、NotebookLM Audio Overview 与 音频应用
NotebookLM 一直以来是个比较低调的产品,但 2024年9月 发布的 Audio Overview 功能却一下震撼了整个AI圈。这一功能的成功导致当时有大量资源投入到以下领域:
- 高质量TTS(文本转语音)
- 双工语音模型
- 高质量语音的播客生成
- 其他音频类应用场景
在2025年涌现的这类应用,很大一部分都是当时入场布局的产物。
除了音频生成外,在过去的一年中,图片和视频的生成也都有着持续的进展,只是产品发布的频率没有LLM这边这么高。
1.5、Claude Code
在应用层中,Claude Code 是一个无法被忽视的典型案例。它在 2025年2月24日 作为预览版发布,在 5月22日 实现GA(正式可用)。
Claude Code同时具备了以下多重标签:
- 编程 — 专注于代码生成
- 真Agent — 具备真正的自主决策能力
- 快速验证了PMF — 产品与市场匹配度得到快速验证
- 无GUI — 纯命令行界面
- 极其昂贵 — 使用成本非常高
- 模型厂通过自身低成本优势与基于API调用的上层应用进行竞争 — 这一点的战略意义尤为重要
Claude Code确实具有很强的战斗力,但到目前为止,在其编程主战场上,已经被 OpenAI生态的Cursor + GPT-5 追上。
小提示: 对于想要尝试Claude Code的开发者,建议先评估预算,因为其使用成本确实较高。同时可以关注Cursor + GPT-5的生态发展,这条技术路线也值得投入学习。
1.6、MCP 与 Manus
MCP(多智能体协作协议)是一股备受关注的技术热潮。它的珍贵之处在于符合一般人的逻辑思维,而生态中大部分没有技术积累的参与者也可以很容易地进行适配。
Manus 作为少有的真Agent产品,在发布之后还能持续创新,这真的非常难得。做过真Agent产品的创业公司很多,但能在发布之后还保持创新的并不多。在我的标准下,只有 Wide Research 算得上是一个产品上的创新。(技术上很多人能看到,但不会真的去尝试做它。)
常见问题:
Q: MCP与普通的API调用有什么不同?
A: MCP的核心在于定义了多个智能体之间的协作标准和通信协议,而不仅仅是单个API的调用。它让不同模型或系统之间能够像人类团队一样分工协作,完成更复杂的任务。它的适配门槛较低,让更多开发者能够参与到Agent生态建设中。
2、评价与展望
2.1、pretrain + RL
推理模型的 RL post-train 范式,从传统强化学习的角度来看,证明了一个重要观点:世界模型(pretrain)对于RL具有重要价值。(对于文本模态来说,LLM就是这里的“世界模型”。)
这种方式不仅限于文本推理,也适用于其他模态。这意味着我们距离在真实世界中做出 能自主行动的实体机器人 又近了一步。
但从文本模态来看,RL post-train的范式的价值尚未被完全挖掘。除了众所周知的RL post-train基础设施问题外,还存在两个主要瓶颈:
(1)对目标业务场景的足够重视
毕竟,如果不想提升编程能力,那就不可能做出一个编程能力强的模型。目标导向的训练投入是决定性因素。
(2)对于Reward和仿真环境构建的足够重视
由于pretrain的世界模型,RL的成本已经大幅降低。虽然相对于过去的传统RL时代,对Reward和仿真环境的要求已经降低了很多,但仍然需要持续的投入和关注。
2.2、Agent的记忆能力
目前来看,记忆能力的发展呈现出以下特点:
- (1) 记忆能力的价值已经成为海内外AI领域的 共识之一。
- (2) 目前我的判断是:通用的记忆能力大概率是由模型厂在模型层面实现的,类似于目前LLM对于tool的使用能力。
海外3家头部厂商(OpenAI、Google、Anthropic)可能会在 2-3个季度之后 在这方面达到60分的及格水平。在此之前,可能最快有厂商会在未来一个季度就宣称实现了该功能,但实际效果预计不足60分。
2.3、LLM还没有被充分的训练如何泛化
LLM确实具有一定的泛化能力,但大多数情况下仍然局限在 同一个问题域之内。目前来看,不同问题域之间的能力基本上是相互独立的。一个模型在某个领域效果好不好,完全取决于其训练过程和数据是否在该方面投入了足够的工作。
究其原因,是因为LLM在训练过程中 并没有被要求跨问题域泛化。我们构建了一个领域的Reward/环境,然后让模型在其中不断学习,直到边际收益降低。实际上,模型被训练为在特定领域中达到最优,而不是在一个环境中学习如何适应新环境。
这其实并不是一个纯粹的技术问题,而是考验模型厂在不同领域的Reward/环境构建中到底投入了多少工作。毕竟你不能指望模型仅仅适应过1个领域就能触类旁通。领域之间共性的学习需要足够多的领域的探索经验,而为了不在训练集上评测,评测本身就需要更多领域的Reward/环境。
当模型学会记忆以及如何泛化之后,我估计这个Agent就已经自然地有了所谓的“好奇心”,而不需要人工植入什么好奇心算法或目标。我谨慎估计,这一目标可能最快会在未来 2-3年左右 实现。
2.4、想法上没有独创性的时代
很多追逐前沿AI进展的人可能会觉得自己的许多想法很独创,“我有了一个深刻的认知”。
由于我已经能够触达不少人的反馈,从网络上的反馈让我意识到:我的大部分想法其实并不原创,我也并不认为别人的认知就完全是独创的。实际上,我已经很少看到能让我觉得 真正独创的想法 了,或多或少都能找到一些前置想法作为基础。
实际上,现在大家都在使用着相同的产品和API、获取着相同的信息,受到内部认知共识度更高的资本圈和大众圈的影响。大部分人得出的判断和结论其实也大同小异。差别主要在于:
- 每个人历史经历带来的“偏见”
- 每个人能够拿到的资源
虽然找到一个类似的“想法”很容易,但最后能把想法做出来、甚至还能广为人知的产品,就真正称得上是凤毛麟角(具有独创性)了。
2.5、AI发展比较快,但还不够快
AI圈每个季度都有明显的进展,而且 2025年的进展实际上比过去都要快。每个细分领域,几乎每2个月就有新的进展出现。
但是,新消息的来源仍然超出了大部分人的耐心范围。再加上目前人类的媒体和传播方式仍旧很原始,导致充斥着各种“狼来了”式的消息,以及对效果的各种夸大。这些现象能够在半年之内,把刚进入这个圈子的人的耐心消磨殆尽。
保持对新产品的关注和体验是一件非常困难的事情,尤其当产品变得越来越贵的时候更是如此。
前沿AI产品已经从过去每月20美元的“穷人的游戏”,变成了每月200美元的“中产的游戏”。 这一变化意味着进入门槛正在提高,对于AI技术的学习和研究也需要更加系统的规划和投入。
展望未来,随着技术成本的降低和生态的完善,我们有理由相信AI应用会逐渐走向更广泛的人群。但在那之前,保持持续的学习和关注仍然是每一位AI爱好者和从业者需要坚持的事情。
