日前,特斯拉CEO马斯克在其个人账号上直播测试了最新版本的FSD自动驾驶系统。这场直播未经任何剪辑处理,马斯克在驾驶过程中还给出了相当详细的讲解。
新版本FSD最大的变化在于:不再依赖传统的高精地图和导航数据,而是完全依靠车载摄像头和神经网络来识别道路和交通情况,并自主做出决策。马斯克在驾驶中提到,特斯拉的工程师并没有为减速带、停车标志或环形交叉路口编写特定的程序代码,但车辆依然能够很好地处理这些场景——核心思路就是用大量视频数据对系统进行训练,让车辆自主学习。
从直播表现来看,整体驾驶体验算得上相当不错。不过在一个红绿灯路口,车辆在绿灯时没有按照规划路线左转,导致马斯克不得不接管。当时,直行车道上的车辆已经等了较长时间的红灯,而对向信号灯切换成左转状态时,Model S竟突然跟着前车启动。好在马斯克和一旁的工程师反应够快,及时介入制止。
有意思的是,这次测试的地点恰好是扎克伯格在帕洛阿尔托的豪宅附近。直播过程中,马斯克还调侃了一句:“如果遇到扎克伯格,我们可以挑战一下,打一架,让气氛变得更有趣。”
说实话,目前外界对这轮demo的评价总体偏负面。从消费者角度看,这完全可以理解——毕竟19分钟就出现一次接管,而且是在红灯这种最常见的驾驶场景里犯了致命错误。不过需要指出的是,这并非面向用户发布的正式版本,而是研发内部测试的Alpha版本。对一个研发中的版本要求它足够完善稳定,多少有些吹毛求疵。作为技术从业者,更合适的做法是从技术角度去看待FSD V12的这次亮相。平心而论,它带来的冲击和引发思考的深度,丝毫不亚于此前的几次AI Day和Autonomous Day。
为什么V12如此引人关注
要理解大家为什么对V12这么兴奋,得追溯到今年5月马斯克放出的一则猛料:FSD V12将彻底转向端到端的自动驾驶技术方案,并且他还表示,V12会让FSD走出Beta阶段,成为正式版产品。这个消息的噱头有多大?可以说一点也不输给2020年宣布FSD Beta将于当年10月发布。毕竟,端到端自动驾驶长期以来只停留在学术研究中。特斯拉之前,仅有的两位先行者——Comma只能在高速进行简单的驾驶操作,Wayve则被局限在英国少数地区的内部测试。而FSD是在广阔的北美大陆上可以任意开启的,这意味着对端到端系统泛化性的要求,比前两者高出了整整一个层级。

业内普遍共识是,端到端的自动驾驶系统理论上比现阶段的模块化方案拥有更高的能力上限。那为什么它一直没成为主流?原因在于,端到端系统在提升模型上限的同时,也无限放大了神经网络黑盒带来的不可解释性问题。而不可解释性会给研发迭代和问题排查带来巨大的负面影响。再加上行业内此前并没有成功的端到端系统先例,对于这种处于前沿科技无人区的技术方案,绝大多数公司既没有勇气也没有实力敢为天下先。
V12首秀的三个关键意义
站在端到端技术路线的角度,这次V12的公开亮相无疑是成功的,甚至可以称得上惊艳。理由主要有三点。
1. 展现了端到端系统的成熟度
不少国内外网友质疑这次Demo的测试场景过于简单——帕洛阿尔托的交通即便在晚高峰,也远比不上国内大城市的拥堵和复杂。在这样的场景下还会出现一次严重问题需要接管,实在算不上优秀。这个观点从消费者角度来看完全没错。

但作为自动驾驶算法从业者,关注点不应该在场景的难易程度上。端到端系统理论上限当然高于基于规则和搜索的主流方案,它的核心问题在于——下限可能极低。今年CVPR上,小鹏的Patrick展示了一张图,很好地说明了端到端系统的特性:模型能力起步慢,再加上黑盒不可解释、不可控的特性,导致系统虽然能处理复杂场景,但简单场景很可能相比现有系统出现退步,甚至犯下一些“弱智”的错误。更糟糕的是,由于行业缺乏端到端系统的工程实践经验,一些看似简单的修复无法通过增加规则代码快速解决。因此,尝试端到端方案的公司,大多数时候可能死在起跑线上。
实际上,如果哪家公司能利用端到端技术架构获得一个功能稳定性匹敌现有系统的自动驾驶系统,那基本就证明了端到端是未来的方向。因为理论上,端到端系统在达到现有技术水平的那一刻之后,会迅速向上突破,把传统技术栈远远甩在身后。这张图中红蓝线交叉的点,可以称为端到端系统正收益的爆发点——一旦达到这个点,主流技术范式就会被碘伏。
考虑到V12的研发时间并不长,能在随机选取的路线上,针对转弯、变道、环岛、与行人交互等基础场景表现出稳定且平顺的驾驶行为,已经让人非常惊讶。这次首秀说明,特斯拉可能已经相当接近这个爆发点了——这是本次Demo传递出的一个极其重要的信号。
2. 透露了端到端自动驾驶的重要思路与实操经验
这次Demo的另一关键意义在于,通过直播中的一些细节以及马斯克和工程师Ashok的对话,透露了特斯拉在端到端系统上的实操经验和理解。在端到端领域严重缺乏行业最佳实践的当下,这些信息对技术从业者具有极高的启发价值。

很多人以为端到端是一个完全不透明的黑盒,但实际上,目前大多数深入的端到端实践都表明,保持系统中间结果的可解释性相当重要。今年CVPR Best Paper UniAD就设计了一个端到端可导、但保留了中间子网络输出的系统。从直播中可以发现,V12几乎完整保留了当前FSD的感知结果输出。很明显,至少在现阶段,特斯拉的端到端方案也是走保留中间功能子网络的路径。
那这个方案和普通的模块化方案有什么区别?核心区别在于,各个模块都去除了基于规则的代码,使得整个系统端到端可导。这样一来,整个系统可以作为一个整体直接对驾驶动作进行训练优化。而传统架构因为模块化和不可端到端可导,各功能模块只能各自为政地训练优化自己的任务,最终结果是多个局部最优无法实现系统全局最优。
V12几乎保留了全部FSD的感知结果可视化效果,但似乎没有红绿灯的可视化。这套方案比较好理解:保留中间结果,相当于用人类先验知识把有用的驾驶概念提取出来给到下游网络;同时,更加前端的原始输入也一并交给下游的决策规划网络,由网络自由选择使用哪些信息进行判断。这种方式通过人类先验加快了端到端系统训练的起步速度,同时保留了原始信息的输入通道,减少了传统模块化系统因中间输出造成的信息损失。此外,对中间结果进行分析,也有助于定位系统犯错时的问题根源,提高解决问题的效率。
另一方面,马斯克和Ashok在聊天中反复强调,V12没有显式地将车道线、环岛、减速带等概念的处理方法灌输给系统。这里的理解应该是:V12并非不检测这些目标,而是在规控模块中没有显式添加应对这些概念的规则。如何行动,完全由网络通过驾驶员视频自主学习获得——比如系统没有要求车辆在车道中间行驶,模型自己从人类驾驶视频中学习何时应该居中,何时可以适当偏离,从而达到更拟人的效果。
3. 展现了端到端系统相比传统架构的优势闪光点
上文提到,我更关注V12在基础功能上是否存在性能回退,但这次Demo也确实展现出了不少闪光点。大家容易忽略的一个亮点,恰恰就发生在第19分钟那次接管之前。场景是这样的:直行绿灯亮起,但前方路口拥堵。合理的驾驶决策是不要进入路口,等待前方空间出现后再通过。FSD V12正是这样做的(虽然按照中国的交规也是这样建议的,但现实执行率并不高)。也正因为这个保守决策,V12这次绿灯没能通过,一直等到红灯亮起。下一次左转绿灯亮起时,V12出现了误判——原因很可能在于,V12目前似乎不再直接检测红绿灯状态(可视化界面中红绿灯检测结果消失了),而是综合参考信号灯情况和周围车辆行为来判断是否通行。当红灯变绿,周围左转车辆开始移动时,它错误地认为直行也可以通行,最终导致了接管。
第二个亮点出现在一次途径点到达过程中:V12可以进行靠边停车的操作,这是当前FSD不具备的功能。Ashok还在直播中透露,未来FSD甚至可以响应用户的语音指令——比如用户可以说“向左换道”或者“带我去前面的沃尔玛”,FSD就会分析语音指令中的语义并执行相应动作。这里推测,V12的模型中可能已经加入了文字模态。在自动驾驶系统中应用语言模型,这是一个目前很少见到的新方向。随着大语言模型的爆发式发展,将语言模型融入自动驾驶决策,确实给人留下了巨大的想象空间。
总结
整体来看,这次FSD V12的Demo是自动驾驶行业中一次具有碘伏性意义的事件。尽管Demo中仍然存在问题,也无法彻底证明端到端系统就是自动驾驶的最终方向,但经过这次展示,端到端自动驾驶很可能将从空中楼阁的尴尬状态走出来,有潜力成为未来几年内行业争相投入的重点方向。作为行业领军的特斯拉,再次扮演了敢为天下先的角色。后续自动驾驶技术范式如何迭代,这次Demo的意义,可能比很多人想象的更加深远。
