小鹏汽车的车主应该都了解了,第二代VLA会迎来重大升级,全新6.3.0版本会在小鹏G9L上全球首发,而且蒸馏模型VLA 2.0 Lite也会即将9月推送上车。
随着新版本的推送,车会变得更智能,这固然很让人期待。除此之外,我觉得小鹏集团通用智能中心负责人的刘先明的发言才是干货,因为他花大量篇幅解释“他们如何让第二代VLA全新模型变强”,而且这关系到小鹏公司未来的发展。
1、先说说新版本能实现什么
第二代VLA 6.3.0版本的核心突破,是让AI理解时间。因为现在的AI通过图像信息只知道现在发生什么,过去和未来它都难以触及。然而,他们的系统能够做到了解过去、现在做什么以及未来应该怎么做。
正如一个场景,一辆车正在掉头,系统能记住前车正在做三点掉头,等待过程中不冒进,前车驶离后迅速起步。它不会因为掉头车没掉完头有空隙就直行,而是等待前车掉完头,马上就直行。车子就变得更像人类在思考。
不仅如此,新系统还能够实现“语音靠边停车”、“语音控制就近泊入”功能。怎么说,它就像出租车司机,用户跟它说靠边停车,车辆就可以自主寻找合适位置并完成靠边停车。例如上图一样,它会找个公交车站靠前的位置停,而不是在主干道上随便停。
2、他们在技术上如何实现
在技术上,他们通过Infini-VLA长时序架构让模型可留存前30秒的道路场景信息,Streaming Inference流式自回归推理将端到端响应速度提升300%,X-Foresight预测世界模型首次上车,可预判未来6秒内周边交通参与者的行为。
重点是运行模式的改变,从以往“看-算-输出-再看”的串行模式,进化为“边看、边想、边行动”的并行处理。
正因有了更强的能力去实现这些功能,新版本端侧模型参数量扩大3.5倍,达到主流VLA模型的15倍以上。当然,车上的多颗图灵芯片也是有足够的算力、内存带宽以及内存总量去处理这些数据。至于开篇说到的蒸馏模型VLA 2.0 Lite,则对应的是一颗图灵芯片的车型。
刚刚聊到第二代VLA的6.3.0版本具备语音靠边停车等功能。用户可以通过语音下达指令到车辆执行,展现了新系统VLA+VLM的融合特性,VLM理解后,VLA便会自动规划并执行靠边停车。为了实现一整套流程,他们引入Master Agent这样的“大脑”去统一处理输入与输出。
