小鹏第二代VLA大模型,最近迎来了一次真正意义上的重大升级。8月27日,小鹏在广州办了一场以“TIME 时间”为主题的体验日活动,正式发布了全新XOS 6.3.0版本,这款系统将率先搭载在小鹏G9L上,而且是全系标配。这次升级最核心的变化,用一句话说就是:AI开始理解时间了。
以前,智能驾驶的AI模型更多是理解三维空间——它能识别出哪里是车、哪里是人、哪里是路、哪里是红绿灯。但真实世界不是一张张静止的图片,而是一个不断变化、连续演进的动态过程。所以这次,小鹏把“时间”这个维度正式纳入了模型,让AI从3D空间理解跃迁到了4D时空理解。听起来有点抽象,但落到实际驾驶场景里,差别非常大。
比如,第二代VLA引入了全新的Infini-VLA长时序架构,车辆能记住前30秒世界里发生了什么。这意味着,路上的连续事件不再被割裂成一帧一帧的独立画面,而是有了上下文。前车之前有过异常变道?行人刚从路边走出来又停了一下?这些信息都能串联起来,帮助模型做出更合理的判断。同时,模型推理效率也大幅提升,采用流式自回归推理,端到端响应速度提升了300%。遇到前车突然刹停、行人折返、旁车强行加塞这些突发状况,车辆的反应更像一个老司机,而不是卡顿的机器。
更厉害的是,小鹏还首次上车了X-Foresight预测世界模型,能预判未来6秒内可能发生什么,提前推演周围车辆和行人的行为轨迹。记住过去、理解现在、预判未来,这套组合下来,AI终于有了“时间感”。
除了智驾层面的升级,这次全新版本还推出了Master Agent,相当于给整车装了一个统一大脑。它把VLA和VLM融合在一起,让车不仅能听懂你说了什么,还能理解你真正想干什么。比如你随口说一句“找个地方停车”,它就能自己拆解任务,调度智驾、底盘、座舱等不同模块协同执行,真正实现从“理解”到“行动”的闭环。这次还带来了“语音靠边停车”“语音控制就近泊入”这类实用功能,L4级的一些体验正在从Robotaxi下放到量产车上。
更值得关注的是,小鹏这套物理AI基座模型,并不只是服务于汽车。它基于统一技术底座,已经实现了L2到L4的能力贯通,并且正在向人形机器人等更多本体延伸。8月24日,小鹏机器人业务完成了首轮股权融资,融资金额超过9亿美元,投后估值超63亿美元,刷新了国内具身智能行业的单轮融资纪录,IDG资本领投,腾讯、阿里巴巴也都跟进了。资本市场对这条从汽车延伸到机器人的技术路线,显然是认可的。
与此同时,小鹏也没有忘记让先进能力惠及更多用户。通过学习式Token压缩和蒸馏训练,他们把第二代VLA的能力部署到了算力更低的平台上,蒸馏版本图灵VLA 2.0 Lite预计9月开启首批推送,让更多车主能体验到更安全、更可靠的城区辅助驾驶。
海外布局也在提速。最近小鹏在德国完成了第二代VLA的本地化验收测试,这套基于中国数据训练的模型,在几乎没增加本地训练数据的情况下,德国城市道路的实际体验和国内非常接近。小鹏目标是在明年上半年率先拿到欧洲监管许可,把高阶智驾带到更多海外用户手中。
物理AI是长期工程,真正的护城河不在于某一项单点突破,而在于背后那套持续进化的AI基础设施。小鹏这些年一直在建设覆盖数据、训练、仿真、评估、部署和算力的完整体系,目前单次训练数据吞吐量已经达到1亿clips,比半年前增长了10倍。数据规模在扩大,模型在进化,算力和工具链在完善,这些能力正在形成复利效应。模型会迭代,产品会变化,但真正能产生长期价值的,是支撑这一切持续运转的基础设施。从汽车到机器人,再到更多智能本体,小鹏正在把物理AI的边界一步步推开。
