最近,小鹏集团今日举办以“TIME 时间”为主题的物理AI分享活动,正式宣布第二代VLA大模型迎来首次重大升级。全新XOS 6.3.0版本将在小鹏G9L上全球首发标配。这次升级最核心的变化,是让AI第一次真正拥有了“时间感”——从过去只理解静态的3D空间,升级为能感知动态变化的4D时空。

真实世界从来不是一张张定格的图片,而是连续流动的过程。以往模型能识别车辆、行人、路标,但要做出靠谱的驾驶决策,光“看见”远远不够,还得知道之前发生了什么、现在正在发生什么、接下来可能发生什么。为此,小鹏引入全新的Infini-VLA长时序架构,让模型能记住前30秒的世界——连续发生的道路事件不再被割裂成独立画面,而是串联成完整的上下文,判断因此更有依据。
光有记忆还不够,现实变化太快,决策必须跟得上。第二代VLA同步升级了推理效率,采用流式自回归推理,从过去的“看→算→输出→再看”的离散模式,变成“边看、边想、边行动”的并行处理。端到端响应速度提升300%,遇到前车急刹、行人折返、旁车强行加塞,车辆反应像老练司机一样敏捷。
更关键的是,模型还要能提前“预判”。小鹏首次在量产车上搭载X-Foresight预测世界模型,可推演周边交通参与者未来6秒内的可能行为,提前规划最优路径。记住过去、理解现在、预判未来——这套组合拳让物理世界基座模型真正理解了时间。


为了支撑这种能力,新版本端侧模型参数量扩大了3.5倍,是主流VLA模型的15倍以上。结合超长时序记忆和更快响应,多维综合安全能力提升了20倍。更大的模型带来更强的泛化能力,也为全球化部署打下基础——近期小鹏在德国完成本地化验收测试,基于中国数据训练的模型,在几乎不增加本地训练数据的情况下,实际体验与国内高度接近,计划明年上半年率先在欧洲获得监管许可。

这次升级不只是智能驾驶层面的进化。小鹏首次推出整车大脑Master Agent,基于自研Omni全模态模型,实现VLA与VLM的驾舱融合。它不仅能听懂自然语言,还能自动拆解用户意图,调度智驾、底盘、座舱等垂直Agent协同执行。比如新增的“语音靠边停车”和“语音控制就近泊入”,用户只要说一句话,车辆就能在智驾状态下自主找到合适位置完成停车——从“听懂指令”到“自主执行”,闭环已经跑通。这也意味着部分Robotaxi的L4级体验正在下放到量产车上。

同一套AI底座,同时驱动汽车和机器人。小鹏明确将自己定位为“物理AI世界的出行探索者”,第二代VLA已实现L2至L4能力贯通,近日其Robotaxi在广州获得远程测试资质,进入主驾无人的关键道路验证阶段。而通用人形机器人IRON搭载3颗图灵AI芯片,有效算力2250 TOPS,基座模型已实现端侧部署,无需远程遥操作即可自主完成任务。8月24日,小鹏机器人业务完成首轮超9亿美元融资,投后估值超63亿美元,刷新国内具身智能行业单轮私募纪录,IDG资本领投、高榕创投参投,并获得腾讯、阿里巴巴两家战略投资者支持,充分体现资本市场对技术路线和量产能力投下信任票。


值得老车主关注的是,小鹏通过Token压缩与蒸馏训练,将基座模型能力部署到算力更低的平台,蒸馏版本图灵VLA 2.0 Lite同样获得显著提升,预计9月开启首批推送,G9L Max版本首发搭载,让更多用户享受到更安全、更可靠的城区辅助驾驶。

小鹏强调,物理AI是长期工程,真正的护城河在于AI Infra的持续沉淀。依托百万车队和十亿级数据资产,数据飞轮正加速转动——单次训练数据吞吐量已达1亿clips,半年增长10倍。从数据采集、模型训练到用户反馈的闭环越来越高效,规模效应开始显现复利。模型会迭代,但真正形成壁垒的是持续迭代的能力;产品会变化,但真正产生长期价值的是支撑产品进化的基础设施。


从AI汽车到人形机器人,再到更广阔的智能本体,小鹏正在让物理AI的边界不断拓展。这次关于“时间”的升级,只是一个新的起点。

