从记住前 30 秒、预判未来 6 秒,到统一整车大脑和跨本体 AI 底座,这次升级真正值得关注的,是小鹏正在把“自动驾驶模型”推向能够持续理解、预测并行动的物理世界模型。
小鹏将模型对现实世界的理解,从“3D 空间”推进到“4D 时空”。
过去几年,智能驾驶最直观的进步,往往被概括为“看得更清楚”“识别得更准”“能走更多路”。但真实驾驶从来不是一张静态图片:前车的刹车是一个过程,行人的犹豫和折返有前因后果,一次加塞也需要结合速度、轨迹和周边关系去判断。真正困难的地方,不只是识别某个物体是什么,而是理解它刚刚做了什么、正在做什么,以及下一秒最可能做什么。
这也是小鹏第二代 VLA 这次首次重大升级最重要的变化。8 月 27 日发布的全新 XOS 6.3.0,将“时间”正式纳入物理世界基座模型:模型开始保存更长的历史上下文,连续推理,并对未来状态进行预测。表面上看,这是几组参数的变化;往深处看,它实际上是在改变智能驾驶做决策的时间尺度。
这次升级,关键数字指向同一件事:让模型拥有“时间感”
一、从“一帧”到“一段历史”,这是理解复杂道路的前提
传统视觉模型很容易把道路切成一帧一帧:这一刻看见行人,下一刻看见车辆,再下一刻输出动作。问题在于,很多危险并不写在“当前这一帧”里,而藏在连续变化中。一个行人站在路边和一个已经连续两次回头、身体前倾的行人,在决策上显然不应该被等价对待。
第二代 VLA 引入长时序架构后,模型可以把过去几十秒里发生过的动作、位置和场景串联起来。它面对的就不再是孤立的视觉输入,而是一段“发生过的故事”。这会直接影响模型对意图的理解:很多原本只能依赖规则兜底的模糊场景,理论上可以在更完整的上下文中获得更稳定的判断。
“History—Present—Future”被放到同一条时间轴上:记住过去、理解现在、预判未来。
更关键的是,时间不只是“记忆”。小鹏把 Streaming Inference 引入端侧推理,让模型从“看—算—输出—再看”的离散循环,变成边观察、边思考、边行动的连续过程;同时,X-Foresight 将预测进一步向未来延伸 6 秒。一个负责把历史接进来,一个负责让当下决策不断档,一个负责把未来推演出去,三者组合后,“时间感”才真正完整。
二、更大的模型不是目的,能否换来泛化、安全和反应速度才是
这次升级还有一个很醒目的数字:端侧模型参数量提升 3.5 倍。单独看参数,很容易落入“大模型军备竞赛”的叙事,但在物理世界里,模型大并不天然等于体验好。车端 AI 受到算力、功耗、时延和实时性的共同约束,参数增长如果只带来更慢的响应,反而会成为负担。
因此,比“更大”更值得看的是它与另外几项能力一起出现:长时序、连续推理、超前轨迹预判,以及 MoT 混合架构对不同任务能力的动态分配。新闻稿给出的结果是,多维综合安全能力提升 20 倍。这里真正体现的是一套工程取舍——把规模增长转化为更强的泛化能力,同时通过架构和推理效率把“模型变大”的成本压回去。
小鹏把此次 VLA 升级概括为“更大、更久、更快、想得更远,也更安全”。
这也解释了为什么小鹏反复强调全球化。道路标线、交通参与者习惯、路口组织方式会变化,但“理解连续行为、预测运动趋势、根据目标做决策”这些能力具有更强的通用性。新闻稿披露,第二代 VLA 已在德国完成本地化验收测试,并计划推动欧洲监管许可。若这种以基座模型泛化为核心的路线成立,那么智驾出海真正需要复制的,就不只是功能列表,而是模型适应新环境的效率。
三、Master Agent:汽车正在从“功能集合”变成一个协同智能体
如果说前面的升级主要解决“车怎么开”,Master Agent 则试图回答另一个问题:一辆智能汽车能不能理解用户真正想完成什么,并自动调动不同系统去做。
过去的智能座舱更像一个不断扩展的功能菜单:语音控制空调、座椅、导航,智驾负责驾驶,底盘负责执行,各模块之间边界清晰。Master Agent 建立在小鹏自研 Omni 全模态模型之上,把用户意图拆成任务,再调度智驾、底盘、座舱、车身控制等垂直 Agent 协同执行。新闻稿中“语音靠边停车”“语音控制就近泊入”就是很典型的例子:用户说的是目标,系统自己决定如何完成。
Master Agent 的意义,不是多一个语音功能,而是让整车拥有统一的任务理解与调度入口。
这背后的变化很重要:汽车交互正在从“指令式”转向“目标式”。过去用户要告诉车每一步怎么做,未来更可能只告诉它“我想干什么”。当智驾、座舱、底盘和车身控制被接入同一个大脑,智能汽车的竞争也会逐渐从单项功能数量,转向跨域协同的完成质量。至少从这次发布释放的信息看,小鹏希望把 VLA 的价值从辅助驾驶扩展到整车智能。
四、一套 AI 底座打通汽车和机器人,才是“物理 AI”叙事的核心
小鹏这次没有把第二代 VLA 只放在汽车里讲。新闻稿同时强调,统一技术底座已经贯通 L2 到 L4,Robotaxi 进入主驾无安全员道路测试阶段;通用人形机器人 IRON 则通过 3 颗图灵 AI 芯片,在端侧部署物理世界基座模型。
“One Infra, Two Products”:同一套 AI 底座,同时服务汽车与机器人。
汽车与人形机器人看起来是两种产品,但对物理 AI 来说,它们面对的底层问题高度相似:都需要感知真实世界、理解连续变化、预测下一步状态,并在有限时间内做出动作。汽车提供的是规模更大的真实道路数据和量产验证环境,机器人则把模型推向更开放、更通用的任务空间。
因此,“一套底座、多种本体”如果能真正跑通,最大的价值不是研发资源复用这么简单,而是让不同产品反过来共同训练一套更强的物理世界能力。汽车积累的时空理解与安全决策经验可以成为机器人能力的基础,机器人在复杂操作中的学习也有机会反哺通用模型。新闻稿中把汽车、Robotaxi、人形机器人放在同一条技术线上,本质上是在强调这种规模化复用。
五、真正难复制的,可能不是某个 VLA 版本,而是让它持续进化的 AI Infra
模型会更新,参数会被追平,单次发布会上展示的能力也会迅速成为行业基准。小鹏在新闻稿后半段把大量篇幅给到 AI Infra,反而更能说明它对长期竞争的判断:物理 AI 的壁垒,不只在某一代模型本身,而在于是否拥有持续把真实世界数据转化为模型进步的能力。
小鹏把模型、数据、训练、仿真、评估、部署与优化视为一整套长期建设的 AI Infra。
与互联网大模型不同,物理 AI 的数据来自真实道路和真实动作,错误成本也更高。它需要的不只是“训练更多”,还包括发现极端场景、复现问题、仿真验证、评估安全边界,再把新模型部署回真实车辆。新闻稿披露,小鹏依托百万车队和十亿级数据资产构建数据飞轮,当前单次训练数据吞吐量达到 1 亿 clips,较半年前提升 10 倍。
数据引擎平台强调统一化存储、多模态检索和规模化挖掘,把真实世界数据变成可持续训练资产。
这套逻辑可以概括为一个循环:车队越大,真实世界数据越多;数据处理和检索能力越强,越容易发现长尾问题;问题进入训练和评估后,模型进化更快;模型能力提升,又能覆盖更多车型和更多本体,产生新的数据。真正产生“复利”的,是这个循环转得越来越快,而不是某一个版本领先多少。
小鹏将物理 AI 能力拆成模型、算力、数据和本体的协同增长,并以 Scaling Law 描述其飞轮。
结语:智能驾驶的下一阶段,竞争的是谁能把“现在”拉成一条时间轴
第二代 VLA 的这次升级,最容易被记住的可能是 3.5 倍参数、300% 响应速度或者 20 倍综合安全能力。但这些数字背后其实都指向同一个方向:AI 不再只回答“眼前有什么”,而是尝试回答“刚才发生了什么、现在意味着什么、接下来可能发生什么,我应该如何行动”。
从这个角度看,“理解时间”并不是一个包装概念,而是物理 AI 从感知走向决策必须补上的维度。它决定了模型能否理解因果、捕捉意图、应对突发,也决定了汽车能不能从被动响应指令,走向主动完成任务。
更值得继续观察的是,小鹏能否把这套能力稳定地落到量产车上,并通过 G9L、VLA 2.0 Lite、Robotaxi 和机器人形成同一套底座的规模验证。因为物理 AI 最终比拼的,不是一次演示能走多远,而是谁能在真实世界里持续收集问题、解决问题,再把解决问题的能力快速复制到更多产品上。
