8月27日,广州。灯光还没全暗,台上就先蹦出一个词——时间。场馆里满屏的全域全场景,一开始显得太安静、也有点抽象。谁也没想到,这场发布会的核心,是用时间来讲故事。等第二代VLA的升级讲完,我反而觉得,这两个字最贴切。
这次升级的核心很简单:让AI司机真正有时间感。它首发的车型是G9L,一台将上市的SUV,全系砍掉激光雷达,只靠纯视觉。预售价25.98万起,纯电、增程版本都有。
具体到技术,Infini-VLA长时序架构把前30秒的画面连成一条时间线。前车怎么动、那辆电动车从哪条道变过来,这些信息都被保留,后面的判断就有底。
再来,X-Foresight预测世界模型可以推演未来6秒的场景:前车会不会加塞、行人会不会折返。就像老司机心里留着一个预案。说实话,这个功能确实挺吓人的(其实有点让人兴奋)。
反应也快了,端到端的速度提升了三倍左右。以往的流程是看-算-输出再看,这次改成边看边想边动。突发状况下,慢半拍和快一拍的差别,直接关系到安全。
还有个MoT混合架构,把城区、园区、泊车等不同任务分给专门的“专家”,避免互相干扰。这几个改动叠加起来,端侧参数扩到了原来的3.5倍,超过主流VLA的15倍,综合安全能力提升大约20倍。
G9L敢把激光雷达砍掉,最重要的地方在这里。它不是因为便宜,而是因为算法和算力已经足够强,敢把拐杖扔掉。这台25万级的家用SUV,用纯视觉就能跑出高阶城区智驾,这对纯视觉路线意义重大,仿佛给整条路径站台。软件和算力,未来可能替代堆料的硬件。
这不是一次普通的OTA更新。小鹏真正值钱的,是背后的AI Infra:百万车队、十亿级数据,单次训练能吞下1亿clips,半年涨了十倍。数据越多,模型越聪明;模型越聪明,用户越多,数据也越多。这个循环一旦起来,追赶就像追不上。
还有一个叫Master Agent的设计,把智驾和座舱打通。你说靠边停,车就能在智驾状态里自己找个地方停好。L4 Robotaxi的技术在下放。广州也拿到了无安全员的远程测试资质,小鹏正把能开的车和能自己开的车之间的墙慢慢拆掉。
从更宏观看,同一套VLA底座,装进车里是智驾,装进机器人IRON里就是具身智能。不久前,小鹏机器人业务完成超9亿美元融资,投后估值63亿美元,刷新了中国具身智能单轮融资纪录。
这对行业到底意味着什么?智能驾驶的比赛,正在从能看到谁在场,转向谁真正懂得路在何处。看得到的是传感器、硬件,花钱就能买到;看懂的,是对世界的理解,需要时间和数据慢慢积累。纯视觉到底靠不靠谱?G9L给了答案——当模型把时间和空间吃透,纯视觉也能用,还能把成本降下来。
Scaling Law在路上不断被验证:第二代VLA的参数量是主流的15倍,安全提升了约20倍。真正的差距,往往不是某一代模型的参数,而是有没有一套能持续迭代的底层设施。
也许,下一个路口,答案就藏在你自己的时间感里。