“我们的看法,纯视觉是模拟人眼,目标是达到开车时‘接近人’;多传感器的融合方案,目标是要‘超越人’。”在一次媒体采访中,华为公司高级副总裁、引望公司CEO靳玉志用这样一句话,划开了智能驾驶领域最核心的技术分歧。
这句话的背景,是特斯拉FSD即将全面入华,而小鹏等中国车企也在加速推进纯视觉方案的落地。一边是“硬件堆料”的多传感器融合派,一边是“算法至上”的纯视觉派,这场关于自动驾驶路线终局的争论,已经从技术圈扩散到了每一位消费者的购车决策中。两种路线背后,究竟藏着怎样的安全哲学?谁才是更接近未来自动驾驶的答案?
[两种安全哲学,两种底层逻辑]
纯视觉路线的出发点,是“模拟人眼”。特斯拉FSD依靠8颗摄像头和端到端神经网络,试图让机器学会像人类一样看路、判断、决策。这种方案的逻辑很清晰:人眼能开车,摄像头理论上也能。而且摄像头成本低、数据丰富、迭代速度快,通过海量真实路采数据训练,系统可以不断逼近甚至超越人类驾驶员的反应能力。
但问题在于,人眼本身就有生理极限。靳玉志在采访中列举了三个典型场景:逆向强光导致的光盲、夜晚全黑暗环境下的夜盲、以及下大雨导致的雾盲和雨盲。在这些场景中,人眼本来就看不清,纯视觉方案自然也无法突破这一物理边界。
华为多传感器融合的逻辑恰恰相反——不是“接近人”,而是“超越人”。这套方案在摄像头之外,增加了激光雷达和毫米波雷达。激光雷达不依赖光线,通过对目标发射激光束来获取三维空间信息,不需要“认识”障碍物,只要检测到有物体存在,就能做出避让或刹停决策。毫米波雷达则擅长测速和穿透雨雾,在恶劣天气下依然能保持稳定的感知能力。
这是一种“安全冗余优先”的工程哲学。每一路传感器都有它独特的优势,也都有各自的短板。摄像头擅长识别色彩和纹理,但在暗光、逆光下容易失效;激光雷达空间精度高,但雨雾天气衰减明显;毫米波雷达穿透力强,但分辨率有限。华为的思路是让三者互补——任何一种传感器失效时,其他传感器仍能兜底。
而小鹏的情况则有些特殊。虽然何小鹏多次强调“纯视觉路线的正确性”,但小鹏实际量产方案采用的是“摄像头+激光雷达+毫米波雷达”的多传感器融合架构,并非特斯拉那种完全去掉激光雷达的纯视觉方案。这种“算法上拥抱视觉、硬件上保留冗余”的折中路线,某种程度上也反映了纯视觉方案在现阶段仍难以完全脱离物理传感器的现实。
[华为的硬件底气:堆料,但不是盲目堆料]
如果说纯视觉路线的核心是算法,那么多传感器融合路线的基石就是硬件。华为在这条路上走得相当坚决。
从ADS 1到ADS 5,华为的激光雷达经历了数次迭代。最新的896线双光路图像级激光雷达,是全球量产最高规格,分辨率相较行业主流水平提升了400%。华为首创的“一体双焦”双光路架构,广角单元纵览前方全域,长焦单元凝视远方细节,二者协同输出高清“画中画”,最远可识别120米处的小型障碍物。
硬件升级的背后是巨大的投入。靳玉志透露,华为在汽车智能化解决方案上的专项研发投入,仅2026年就将超过180亿元,其中70-80亿元用于算力建设。云端训练算力已经从2023年的2.8 EFLOPS提升到60 EFLOPS,三年增长超过21倍。未来五年,华为计划继续投入700-800亿元建设算力。
这种投入规模在行业内几乎是独一档的存在。但“堆料”并不意味着无脑堆砌硬件。华为的每新增一种传感器,都对应着解决特定的感知盲区。分布式毫米波雷达弥补摄像头在雨雾天气下的短板,补盲激光雷达覆盖车辆侧向和近场区域的感知死角,896线激光雷达则负责提升对低反射率异物——比如夜间路面上的轮胎、锥桶——的识别能力。
更重要的是,华为通过自研芯片和规模化生产,正在逐步降低硬件成本。目前已有超过25个品牌、50款车型与华为乾崑展开合作,搭载量已经突破190万台。规模越大,单颗传感器的成本就越低,这套“堆料”方案也就越具备商业上的可行性。
[现实检验:多传感器融合的实战优势]
技术路线之争,最终还是要落到真实场景中检验。
雨雾天气是纯视觉方案最典型的“翻车”场景。暴雨中前车扬起的水雾会让摄像头视野严重受限,系统频繁陷入“猜”的尴尬,甚至触发幽灵刹车。而毫米波雷达具备穿透雨雾的能力,激光雷达在雨雾中的探测距离虽然也会衰减,但仍有足够的感知余量,两者结合可以让车辆在恶劣天气下保持基本的感知能力。
逆光和眩光场景同样棘手。驶出隧道的一瞬间,光照强度急剧变化,摄像头会出现短暂的“致盲”,识别延迟明显。在重庆等复杂立交路段,纯视觉方案在逆光加隧道出口场景下,刹车介入明显偏晚。而激光雷达不受光线变化影响,点云数据在光盲瞬间仍然稳定输出,为系统提供可靠的环境信息。
夜间场景的差距更为显著。在缺乏路灯的乡村道路上,纯视觉系统会主动提示“视野受限”,识别置信度大幅下降,暗光环境下行人、非机动车等小目标容易被淹没在噪点中。美国国家公路交通安全管理局(NHTSA)对特斯拉FSD的专项调查结论显示,纯视觉方案在低能见度环境下存在致命缺陷,已确认9起直接相关的碰撞事故。
这些极端场景出现的概率或许不高,但一旦发生,后果往往是不可逆的。靳玉志在媒体日上说过一句话:“车能修,人不能修。”这句话背后的逻辑是,安全不能靠概率,而是要靠冗余。多传感器融合方案的价值,不是为了在99%的工况下做得更好,而是在那1%的极端场景中,保证系统仍然有兜底的能力。
[共存还是取代?]
回到最开始的问题:多传感器融合和纯视觉,谁才是未来?
短期来看,两条路线将在不同市场区间共存。纯视觉方案凭借成本优势,在中低端车型上快速普及,满足L2+级别智能驾驶的需求。而多传感器融合方案则聚焦高端车型和Robotaxi,以安全冗余作为核心卖点。美国新泽西州近期拟出台法案,强制要求全自动无人车搭载多套融合传感器,这从政策层面印证了一个趋势——当自动驾驶进入L3、L4乃至更高阶的阶段,安全标准只会越来越严,纯视觉方案面临的合规压力也会越来越大。
长期来看,L4级自动驾驶对感知可靠性的要求极高,多传感器融合几乎是必然选择。但纯视觉方案也并非没有突破的可能。随着Transformer架构、BEV感知、端到端大模型等技术的成熟,算法正在不断缩小与硬件方案之间的差距。特斯拉FSD V13版本在实测中已经展现出“老司机”般的通行效率,200公里路段零危险干预。小鹏的第二代VLA模型也在部分复杂路况下表现出超越特斯拉FSD的能力。
但关键在于,算法可以无限逼近人类,却很难超越物理定律。摄像头在暗光、逆光、雨雾下的物理限制,不是靠算法迭代就能彻底解决的。这也是为什么靳玉志会直言:“在面向未来自动驾驶的时候,安全要求的等级会更高,纯视觉是没有办法满足的。”
两种路线,本质上是两种价值选择。纯视觉赌的是算法无限逼近人类感知的极限,追求的是用更低的成本实现最大范围的普及。多传感器融合赌的是硬件冗余带来的安全底线,追求的是在任何极端场景下都不失效。
你会选择哪一种?是相信算法总有一天能像人一样“看路”,还是认为机器应该拥有比人更强的感知能力?