12月20日,旧金山因变电站火灾导致近三分之一区域断电,13万居民失去电力,数百个路口红绿灯熄灭。Waymo无人驾驶车辆在多个路口中央停驻、双闪长亮,成片瘫痪,需警察以手势人工疏导;市长Daniel Lurie亲自致电Waymo CEO要求撤车。官方解释称,系统按四向停车规则应对失灵红绿灯,但因停电规模过大,大量车辆集中向远程运营中心发送确认请求,导致后台过载、响应中断。
同日,马斯克在X平台发文称Tesla Robotaxis未受停电影响。对比显示,Waymo依赖后台远程兜底的重感知、高精地图+激光雷达路线,在通信与基础设施失效时暴露系统性脆弱;而特斯拉采用端到端神经网络,不依赖外部指令或高精地图,通过数十亿英里真实驾驶视频训练,具备自主观察、判断与决策能力。NVIDIA机器人部门负责人Jim Fan试驾FSD v14后评价其‘通过了物理图灵测试’。
在中国,小鹏汽车正实践相同技术路径。12月初一段夜间行车视频显示,其测试车在无地图标注、无提前预警情况下,识别出临时交警查酒驾手势并平稳减速停靠。小鹏智驾产品负责人袁婷婷将该现象定义为‘VLA2.0涌现场景’。该行为无法通过预设规则覆盖,依赖模型对动态物理世界的实时理解能力,体现大模型在参数量突破临界点后产生的类人判断涌现效应。
小鹏技术路径具备完整闭环:4月在香港披露720亿参数‘物理世界基座模型’,为当时主流VLA模型参数量的35倍;建成国内首个万卡智算集群,算力达10 EFLOPS,GPU利用率长期超90%;并在10亿、30亿、70亿、720亿参数模型上首次明确验证Scaling Law在自动驾驶领域持续生效。6月于CVPR自动驾驶研讨会(WAD)上,小鹏作为唯一中国车企与Waymo、英伟达、UCLA同台,公布云端基模已处理超40万小时视频数据,GPU流式多处理器利用率(SM utilization)达85%,并启动视觉Token压缩研究。
11月广州科技日,小鹏发布第二代VLA模型,取消传统Vision-Language-Action架构中的Language层,实现视觉信号到动作指令的端到端直出;模型参数量达数十亿,部署于三颗自研图灵AI芯片构成的车端平台,总算力2250TOPS;训练数据量近1亿clips,等效人类驾驶经验约6.5万年;全链路模型迭代周期压缩至5天。该闭环被命名为‘云端模型工厂’,涵盖云端训练、强化学习、知识蒸馏、车端部署及用户数据回流再训练。
车端部署瓶颈在于算力约束。云端720亿参数模型无法直接移植至车载平台。小鹏与北京大学联合完成的论文《FastDriveVLA》被AAAI 2026录用,提出专用于端到端VLA模型的视觉Token剪枝框架。该框架构建nuScenes-FG数据集,含24.1万个带前景标注图像;采用MAE风格像素重建策略与对抗性前景-背景重建机制,训练出轻量级剪枝器ReconPruner(参数量7000万)。实测中,单次输入3249个视觉Token可降至812个,削减75%;FLOPs降低7.5倍,预填充时间缩短3.7倍,解码时间缩短1.3倍;在nuScenes开环规划基准测试中,25%、50%、75%剪枝比例下均超越现有方法,25%剪枝时L2轨迹误差与碰撞指标甚至优于原始未剪枝模型,证实冗余背景Token去除可提升模型专注度与性能。
技术落地指向商业化重构。小鹏宣布2026年推出三款Robotaxi车型,起售价低于20万元人民币;2027年在部分城市启动试运营。相较Waymo单车成本逾100万元人民币,小鹏成本优势源于纯视觉方案、芯片-算子-模型软硬协同研发,以及L2与L4共用同一套软件底座。其商业模式同步覆盖2B与2C:除Robotaxi运营服务外,2026年将推出‘Robo’智驾版本面向私人用户销售,硬件配置、安全冗余与智驾技术与Robotaxi完全一致,支持用户自主驾驶或启用全自动驾驶功能。高德已确认成为其全球首个Robotaxi生态合作伙伴,将通过开放SDK共建运营网络。
小鹏2025年技术演进呈现严密节奏:4月验证大模型规模效应,6月展示工程化训练与部署能力,11月发布端到端VLA2.0,12月解决车端高效推理最后一环。整条路径旨在回答‘大模型如何落地自动驾驶’这一核心命题。下一步关键验证为量产体验:第二代VLA将于2026年第一季度在Ultra车型启动L2量产搭载,L2直通L4的技术可行性即将接受真实场景检验。
免责声明:本文内容由开放的智能模型自动生成,仅供参考。



