车东西(公众号:chedongxi)
作者 | 郭月
编辑 | 志豪
中国智驾出了国门,还能不能打?
过去几年,中国汽车出口量节节攀升,中国汽车的竞争力已不止于动力与续航——智能化正在成为新的杀手锏。在全球路况最复杂市场磨出来的智驾技术,如今正跟随整车一起,驶向海外。
多家中国车企纷纷落子布局:小鹏日前官宣,第二代VLA模型已实现同一套架构打通中国与欧洲市场,当前正推进欧洲地区的量产适配工作,目标2027年逐步向海外用户交付。
吉利旗下千里浩瀚G-ASD智能驾驶系统今年3月取得联合国欧盟UNR171国际认证,蔚来也在欧洲落地智能驾驶技术中心。
与此同时,全球自动驾驶的法规通道也在打开。此前联合国世界车辆法规协调论坛(WP29)正式批准发布了全球首个自动驾驶系统全球技术法规,2026年底开始自动驾驶可以合法进入全球市场。
但通道打开不等于路好走,国内练好的智驾系统到了海外,如何适应当地路况和规则?训练数据从哪来?能否跟上适配节奏?本文将结合小鹏相关团队发布的一系列论文,分析其如何将智驾系统带向欧洲。
一、欧洲“考场”难在哪?智驾规则得先“翻篇”
中国车企的智驾系统在欧洲,首先要面对三道坎。
第一道坎:路况、标识、规则完全不同。
一般来说,欧洲城市多窄巷、老街,车道宽度远小于国内,道路标识体系也大不相同——限速牌、方向指示、路权标志的样式和颜色与国内差异明显。

▲欧洲道路通行权的优先级层级金字塔
更关键的是交通参与者行为的差异,国内许多路口依赖驾驶员相互观察、互相礼让来通行,但欧洲实行严格的优先路权规则,主干道车辆拥有绝对通行权,可以全速通过,没有义务为辅路来车减速,辅路车辆必须停车让行,如果辅路车辆抢行导致事故,辅路车辆往往要负全责。

▲如图驾校车辆先行,因为它行驶在有优先通行标识的道路上,然后骑自行车的人才能通行
这些差异意味着,在国内训练好的感知和决策模型,到了欧洲可能需要重写决策逻辑。
第二道坎:法规限制严格,大规模实地路测困难重重。
欧洲各国的路测法规严格且各不相同,审批流程长、窗口期短,一支路测车队在当地跑一天的成本可能是国内的数倍。
更关键的是,很多需要训练的危险场景——比如前车突然掉落货物、窄巷中突然窜出的自行车——在真实道路上本就罕见,想专门去采集几乎不可能。车企每进一个新市场,都要从零建立路测队伍,落地节奏被严重拖慢。
第三道坎:传统仿真帮不上忙。
小鹏技术团队在论文中指出,行业目前大量采用基于3D高斯泼溅(3DGS)的传统仿真技术,本质上是“复现”采集过的场景——摄像头扫过一条路,就能在仿真里重建出来。
但问题是,它缺乏对物理世界的真正理解,一旦被测的自动驾驶系统做出了与当初采集时不同的动作(例如为避让障碍物而紧急变道),这个动作就超出了3DGS的重建“知识范围”,系统就无法对后续场景进行有效生成与评估,换句话说,传统仿真无法“想象”出未曾观测过的视角。
这三道坎归结起来是同一个问题:智驾系统到了欧洲市场,可能缺少足够丰富的场景数据来训练和验证。
小鹏的解法不是去欧洲多跑路测,而是构建了一套“数据生成”的技术体系,这套体系包含三项核心技术:X-World负责生成海量仿真场景,X-Cache让生成速度足够快,TuringViT则确保系统能“看清”欧洲复杂的道路细节。
三环相扣,为小鹏智驾出海打下了技术底座。
二、仿真场景“随心配” AI辅助路测“跑遍”欧洲大街小巷
X-World是小鹏推出的可控多视角生成式世界模型,可以把它理解为“现实世界模拟器”。
它要做的事情很简单:给定当前路况和驾驶操作,在给定动作条件下生成符合物理约束的未来视频,同时在持续生成过程中保持良好的可控性与稳定性。
▲X-World模型架构
对出海场景来说,这意味着只需要输入少量欧洲当地的真实驾驶画面,X-World就能“举一反三”,自动生成大量符合欧洲视觉风格和交通规则的仿真场景,大幅减少对当地大规模路测的依赖。
它怎么做到精准可控?
欧洲和中国的路况差异很大,X-World必须能按需生成特定场景。为此,它设计了四个维度的控制接口:
(1)控制自车动作:通过速度、转向曲率等参数控制车辆轨迹,适配不同国家的驾驶习惯,比如左舵/右舵、不同限速规则。
(2)控制动态物体:指定车辆、行人的位置和移动轨迹,模拟不同国家的交通参与者行为,比如欧洲的优先路权规则、东南亚的摩托车混行。
(3)控制静态元素:指定车道线、道路边界、交通标志的样式和位置,直接匹配当地的道路标准。
(4)控制全局外观:调整天气、时间、场景整体风格,适配海外当地的视觉风格。
这套能力相当于给研发团队提供了一个“全球路况编辑器”,无需去当地采集海量数据,就能针对性地生成各类场景。
多摄像头画面会不会“穿帮”?
根据官方论文,智驾系统依赖多个摄像头同时工作,而仿真生成时多摄像头生成画面,往往会出现同一个物体在不同视角里位置、形态对不上的“穿帮”问题。
X-World的解决办法是在模型结构上强制约束:靠视角-时间自注意力机制,保证跨视角的一致性。
简单说,模型生成画面时,多个摄像头不是各自独立计算,而是会互相校准,保证同一个物体在所有画面里的位置、大小、姿态完全统一;前后帧之间,上一帧的信息会传递给下一帧,保证视频动起来连续平滑。
放到出海场景里,无论是狭窄的古城街道、宽阔的高速,还是人车混行的城市道路,多视角画面的空间一致性都能得到保障,让第二代VLA基于准确的多视角画面做决策。
这套模型实际效果如何?
目前,X-World已经在小鹏汽车自动驾驶的闭环仿真测试、在线强化学习、数据生成等环节起到支撑作用。
闭环仿真测试方面,依托X-World,小鹏构建面向第二代VLA的闭环评估引擎,目前,小鹏自动驾驶仿真场景从一年前的3万增加到50多万个,每日仿真测试里程等效于3000万公里实车测试。

▲基于世界模型的仿真测试
在线强化学习方面,X-World可充当在线强化学习的仿真平台,便于智驾针对自动驾驶中的难点场景进行专项优化,例如重点优化模型在路口遭遇行人“鬼探头”、拥堵路段变道犹豫等场景的表现。
数据生成方面,X-World可实现大规模数据生成与增强。X-World作为生成式数据工厂,既可以生成缺失的长尾场景数据,也能生成海外数据用于模型训练,加速小鹏自动驾驶全球化落地进程。
三、仿真太慢等不起?AI学会“抄近道”
场景生成能力有了,下一个问题是效率。
智驾系统要熟悉各国路况、测遍各类长尾场景,背后是海量的虚拟测试里程,如果画面生成速度跟不上,同样时间内能覆盖的地区、能跑完的场景就很有限,整体适配的节奏也会被拖慢。
小鹏团队为此打造了X-Cache方案——官方定义为“面向少步自回归世界模型的跨段块级缓存”。

▲X-Cache总体架构
这个解决思路很巧妙,它发现了一个规律:相邻两段画面的中间计算结果高度相似——就像你看视频时,前后两帧画面差别很小,那么能否复用上一段已经算好的结果,避免重复计算?
X-Cache正是这样做的,它靠复用计算结果提速,在几乎不影响画质的前提下,复用相邻画面的中间计算结果,减少约七成的重复计算,对模型核心部分实现最高约2.7倍的推理加速。

▲X-Cache推理加速可提升2.7倍
画质牺牲大吗?
论文数据显示,结构相似度(SSIM)在0.999以上(满分1),学习感知图像块差异(LPIPS)在万分之四以下,画质损失处于人眼几乎不可感知的级别。
这意味着仿真画面与真实场景的差异足够小,对应到出海场景中,X-Cache可加快多地区智驾场景的测试与训练进度;同时极小的画质损失,也让仿真结果更贴近真实画面,降低仿真与真实场景的差异。

▲X-Cache结构相似度在0.999以上
这个方案通用性如何?
论文指出,X-Cache不是X-World专属,所有同类型的模型都可以适配。智驾业务需要拓展更多区域市场时,这套加速能力可以直接复用。
四、智驾来到欧洲 “眼力”也是考验
X-World解决仿真素材供给,X-Cache解决生成效率,整套智驾体系出海还有更底层的感知技术需要提升。
无论真实摄像头拍的画面还是仿真生成的画面,最终都要靠VLA模型来做识别和决策。
VLA“看懂”画面的能力来自视觉编码器——可以简单理解为一个把画面变成模型可理解信号的“翻译官”。
欧洲场景对这位“翻译官”提出了苛刻要求:欧洲路牌文字密集、字体小,摄像头必须看得清细节;同时处理多路高清画面,算力消耗巨大。
行业主流的开源方案普遍面临算力吃紧、数据效率低、场景适配难的问题。
小鹏推出的视觉 Transformer基础模型TuringViT正是为此设计,它具备三大优势。

▲TuringViT 的块架构和模型配置
第一,算力效率高。 该方案采用独特的混合注意力结构,在高分辨率下推理速度达到主流方案的2~3倍,分辨率越高优势越明显。

▲三款视觉模型推理延迟对比
第二,数据利用精。该方案通过自研的数据筛选流水线,仅用主流方案十分之一的训练数据就能达到顶尖识别效果。

▲不同视觉模型所需训练数据和精度对比
第三,原生支持动态分辨率。TuringViT采用了一套全新训练范式,不同尺寸、不同长宽比的图像可以直接输入模型处理。
这对于智能驾驶场景尤其关键——多路环视摄像头传来的画面分辨率各不相同,模型不需要任何适配就能直接处理,输出低延迟、高质量的视觉特征给下游决策模块。

▲数据清洗流水线
简单说,TuringViT让VLA在欧洲复杂路况下“看得清、看得全、看得快”。
小鹏通用智能中心负责人刘先明表示,TuringViT的特性可以支撑自动驾驶、座舱交互、机器人,也为从中国到全球的智能化出海打下基础。

▲刘先明发文称TuringViT助推智能化出海
结语:把中国智驾“搬”到欧洲,小鹏搭好了三块跳板
从X-World到X-Cache再到TuringViT,小鹏解决的不是某一个技术细节,而是智驾出海最核心的难题——让智驾在海外市场,也能提前“练”好。
具体怎么练?
第一块跳板是数据。X-World像一台“世界模拟器”——给它欧洲当地的真实画面和驾驶指令,它就能批量生成仿真场景。
这意味着不需要把每条欧洲街道都跑一遍,只需输入少量当地真实画面,X-World就能自动生成大量符合当地交通特征的仿真场景,让智驾系统有足够的素材可练。
第二块跳板是速度。X-Cache像一个“加速器”——它能用更短的时间跑完仿真,这意味着智驾仿真同样时间内能覆盖更多国家、跑完更多场景。
第三块跳板是感知。TuringViT像一副高清“眼镜”,戴上这副“眼镜”,VLA才能看得清、看得准。
三块跳板稳稳架好,小鹏踏上“一套智驾走全球”的征途。
当然,仿真与真实路况之间仍存在偏差,待持续优化,同时车端芯片推理算力也需长期迭代打磨,智驾出海方向已经清晰,但能否按时落地——时间会给出答案。