如何科学地评价一套城市NOA系统的好坏?接管次数、场景覆盖率、驾驶舒适度——这些指标如何量化、如何控制变量、如何避免主观偏差?东吴证券在2025年1月上海路测中构建了一套"大样本泛化路测+小样本深度路测"的双轨评价框架,覆盖7家车企、近50人评价团队、标准化21个细分场景,为行业提供了一套可复用的自动驾驶路测方法论。本文基于该报告,拆解其路测设计逻辑、定量指标体系和核心结论,为智能驾驶行业研究提供方法参考。
双轨路测方法论——大样本泛化与深度路测的互补逻辑
东吴证券设计了两种路测形式以实现"广度与深度"的平衡。大样本泛化路测指近50人集中于9:00-18:00时段、基于固定路线(约7km)进行智能化体验测试,但不同车型的驾驶员难以保持一致。其优点是同时段覆盖多车型、路线标准化、样本量丰富;不足在于评价员主观尺度不一致、安全员干预阈值不同、路测时长较短无法深入体验。
小样本深度路测则指相同安全员和评价员于不同时段、基于相似路线(约25km/1.5小时)进行测试,安全员与评价员均为东吴汽车组内成员。其优点在于评价尺度一致、安全边际一致、路测时长长且场景丰富;不足在于不同时段路况不一致、细微路线差异带来扰动、样本量单一。
这两种方法的互补逻辑清晰:泛化路测用大样本量对冲个体主观偏差,捕捉统计意义上的梯队差距;深度路测用控制变量法精确归因每一起接管的场景和原因,揭示能力边界和断点类型。两者结合,既避免了"一个人的主观评价"的偏差,也避免了"只看数据不看原因"的肤浅。
表:大样本泛化路测与小样本深度路测方法论对比| 维度 | 大样本泛化路测 | 小样本深度路测 |
|---|
| 样本量 | 近50人评价团队 | 相同安全员+评价员(东吴汽车组) |
| 路线 | 固定路线约7km | 相似路线约25km/1.5h |
| 时段 | 9:00-18:00集中测试 | 不同时段(覆盖早晚高峰) |
| 核心变量 | 评价员主观尺度、安全员干预阈值 | 路况时变、路线微差 |
| 优势 | 样本丰富、覆盖同时段路况 | 评价尺度一致、场景覆盖深 |
| 不足 | 时长短、无法深入体验 | 样本量单一、路况扰动 |
定量指标体系——从接管次数到场景成功率的量化标尺
东吴证券构建了一套多维度的定量评价指标体系,核心指标包括:接管次数(总接管/安全性接管/非安全性接管)、环岛成功率(司机无接管频率×10)、掉头成功率(司机无接管频率×10)、驾驶稳定性(急刹频率分级打分0/5/10)、驾驶信任度(智驾能力与试乘评价人自身对比分级打分0/5/10×3)。
接管次数的安全性/非安全性二分法是这套体系中最具洞察的设计——它区分了"系统做不了"和"驾驶员嫌慢"两种本质不同的接管原因,使得"接管次数多=体验差"的简单线性思维被打破。在泛化路测中,理想虽然总接管次数最少(0.87次),但其深度路测接管达7.6次却以效率型为主——如果不是这套分类体系,这个数据可能被误读为"理想深度测试表现大幅下滑"。
环岛成功率和掉头成功率的量化方式也值得关注——采用"司机无接管行为频率×10"的计分方式,本质上是将场景通过率转化为0-10分的直观标尺。小鹏和华为在泛化测试中这两项得分均处于高位,而蓝山、极氪的环岛得分为0(先验性断点,系统直接退出),直观反映了场景覆盖能力的"有无"差距。
驾驶风格与安全员效应——定性分析中的变量控制艺术
东吴证券在报告中多次强调安全员风格对评价结果的影响。1月15日上午测试中小鹏/享界/理想分别对应激进/保守/中性的安全员,下午将小鹏与享界的安全员对换——这一对照设计揭示了安全员干预阈值差异对接管数据的显著扰动。同一个智驾系统,在不同风格安全员的操作下,接管次数可能出现"±30%"的波动。
为控制这一变量,1月16日的测试中腾势、蓝山、极氪、小米采用统一安全员团队,且确认"安全员驾驶风格并未导致智驾评价的显著偏差"——因为第二梯队的接管场景多为"先验性断点"(系统明确做不了),而非"效率型接管"(系统能但慢)。换句话说,当系统能力边界清晰、先验性断点明确时,安全员风格的影响反而减弱——因为"系统做不了"是客观事实,无论谁来开都得接。
定性层面的驾驶风格分析同样具有方法论意义。东吴证券将第一梯队三家的驾驶风格定性为"激进/中性/保守"三种类型,并分析了每种风格对应的接管分布特征——华为的激进带来主动场景多、但接管集中挑战型场景;理想的保守带来效率型接管为主、安全边界清晰;小鹏的中性带来场景间方差最小、稳定性最高。这种风格-数据的交叉分析方法,为定性观察提供了定量数据的支撑。
从路测报告看2026智能驾驶评价方法论的趋势
东吴证券这份路测报告的方法论设计对行业有三点启示。第一,城市NOA的评价需要从"功能清单式"升级为"场景图谱式"——21个标准化场景的难度分层和通过率评估,远比"是否支持城市NOA"的二元判断更有信息量。第二,接管次数的统计必须配套"接管类型"和"场景归因"——单纯比较接管次数而不区分安全性/效率性、不标注发生在环岛还是直行,会导致严重的结论偏差。第三,安全员/驾驶员的个体差异必须作为变量纳入实验设计——不同干预阈值可能导致同一系统的评价差异达30%以上,横评测试中应采用"相同安全员"或"大样本对冲"两种策略之一进行控制。
对于行业研究者和消费者而言,这份路测报告提供了一份可复用的评价框架:看城市NOA系统,不仅要看"能不能开",还要看在21个细分场景中的覆盖广度和通过质量;不仅要看"接管几次",还要看"在哪里接""为什么接""是谁在开"。自动驾驶路测正在从"经验驱动"走向"数据驱动+场景驱动"的新阶段。