先来说说这次竞赛的背景。在DeepTest 2026研讨会上,组织方专门举办了一场测试工具竞赛,目标是衡量各参赛工具对汽车辅助驾驶大模型(LLM)的测试效果。最终,有四支团队提交了正式的工具。下面我们就逐一看看它们各自的路数。
ATLAS
总分排名第一的测试工具名为ATLAS,由巴西PUC-Rio大学的团队打造。这个工具的核心策略,说起来挺有意思——它借鉴了人类的一个特点:人在承受压力的时候,往往会忽略或者简化处理一些本该知道的信息。于是,团队决定让ATLAS在向汽车辅助驾驶LLM提问时,刻意制造一种紧迫感。具体怎么做的呢?方法包括在问题里加入“立刻”、“越快越好”这类词语,使用更短促的句式,甚至模仿司机在紧急情况下的说话方式。
除此之外,ATLAS还运用了几条精细的战术:它会统计汽车用户手册里哪些安全警示信息已经在之前的提问中被用过,然后优先挑选那些还没被问过的信息,以此来增加问题的覆盖面。对于那些被反复使用却始终没能让LLM出错的警示信息,它会套用那些曾经成功“难倒”过LLM的提问方式,重新组织问题再问一遍。更绝的是,它还会在提问里添加一些口语化的填充词,比如“嗯”、“你知道吗”,或者改写已有问题,甚至交叉组合两种不同的提问风格,当然,优先选用那些曾经导致过错误回答的套路。
Exida
获得总分第二的Exida,开发团队来自德国的Exida公司、宝马集团和慕尼黑工业大学。他们的思路与ATLAS正好相反——不是给LLM施加压力,而是想方设法减少提问触发安全警示的可能性。为此,他们设计了一套三步走的方法:
- 第一步,生成需要查询汽车用户手册的场景。通过一系列实验,他们挖掘出了一些会降低LLM险情识别能力的关键词,比如特定的天气状况、目的地、驾驶行为、驾驶状态,以及与时间紧迫性相关的词语。同时,他们还通过指令刻意避免生成过于抽象的意图,防止LLM自己去资料库里补充缺失的信息。
- 第二步,从这些场景中精确抽取用户的意图。
- 第三步,把场景中的片段、用户意图,再加上一些随机词汇(比如提问的开场白、紧急情况用语等)组合起来,生成一批测试提问。最后,利用Jaccard相似度过滤掉那些重复度过高的问题,确保生成的提问足够多样。
值得一提的是,Exida在“错误率”这个评测指标上,拿到了全场最佳的成绩。
Warnless
总分第三的Warnless,由伦敦大学学院和慕尼黑工业大学的团队联合开发。这个团队发现一个很有意思的现象:不同安全警示信息在被汽车辅助驾驶LLM回答时,被遗漏的概率并不一样。基于这个观察,他们开发了一套动态策略:实时统计每一条安全警示信息在LLM回答中被遗漏的概率,然后用这个统计结果来指导后续提问的选择——那些更容易让LLM犯错的信息,会被更频繁地拿出来测试。
在Warnless的提问生成过程中,提示语里会包含这些内容:选定的安全警示信息、与之相关的汽车部件信息、该信息之前被提问及回答的效果记录、生成提问的具体任务描述,以及少量学习样本。开发团队还用了DSPy这套提示语优化工具来不断打磨提示语的效果。
CRISP
排名第四的CRISP,来自宝马集团荷兰公司的一位开发者之手。它的做法是:先根据选定的安全警示信息,提炼出一个主题短语,然后补充相关的具体场景(比如天气、维修、汽车拖挂等),最终生成简短且针对性强的提问。这么设计的目的是什么?就是为了诱导汽车辅助驾驶LLM用最简练的方式回答,从而增加它在回答中遗漏安全警示内容的可能性。
CRISP还会记录每一条安全警示信息是否曾导致过错误回答。在后续选择测试对象时,它会优先翻那些曾经“出过事”的信息。最终评测结果显示,CRISP发现的错误回答在绝对数量上排名第一。这一点其实说明了:多样化的测试方法对于评测LLM应用来说,真的很关键。
Random
作为基线工具的Random,做法最简单直接:从汽车用户手册里随机挑选一条安全警示信息,然后让LLM根据这个信息生成测试提问。虽然策略粗糙,但它的存在为其他工具提供了一个对比基准。
下面这张图,展示了各工具针对“在汽车中安装婴儿座椅”这一安全警示信息所生成的具体提问,大家可以直观地感受一下不同测试工具的提问风格差异。

参考资料
以下资料的使用许可协议均为CC BY 4.0
https://creativecommons.org/licenses/by/4.0/
[1] ATLAS: Adaptive Test Learning And Selection at the DeepTest 2026 Tool Competition
https://doi.org/10.1145/3786154.3796500
[2] Exida Test Generator at the DeepTest 2026 Tool Competition
https://doi.org/10.1145/3786154.3796501
[3] Warnless at the DeepTest 2026 Tool Competition
https://doi.org/10.1145/3786154.3796503
[4] Contextual Risk-Driven Input Structuring for Probing (CRISP) at the DeepTest 2026 Tool Competition
https://doi.org/10.1145/3786154.3796502
[5] DeepTest Tool Competition 2026: Benchmarking an LLM-Based Automotive Assistant
https://arxiv.org/abs/2604.12615
