Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle Vulnerabilities
作者: Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman
分类: cs.CR, cs.AI
发布日期: 2026-07-20
💡 一句话要点
评估开放权重LLM生成自动驾驶车辆漏洞的结构化威胁信息
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自动驾驶车辆 结构化威胁信息 大型语言模型 漏洞映射 安全性评估 威胁情报 CVE数据库 MITRE ATT&CK
📋 核心要点
- 现有的漏洞文档通常以纯文本形式存在,缺乏结构化信息,导致安全从业者在风险缓解时面临困难。
- 本文提出利用开放权重的LLM生成结构化威胁信息表达(STIX),以提供更有效的漏洞信息表示。
- 实验中,单模型配置在SDO、SRO和CWE映射上分别取得了0.94、0.63和0.99的F1分数,显示出显著的性能提升。
📝 摘要(中文)
连接和自动驾驶车辆(CAV)依赖于互联的软件和硬件组件,其中的漏洞可能会危及资产、用户和车辆操作。这些漏洞通常以纯文本形式记录在公共漏洞和暴露(CVE)数据库中,但安全从业者需要有关受影响资产、弱点类型和攻击行为的结构化信息。为此,本文评估了开放权重的大型语言模型(LLMs)在生成结构化威胁信息表达(STIX)方面的能力,构建了CAV-STIXGen数据集,并对11个不同参数规模的LLM进行了评估。实验结果显示,单模型配置在SDO、SRO和CWE映射上取得了较高的F1分数,尽管MITRE ATT&CK映射仍然具有挑战性。最后,分析了CWE和MITRE ATT&CK的共现,以识别CAV领域中的重复威胁模式。
🔬 方法详解
问题定义:本文旨在解决连接和自动驾驶车辆(CAV)中漏洞信息缺乏结构化表示的问题。现有方法主要依赖于CVE数据库的纯文本记录,无法满足安全从业者对详细结构化信息的需求。
核心思路:通过评估开放权重的大型语言模型(LLMs),生成结构化威胁信息表达(STIX),以便更好地映射CAV相关的漏洞信息。该方法旨在自动化漏洞到STIX的转换,提升威胁情报的效率。
技术框架:研究构建了一个名为CAV-STIXGen的数据集,该数据集将CAV漏洞描述映射到STIX域对象(SDO)、STIX关系对象(SRO)、通用弱点枚举(CWE)和MITRE ATT&CK技术。评估了11个不同参数规模的LLM,采用多种提示策略和温度设置。
关键创新:本研究的创新点在于利用LLM生成结构化威胁信息,填补了现有方法在漏洞信息表示上的空白,尤其是在CAV领域的应用。
关键设计:在实验中,单模型配置的F1分数分别为SDO 0.94、SRO 0.63和CWE 0.99,显示出良好的映射能力。多代理设置下,Gemma-4-31B和Codestral-22B在SDO和SRO的F1分数分别为0.91和0.43。
🖼️ 关键图片
📊 实验亮点
实验结果显示,单模型配置在SDO、SRO和CWE映射上分别取得了0.94、0.63和0.99的F1分数,表明该方法在生成结构化威胁信息方面具有显著的性能优势。尽管MITRE ATT&CK映射仍具挑战性,但在多代理设置下,Gemma-4-31B和Codestral-22B的表现也相对较好,进一步验证了该方法的有效性。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶车辆的安全性评估和漏洞管理。通过自动化生成结构化威胁信息,安全从业者可以更高效地识别和应对潜在威胁,从而提升交通安全的整体防御能力。未来,该方法可能扩展到其他领域的安全威胁信息生成。
📄 摘要(原文)
Connected and Autonomous Vehicles (CAVs) rely on interconnected software and hardware components, including sensors, Electronic Control Units, in-vehicle infotainment systems, and telematics units, where vulnerabilities can compromise assets, users, and vehicle operations. These vulnerabilities are commonly documented as plain text in the Common Vulnerabilities and Exposures (CVE) database; however, security practitioners require structured information about affected assets, types of weaknesses, and attack behaviors to effectively mitigate the risks from these vulnerabilities. To this end, we evaluate open-weight Large Language Models (LLMs) for generating Structured Threat Information Expression (STIX), a well-known structured format for representing threat information, for CAV-related CVEs. We construct a dataset called CAV-STIXGen that maps CAV vulnerability descriptions to STIX domain objects (SDO), STIX relationship objects (SRO), Common Weakness Enumeration (CWE), and MITRE ATT&CK techniques mappings. Using this dataset, we evaluated 11 open-weight LLMs (4B to 120B parameters) across various prompting strategies and temperatures. Single-model configurations achieve F1 scores of 0.94 for SDO, 0.63 for SRO, and 0.99 for CWE mapping, while complete MITRE ATT&CK mapping remains challenging. In a multi-agent setup, Gemma-4-31B and Codestral-22B achieve F1 scores of 0.91 for SDOs and 0.43 for SROs, respectively. Lastly, we analyze CWE and MITRE ATT&CK co-occurrences to identify recurring threat patterns in the CAV domain, demonstrating how AI-assisted vulnerability-to-STIX translation can automate threat intelligence and prioritize defense in transportation security.