MITRE的"最重要硬件弱点"榜单,是全球硬件安全圈最严肃的专家共识,每一份入选漏洞都经过数十位工程师的反复审视。但2025版的背后,藏着一个让专家们五味杂陈的事实:1026份候选漏洞里,有411份——也就是整整四成——是由一个从未见过任何标注数据的AI流水线筛出来的。这不是辅助,是接生。
MITRE最硬的榜单,悄悄换了接生婆
说起MITRE CWE的"最重要硬件弱点"(MIHW),业内的想象是:几位白发苍苍的工程师坐在会议室里,对着成吨的CVE报告逐条过审,靠数十年经验拍板哪些漏洞"足够致命"。这套流程庄严、缓慢、自带权威光环。
但2025版MIHW的实际生产链路,被一篇arXiv:2509.00647的论文撕开了一个口子。研究团队用LLM-HyPZ这套零样本框架,把2021至2024年的CVE语料跑了一遍,从浩如烟海的漏洞库里筛出1742条与硬件强相关的条目,最终直接喂进了MIHW工作流的1026份候选清单中的411份。
411/1026,比率是40.1%。换句话说,专家委员会最终拍板的那份"金标准"清单,骨架有四成是机器搭的。
这还不是最刺激的。最刺激的是"零样本"三个字——这套流水线没有用任何人工标注数据训练,没见过一条"这条是硬件漏洞、那条不是"的范例。它从纯文本的CVE描述里,靠上下文嵌入和非监督聚类,自己把硬件漏洞挑了出来。
专家评审的权威性没有消失,但权威性的来源被悄然改写:不再是"我看过所以我懂",而是"机器先把大部分噪音滤掉了,我只需要在剩下的里挑"。当四成的骨架由机器搭好,那剩下六成的专家工作,究竟是"独立判断"还是"顺水推舟",就成了一道很难回答的题。
一台AI圈出了五条攻击暗道
LLM-HyPZ真正让硬件安全圈睡不着的,是它把1742条硬件漏洞自动归并成了五个高度收敛的主题:物理访问攻击、物联网和移动端的内存破坏、固件提权、BIOS层攻击,以及跨越抽象层的混合型缺陷。
这五条暗道,几乎覆盖了当下硬件攻防的最前线。你可以看到手机基带的越权读取、IoT摄像头的内存越界、智能家居网关的固件后门、笔记本BIOS的供应链劫持、甚至工控设备调试接口的物理接触攻击——这包括并不限于:消费电子、车载系统、医疗设备、边缘计算节点、工业PLC、智能卡、卫星通信终端。时代抛弃一个防御体系时,连一声再见都不会说。
更反直觉的是,这五条主题不是由某个安全研究员预先定义的"分类大纲"。它们是从数据里自己长出来的——非监督聚类在语义空间里自然形成了这种结构。这意味着,过去几十年硬件安全圈积累的"经验直觉",终于有了一个可被数据反推的客观锚点。
传统专家评审往往偏好自己熟悉的攻击面,忽视自己不熟悉的领域,于是MIHW历史版本里长期存在"消费电子偏多、工控偏少"的隐性偏差。当分类器不带任何先入为主的偏见时,反倒可能比专家更早嗅到新威胁的崛起。
模型的体面,是有门槛的
LLM-HyPZ的实验数据里藏着一个让甲方采购部门极其尴尬的真相。
论文跑了从7B到70B不等的多个开源和闭源大模型,分类准确率的分布近乎残忍:LLaMA 3.3 70B和GPT-4o、GPT-4-Turbo这一档的大模型,把硬件/软件二分类做到了98%以上的近满分;而体量更小的模型,准确率直接跌到65%以下。是的你没看错,65%——比随机猜好不了太多,幽默不?
这条分水岭划得笔直:硬件漏洞描述里大量充斥着寄存器地址、总线协议、芯片代际这种高度专业化的语汇,小模型的语义天花板根本抬不动这类行话。换句话说,“把大模型塞进安全运营中心"这件事,不是意愿问题,是预算问题。
更冷的事实是,整套流水线对算力的胃口并不收敛。LLaMA 3.3 70B跑一次CVE语料的上下文嵌入,单次推理成本足以让一个中型安全实验室的月度云账单翻倍。硬件漏洞发现的"民主化”,目前还停留在巨头和高校实验室的算力池里。
但这恰恰构成一种趋势差:当专家委员会需要预约会议室、订机票、凑齐十个人的日程表时,AI流水线只需要一行Python——只要你有那700亿参数和对应的GPU集群。规模优势的天花板正在被重新丈量。
“最重要"的定义权正在易主
LLM-HyPZ的局限同样坦率:硬件、固件、软件三者的边界在CVE描述里本就是模糊的,二分类做到99.5%不代表每一条都干净;固定的聚类数目无法穷尽硬件弱点分类法的演化;高容量模型带来的算力和费用开销,离"大规模常态化部署"还有距离。
但这些短板恰恰是趋势问题,不是方向问题。论文已经规划了多模型投票、多标签层级分类、轻量化推理流水线这些演进路径——都是工程问题,不是范式问题。
真正值得硬件安全圈警惕的,是一个更冰冷的趋势金句:看静止的绝对值——“我们今年审了多少条漏洞"“专家委员会成立多少年了”——是弱者最后的安慰剂;真正决定下一个十年话语权的,是AI流水线相对专家委员会的那种效率斜率。
当411/1026在2025年悄悄发生,1026/2500在2026年悄悄发生,2500/5000在2027年悄悄发生时——MITRE的榜单还在,专家还在,但"最重要"这三个字的定义权,正在被一行行Python悄悄接走。硬件安全的旧叙事里,专家的经验是最后的堡垒。在AI辅助的数据洪流面前,这座堡垒正在从"不可替代"变成"值得致敬”。下一个十年的入场券,不发给最懂寄存器的人,而发给最先让机器替自己看懂寄存器的人。
本文基于 arXiv:2509.00647(LLM-HyPZ: Hardware Vulnerability Discovery using an LLM-Assisted Hybrid Platform for Zero-Shot Knowledge Extraction and Refinement)