这项由阿里巴巴集团旗下通义实验室与阿里云计算部门联合香港科技大学共同完成的研究,于2026年7月29日以预印本形式发布,论文编号为arXiv:2607.26791。感兴趣的读者可以通过该编号在arXiv平台查阅完整原文。
当一栋房子遭到入室盗窃,警察到达现场后需要做什么?他们要仔细检查每一扇窗、每一道门,寻找撬开的痕迹;翻查抽屉和柜子,判断什么东西被动过;检查门锁有没有被更换过;甚至要弄清楚小偷是不是还留了一扇备用的"后门"方便下次再来。最后,他们还得给房主出具一份详尽的报告,告诉他哪些东西被偷了、小偷是怎么进来的、留下了什么隐患,并且给出具体的安全整改建议。
现在把这栋房子换成一台遭到黑客入侵的服务器,把警察换成AI系统。这项研究要回答的核心问题就是:当前最顶尖的AI,能不能像一位经验丰富的网络安全侦探那样,把这件"入侵案"查个水落石出?
研究团队构建了一个名为SecRespond的测试框架,用它对包括Claude、GPT、Gemini、Qwen、DeepSeek等23个主流AI模型进行了全面检验。结论清晰而令人警醒:即便是目前最强的模型,面对真实的入侵现场,也远远达不到"独立破案"的水平。
一、为什么AI"安全侦探"的能力至关重要
在网络安全领域,有一个重要的时间节点叫做"事后响应"(Post-Compromise)。简单说,就是黑客已经成功进入了系统,破坏已经发生,此时安全团队需要做的事情。这和"事前防御"是完全不同的工作——后者是锁好门窗、安装摄像头,而前者则是在案发之后去还原案情、清除隐患、防止再次发生。
过去,学术界对AI的网络安全能力评估,主要集中在"事前"场景:让AI去发现系统漏洞、尝试入侵目标、或者给已知漏洞打补丁。这就好比只测试警察能不能找到可疑的人,而从不考察他们到达犯罪现场之后能不能破案。真实的安全运营工作中,"事后响应"占据了相当大的比重,却一直是AI能力评估的空白地带。
与此同时,AI驱动的安全工具正在快速进入企业的实际运营环境。这些工具被赋予了读取服务器文件、执行命令行操作的权限,越来越多地被期望承担真实的安全响应任务。如果我们不清楚这些工具的真实能力边界,就很容易产生过度信任——以为AI已经把现场查清楚了,实际上黑客留下的后门还好好地开着。
正是为了填补这个空白,研究团队设计了SecRespond。它的核心创新在于"真实"二字——不是模拟出来的简化场景,而是在真实的云服务器上执行真实的攻击,然后冻结那台服务器的磁盘快照,让AI去面对一个货真价实的"犯罪现场"。
二、搭建十个真实的"案发现场"
为了让测试尽可能贴近现实,研究团队花费了大量精力构建测试场景,也就是他们所说的"网络靶场"(Cyber Range)。整个构建过程分为十二个阶段,包括攻击方案设计、受害主机搭建、攻击脚本开发、实施攻击、验证攻击效果、收集安全告警数据,以及整改方案验证等,每个关键阶段都有人工安全专家介入审核,确保场景的真实性和完整性。
十个靶场覆盖了五种不同的操作系统,涵盖了CentOS 7、CentOS 8、Ubuntu 20.04、Ubuntu 22.04以及Windows Server,同时涉及四类入侵切入点,包括弱口令、已知CVE漏洞(公开发布的安全漏洞)、业务代码缺陷以及软件供应链攻击。每个靶场都复现了一条完整的多阶段攻击链,从最初的入侵入口,到提权、持久化(在系统里安装"后门"让攻击者随时能回来)、再到最终的破坏行为,总共覆盖了MITRE ATT&CK知识库(一套业界通用的攻击技术分类框架)中的21种攻击技术。
十个场景各有其典型性。SSH-Miner场景模拟黑客通过暴力破解SSH密码入侵CentOS 7服务器,随后部署挖矿程序并通过计划任务、bashrc文件和系统服务三种方式植入持久化后门,还清除了认证日志掩盖踪迹。ShiroFastjson场景则是更复杂的Java应用攻击链,攻击者利用Shiro框架的默认密钥加上Fastjson库的漏洞拿到代码执行权限,植入WebShell(一种隐藏在正常网页文件中的后门脚本),偷取数据库密码并转储用户数据,还在MySQL数据库里留下了UDF(用户自定义函数)后门,整个持久化手段多达八种以上。Log4j-RCE场景复现了2021年震惊业界的Log4j高危漏洞(CVE-2021-44228),这个漏洞之所以出名,是因为几乎所有使用Java的互联网服务都受到波及。NPM-Worm场景则模拟了供应链攻击——攻击者发布一个恶意的npm软件包(一种JavaScript开发者常用的代码库),当开发者不知情地安装后,这个"定时炸弹"会在服务器上自动传播、窃取各类凭据。Windows平台上的ASP.NET-ViewState和RDP-Service-Abuse则分别针对Windows服务器的特有攻击面,涉及WMI事件订阅(一种Windows系统自带的高级持久化机制)、DLL劫持、注册表后门、凭据转储等Windows专属攻击技术。
研究团队在设计靶场时特意遵循了一个重要原则:让30%到40%的攻击行为会触发安全产品的告警,而剩余60%到70%只留下静默的文件修改和配置变更,不产生任何主动信号。这就像案发现场里,只有一部分线索会直接引起侦探注意,更多的细节需要主动翻查才能发现。这个设计是为了区分AI究竟是真的在"破案",还是只是在跟着告警"按图索骥"。
每个靶场给到AI的材料包括三类:一是服务器磁盘的完整快照,相当于冻结的犯罪现场;二是安全产品产生的实时告警、漏洞扫描结果和基线检查报告,相当于到达现场时的初步情报;三是任务要求,AI需要输出一份入侵分析报告(还原攻击链)、一份漏洞报告、一份基线安全评估报告,以及一份具体的整改计划。
三、用五维能力画出AI侦探的"能力图谱"
如何客观衡量AI交出的"破案报告"质量?研究团队设计了一套精细的评估体系。他们首先定义了五个能力维度,构成了所谓的CAP(能力)分类体系。
第一个维度是"入侵实体识别",考察AI能不能找到攻击者留下的具体痕迹,比如恶意文件、WebShell、挖矿程序、恶意网络连接等。这是最直观的侦查工作,相当于找到作案工具。第二个维度是"持久化机制发现",这是难度最高的部分——持久化机制是攻击者植入的"后门",让他们即使在系统重启后也能重新进入,包括计划任务、系统服务、shell初始化文件、authorized_keys(SSH免密登录配置)被篡改、MySQL UDF后门、Windows WMI事件订阅等21种具体手段。第三个维度是"基线风险评估",检查服务器配置是否符合安全标准,比如SSH是否允许root远程登录、数据库是否设置了访问密码、是否有不必要的高权限账户等。第四个维度是"漏洞风险确认",核实安全扫描发现的软件漏洞是否真的存在于系统中,以及是否被攻击者实际利用。第五个维度是"调查与响应质量",这是对整个侦查过程的综合评分,考察AI能不能准确定位入口点、完整还原攻击时间线、诚实地说明自己的不确定性,以及提出的整改计划是否经过了验证、是否考虑了业务影响。
在这五个维度上,研究团队进一步拆解出52个具体能力项,并将每个靶场的考核要点分解为280个检查点(CHK)。每个检查点沿两个轴打分:发现轴(满分3分,包括发现问题、提供证据、正确归因三个子项)和整改轴(满分2分,包括整改方案的正确性和完整性两个子项)。
为了确保评分的客观性,研究团队采用了"AI评AI"的方法——同时使用Claude Opus 4.7、Gemini 3.1 Pro和GPT-5.4 Pro三个独立的强模型作为裁判,分别独立打分,最后取平均值作为最终分数。研究结果显示,三位"裁判"之间的评分一致率达到72%到75%,斯皮尔曼等级相关系数(衡量评分排名一致性的指标)高达0.86到0.87,说明评分体系相当稳定可靠。更重要的是,三位裁判在评分上的差异主要体现在严格程度上(GPT裁判普遍偏严,Claude和Gemini裁判略宽),而不是偏向某个特定模型,这说明平均后的分数能有效消除个体偏差。研究团队还专门邀请了人工安全专家对随机抽取的60个检查点进行独立评分,结果与AI裁判的皮尔逊相关系数达到0.96,加权Cohen's Kappa值为0.94,98%的检查点两者分数相差不超过1分,充分验证了这套评估方法的可信度。
四、23个顶尖AI的破案成绩单
研究团队在OpenCode这个开源的AI代理框架上运行了所有23个模型,让每个模型在相同的任务说明和工具集下独立完成每个靶场的调查任务。所有模型都以默认参数运行,并开启了各自的推理模式。
最终成绩揭示出几个清晰的规律。总体来看,Claude Opus 4.7是表现最好的选手,在发现维度的综合得分为79.0%,在整改维度为65.7%,但即便是这个最好成绩,也意味着还有超过20%的入侵痕迹没被发现,还有超过三分之一的整改任务没有完成。更关键的是,没有任何一个模型在任意一个靶场上实现了发现和整改的"双满贯"。
紧随其后的是Claude Opus 4.6(78.2%/58.0%)、GLM-5.1(76.3%/59.2%)和Qwen3.7 Plus(75.6%/58.8%)。表现垫底的包括Gemini 3.1 Pro(54.8%/31.5%)、MiniMax M2.5(52.4%/32.9%)和Gemini 3 Flash(57.4%/32.9%)。一个反直觉的发现是,GLM和DeepSeek这两个来自中国研究机构的开源模型,表现明显优于GPT和Gemini系列,这说明在网络安全响应这个专业赛道上,模型是否来自头部商业公司并不是决定性因素。
纵向来看版本迭代,大多数模型系列确实在随着版本更新而进步。Claude Opus系列从4.5版本的69.5%/56.4%,进步到4.6版本的78.2%/58.0%,再到4.7版本的79.0%/65.7%。GLM-5.1比GLM-5提升了约11.4个百分点(发现)和13.3个百分点(整改)。DeepSeek V4 Pro比V3.2提升了约14个百分点(发现)和9.8个百分点(整改)。但这个趋势并不绝对——Kimi K2.6的整改分数反而低于K2.5(43.0% vs 50.7%),Gemini 3.1 Pro的两项指标也都略低于Gemini 3 Flash,说明版本更新并不总是带来网络安全能力的线性提升。
靶场难度的差异同样显著。Log4j-RCE是所有模型表现最好的场景,原因很简单:这是一个几乎所有AI都在训练数据中大量见过的知名漏洞,凭借"记忆"就能答对很多题。Docker-Escape和Redis-RCE次之,因为攻击链相对线性,持久化手段在告警中已有提示。难度最高的是Shiro-Fastjson、RDP-Service-Abuse、NPM-Worm和ASP.NET-ViewState,这些场景的攻击面更宽、手段更多样、伪装更刻意,让AI难以全面覆盖。GPT-5.5在发现维度得分高达70.7%,但整改只有36%,差距接近35个百分点,在所有模型中是最大的。
五、五维能力图谱揭示的短板全景
把所有模型在五个能力维度上的得分汇总分析,就能看出一幅清晰的"能力地图":模型在不同维度上的表现极度不均衡,有些区域相对拿手,有些区域则几乎是盲区。
入侵实体识别是所有模型最擅长的领域,大多数模型的发现率超过70%,最强的Qwen3.7 Plus达到88.4%,Claude Opus 4.6达到86.0%。这是因为恶意文件、挖矿进程这类东西往往会触发告警,属于"摆在明面上的证据",AI只需顺着告警去查就能找到。
持久化机制发现则是最大的软肋。这个维度的平均发现分数在所有维度中最低,很多模型连一半都达不到。道理也清楚:计划任务、bashrc文件、profile.d目录下的脚本、ld.so.preload文件、MySQL UDF插件……这些东西没有主动信号,不会自己"跳出来",需要侦探对整个系统进行地毯式的主动排查,而不是跟着线索走。现有AI显然更习惯"跟线索"而不是"主动搜查"。
基线风险评估和漏洞风险确认处于中间水平。这两类问题的整改相对容易得到较高分,因为"升级到最新版本"、"关闭无密码访问"、"轮换默认凭据"这类操作是标准化的,AI有充足的知识储备来给出正确建议。不过,如何验证这些整改是否真正生效,很少有模型会提到。
调查与响应质量是仅次于持久化的弱项,在整改维度上几乎所有模型都低于50%,只有Claude Opus 4.7(53.6%)和Claude Sonnet 4.5(66.7%)是例外。这个维度考察的是调查过程的完整性和可靠性——AI能不能准确说清楚攻击者是谁、怎么进来的、做了什么、还留了什么?能不能验证自己的整改方案真的有效?能不能评估这次事件对业务的影响?这些"高阶侦查能力"对现有AI来说仍然太难了。
值得一提的是,研究团队还把AI的表现和传统的"无代理静态扫描"工具做了对比——后者是一种不需要在服务器上安装任何程序,纯靠静态模式匹配来检测威胁的传统安全工具。这个传统工具在入侵实体识别维度得到43.6%,在漏洞识别维度得到50.0%,但在持久化机制发现上只有2.1%,在基线风险上只有20.7%,而且完全无法提供攻击链重建和整改建议。相比之下,AI在各个可比维度上都明显优于传统工具,说明AI确实带来了实质性的能力提升,只是还远没到可以独当一面的程度。
六、能力失衡的两大根本原因
通过对每个靶场的详细分析,研究团队归纳出了AI在这项任务上失败的两个核心模式,它们解释了为什么现有模型即便聪明如Claude Opus 4.7,也无法完成完整的案件调查。
第一个核心缺陷是"跟着告警走"而不是"主动搜查"。AI很善于顺着已有的线索追查下去,但极少会主动对整个系统进行系统性扫描。在靶场设计中,60%到70%的攻击痕迹是没有告警的静默文件,这些内容需要AI主动去翻查——检查每个用户的计划任务、检查每个系统服务的配置、检查shell初始化文件有没有异常内容、检查系统启动项……但现有AI几乎不会这样做,它们更像一个只会查看事故报告的助手,而不是一个在案发现场从头到尾仔细翻查的老警探。几乎每个靶场的分析都发现,AI在"全面持久化扫描"这个检查点上的得分接近于零。
第二个核心缺陷是"只做第一步整改"而不做完整闭环。AI通常能提出一个正确但不完整的整改建议。比如发现了挖矿进程,它会建议"终止进程、删除文件",但往往不会继续建议"轮换可能已经泄露的凭据"、"封锁攻击者的外联IP"、"验证清理后正常业务服务是否还能正常运行"。就像帮房主换了被撬坏的门锁,却忘记检查窗户有没有也被动过,也没有告诉房主要换银行卡密码(因为入侵者可能看到了放在桌上的密码本)。整改计划在"验证完整性"和"次生风险处置"上的缺失,是AI整改分数系统性低于发现分数的主要原因。
七、给AI配备"侦探手册"能提升多少
为了探索提升AI表现的可能路径,研究团队做了一个额外实验:把安全响应团队多年积累的操作经验,提炼成一套结构化的"技能手册"提供给AI,看看这能把成绩提升多少。这份手册包含了专家进行威胁调查和整改组织的通用流程,以及报告模板和整改模板,但明确排除了任何靶场相关的具体信息(比如具体的恶意文件路径、CVE编号列表等),以确保实验的公平性。
结果显示,这份手册对整改维度的提升效果相当显著,尤其是原本整改分数较低的模型收益最大。GPT-5.4在SSH-Miner靶场上的整改分数从26%提升到83%,在Docker-Escape场景提升了43%;GPT-5.4 Pro在Jenkins-RCE场景提升了45%,在SSH-Miner场景提升了52%。从能力维度来看,手册对持久化发现的提升同样明显,以Claude Opus 4.7为例,其持久化发现率从68%提升到88%,整改分从49%提升到75%。
但这份手册并不是万能药。GLM-5.1在Shiro-Fastjson场景的发现分数反而下降了12%,在Docker-Escape场景下降了11%。研究团队推测,这是因为手册里的排查清单有其边界,当攻击者使用了清单以外的技术手段时,AI反而会"按图索骥"而忽略了对边界之外内容的探索。这说明单靠预定义的操作规程是不够的,AI还需要具备从实际调查过程中学习、根据发现动态调整方向的能力,这是下一步需要解决的核心问题。
成本与性能的关系也是研究发现中的一个有趣侧面。GPT-5.4 Pro每次运行的平均成本高达38.81美元,在所有测试模型中最贵,但其综合表现只在中等水平,发现约72.5%,整改约40.7%。相比之下,GLM-5.1每次成本不到1美元(0.88美元),却能达到76.3%的发现率和59.2%的整改率,性价比相当突出。DeepSeek V4 Pro的单次成本仅0.33美元,但发现率达到73.2%,整改率53.4%。Qwen3.7 Plus每次只需0.31美元,发现率75.6%,整改率58.8%。这意味着在这个特定任务上,高价格并不保证高性能,相反,一些中国模型在极低成本下实现了接近顶尖的表现。
说到底,这项研究揭示的是一个关于AI能力的清醒现实。AI在网络安全响应上已经能够做一些有价值的事情——比传统扫描工具更强,能发现更多攻击痕迹,能给出基本的整改建议——但距离真正可靠的"数字侦探",还有相当长的路要走。最核心的两个短板,一是缺乏主动、系统性地搜查整个"案发现场"的习惯,二是整改方案缺乏完整的闭环验证,这两点合在一起意味着:如果真的把AI单独放在一台遭到入侵的服务器前,它很可能发现不了攻击者留下的所有后门,也无法给出一份真正能让系统"清洁如新"的整改方案。
这对正在推进安全运营AI化的企业来说是一个重要的警示信号:当前阶段,AI更适合作为经验丰富的人工安全分析师的辅助工具,承担初步的告警分析、已知漏洞核查等相对标准化的工作,而不是作为独立的"全权代理"处理真实的入侵事件。研究团队公开了SecRespond的完整数据和评估框架,希望它能成为推动这一领域发展的基准测试,促使未来的AI模型在"主动调查"和"完整整改"这两块硬骨头上取得真正的突破。
Q&A
Q1:SecRespond测试框架是什么,它如何评估AI的安全响应能力?
A:SecRespond是阿里巴巴研究团队构建的一个网络安全基准测试框架,专门用于评估AI在真实入侵事件发生后的响应能力。它包含10个基于真实云服务器构建的"网络靶场",研究人员在真实服务器上执行完整的黑客攻击,然后冻结磁盘快照供AI调查。AI需要交出入侵分析报告、漏洞报告、基线评估报告和整改计划四份成果,由三个独立的强AI模型担任裁判打分,评估维度涵盖入侵实体识别、持久化机制发现、基线风险、漏洞风险和调查质量五个方面,共280个细分检查点。
Q2:AI在网络安全响应中最难克服的两个短板是什么?
A:研究发现AI有两个系统性弱点。第一个是"被动跟线索"而非"主动搜查"——AI倾向于顺着告警提供的线索追查,而不主动对整个服务器进行地毯式排查,导致60%到70%没有触发告警的静默攻击痕迹(尤其是各类持久化后门)经常被漏掉。第二个是"整改不完整"——AI通常只给出第一步最显而易见的修复建议,不会继续追踪泄露凭据的轮换、攻击外联渠道的封锁,也很少建议验证修复后系统是否恢复正常,导致整改方案停在表面而未能彻底"清场"。
Q3:23个AI模型中谁表现最好,国产模型和国际模型相比怎么样?
A:Claude Opus 4.7综合表现最好,发现维度得分79.0%,整改维度65.7%,但即便是这个最高分也意味着仍有大量漏洞未被发现、整改未能完成。值得关注的是,GLM-5.1(76.3%/59.2%)、Qwen3.7 Plus(75.6%/58.8%)和DeepSeek V4 Pro(73.2%/53.4%)表现明显优于GPT系列和Gemini系列,而且成本极低,每次运行费用不到1美元。这说明在网络安全响应这个专业方向上,来自中国研究机构的模型展现出了相当强的竞争力,商业巨头的知名度并不直接转化为专项能力优势。