问题
内核级安全遥测数据的到达速度超过了任何人工标注的能力,因此一个可部署的检测器必须仅从良性行为中学习,同时依然能够捕获它从未见过的攻击;评估方案还必须在真实的攻击发生率下,保持头条数字的诚实可信。
背景
该数据子集包含347,399个内核进程事件,涉及16个字段,覆盖5个蜜罐主机,取自包含8,004,918个事件的BETH语料库(Highnam et al. 2021):即完整的已标注验证子集,加上一台被攻击主机的158,432个已确认恶意事件,这使得探索性分析中的恶意占比提高到45.6%。两部分标签均由数据集作者手工标注,而检测模型则重采样至更贴近真实情况的1%流行率。
方法
十六个原始字段依照BETH论文的指导,精炼为7个工程特征,一次UMAP投影在任何模型训练之前,就确认了工程化特征空间能够区分两个类别,随后一个拥有300棵树的孤立森林在31,185个仅良性事件上完成拟合。一个60,000个事件的样本,在模拟1%流行率下,以52.5/17.5/30的比例划分为拟合集、验证集与留出集;告警阈值在验证集上最大化F2后冻结,随后才对留出集评分,置信区间来自400次重采样的自助法。
结果
冻结阈值在留出集的180次攻击中检出162次(召回率0.9000;95%置信区间0.85至0.94),同时在17,820个良性事件中标记346个(假阳性率0.0194),ROC AUC为0.9714,PR AUC为0.2972,告警预算为每100k个事件2,822条。精确率落在0.3189:在1%流行率下,大约每三条告警中就有一条命中真实攻击,这是刻意让召回率优先于精确率所付出的代价。
验证范围
恶意类别仅包含单一主机上的一场僵尸网络部署活动,全部流量都来自同一个蜜罐环境,且该数据子集将恶意占比提高到45.6%,只有经过重采样的1%流行率才贴近生产环境;notebook中早期的样本内演示(在默认决策边界下,召回率1.0对应精确率0.034)仅用于说明分数行为,不计入头条结论。
证据
该公开仓库包含带有内嵌输出结果的已执行notebook、九张已提交的图、固定版本的依赖、一个断言关键行数的数据重建脚本,以及一次记录在案的RANDOM_STATE=42重新执行,后者精确复现了每一个头条指标。