张
内蒙古大学
毓
内蒙古大学
张
内蒙古大学
毓
内蒙古大学
杨
内蒙古大学
涛
内蒙古大学
姬杨帆
内蒙古大学
顾知义
内蒙古大学
目的是验证仅利用邮件头信息检测垃圾邮件和钓鱼邮件的可行性,并比较监督与无监督模型性能。方法 基于 TREC 2007 和 Monkey.org 数据集,从 76707 封邮件中提取缺失字段、字符串模式、Received 头一致性、域名匹配等 94 项特征,构建 10 种监督模型、单类支持向量机和孤立森林,以准确率、精确率、召回率、F1 值和 AUC 评价性能。结果 垃圾邮件任务中,堆叠集成准确率和 F1 值分别为 .9971 和 .9978,随机森林分别为 .9966 和 .9975;多种监督模型在钓鱼邮件任务中的准确率达到 1.0000。无监督模型中,孤立森林检测垃圾邮件的准确率为 .7592,单类支持向量机检测钓鱼邮件的准确率为 .7403。域名一致性和关键头字段缺失是主要判别特征。结论 邮件头特征能够有效支持异常邮件检测,监督模型整体优于无监督模型,但仍需通过跨来源、跨时间数据验证泛化能力。