HyperAIHyperAI

Command Palette

Search for a command to run...

人工智能在银行欺诈操作识别中的应用

Bohdan Mytnyk Oleksandr Tkachyk Nataliya Shakhovska Solomiia Fedushko Yuriy Syerov

摘要

本研究探讨将人工智能应用于银行欺诈识别的任务。近年来,受 COVID-19 疫情影响,大量业务向线上平台迁移,同时涌现出许多被犯罪分子用于欺骗用户的慈善基金,导致银行欺诈变得更为普遍。本文重点关注机器学习算法,将其作为分析和识别在线银行交易的适用工具。研究的科学创新点在于开发了用于识别欺诈性银行交易的机器学习模型,以及用于预处理银行数据以便进一步比较和选择最佳结果的技术。本文还详细阐述了多种提升检测精度的方法,例如处理高度不平衡数据集、特征变换和特征工程。所提出的模型基于人工神经网络,有效提高了欺诈交易检测的准确率。对不同算法的结果进行了可视化,其中逻辑回归算法表现最佳,输出的 AUC 值约为 0.946。堆叠泛化方法则取得了更优的 AUC 值 0.954。利用人工智能算法识别银行欺诈是当今数字社会中一个极具现实意义的课题。

一句话总结

来自利沃夫国立理工大学和布拉迪斯拉发夸美纽斯大学的研究人员提出了用于欺诈性银行交易识别的机器学习模型,采用特征工程和堆叠泛化来处理不平衡数据,实现了0.954的AUC,从而展示了数字银行中检测准确率的提升。

核心贡献

  • 论文引入了预处理技术,包括数据平衡、特征变换和特征工程,以处理用于欺诈检测的高度不平衡的银行交易数据。
  • 提出了一种基于神经网络的模型,有效提高了欺诈交易识别的准确率。
  • 对比实验表明,逻辑回归的AUC为0.946,而采用输出变形的堆叠泛化模型将AUC进一步提升至0.954。

引言

受COVID-19疫情和乌克兰战时筹款活动的推动,网上银行的快速普及使得自动欺诈检测成为保护客户和金融机构免受电信诈骗、身份盗窃、账户接管和洗钱损失的关键。此前用于交易分类的机器学习方法常常在模型透明度、数据不平衡和隐私问题方面遇到困难,且许多研究并未解决在数字活动高峰期间实时在线欺诈的独特挑战。在这项工作中,作者开发并比较了多种分类算法与预处理技术相结合的方法,用于识别欺诈性银行交易。他们进一步提出了一种堆叠泛化方法,通过对弱分类器输出进行变形,相比最佳单一模型取得了轻微的AUC提升,其中逻辑回归实现了最高的单一模型AUC,约为0.946。

数据集

作者使用了Kaggle(mlgulb/creditcardfraud)上的信用卡欺诈检测数据集。该数据集包含欧洲持卡人在两天内进行的284,807笔交易,其中仅有492笔为欺诈交易——这是一个高度不平衡的分布。

  • 特征:大多数变量经过PCA变换以保护用户隐私;只有时间(自第一笔交易以来的秒数)和金额(交易价值)保留了原始形式。
  • 预处理
    • 标准化:时间和金额列被标准化为零均值和单位方差(z-score)。
    • 欠采样:随机欠采样减少多数类样本,直到数据集平衡,以解决严重的类别不平衡问题。
  • 使用:平衡和标准化后的数据集用于训练和评估七种分类算法:随机森林、k近邻、逻辑回归、线性判别分析、决策树、朴素贝叶斯和支持向量机。性能通过ROC曲线和AUC分数进行评估。
  • 比较:已有超过4,050个笔记本基于此数据集构建,使作者能够将他们的结果与现有方法进行基准比较。

方法

作者利用有监督机器学习框架来解决信用卡欺诈检测问题。整体工作流被构建为一个顺序管道,将原始交易数据转化为稳健的预测模型。

如下图所示:

该过程从数据集加载开始,作者在此使用了信用卡欺诈检测数据集。由于大多数特征已通过主成分分析匿名化,作者专注于对未加密的时间和金额变量进行标准化。标准化使变量以均值为中心,具有单位标准差,表达为:

X=XμσX^{\prime} = \frac{X - \mu}{\sigma}X=σXμ

其中 μ\muμ 是数学期望,σ\sigmaσ 是标准差。

标准化之后,作者对训练集应用随机欠采样。该技术随机移除多数类中的样本以平衡类别分布,确保模型不会偏向主导类别。

数据预处理完成后,作者进行模型拟合。他们评估了一组不同的候选算法,包括随机森林、K近邻、逻辑回归、随机梯度下降、决策树、朴素贝叶斯和支持向量机。对于每个模型,都使用交叉验证进行超参数调优,以找到最佳配置。

为了进一步提高预测准确性,作者探索了堆叠泛化。该方法集成多个底层模型以改进高层元模型。作者从原始数据中生成 KKK 个横截面数据集,用于训练 KKK 个独立的弱分类器 f1(),,fk()f_1(\cdot), \dots, f_k(\cdot)f1(),,fk()。然后使用元模型 mmm 组合结果:

res=m(f1()×f2()××fk())\mathrm{res} = m(f_1(\cdot) \times f_2(\cdot) \times \dots \times f_k(\cdot))res=m(f1()×f2()××fk())

其中,变换后的特征与训练数据集结合,以提高泛化能力。

最后,管道以模型测试和输出最佳模型结束。作者使用接收者操作特征曲线和曲线下面积指标来评估模型。该曲线绘制了在不同分类阈值下的真阳性率与假阳性率。真阳性率定义为:

TPR=TPTP+FNTPR = \frac{TP}{TP + FN}TPR=TP+FNTP

假阳性率定义为:

FPR=FPFP+TNFPR = \frac{FP}{FP + TN}FPR=FP+TNFP

其中 TPTPTP 代表真阳性,FNFNFN 代表假阴性,FPFPFP 代表假阳性,TNTNTN 代表真阴性。在测试数据上取得最高指标的模型被选为最终输出。

实验

该研究在一个高度不平衡的信用卡欺诈数据集上评估了多种分类器,并应用标准化和随机欠采样进行预处理。在单一模型中,逻辑回归取得了最高的AUC,为0.946,但ROC曲线表明所有算法表现相似。一个堆叠泛化集成模型进一步提升了结果,F1分数达到0.96,优于单一最佳分类器。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供