Command Palette
Search for a command to run...
Pangram 4 技术报告
Pangram 4 技术报告
Ben Glickenhaus Katherine Thai Jenna Russell Elyas Masrour Yue Han Max Spero Bradley Emi
摘要
我们推出了 Pangram 4,这是 Pangram Labs 最新的基于深度学习的 AI 文本分类模型。我们取得了 0.9916 的 AUROC,同时假阳性率为 0.0041%,假阴性率为 0.3396%。与 Pangram 3 相比,Pangram 4 不仅整体准确率有所提升,还展现出更优的分布外泛化能力和对对抗攻击的鲁棒性。Pangram 4 的另一项新颖贡献在于其区分细粒度编辑和混合 AI 与人类合著文本的能力得到了增强。我们展示了在边界检测任务和交错式 AI 辅助检测方面的改进。最后,我们报告了在标准 AI 检测基准上的指标,结果表明 Pangram 4 在多种场景和领域的 AI 文本检测任务上均达到了最先进的性能。
一句话总结
Pangram Labs和马里兰大学的研究人员推出了Pangram 4,一个基于深度学习的AI文本分类模型,其AUROC达到0.9916,在分布外泛化、对抗鲁棒性以及区分细粒度编辑和混合AI与人类共同创作文本的能力上显著提升,在标准基准上实现了最先进的性能。
核心贡献
- Pangram 4是一个深度学习AI文本分类器,AUROC为0.9916,假阳性率0.0041%,假阴性率0.3396%,在标准AI检测基准上取得了最先进的性能。
- 与Pangram 3相比,该模型展现出更优的分布外泛化能力和对对抗攻击的鲁棒性。
- Pangram 4引入了对混合人类与AI作者身份的细粒度检测,能够实现文档内边界检测和识别交织的AI辅助内容。
引言
AI生成内容在互联网、社交媒体、新闻甚至学术评论中的快速增长,催生了对可靠检测工具的迫切需求,以应对错误信息和给读者带来的认知负担。虽然经验丰富的个人有时可以凭肉眼识别AI文本,但这种人工方法劳动密集且无法规模化,而现有的自动化检测器往往缺乏处理混合人类与AI作者身份或精确定位文档中哪些部分由机器撰写的细粒度能力。作者介绍了Pangram 4,一种新的AI文本检测模型,其假阳性率仅为0.0041%,达到了最先进的准确率。除了文档级分类,Pangram 4还为混合作者文本提供细粒度的片段预测,并展示了对人性化攻击的鲁棒性,为AI在写作中的使用方式提供了更详细的视图。
数据集
作者为Pangram构建了一个多源训练数据集,结合了人类撰写、AI生成和AI辅助的文本。目标是教会模型检测文本是如何产生的,而非其内容是什么。以下是数据集组成、处理和使用方式的细分。
-
总体组成
- 训练集涵盖广泛的领域、语言和生成模型。
- 包含三类文本:人类撰写、完全AI生成和AI辅助(共同创作或润色)。
- 人类撰写的来源通过合成镜像、AI编辑和翻译进行转换,以创建非人类示例。
-
人类撰写子集
- 来源于开放许可或公司拥有的语料库,类似于用于训练大型语言模型的语料。
- 覆盖多个来源、领域和语言(确切规模未披露,但描述为庞大且多样)。
- 明确排除了用户提交的数据、客户API数据以及未经授权的网络爬取内容。
-
AI生成子集(合成镜像)
- 完全在内部使用广泛使用的LLM分布生成。
- 合成镜像过程:
- 提示LLM提取人类撰写文档的主题。
- 提示同一或另一个LLM就该主题撰写一篇新文章。
- 对于问答数据集,问题本身可作为镜像提示。
- 在可用的情况下,使用额外的元数据(文章标题、关键词)来约束生成文本。
- 最终过滤步骤会丢弃任何逐字重复原始文档显著部分的合成镜像,以确保新颖性。
- 该方法强制主题不变性:模型学习区分写作过程而非主题特定模式。
-
AI辅助子集
- 遵循EditLens论文中的方法创建。
- 代表部分AI编辑、混合或共同创作的文本,介于纯人类和纯机器生成内容之间。
-
训练中的使用
- 所有三个子集合并用于训练Pangram。
- 混合比例未详细说明,但数据集旨在让模型接触人类、AI生成和AI辅助写作的现实谱系。
- 除合成镜像和逐字重叠过滤外,未提及裁剪或其他额外的结构预处理。
方法
作者介绍了Pangram 4,一个旨在细粒度token级别识别人类、AI辅助和AI生成文本,同时检测对抗性人性化尝试的模型。整体框架通过重叠窗口处理用户输入,通过共享骨干网络提取多级表示,并将这些特征路由到专用分类头,然后应用校准的结构化解码器。如下图所示:
模型架构 系统的骨干网络基于一个开放权重的混合专家模型。对于长度为S的输入序列,共享骨干网络在每个位置i计算隐藏表示hi∈RD。作者在这些隐藏状态上附加独立的线性分类头以支持多个目标。窗口级任务,包括段落级编辑、混合作者二分类和人性化检测,利用最终监督序列位置hS的表示,以确保分类头在因果注意力下关注完整的输入窗口。
为了实现细粒度的token级预测,一个共享的线性token分类头对每个hi应用线性投影,生成logits Ztok∈RS×3,对应类别{人类, AI辅助, AI生成}。由于因果注意力将token的上下文限制为其前缀,作者采用了Repeat2策略。输入序列被复制为x=(x1,…,xS,x1,…,xS),使得第二份副本中的每个被监督token都能访问完整的文档上下文。损失在第一份副本上被屏蔽,仅监督第二份副本。
训练过程 作者利用两阶段训练过程来优化计算效率。在第一阶段,他们训练一个仅受段落和人性化目标监督的检查点。然后将LoRA适配器合并到基础模型中,初始化一个新的适配器,并进入第二阶段,该阶段加入了计算量更大的token级目标。随后,一个离线主动学习循环通过在预留数据池上运行推理来识别困难负样本。被误分类为AI的人类文本被合成镜像化并重新引入训练流程,以细化模型的决策边界。
Token级后处理流程 在推理过程中,长文档被分割成512个token的重叠窗口,步长为256。对每个窗口应用Repeat2构建,模型输出段落级分布、token级logits和混合文档概率。
后处理算法将这些观察结果聚合为一个统一的解码问题。首先,15桶段落头估计加权AI比例,该比例使用三角基函数投影到三个类别锚点上,形成三元文档先验。原始token和段落logits在所有包含特定token的窗口上取平均,创建一个6维校准特征向量xi。然后,一个多项逻辑校准模型计算条件随机场一元势ui(c)=αc+wc⊤xi+δc。
这些校准的一元分数定义了一个三状态线性链条件随机场。Potts转移势τi(a,b)结合了平滑惩罚λ和混合证据松弛参数γ。使用多类Viterbi解码计算最大后验标签序列。最后,作者通过对每个句子内的token进行多数投票,并合并低于可配置最小长度阈值的连续标签段,来强制执行句子级分辨率,确保鲁棒且精确的边界检测。
实验
Pangram 4在跨领域、语言和对抗场景的人类、AI生成和AI辅助文本上进行了评估,使用了合成基准和公开语料库。它实现了极低的假阳性和假阴性率,较先前版本有显著改进,并展示了在细粒度上对混合人类与AI作者身份的强检测能力。该模型表现出鲁棒的多语言性能,对非母语英语没有偏见,并对人性化工具和红队攻击具有韧性。
使用注意力和密集LoRA模块的候选模型A在低假阳性率(0.42%)下实现了最低的假阴性率(0.93%)。基于MoE的骨干网络在仅注意力LoRA下表现最佳;添加路由专家模块严重降低了性能,特别是对于候选模型B,假阴性率上升至85%。候选模型A(注意力+密集LoRA)在所有配置中实现了最佳的假阴性率(0.93%)和假阳性率(0.42%)。对于MoE骨干网络,在LoRA中针对路由专家导致假阴性率大幅增加,候选模型B的假阴性率从1.18%跃升至85.03%。
Pangram 4分两阶段训练以优化效率。阶段1仅使用单副本输入上的段落级和人性化目标引导表示,而阶段2合并LoRA适配器,并添加token级和混合作者头,采用Repeat2输入方案,吞吐量减半。人性化损失在两个阶段都使用停止梯度,以防止更新共享骨干网络。阶段1仅在单副本输入上训练段落级编辑头和人性化头,通过停止梯度将骨干网络与人性化损失隔离。阶段2合并阶段1的适配器,然后添加token级来源和混合作者头,同时通过Repeat2处理512个token的窗口,与单副本输入相比,吞吐量大约减半。
Pangram 4在520,000个样本的基准上将总体假阴性率降至0.3396%,较先前版本的1.9942%有显著改进。在生成模型家族中,Anthropic的Claude模型总体假阴性率最低,为0.195%,而OpenAI模型为0.316%。未观察到模型发布日期与其假阴性率之间存在有意义的关联。在相同数据集上,总体假阴性率从Pangram 3.3.2的1.9942%降至Pangram 4的0.3396%。Anthropic的Claude家族总体假阴性率从1.002%降至0.195%。Claude Haiku 4.5在Pangram 4下记录了最低的个体假阴性率,为0.130%。每个列出的生成模型在Pangram 4下的假阴性率均低于先前版本。OpenAI模型的假阴性率为0.316%,高于Anthropic家族的总体水平。
在AI润色评估集上,Pangram 4将AI假阳性率降至接近零(0.01%),而Pangram 3.3.2为0.18%,同时更频繁地将轻度AI编辑的文本正确标记为混合(0.54% vs 0.12%)。这表明对轻微AI编辑和完全AI生成内容的区分能力有所提高。Pangram 4在AI润色文本上的AI假阳性率降至0.01%,比Pangram 3.3.2的0.18%降低了17倍。混合分类率从0.12%上升到0.54%,显示Pangram 4更有可能识别AI辅助写作,而不会将其误分类为完全AI生成。
在大量AI编辑的学生论文数据集上,Pangram 4正确识别混合作者身份的比例为55%,是先前版本5.5%的十倍。它将主要预测从人类转变为混合,同时将完全AI分类降至仅3.6%。Pangram 4的AI辅助召回率从5.54%上升到55.01%,将AI编辑的文本标记为混合的频率提高了十倍。该模型现在对大多数AI辅助文本预测为混合(55.01%),而先前版本将79.23%标记为人类。
实验评估了Pangram 4,一个使用带有注意力和密集模块的LoRA适配器进行两阶段训练的AI文本检测器,在大型基准和专门测试集上的表现。该模型实现了总体假阴性率的大幅降低,AI润色文本上的假阳性率接近零,以及在大量AI编辑的论文上混合作者召回率提高十倍。MoE骨干网络在仅注意力LoRA下表现最佳,因为针对路由专家会严重降低检测性能。这些结果证明了对轻微AI编辑和完全AI生成内容的区分能力有所提高,并且在不同生成模型家族中表现稳健,与模型发布日期无关。