HyperAIHyperAI

Command Palette

Search for a command to run...

2 小时前
LLM

AISPA:面向大语言模型应用的用户中心化系统提示审计框架

摘要

系统提示是开发者配置的指令,用于管控 AI 应用中基础模型的行为。它们广泛应用于商业 AI 产品,但极少向公众或监管机构披露,这在 AI 系统的大规模部署中造成了严重的信任与问责鸿沟。本文提出人工智能系统提示保障(AISPA)框架,这是一个以用户为中心、用于系统化审计 AI 系统提示的框架。AISPA 检查系统提示的特定部分,并沿八个与用户息息相关的维度进行评估:AI 是否对其身份保持透明、是否提供真实信息、是否保护隐私、是否安全行事、是否尊重用户控制并避免操纵、是否妥善处理不安全请求、是否有助于防止伤害,以及是否支持公平、包容与中立。我们随后利用该框架审查了 88 个商业 AI 产品系统提示中的 3,249 条指令,将每条指令分类为保护性(对用户有利)或问题性指令。我们的审计揭示了四项核心发现。第一,系统提示的设计在不同产品和开发者之间差异显著,部分机构平均每个产品包含超过 60 条保护性指令,而另一些机构平均不足 5 条。第二,保护性指令被广泛采用但覆盖范围较浅:98.9% 的产品至少包含一条保护性指令,但仅有 24% 的产品覆盖了 AISPA 分类体系的所有八个维度。第三,系统提示的长度持续增长且对用户的保护性日益增强,这表明用户保护正成为商业提示设计中一个愈发受到关注的议题。第四,尽管取得了这些进展,问题指令依然普遍存在:约 40% 的产品至少包含一条违背用户利益的指令,且保护性指令与问题指令经常共存于同一提示中。我们的发现凸显了商业 AI 产品系统提示在透明度、标准化和独立监督方面的迫切需求。

一句话总结

斯坦福大学、卡内基梅隆大学、德克萨斯大学奥斯汀分校等机构的研究人员提出AISPA,一个以用户为中心的框架,用于系统性地审计商业AI产品中的系统提示,涵盖透明度、安全性和公平性等八个维度。他们对来自88个产品的3,249条指令的分析表明,虽然保护性指令普遍存在,但40%的产品仍包含至少一条问题指令,凸显了加强透明度、标准制定和独立监督的必要性。

核心贡献

  • AISPA,一个以用户为中心的审计框架,提供了一个八维分类法和一个人机协同工作流,用于系统性地评估系统提示。
  • 该框架被应用于审计来自88个商业AI系统提示的3,249条指令,将每条指令分类为保护性或问题性。
  • 审计结果显示,98.9%的产品至少包含一条保护性指令,但仅有24%覆盖了全部八个维度,约40%包含与用户利益相悖的指令。

引言

系统提示是隐藏的、由开发者编写的指令,它们将通用LLM配置成特定产品,定义其角色、边界和安全行为。尽管它们有能力塑造数十亿用户的交互,但很少被披露,也缺乏任何系统性审查,形成了治理空白:现有的安全工作将系统提示视为需要防御攻击的可信构件,而非独立审查的对象。作者提出AISPA,一个以用户为中心的审计框架,建立在从人权原则衍生出的八个维度之上,并采用人机协作流水线。将该框架应用于审计88个商业系统提示后,他们发现,虽然保护性指令有所增长,但约40%的产品仍包含损害用户利益的指令,全面覆盖的情况很少见,且反复出现一类“灰色地带”指令难以简单归类为安全与否,这凸显了第三方提示审计的必要性。

数据集

作者构建了一个包含88个商业AI产品系统提示的数据集,数据来源于六个开源GitHub仓库,其中包含泄露或公开披露的提示。该语料库涵盖通用聊天机器人、编程助手、自主agent、搜索与研究工具及其他专业应用。

  • 收集与验证:提示从六个仓库中收集。通过与仓库维护者联系了解其策展流程,并交叉比对同一产品在不同独立来源中的提示来计算内容重叠,以验证真实性。
  • 标注流程
    • 第一轮:Claude-4.6-Opus作为预标注器,生成候选文本段。
    • 第二轮:六名经过训练的标注员独立筛选候选段。他们首先在20个文本段上完成校准练习,两两标注员间一致性达到0.933。
    • 第三轮:三位专家共同审查剩余案例并裁定最终标签。 该流程从1,818个唯一文本段中产生了2,420条条目。
  • 标签分布:2,346条条目被标注为保护性指令(+1),74条为问题指令(−1),另有44条条目(涉及29个文本段)被标记为“灰色地带”案例,供单独分析。
  • 论文中的使用:该数据集即审计语料库。作者未将其划分为训练集和测试集,而是直接对所有收集到的提示应用三轮标注流程。得到的标注文本段用于研究现实世界系统提示中保护性指令与问题指令的普遍性和性质,灰色地带案例则在专门的分析章节中加以探讨。

方法

作者提出了人工智能系统提示保障(AISPA),一个以用户为中心的框架,旨在评估大语言模型应用中的系统提示。与专注于防御外部对抗攻击的传统安全方法不同,AISPA旨在保护用户免受源自AI系统本身的危害。该分类法以《世界人权宣言》为基础,确保审计维度与用户基本权利相对应。

如下图所示,该分类法包含八个不同的维度。每个维度作为一个单一轴,用于将提示文本段评估为保护性或问题性,从而无需为安全防护和有害行为分别建立分类法。

这些维度包括身份透明度、真实性与信息完整性、隐私与数据保护、工具与行动安全、用户自主性与防操纵、不安全请求处理、危害预防与用户安全,以及公平性、包容性与中立性。例如,身份透明度评估系统是否披露其AI本质(保护性)或隐瞒(问题性)。

为使该分类法可操作化,作者定义了以提示文本段为基本分析单元的具体审计指南。一个文本段通常是传达一条独立指令的单个句子。该框架区分了核心逻辑段和非核心逻辑段,核心逻辑段定义基本产品功能,被排除在审计之外;非核心逻辑段则施加具有伦理或安全影响的补充行为指令。附加在核心逻辑段上的补充子句同样可审计。

对于每个可审计的文本段,框架在相关维度下分配极性:+1+1+1表示保护性(促进透明度、安全等),1-11表示问题性(鼓励欺骗、不安全行为等)。

有关这种文本段级别审计过程的图示,请参阅框架图。

在所示示例中,一个有关数据隐私的保护性文本段被标注为隐私与数据保护下的+1+1+1,而一个指示AI隐瞒其本质的问题文本段被标注为身份透明度下的1-11

作者形式化了一个实用的审计工作流,将基于LLM的分析的可扩展性与人类判断的可靠性相结合。这通过一个三轮协作审计协议实现。

如下图所示,该流水线从第一轮开始,LLM作为专家预标注器。模型将系统提示分解为候选文本段,识别可审计范围,并提出带有理由的临时维度与极性分配。此阶段最大化召回率。

在第二轮中,经过培训的人类标注员筛选LLM提议以强制精度。经过校准阶段后,标注员独立审查候选段,拒绝无支持的标签,并识别遗漏的文本段。最后,第三轮由三位领域专家进行审查,验证正确性并解决分歧。此处应用严格的不对称阈值:问题标签(1-11)仅在所有三位专家一致同意时才保留,这反映了在声誉受损方面误报的高风险。这种分工确保了全面覆盖、高精度和规范性一致性。

实验

对商业AI应用中系统提示的系统性审计表明,虽然保护性指令已近乎普遍,且随时间推移在长度和覆盖范围上有所增长,但问题指令仍存在于约三分之一的产品中,而覆盖全部八个安全维度的全面保护依然罕见。组织层面的分析显示,Anthropic和OpenAI等领先供应商在增加安全防护的同时最小化有害指令,而其他供应商如Venice则表现出问题性内容多于保护性内容,编程助手如GitHub和Cursor则显示出自主执行与用户自主性之间的张力。审计还识别出一个重要的灰色地带案例——包括人类模仿、准社会依赖线索、用户启用的安全覆盖以及涉及政治内容政策——这些案例凸显了可用性与用户保护之间的设计权衡,表明保护性指令的存在并不能保证其被遵守。

AISPA分类法将系统提示指令组织为八个维度,每个维度涵盖保护性和问题性示例。保护性指令强调透明度、真实性、安全性和用户自主性,而问题性指令则隐藏AI身份、压制信息、操纵对话或削弱安全默认设置。观察到的模式表明,许多问题性指令源于设计权衡,例如培养准社会纽带或允许用户覆盖,模糊了用户体验与用户保护之间的界限。身份透明度包括明确的AI披露和明确的隐瞒,展示了该维度的双向性。真实性与信息完整性因隐藏触发的动作未被执行而受到损害。隐私与数据保护将通知用户有关共享数据与无声地纳入个人信息而不作解释进行了对比。用户自主性与防操纵的范围从仅做被要求的事情,到使用脚本引导对话并在未经用户同意的情况下阻止结束。不安全请求处理可以是保护性的,通过优先考虑安全规则而非用户请求,也可以是问题性的,通过完全移除内容限制。危害预防与用户安全则显示出在处理情绪困扰信号与完全拒绝讨论任何敏感话题之间的分歧。

AISPA分类法将系统提示指令归类为八个保护性与问题性维度,揭示了众多有害指令源自用户体验与安全之间的设计权衡,例如培养准社会纽带或允许用户覆盖。关键模式包括双向身份透明度(明确AI披露 vs. 隐瞒)、因静默失败而损害的真实性、通过未披露数据使用造成的隐私泄露,以及通过脚本化对话引导进行的操纵。该分类法还凸显了不安全请求处理与危害预防方面的不同方法,从优先考虑安全规则到完全移除限制,展示了保护与问题设计之间的模糊界限。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供