Command Palette
Search for a command to run...
修辞如何对 AI 审稿人实施奖励黑客攻击?剖析 AI 同行评审中的修辞敏感性
修辞如何对 AI 审稿人实施奖励黑客攻击?剖析 AI 同行评审中的修辞敏感性
Ming Li Chenguang Wang Xirui Li Xinyue Zeng Dianqi Li Peng Shi Dawei Zhou Tianyi Zhou
摘要
随着大语言模型日益参与科学评价,我们研究了一种潜在的奖励黑客形式:在保持所报告科学内容不变的情况下,修辞选择如何塑造 AI 评审判断,以及这些效应在不同评价条件下如何变化。我们基于 120 篇匿名化的 ICLR 2026 投稿,构建了一个包含 4200 篇完整论文手稿的受控语料库。两个 LLM 改写器沿相反方向变换六个修辞维度,五个 LLM 审稿人在标准协议和严格协议下对生成的手稿进行评价。我们还测试了联合改写、递归改写和审稿人引导改写。结果表明,修辞敏感性是结构化的,而非均匀分布。证据框架和新颖性立场在总体评价中产生了最大的正负对比,范围框架构成较弱的第二层级;其余维度的效应较小或较不稳定。这一层级在不同人类评估质量水平上持续存在,但分数变动强烈依赖于 AI 审稿人的原始分数:低分倾向于上升,高分倾向于下降,方向性对比在中间分数段最为清晰。更复杂的工作流程并不能可靠地带来更大收益。联合改写强烈依赖于改写器,审稿人引导并不一致地优于无引导的二次改写,而重复改写带来的收益递减且依赖于具体配置。在各种条件下,改写器主要决定对立变体之间的分离程度,而审稿人决定其分数效应的幅度和方向。严格评审使平均 OA 降低 1.36 分,但并未一致地改变修辞敏感性。这些发现明确了修辞呈现何时会影响 AI 科学评审,并推动构建对科学写作中内容保持型变异具有鲁棒性的评价系统。
一句话总结
在一项使用 4,200 份经重写的 ICLR 2026 手稿并交由两个 LLM 重写模型和五个 LLM 审稿模型评分的对照研究中,来自马里兰大学、弗吉尼亚理工大学、MBZUAI 和滑铁卢大学的研究人员发现,证据框架和新颖性立场对 AI 审稿判断的改变最大,严格审稿使平均总体评估(OA)降低 1.36 分,并且评估系统应对保持内容的写作变化保持稳健。
核心贡献
- 本文引入了一个端到端的对照分析框架,该框架使用两个 LLM 重写模型和五个 LLM 审稿模型,分析由 120 份匿名化 ICLR 2026 投稿衍生的 4,200 份全文变体,支持在六个修辞维度上进行单维度、联合、递归和审稿人引导的重写。
- 本文提供了一个面向完整 LaTeX 项目的 agentic 源文件级重写工具,该工具施加内容保持约束、程序化检查、编译和修复,以生成可审阅的全文变体。
- 结果表明修辞敏感性是有结构的而非均匀的:证据框架和新颖性立场在总体评估中产生最大的正负对比,范围框架构成较弱的第二层级,并且这些效应在人类评估质量水平上持续存在,同时取决于 AI 审稿模型的原始评分。联合重写强烈依赖于重写模型,审稿人引导并不总是优于无引导的第二轮,重复重写产生递减的、取决于配置的收益,严格审稿使平均总体评估降低 1.36 分,而未一致地改变修辞敏感性。
引言
随着大语言模型既被用于帮助作者修改手稿,也被用于自动化科学同行评审,修辞呈现可能独立于科学价值影响 AI 判断的风险日益增加。已有研究表明,LLM 审稿模型可能受到行文冗长程度、位置、元数据、对抗性扰动和仅改变呈现的改写的影响而产生偏差,但现有研究并未系统地将修辞变化与底层科学内容分离,也未梳理哪些修辞维度驱动评分变化。作者的主要贡献是一个对照分析框架,该框架将 agentic 全文重写工具与多模型 AI 审稿相结合,使用来自 ICLR 2026 投稿的 4,200 份手稿以及沿相反方向变化的六个修辞维度,衡量保持内容的呈现变化如何影响审稿评分。
数据集
作者从 ICLR 2026 投稿及匹配的公开 arXiv 来源构建了一个对照数据集。
- 语料来源与筛选: 投稿通过 OpenReview API 获取。仅当论文具有有效评估和审稿意见时予以保留;已撤回和直接拒稿的论文被排除。
- 基于评分的抽样: 论文按人类总体评分均值的六个区间抽样:[1, 3)、[3, 4)、[4, 5)、[5, 6)、[6, 7) 和 [7, 8.5]。作者每个区间选择 20 篇论文,共 120 篇。
- 来源匹配: 候选的公开 arXiv LaTeX 源码使用手稿元数据与 OpenReview 投稿匹配。当 arXiv 记录存在多个版本时,作者使用基于 token 的余弦相似度和 5-gram Jaccard 相似度比较标准化后的源文本与 OpenReview PDF,并保留总体对应最强的版本。
- 匿名化与基线构建: 一个 agentic 匿名化 LLM 删除作者姓名、单位、致谢、投稿状态声明以及携带身份信息的资源链接。源文件差异检查将编辑限制在身份相关和状态相关区域。作者人工检查编辑后的源文件和编译生成的 PDF,对照投稿确认身份信息已被删除,而其他内容保持不变。该经过验证的项目成为公共基线。
- 对照重写变体: 每个基线被用于在六个维度上独立生成正向和负向修辞变体:主张与新颖性立场、范围与泛化、定量证据框架、贡献结构、技术语体与形式化、词汇与句法复杂度。每次重写将特定维度的指令与项目级内容保持约束相结合。
- 用途: 所得数据集被用作对照分析基准,其中相同的底层科学内容在不同修辞呈现下被评分。该设计将方向性修辞敏感性与由重写本身引起的评分移动区分开来。文本未描述该语料的训练划分或混合比例。
方法
作者设计了一个对照分析框架,用于隔离修辞呈现如何影响 AI 审稿判断,同时保持底层科学内容不变。该框架由三个阶段组成。首先,构建经验证的手稿基线和受控的修辞变体。其次,所有手稿在盲法 AI 审稿条件下进行评估。第三,在同一论文内比较判断结果,使评分变化能够归因于特定的修辞变化,而非科学贡献的差异。该框架涵盖单维度、联合、递归和审稿人引导的重写。
在基线构建方面,作者通过 OpenReview API 收集 ICLR 2026 投稿的种子语料。仅保留具有有效评估和审稿意见的投稿,排除已撤回和直接拒稿的论文。为覆盖广泛的质量范围,作者从人类总体评分均值的六个区间中每个区间抽样 20 篇论文,共 120 篇。候选的公开 arXiv LaTeX 源码使用手稿元数据与 OpenReview 投稿匹配。当 arXiv 记录存在多个版本时,作者使用基于 token 的余弦相似度和 5-gram Jaccard 相似度比较标准化后的源文本与 OpenReview PDF,保留总体对应最强的版本。在重写之前,一个 agentic 匿名化 LLM 删除作者姓名、单位、致谢、投稿状态声明以及携带身份信息的资源链接。源文件差异检查将编辑限制在身份相关和状态相关区域,并且对编辑后的源文件和编译生成的 PDF 进行人工检查,确认身份信息已被删除而其他内容保持不变。该经过验证的项目成为公共基线,每个受控变体均从该基线独立生成。
修辞干预设计定义了六个预先指定的呈现维度,这些维度取自主要 AI 会议使用的审稿指南:主张与新颖性立场、范围与泛化、定量证据框架、贡献结构、技术语体与形式化、词汇与句法复杂度。对于每个维度,作者从同一基线生成正向和负向变体。这种双向设计将方向性敏感性与由重写本身引起的评分移动区分开来,因为两个变体共享同一原始手稿。
源文件级重写工具作用于完整的 LaTeX 项目。GPT-5.5 通过 Codex CLI 以及 Opus 4.8 通过 Claude Code 检查每个项目,识别可编辑的手稿正文,并将要求的干预贯穿整个叙述。重写范围刻意较广:agent 可以修改措辞、组织结构、强调、图表标题、表格以及全文中对报告结果的呈现和解读。然而,提示级约束要求保留底层方法、实验设置、报告数值和比较、证据边界、实质性发现和科学含义,而无需句子级语义等价。编辑后,程序化检查器将受保护的结构锚点与匿名化基线进行比较。这些锚点包括引用键和交叉引用键、标签、URL、图形路径、受支持的数学环境、代码和算法环境以及参考文献文件。检测到的违规将被返回给重写 agent 进行修复,未解决的违规或编译失败会导致输出被丢弃。
在单维度工作流中,每个重写模型从同一匿名化基线独立生成全部六个维度的两个方向。这为每篇论文和每个重写模型产生 12 个变体。没有任何单维度干预在另一个之上应用,因此每个变体代表对一个修辞轴的干净方向性操纵。
增强型重写工作流建立在单维度设置之上。联合重写将全部六个修辞维度的正向合并到一个提示中,并同时应用于匿名化原始 LaTeX 项目。模型加强有依据的论断和新颖性陈述,仅在合理处拓宽范围,突出已有的定量证据和贡献,提高技术精确性,并使用更精练但可读的学术写作。这些目标在段落层面联合应用,而非作为六次顺序编辑或句子级清单。递归重写将联合程序应用于三轮,其中第一轮重写匿名化原始稿,随后每一轮使用相同提示和保持要求重写前一轮的输出。
审稿人引导的重写是两阶段过程。联合重写首先生成一份中间手稿。随后从重写骨干模型在编译生成的中间 PDF 上获取一份标准审稿,并对结构化审稿进行验证。在第二阶段,同一重写模型接收中间项目以及经验证的审稿 JSON、完整的六维度提示和共享的保持要求。要求其保留优势、通过手稿修改应对弱点和问题,并对审稿中认为过度、夸大、范围过宽、过于正式或不必要复杂的任何修辞维度进行调适。
在评估方面,每份匿名化原始稿和重写后的源文件被编译为 PDF,并由 Gemini 3.5 FL、Qwen 3.5 F、GPT-5 mini、GPT-5.5 或 Sonnet 5 独立评估。审稿模型不被告知重写条件或重写模型。固定标准提示遵循常规会议评分细则。严格提示额外要求高评分需要具体证据,并指示审稿模型除非呈现变化改变科学评估,否则不应给予加分。两种提示均请求结构化审稿和与 ICLR 指南一致的数值评分。总体评分是主要结果,而健全性、表述和贡献是次要结果,审稿人置信度是辅助诊断指标。弱接受概率定义为总体评分为 6 或更高的评估所占比例。
配对分析对同一论文、同一审稿模型和同一提示下的每次重写与匿名化原始稿进行比较。这种匹配比较在保持评估条件不变的情况下衡量评分是否移动、朝哪个方向移动以及移动多少。作者还比较同一重写模型下同一维度的正向和负向变体,从而提供方向性分离,而非仅由重写引起的移动。对于汇总分析,匹配效应首先在每篇论文内取平均,然后按六个人类评分分层以等权重汇总。标准协议和严格协议分别分析,固定模型分析保持审稿模型和重写模型不变。作者报告有符号的平均变化、平均绝对移动以及基于 5,000 次分层内论文级 bootstrap 重采样的 95% 百分位区间。缺失结果保持缺失,不进行插补。估计值按其幅度、方向和跨审稿模型、重写模型及评估协议的一致性进行解释。
实验
评估设置将匿名化原始稿与保持内容的修辞重写配对,并要求多个 AI 审稿模型在标准和严格提示下对其评分,分析总体评分、弱接受概率和次要评分中的匹配变化。证据框架和新颖性立场产生最大且最一致的效应,其次是范围框架,而 AI 审稿模型的初始评分强烈制约移动方向。更复杂的联合或迭代重写产生依赖于重写模型的递减收益,严格提示主要降低评分而未能一致地降低修辞敏感性;重写模型塑造对比,而审稿模型在如何将变化转化为评分和评分细则维度上存在差异。
一个受控评估语料由 120 份匿名化 ICLR 2026 投稿构建,通过保持内容的修辞重写扩充为 4,200 份全文手稿。该框架在两个重写模型上沿相反方向变化六个修辞维度,并包含单维度、联合、递归和审稿人引导的重写。该设计支持在盲法条件下的论文内比较,以考察修辞如何影响 AI 审稿判断。六个修辞维度在两个相反方向上变化,产生十二种干预条件。两个重写模型生成手稿变体,而多个审稿模型评估这些变化如何转化为评分。单维度重写构成最大的对照子集,联合、递归和审稿人引导的重写增加了更广泛的呈现变化。审稿模型通常偏好相同的修辞方向,但在评分相对于原始稿上升还是下降上存在分歧。严格审稿向下重新校准评分,但未一致地降低或加强对修辞的敏感性。相同的修辞变化在不同审稿模型上映射到科学价值维度的方式不同,限制了评分细则层面的可解释性。
一个受控重写框架在保持底层科学内容的前提下沿相反方向变化六个科学修辞维度。审稿模型通常偏好更自信的新颖性主张、更广的有支持范围以及更强的证据强调,但它们在评分上相对于原始稿上升还是下降存在分歧。严格提示总体上降低评分,而未一致地使审稿结果对保持内容的修辞更加不敏感。修辞干预空间包括新颖性立场、范围框架、证据框架、贡献显著性、技术语体和语言复杂度。更自信的新颖性主张、更广的有支持范围以及更强的证据强调通常在各审稿模型之间被偏好,尽管对评分的影响因审稿模型而异。审稿模型的选择塑造修辞干预如何转化为评分,而重写模型的选择主要影响修辞对比的强度。
修辞对 AI 审稿评估的影响集中在证据框架和新颖性立场上,范围框架构成较弱的第二层级。正向证据、新颖性和范围变体往往被偏好于负向变体,尽管效应大小和方向因审稿模型而异。其余维度显示出较小或较不稳定的变化。证据框架和新颖性立场产生最大的正负对比,其次是范围框架。正向新颖性、证据和范围变体在展示的配置中受到偏好,而负向变体通常降低评估。新颖性和范围效应主要以惩罚为驱动,而证据框架在两个方向上推动评估。审稿模型的选择塑造效应的幅度和符号,Sonnet 5 将变化向下推移,而其他审稿模型显示更宽的响应分布。
在标准评估下,总体评估的平均变化取决于修辞维度、重写模型和审稿模型。在展示的较低人类评分质量范围内,新颖性、证据和范围框架产生最清晰的正负对比,正向变体通常提高评分,负向变体降低评分。审稿模型在评分变化的总体水平和符号上存在差异,Qwen 3.5 F 和 GPT-5 mini 趋向正向,GPT-5.5 混合,而 Sonnet 5 持续为负。新颖性、证据和范围框架显示最清晰的正负对比;正向变体倾向于提高评分,负向变体倾向于降低评分。技术、贡献和词汇维度显示更多混合或依赖于审稿模型的效应。审稿模型在符号和幅度上不同:Qwen 3.5 F 和 GPT-5 mini 通常平均提高评分,而 Sonnet 5 将大多数效应向下推移。在此质量范围内,重写效应未显示出与论文质量相一致的敏感性梯度。
在标准评估下,AI 审稿模型的初始评分强烈预测评分移动的方向,低初始评分倾向于上升,高初始评分倾向于下降。在最低的原始评分范围内,修辞重写在所有维度上产生以正向或中性为主的平均变化,幅度依赖于审稿模型。证据框架和新颖性立场显示最大且最一致的对比,而范围框架构成较弱的第二层级。对于最低的原始 AI 评分范围,平均变化在所有修辞维度上以正向或中性为主,最大的增幅来自 Qwen 3.5 F 和 GPT-5 mini。证据框架和新颖性立场产生最大且最一致的对比,而范围框架是较弱的第二层级,评分移动与 AI 审稿模型的初始评分关联更强。
该评估使用一个受控语料,由 120 份匿名化 ICLR 2026 投稿经两个重写模型扩充为 4,200 份保持内容的手稿变体,沿相反方向变化六个修辞维度,并在盲法条件下由多个 AI 审稿模型判断。实验表明,修辞效应集中在证据框架、新颖性立场以及较弱程度上的范围框架,正向变体通常被偏好于负向变体。然而,评分变化强烈依赖于审稿模型和审稿模型的初始评分,且严格审稿提示总体上降低评分而未使结果一致地对修辞不敏感。重写模型的选择主要影响修辞对比的强度,而非评分移动的方向。