HyperAIHyperAI

Command Palette

Search for a command to run...

LLM
智能问答

从被动响应到主动纠错:增强大语言模型对输入事实扰动的鲁棒性

Ping Wang Xiangguo Sun Bingbing Xu Guocong Li Xiaofeng Meng

摘要

当用户输入包含误导性前提时,大语言模型(LLM)经常给出自信但事实错误的回答,我们将这一现象归因于输入中的事实扰动。现有的幻觉缓解方法通常假设用户输入是可靠的,忽视了此类事实错误如何主动误导模型推理。为解决这一脆弱性,我们提出 DEDUCE,一个将 LLM 从被动响应者转变为主动纠错者的三阶段框架。DEDUCE 分三个阶段运行:(1)通过细粒度事实抽取与验证检测错误;(2)通过多视角审议制定纠正策略;(3)纠正误解并给出可靠答案。我们还提出了 Mis-FactQA,一个包含不同程度事实错误的数据集,并提出了评估模型鲁棒性的新指标。在 TruthfulQA、FalseQA 和我们的 MisFactQA 基准上的实验表明,DEDUCE 显著提升了准确率和纠错能力。在 Qwen、LLaMA 和 Gemma 系列模型上的一致提升证实了其有效性和可扩展性。

一句话总结

中国人民大学、东南大学和浙江大学的研究者提出 DEDUCE,一个通过检测输入事实错误、经由多视角审议制定纠正策略并修正误解来增强 LLM 鲁棒性的三阶段框架,同时引入 MisFactQA 和新的评估指标,在 TruthfulQA、FalseQA 和 MisFactQA 上跨 Qwen、LLaMA 和 Gemma 模型取得一致的准确率和纠错增益。

核心贡献

  • 论文引入 DEDUCE,一个三阶段框架,通过细粒度事实提取与验证检测用户输入中的事实错误,经由多视角审议制定纠正策略,并在生成可靠答案的同时修正误解,从而将 LLM 从被动响应者转变为主动纠错者。
  • 提出新数据集 MisFactQA 以及细粒度评估指标,系统评估模型在包含虚假前提、事实矛盾和复合错误的事实扰动输入下的鲁棒性。
  • 在 TruthfulQA、FalseQA 和 MisFactQA 上的实验表明,DEDUCE 在 Qwen、LLaMA 和 Gemma 模型系列上一致提升答案准确率和纠错能力,证实其有效性和可扩展性。

引言

大型语言模型编码了大量现实世界知识,在生成任务上表现良好,但仍容易出现幻觉,尤其是当真实用户输入的查询包含虚假前提、矛盾或复合错误等事实错误时。此前的缓解工作大多将幻觉视为模型侧问题,贯穿预训练、微调和推理阶段,通常假设用户输入是正确的,要么忽略错误前提,要么尝试自我纠正,但可能被同样的输入带偏。作者认为,误导性用户输入可能覆盖参数化知识,即使在优化良好的模型中也诱发幻觉。为此,他们提出 DEDUCE,一个检测、制定和纠正框架,定位并分析输入错误,审议响应策略,并基于已验证知识作答,同时提供 MisFactQA 基准和细粒度指标,用于评估对事实扰动问题的鲁棒性。

数据集

作者构建 MisFactQA,一个用于虚假前提问答(FPQA)的数据集,结合三个具有已验证真实答案的来源:

  • 来源:Prize、EchoMist 和公开问答数据集的精选子集。
  • 查询-响应对:每个示例要求模型检测输入中的虚假信息,然后生成纠正后的前提及相应答案。
  • 错误类型:为超越单一错误评估,数据集引入三类事实扰动:
    • 单一虚假前提 – 输入包含一个可能误导推理的错误陈述。
    • 内部矛盾描述 – 输入包含相互冲突的声明,迫使模型在两者间做出选择。
    • 多重错误 – 输入组合了多个虚假前提或虚假前提与矛盾,挑战模型捕获所有问题的能力。
  • 用途:论文将 MisFactQA 用作基准,衡量模型在事实扰动下的鲁棒性。正文未给出明确的训练划分或混合比例;更多构建细节(如确切规模、过滤规则、元数据)见附录 B.2。

方法

作者引入 DEDUCE,一个输入侧幻觉缓解框架,旨在解决现有方法在处理事实扰动输入时的局限。DEDUCE 不传播错误信息,也不因推理偏差导致自我纠正失败,而是将挑战重新表述为一个可解释、可辩论且可验证的协作过程。该框架包含三个协同模块:检测(Detect)、制定(Devise)和纠正(Correct)。

检测:输入检测与分析 为防止模型被表面连贯的查询误导,检测模块采用原子事实检测机制。它使用分解函数 ϕ\phiϕ 将查询 QQQ 分解为一组最小、可独立验证的事实单元:

ϕ(Q)={AC1,AC2,,ACn}\phi(Q) = \{AC_1, AC_2, \dots, AC_n\}ϕ(Q)={AC1,AC2,,ACn}

其中每个 ACiAC_iACi 是一个自包含的事实断言。每个单元通过真实性检查 F()\mathcal{F}(\cdot)F() 和成对一致性检查 C(,)C(\cdot, \cdot)C(,) 独立评估:

F(ACi)={1,if ACi is factually incorrect0,otherwise\mathcal{F}(AC_i) = \begin{cases} 1, & \text{if } AC_i \text{ is factually incorrect} \\ 0, & \text{otherwise} \end{cases}F(ACi)={1,0,if ACi is factually incorrectotherwise C(ACi,ACj)={1,if ACi and ACj are mutually inconsistent0,otherwiseC(AC_i, AC_j) = \begin{cases} 1, & \text{if } AC_i \text{ and } AC_j \text{ are mutually inconsistent} \\ 0, & \text{otherwise} \end{cases}C(ACi,ACj)={1,0,if ACi and ACj are mutually inconsistentotherwise

这些检查产生不相交的错误集合 Efact\mathcal{E}_{\text{fact}}EfactEconflict\mathcal{E}_{\text{conflict}}Econflict,从而精确定位错误类型和位置。然后,该模块生成结构化诊断摘要 MisSum(Q)\text{MisSum}(Q)MisSum(Q),将抽象判断落实为具体的自然语言声明,指明是否存在错误、其位置及其影响。

制定:多视角审议 为克服单模型自我纠正中固有的自我强化偏差,制定模块引入多视角策略辩论机制。该过程将纠正策略制定分解为三个互补角色,均以模型内部知识和 MisSum(Q)\text{MisSum}(Q)MisSum(Q) 为条件。 首先,生成器(G)生成初始策略草案 s(0)s^{(0)}s(0),枚举可行的纠正路径:

s(0)=G(Q,MisSum(Q))s^{(0)} = \mathcal{G}(Q, \text{MisSum}(Q))s(0)=G(Q,MisSum(Q))

其次,审阅器(R)采取对抗立场,从完整性、准确性和可靠性方面识别 s(0)s^{(0)}s(0) 的弱点,生成结构化批评 rrr

r=R(s(0),MisSum(Q))r = \mathcal{R}(s^{(0)}, \text{MisSum}(Q))r=R(s(0),MisSum(Q))

若发现不足(rr \neq \emptysetr=),仲裁器(A)介入,公正评估双方观点,生成最终验证策略 π(Q)\pi^*(Q)π(Q)

π(Q)=A(s(0),r)\pi^*(Q) = \mathcal{A}(s^{(0)}, r)π(Q)=A(s(0),r)

这种角色分离确保在执行前形成全面且经多视角验证的策略。

纠正:纠正与响应 在最后阶段,模型顺序执行验证策略 π(Q)\pi^*(Q)π(Q),以确保忠实遵循。执行流水线包含三个具体行动:(1)错误识别,明确指出输入中的事实错误;(2)带理由的纠正,提供正确信息及支撑推理;(3)可靠回答,在纠正后的前提下生成最终答案。

实现策略 作者使用两种互补策略实现 DEDUCE:DEDUCE-Prompting 和 DEDUCE-Tuning。DEDUCE-Prompting 通过提示直接应用三个模块,提供可解释且灵活的方法,无需额外训练。DEDUCE-Tuning 通过两阶段过程将推理模式内化到模型参数中。在第一阶段(检测微调),模型使用教师模型生成的训练数据学习识别事实错误和冲突,确保错误检测的可靠基础。在第二阶段(制定与纠正微调),模型在经严格质量标准过滤的验证多视角策略和对应正确答案上训练。这一组合阶段使模型能够内化多视角推理并在单步中执行纠正,缓解自我强化偏差。

实验

评估结合 TruthfulQA、FalseQA 和 MisFactQA,使用准确率及补充指标,评估模型是否被查询中的事实错误误导、检测并纠正它们。DEDUCE 与默认提示、上下文学习、思维链、LoRA 微调以及可解释的虚假假设检测基线进行比较,在模型系列上一致提升准确率和纠错能力,同时减少误导性响应。错误分析表明,虚假前提比明显矛盾更损害性能,消融实验显示策略生成模块尤为重要。该方法也泛化到更强的 LLM,这些模型仍易受事实扰动影响,案例研究证实将查询分解为原子声明有助于防止不加批判地接受错误信息。

澄清分数(Clarification Score)标准定义了模型面对错误查询时响应质量的五个等级,从接受虚假声明到完全纠正。它实现了对部分正确性的细粒度评估,超越二元准确率或表面相似度指标。1 分(被误导)表示模型强化错误,5 分(完全澄清)要求明确驳斥虚假声明并给出准确答案。中间等级区分回避(忽略错误并错误作答)、矛盾响应(识别部分虚假声明但给出冲突信息)和部分纠正(检测到大多数错误但未在正确前提下作答)。

DEDUCE-P 在 FalseQA 和 MisFactQA 上均一致优于所有基线,取得最高的准确率、澄清分数和纠正率,同时产生最低的误导率。相较于次优方法 SFT,在 FalseQA 上的提升尤为显著,准确率提高近五个百分点,纠正率提高约四个百分点。DEDUCE-P 在两个数据集的所有指标上均取得最佳结果,误导率最低,纠正率最高。与最强基线 SFT 相比,DEDUCE-P 将 FalseQA 上的误导率从 20.47 降至 19.12,将 MisFactQA 上的误导率从 23.47 降至 18.23,同时将 MisFactQA 上的纠正率从 65.16 提升至 70.62。

在 TruthfulQA 上,DEDUCE-P 方法在所有测试的 instruct 模型上一致取得最高准确率,而思维链提示在所有情况下均低于原始基线。这一反直觉的下降支持了在缺陷输入上推理会放大错误的假设。与结构化的检测与纠正方法相比,上下文学习和监督微调仅提供有限改进。DEDUCE-P 在三个模型上均取得最佳准确率,在 LLaMA-3.1-8B 和 Gemma3-12B 上的增益尤为显著。思维链提示在每个架构上都降低了准确率,低于原始模型,说明在误导性输入上进行不加批判的推理会损害性能。

DEDUCE 在 FalseQA 和 MisFactQA 上均提升了 GPT-4o-mini 和 DeepSeek-V3 的准确率,同时使用的 token 数量少于 CoT 和 IAQ-FA 等其他鲁棒性方法。即使更强的模型仍易受误导性输入影响,但 DEDUCE 以更好的准确率-效率权衡缓解了这一点。DEDUCE-T 在两个模型上均取得最高的 MisFactQA 准确率,将 GPT-4o-mini 从 65.1% 提升至 82.9%,将 DeepSeek-V3 从 69.9% 提升至 84.6%。与 CoT 和 IAQ-FA 相比,DEDUCE-T 在两个数据集上以显著更低的平均 token 消耗实现了更高准确率。GPT-4o-mini 和 DeepSeek-V3 在 MisFactQA 上的原始模型准确率均低于 70%,证实更强的 LLM 也无法免疫误导性事实前提。

评估使用包含虚假前提的数据集(FalseQA、MisFactQA、TruthfulQA)来衡量模型检测和纠正错误查询的能力。DEDUCE-P 通过明确驳斥虚假声明一致优于基线,取得更高的纠正率和更低的误导率。在缺陷输入上进行思维链提示会放大错误并降低准确率,而 DEDUCE 即使在 GPT-4o-mini 和 DeepSeek-V3 等强模型上也以更高效的 token 使用提升鲁棒性。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供