HyperAIHyperAI

Command Palette

Search for a command to run...

4 小时前
推理
Agent

迈向评估式人工智能的论证基础

Xiang Yin Tim Miller Antonio Rago Nico Potyka Francesca Toni

摘要

评估式人工智能(EAI)近期被提出作为一种辅助人类决策的方式,其特点不是给出单一建议,而是呈现相互竞争的假设,并附上支持与反对每项假设的证据。在本立场论文中,我们主张(计算)论证是最合适的范式,可为具备可解释性与可争议性的 EAI 形式提供形式化、可计算的基础。论证还能自然地通向一种多智能体 EAI 愿景,使源自不同来源和推理风格的多样化评估模型能够交互,并围绕假设与证据共同进行审慎推理。总体而言,本立场论文为面向分布式、以人为中心的 EAI 系统的长期研究议程奠定了基础。

一句话总结

作者提倡将计算论证作为Evaluative AI的形式化、可计算基础,从而构建可解释且可抗辩的多agent系统,其中来自不同来源与推理风格的多样化评估模型相互作用,并针对竞争性假设与证据进行共同审议,以支持以人为本的决策。

核心贡献

  • 提出加权定量双极论证框架(wQBAFs)作为Evaluative AI的形式化、基于排名的基准,实现内在的可解释性与可抗辩性。
  • 该论证结构通过使评估过程显式且可审计,生成了忠实解释;可抗辩性则通过反事实解释得到支持,允许用户修改论证权重以改变假设强度。
  • 本文提出了一种多agent愿景,即来自不同来源与推理风格的多样化评估模型能够交互并审议假设与证据,从而支持协作式人在环中(human-in-the-loop)决策。

引言

可解释AI(XAI)通常遵循“推荐-解释”范式,即模型先输出决策,再对该决策进行辩解。这种方式可能导致认知固着(cognitive fixation),使用户在没有充分审议的情况下过度依赖或草率否定AI建议,这在医疗、法律和金融等高风险领域尤为棘手。Evaluative AI(EAI)最近被提出作为替代方案,它呈现多个可能的假设,并附上支持或反对每个假设的结构化证据,从而保留人的自主性。然而,现有EAI实现(如基于证据权重(Weight of Evidence)的方法)提供的假设与证据之间的依赖结构有限,且缺乏解释与可抗辩性的原则性框架。作者通过将EAI形式化为基于排名的问题,并引入加权定量双极论证框架(wQBAFs)作为形式化基础,弥补了这些不足。该论证方法支持假设与证据之间更丰富的关系,能生成排名的忠实解释,并允许用户对任何组件提出质疑,从而推进了以人为本、可抗辩且可能为多agent的EAI系统。

方法

作者将Evaluative AI形式化为一个基于排名的问题,然后提出一种基于加权定量双极论证框架(wQBAFs)的论证方案。整体流程包括三个阶段:形式化评估场景、将其映射为wQBAF,以及得出假设的排名。

该框架从一组假设 H\mathcal{H}H 和一组证据 E\mathcal{E}E 开始。每个元素 x(EH)x \in (\mathcal{E} \cup \mathcal{H})x(EH) 被赋予一个初始权重 τ(x)\tau(x)τ(x),该权重捕获了在考虑任何交互之前其基线合理性或严重性。这些元素之间的关系通过两个不相交的二元关系建模:pro 和 con。pro 关系 (x,y)(x,y)(x,y) 表示 xxx 支持 yyy,而 con 关系表示 xxx 攻击 yyy。这些关系不仅允许从证据指向假设,还允许证据之间以及假设之间的关系,从而支持多步推理链。每个关系还通过关系权重 w(r)[0,1]w(r) \in [0,1]w(r)[0,1] 进行量化,表示影响力的强度。

基于这一形式化,基于排名的EAI问题被定义为确定 H\mathcal{H}H 上的一个全预序 E\succcurlyeq_EE,其中 h1Eh2h_1 \succcurlyeq_E h_2h1Eh2 表示 h2h_2h2 不比 h1h_1h1 更合理。作者认为,这种排名形式自然地容纳了多个假设,与EAI的核心理念一致,并为生成和评估排名提供了具体的计算框架。

为解决该问题,作者将EAI设置映射为一个wQBAF。wQBAF是一个五元组 Q=A,R+,R,τ,wQ = \langle \mathcal{A}, \mathcal{R}^+, \mathcal{R}^-, \tau, w \rangleQ=A,R+,R,τ,w,其中 A=EH\mathcal{A} = \mathcal{E} \cup \mathcal{H}A=EH 是论证集合,R+\mathcal{R}^+R+ 对应pro关系,R\mathcal{R}^-R 对应con关系,τ\tauτ 提供基础分数,www 提供边权重。这种映射允许对所有证据和假设平等地进行辩论。

解决方案分为两步。首先,系统通过应用定量评估方法,根据支持和攻击关系更新初始权重,计算每个论证的最终强度。其次,通过比较计算出的强度得出假设的排名。作者强调,基于wQBAF的方法本身具有可解释性:图结构定性地揭示了从证据到假设的推理路径,而最终强度可以通过归因方法或反事实解释进行定量解释。该框架还支持可抗辩性,因为用户可以修改权重或关系,观察假设强度如何变化。

为了指导排名方法的选择与评估,作者引入了一组理想原则。点式原则包括单调性(Monotonicity),确保为假设增加pro证据不会降低其排名;平衡性(Balance),要求当pro和con影响相互抵消时排名保持不变。对式原则包括等价性(Equivalence),要求具有相同证据集的假设必须排名相同;支配性(Dominance),奖励拥有更优pro证据的假设。在全局层面,鲁棒性(Robustness)、可解释性(Explainability)和可抗辩性(Contestability)原则支配着排名系统的整体行为,确保在扰动下的稳定性、排名逻辑的透明性以及用户挑战结果的能力。

最后,作者将框架扩展到多agent场景。他们认识到,现实世界的评估整合了从人类专家、领域工具到LLM生成证据等异构信息源。在这一视角下,每个wQBAF充当一个自主论证agent。Agent可以通过论证式通信提出新证据,或通过原则性的交换协议调和矛盾。多个wQBAF还可以通过论证的语义对齐、证据结构聚类或基于假设排名的集成式聚合,融合为组级评估。这种多agent视角将基于论证的EAI定位为分布式、具有韧性且真正审议式评估系统的基础。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供