耶鲁发布新基准,对比临床决策AI多智能体与单模型推理
近日,耶鲁大学医学院马克·杰因斯坦团队在《Patterns》期刊发表论文,正式发布医疗大模型评估基准MedicalAgentsBench,旨在解决人工智能在临床决策应用中的效能评估难题。随着AI深入医疗领域,学界对两类推理架构的优劣展开争论:一是依赖多个大语言模型实时交互达成共识的外部多智能体模式,类似专家会诊;二是通过强化学习在单一模型内完成多步推理的内部单模型模式。传统评测因过度依赖标准化考试数据,易被模型记忆能力突破,难以区分真实推理水平。为此,研究团队整合八项权威医疗数据集,构建包含八百余道复杂临床问题的新型基准。评测结果显示,两种推理路径并无绝对优劣,而是呈现显著互补效应。将外部多智能体机制引入内部推理模型,可进一步提升复杂医疗问答的准确性。鉴于医疗数据的高度敏感性,公开模型难以直接投入临床。该基准的建立为医疗机构评估私有化AI系统的性能与成本提供了科学标尺,有助于加速构建安全、高效的专属临床决策辅助系统,推动医疗人工智能向更精准方向演进。
