新基准测试揭示22款大语言模型推荐专家存在偏见
近日,复杂科学中心研究员Lisette Espín-Noboa团队发布最新研究,系统评估了涵盖GPT、Gemini、LLaMA等在内的22款大语言模型在专家推荐场景中的表现。研究指出,当前AI在推荐学术专家时存在显著偏见,平均高达四成的专家领域匹配错误,且过度聚焦欧美资深学者,导致女性及少数族裔学者被系统性边缘化。针对此问题,团队构建了LLMScholarBench基准测试,从技术质量与社会代表性九个维度对模型进行量化评估。实验表明,尽管检索增强生成或特定提示词干预能分别提升事实准确率或多样性指标,但改善单一维度往往以牺牲另一维度为代价,难以实现综合优化。此外,提示词中的地理位置设定会直接影响推荐结果,而语言与用户角色则无显著影响。研究强调,此类偏差并非特定模型缺陷,而是训练数据与网络生态中结构性不平等的投射。随着AI深度介入学术遴选与职业推荐,团队呼吁开发更均衡的学术知识库,并推广该基准工具,以推动生成式人工智能在关键决策场景中的公平性与可靠性。
此资讯由 AI 智能聚合生成,旨在高效传递行业动态,不代表任何观点或建议。
