新ベンチが実証22LLMの専門家推薦バイアス
複雑系科学研究所(CSH)のLisette Espín-Noboa氏らによる研究シリーズは、大規模言語モデルが専門家推薦に用いられる際に生じる構造的バイアスを詳細に分析した。物理学を事例とした初期テストでは、6種のモデルが推薦する専門家の約40%で研究分野の誤分類が発生し、男性・上級職・米国在住・高引用数の研究者に偏っていることが判明した。女性や少数民族の推薦割合は実際の学術記録を下回り、特定の人種グループは検出されなかった。事実関係の正確さは約80%にとどまり、複雑なタスクでは精度がさらに低下した。 これを受けて研究チームは、技術品質と社会的多様性を測る9指標を用いた評価フレームワーク「LLMScholarBench」を開発し、22種のLLMで検証を行った。その結果、検索拡張生成(RAG)は事実の正確性を向上させる一方、プロンプトエンジニアリングによる社会的多様性の改善とは両立せず、技術的要件と公平性の間に明確なトレードオフが存在することが示された。また、プロンプトの言語や役割指定は推薦結果に影響を与えなかったが、地理的条件を変化させると推薦される学者の分布が変動し、地理的要因がバイアスを増幅する一端となっていることが確認された。 最新モデルへのRAG適用テストでは、ウェブ検索による正確性の向上が、既存のオンライン環境が持つ多様性の欠如をそのまま取り込む結果となり、かえって公平性指標を悪化させた。研究チームは、これらの偏りがモデル固有ではなく構造的に生じる現象であると強調し、LLMScholarBenchを公開ベンチマークとして提唱している。AI推薦システムのバイアス是正には、単なる学習データの更新ではなく、学術貢献の全範囲を反映した包括的な知識基盤の構築と、品質と公平性を同時に最適化する介入手法の開発が不可欠である。学術界に限らず医療や法務など幅広い分野での専門家検索リスクを軽減するため、本ベンチマークは今後のLLM監査と透明性確保の標準ツールとしての役割が期待されている。
