HyperAIHyperAI

Command Palette

Search for a command to run...

AI試験性能向上、大学は評価方式転換

ウルロンゴン大学(オーストラリア)の研究チームが発表した新調査により、生成AIの法学試験対策能力が過去1年で大幅に向上していることが実証された。本研究では、同大学の必修科目である刑法と不法行為法の最終試験問題を、5社の9種類のAIモデルに解答させた。2023年の調査ではAIは知的要求の高いタスクで人間に及ばなかったが、最新のモデルは刑法で平均76.3点、不法行為法で平均66点を記録し、それぞれ学生の上位82.5%および61%を上回る成績を収めた。特に法的仮説事案の批判的分析において、以前の弱点がほぼ解消されたことが確認された。 一方、AIの能力はモデルや科目によって大きくばらつきがあり、優秀な分析能力と併せて出典の誤引用や幻覚といった課題も残っている。調査結果は、監視のない評価の成績信頼性に疑問を投げかけるとともに、学生による不正なAI利用リスクが高まっていることを示唆している。 研究チームは、大学の対応策として三つの評価アプローチを提案している。第一に、基礎知識と独立した推論能力を証明するため、対面での筆記試験や口頭試問、監督下での問題解決を必修とし、初期課程ではこれを主軸とすべきである。第二に、AIとの協働プロセスそのものを評価する課題を導入する。最終製品だけでなく、プロンプトの設計、出典の検証、AI出力の誤識別や改善手順を評価対象とする。第三に、実務を模したリレー形式の評価を導入する。人間主導型では監督環境で下書きを作成後AIと協働して完成させ、AI主導型ではAI生成案を監督環境で独自に検証・批判し再提出させる。両者の提出物を個別採点し、法学知識とAI監視能力の両軸を測定する。 本研究は対象科目と大学が限定的であり、プロンプト設計や採点の主観性、モデルの継続的な性能変化については今後の検証が必要だと指摘している。しかし、AIが教育現場に不可欠なツールとなる中で、大学は技術への依存を避けるのではなく、学生の基礎学力維持とAI出力の批判的検証能力の育成を両立させる評価体系への転換を急ぐ必要がある。AI時代における学術的誠実性と人材育成の在り方を見直す契機となる重要な知見である。

関連リンク