HyperAIHyperAI

Command Palette

Search for a command to run...

AI、古典的なチューリングテストで人間より人間らしいと評価

カリフォルニア大学サンディエゴ校の新しい研究が、現代の人工知能システムが古典的なチューリングテストに合格し、人間よりも人間らしく振る舞えることを初めて実証しました。この研究は、英科学誌『PNAS』に発表され、AI が人間の会話と見分けがつかないほどになり得るという科学的証拠を提示しています。テストでは、参加者が同時に人間と大規模言語モデル(LLM)とチャットし、どちらが人間かを判定します。実験には、UCSD の学生とオンライン参加者を含む約 500 人が参加しました。 結果、最も進化したモデルである GPT-4.5 は、実際の人間を判定された頻度よりも 73% も高い確率で「人間」と見なされました。また、Meta の LLaMA-3.1-405B も 56% の確率で人間と判定され、これは実際の人間との統計的差異がない水準でした。一方、以前のモデルやルールベースのチャットボットは、20% 前後の低い確率しか得られませんでした。この劇的な差は、AI に特定の人物像や性格を指示するプロンプトを与えたかどうかにかかっていました。指示がない場合、GPT-4.5 の人間判定率は 36% まで低下しましたが、キャラクターを演じるよう指示された場合、AI は人間特有の冗談、率直さ、甚至しいたずらなミスを含んだ社会的行動を示すことができました。 研究者らは、チューリングテストが単なる知能の試みから「人間らしさ」の測定基準へと変化していると指摘しています。AI は知識量ではなく、ミスを犯す能力や社会的文脈を操ることで人間と見分けがつかなくなっているのです。しかし、この成果は大きな社会的リスクも伴います。5 分や 15 分の会話を通じて AI と区別がつかない状態が作れるため、オンライン上の信頼関係が揺らぐ恐れがあります。悪意のある利用者がこの技術を悪用し、個人情報をだまし取る、投票操作を行う、商品購入を誘導するなどの行為が可能になる可能性があります。 研究者らは、この技術が進化することで社会にどのような safeguards(防御策)が必要かを議論するきっかけとなることを願っています。現在の AI は人間のように振る舞う能力はありますが、それが人間らしさを理解しているわけではなく、人間がどう振る舞うべきかを指示されて初めてその役割を演じることができます。この研究は、デジタル空間での対話において、相手が人間かボットかを信頼することが極めて困難になっている現実を浮き彫りにしました。

関連リンク

AI、古典的なチューリングテストで人間より人間らしいと評価 | 人気の記事 | HyperAI超神経