HyperAIHyperAI

Command Palette

Search for a command to run...

AI コーディングツールの四割が誤り、調査で判明

オンタリオ大学ウォータールー校の新たな研究により、AI によるコーディング支援ツールの信頼性に重大な疑問が生じています。この研究は、大規模言語モデル(LLM)が基本的なソフトウェア開発タスクにおいて依然として苦戦していることを示し、開発者が AI 生成結果の正確性や一貫性を確保することの難しさを浮き彫りにしました。発表された論文「StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs」は、機械学習研究誌に掲載され、2026 年の ICLR 会議でも発表される予定です。従来の LLM は自然言語で回答していましたが、OpenAI や Google などの企業が JSON や XML などの構造化された形式で出力させる機能を開発し、人間やシステムによる処理を容易にしました。しかし、ウォータールー大のチームが行ったベンチマークテストでは、最も高性能なモデルでも約 75% の精度しか達成できず、オープンソースモデルではさらに低い約 65% に留まりました。今回の研究では、11 の LLM モデルを用いて 18 の構造化形式と 44 のタスクを評価し、モデルが定められたルールにどれだけ忠実に従えるかを分析しました。研究の共著者であるジャド氏によると、テキスト関連のタスクでは比較的優れていますが、画像、動画、Web サイトの生成といったタスクでは非常に苦手としています。また、この研究はジャド氏、学生で協力者のヤン氏、および教授のチェン氏らによる共同作業であり、世界中の 17 人の研究者による注釈データも取り入れています。開発者はエージェントを運用しようとしても、依然として人間の監督が不可欠であり、AI が人間の代わりとして完全に自律して動作する状態には程遠いとの結論に至りました。

関連リンク