研究显示顶尖 AI 编程工具错误率达 25%
滑铁卢大学最新研究显示,顶级 AI 编程工具在生成结构化代码时仍存在显著缺陷,错误率高达四分之一。随着大语言模型在软件开发中的应用日益普及,开发者对其生成内容的准确性、一致性及集成便捷性仍存疑虑。尽管 OpenAI、Google 和 Anthropic 等公司已推出“结构化输出”功能,强制模型以 JSON、XML 等预设格式响应,但新研究揭示了技术尚未达到预期可靠性。该研究题为《StructEval:基准测试大语言模型生成结构化输出能力》,发表于《机器学习研究事务》并将亮相 2026 年国际机器学习大会。测试表明,即使是当前最先进的模型,其准确率也仅约为 75%,而开源模型的表现更接近 65%。研究团队评估了 11 个大语言模型在 18 种结构格式和 44 项任务中的表现,重点考察模型遵循规则的能力及输出准确性。作者姜东富指出,模型在处理文本相关任务时表现尚可,但在涉及图像、视频或网站生成的任务上则显得力不从心。这项研究由姜东富与本科生杨佳林、助理教授陈文虎等人合作完成,并汇集了全球 17 名研究人员的标注数据。陈文虎强调,该项目体现了滑铁卢大学学生从标注者到研究主导者的成长路径。研究人员警告,尽管结构化输出是软件开发的重要进步,但目前系统仍不够可靠,无法完全替代人类监督。开发者在使用此类 AI 代理时,仍需进行大量人工审查以确保代码质量,避免引入潜在风险。
此资讯由 AI 智能聚合生成,旨在高效传递行业动态,不代表任何观点或建议。
