HyperAIHyperAI

Command Palette

Search for a command to run...

前沿AI代理难以胜任原创科学研究

近期发表于arXiv平台的一项研究对前沿人工智能代理独立开展开放性科研的能力进行了实测。研究团队赋予模型六天时间、完整的互联网访问权限、专属算力及约三千美元的模型使用额度,要求其围绕两项尚未公开的学术会议主题独立完成实验设计与论文撰写。经采用顶级会议审稿标准的人类专家评估,两份AI生成的稿件均遭到明确拒稿,综合评分分别为1/6与2/6。 评估指出,尽管代理模型能够理解核心研究问题并提出部分合理方向,但其科学推理存在显著缺陷。实验设计严谨性不足,面对负面反馈时仅懂得添加限定条件,缺乏重构研究的灵活性。此外,模型在时间与资源管理上表现失当,实际消耗预算不足一半,却因进度仓促导致成果远未达到学术发表标准。 该结果虽对AI独立科研的预期构成现实冷思考,但并未否定其在科学探索中的价值。业内专家强调,在可预见的未来,人工智能更适合作为实验室辅助工具,负责处理常规测试、文献检索与数据处理等基础工作,而非取代人类科学家承担核心发现与创新决策。

相关链接