HyperAIHyperAI

Command Palette

Search for a command to run...

基准
LLM

英国AISI携手EvalEval开源基准结果提升可复现性

英国人工智能安全研究所近日宣布与EvalEval联盟达成深度协作,正式采用其标准化评估基础设施,公开共享前沿大模型测评数据。此次合作源于双方在NeurIPS 2025研讨会上的技术对接,研究所的实证反馈直接推动了通用评估架构的迭代。 面对评估报告格式分散、元数据缺失导致难以复现的行业痛点,EvalEval推出公开平台与统一数据标准,将基准测试配置、运行记录与模型信息整合为可解析记录。研究所率先接入该体系,完整公开了关于推理算力与前沿模型性能关系研究的五项核心基准结果。数据涵盖Claude与GPT系列等六款旗舰模型,包含经核验的性能曲线、提示协议及算力消耗详情,并同步开放网络安全专项评测记录。 该举措通过透明化评估上下文与实验环境,使科研团队能够精准复现实验、横向对比不同协议下的性能差异,并为行业元研究提供可靠参照。此举有效弥合了当前评估报告的信息缺口,为全球人工智能安全治理与开源科研协作奠定了可验证、可追溯的数据共享基础。

相关链接