HyperAIHyperAI

Command Palette

Search for a command to run...

Eureka Bench Logs 评测日志数据集

日期

数据集组织

微软

论文 URL

2409.10566

许可证

Apache 2.0

Eureka Bench Logs 评测日志是由 Microsoft 于 2024 年发布的一个包含大型基础模型评估日志的数据集,相关论文成果为「Eureka: Evaluating and Understanding Large Foundation Models」,旨在提供对大型基础模型在复杂任务中推理能力的深入理解与评估。

该数据集包含了来自 Eureka ML Insights 框架的运行日志,记录了不同模型家族和具体模型在各类基准测试中的详细表现。 数据按基准测试、模型家族及模型名称进行组织,涵盖了 Phi-4-reasoning 等模型的推理时间扩展研究结果。 这些信息有助于研究人员分析模型在图像到文本等任务上的性能差异与优化方向。

数据集组成

  • 基准测试 (Benchmarks):日志按照具体的评测基准进行分类,涵盖图像到文本等多模态任务。
  • 模型家族 (Model Families):数据按模型家族分组,便于对比同一架构下不同模型的进展。
  • 模型名称 (Model Names):每个日志条目对应具体的模型实例,记录了详细的推理与评估数据。

这些日志数据为评估和理解大型基础模型提供了丰富的实证材料。

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供