HyperAI
Command Palette
Search for a command to run...
Eureka Bench Logs 评测日志数据集
Eureka Bench Logs 评测日志是由 Microsoft 于 2024 年发布的一个包含大型基础模型评估日志的数据集,相关论文成果为「Eureka: Evaluating and Understanding Large Foundation Models」,旨在提供对大型基础模型在复杂任务中推理能力的深入理解与评估。
该数据集包含了来自 Eureka ML Insights 框架的运行日志,记录了不同模型家族和具体模型在各类基准测试中的详细表现。 数据按基准测试、模型家族及模型名称进行组织,涵盖了 Phi-4-reasoning 等模型的推理时间扩展研究结果。 这些信息有助于研究人员分析模型在图像到文本等任务上的性能差异与优化方向。
数据集组成
- 基准测试 (Benchmarks):日志按照具体的评测基准进行分类,涵盖图像到文本等多模态任务。
- 模型家族 (Model Families):数据按模型家族分组,便于对比同一架构下不同模型的进展。
- 模型名称 (Model Names):每个日志条目对应具体的模型实例,记录了详细的推理与评估数据。
这些日志数据为评估和理解大型基础模型提供了丰富的实证材料。
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。