HyperAIHyperAI

Command Palette

Search for a command to run...

FEA-Bench 代码生成基准测试数据集

日期

数据集组织

微软

许可证

Other

FEA-Bench 是由 Microsoft 于 2025 年发布的一个用于评估仓库级代码生成能力的基准测试数据集,旨在衡量大型语言模型在仓库级增量代码开发中的性能。

该数据集包含 1,401 个来自 83 个 GitHub 仓库的任务实例,这些实例源自旨在实现新功能(Feature Implementation)的拉取请求(Pull Requests)。 每个任务实例包含仓库信息、基础提交哈希、拉取请求编号以及单元测试的状态信息(FAIL_TO_PASS 和 PASS_TO_PASS),主要用于评估模型解决复杂软件工程任务的能力,不适用于模型训练以防数据污染。

数据集组成

  • instance_id: 任务实例的标识符。
  • pull_number: 原始 GitHub 拉取请求的编号。
  • repo: 源代码仓库名称(格式为 owner/repo)。
  • version: 仓库版本信息。
  • base_commit: 基础提交的 SHA256 哈希值。
  • environment_setup_commit: 环境设置提交的哈希值。
  • created_at: 任务创建时间。
  • FAIL_TO_PASS: 字符串序列,包含需要修复的失败测试用例。
  • PASS_TO_PASS: 字符串序列,包含需要保持通过的测试用例。

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供