HyperAI
Command Palette
Search for a command to run...
FEA-Bench 是由 Microsoft 于 2025 年发布的一个用于评估仓库级代码生成能力的基准测试数据集,旨在衡量大型语言模型在仓库级增量代码开发中的性能。
该数据集包含 1,401 个来自 83 个 GitHub 仓库的任务实例,这些实例源自旨在实现新功能(Feature Implementation)的拉取请求(Pull Requests)。 每个任务实例包含仓库信息、基础提交哈希、拉取请求编号以及单元测试的状态信息(FAIL_TO_PASS 和 PASS_TO_PASS),主要用于评估模型解决复杂软件工程任务的能力,不适用于模型训练以防数据污染。
数据集组成
- instance_id: 任务实例的标识符。
- pull_number: 原始 GitHub 拉取请求的编号。
- repo: 源代码仓库名称(格式为 owner/repo)。
- version: 仓库版本信息。
- base_commit: 基础提交的 SHA256 哈希值。
- environment_setup_commit: 环境设置提交的哈希值。
- created_at: 任务创建时间。
- FAIL_TO_PASS: 字符串序列,包含需要修复的失败测试用例。
- PASS_TO_PASS: 字符串序列,包含需要保持通过的测试用例。
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。