HyperAIHyperAI

Command Palette

Search for a command to run...

FEA-Bench コード生成ベンチマークデータセット

日付

データセット構成

Microsoft Corporation

ライセンス

Other

FEA-Bench は、Microsoft が 2025 年に公開した、リポジトリレベルのコード生成能力を評価するためのベンチマークデータセットであり、大規模言語モデルにおけるリポジトリレベルのインクリメンタルなコード開発の性能を測定することを目的としています。

このデータセットには、83 個の GitHub リポジトリから収集された 1,401 件のタスクインスタンスが含まれており、これらのインスタンスは、新機能の実装(Feature Implementation)を目的としたプルリクエスト(Pull Requests)に由来しています。 各タスクインスタンスには、リポジトリ情報、ベースコミットハッシュ、プルリクエスト番号、およびユニットテストのステータス情報(FAIL_TO_PASS および PASS_TO_PASS)が含まれており、主にモデルが複雑なソフトウェアエンジニアリングタスクを解決する能力を評価するために使用されます。データ汚染を防ぐため、モデルのトレーニングには適していません。

データセットの構成

  • instance_id: タスクインスタンスの識別子。
  • pull_number: 元の GitHub プルリクエストの番号。
  • repo: ソースコードリポジトリ名(形式は owner/repo)。
  • version: リポジトリのバージョン情報。
  • base_commit: ベースコミットの SHA256 ハッシュ値。
  • environment_setup_commit: 環境設定コミットのハッシュ値。
  • created_at: タスクの作成日時。
  • FAIL_TO_PASS: 修正が必要な失敗テストケースを含む文字列シーケンス。
  • PASS_TO_PASS: 合格を維持する必要があるテストケースを含む文字列シーケンス。

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています