Code Generation On Res Q
評価指標
pass@1
評価結果
このベンチマークにおける各モデルのパフォーマンス結果
比較表
モデル名 | pass@1 |
---|---|
res-q-evaluating-code-editing-large-language | 30.0 |
res-q-evaluating-code-editing-large-language | 58.0 |
res-q-evaluating-code-editing-large-language | 20.0 |
res-q-evaluating-code-editing-large-language | 18.0 |
res-q-evaluating-code-editing-large-language | 30.0 |
res-q-evaluating-code-editing-large-language | 36.0 |
res-q-evaluating-code-editing-large-language | 46.0 |
res-q-evaluating-code-editing-large-language | 29.0 |
res-q-evaluating-code-editing-large-language | 37.0 |