HyperAI
Command Palette
Search for a command to run...
Résultats de performance de différents modèles sur ce benchmark
Metrics
0.1
0.2
0.01
0.05
F1
error
correct
GPT-4o
Average
Qwen2-7B
Llama3-8B
GLM-4-Plus
Llama3.1-8B
Qwen2.5-14B
Llama3.1-70B
3 lignes au total