HyperAI
Command Palette
Search for a command to run...
Résultats de performance de différents modèles sur ce benchmark
Metrics
WikiTQ (Average)
TabFact (Average)
WikiTQ (GPT-4o-mini)
WikiTQ (Qwen2.5-72B)
TabFact (GPT-4o-mini)
TabFact (Qwen2.5-72B)
WikiTQ (LLaMA3.3-70B)
TabFact (LLaMA3.3-70B)
Val
Test
6 lignes au total