HyperAIHyperAI

Command Palette

Search for a command to run...

Sachliche Konsistenz

Überprüfung, ob der generierte Text sachlich mit dem Quellematerial übereinstimmt; Erkennung von Halluzinationen und faktischen Fehlern in den Modellausgaben.

Leaderboard

Insgesamt 100 Modelle

Benchmarks

POPE
KILT: FEVER
Re2G
MedClaim
StrategyClaim
TruthfulClaim
B-score evaluation set
MMLU
AMBER
CorFEVER
FEVER
BEAF
CSQA
HLE
MuSiQue
MedMCQA
AVeriTeC
FNC-1
Sepúlveda-Torres R., Vicente M., Saquete E., Lloret E., Palomar M. (2021)
MediEval
SQuAD
GQA
LIAR
MMRel
R-Bench
TruthfulQA
AVHBench
COCO
HotpotQA
MOCHEG
PhD
SNLI
VERITE
A-OKVQA
ARC-C
HellaSwag
NewsCLIPpings
PubmedQA
BIG-Bench
CosmosQA
FaithEval
FakeHealth
LLaVA-Bench
MedQA
MMFakeBench
MMLU Anatomy
MMLU Clinic
MMLU Col-Bio
MMLU Col-Med
MMLU Gene
MMLU Pro-Med
MovieSum
MSCOCO
PubHealth
RAGTruth
RAWFC
RPE
SCIFACT
Biography
CICERO V1
CICERO V2
CLAIMREVIEW2024+
CommonsenseQA 2.0
Disagreement Set
EG-QA
Feverous
HallusionBench
HOVER
MISBENCH
MMEval-Pro
MMVP
PIQA
POPE-A
POPE-P
POPE-R
QASC
RealWorldQA
SIQA
SWAG
TriviaQA
True-False
VMCBench
VStar
5Pils-OOC
ADE
Adversarial GLUE
bAbI
BorderLines
Caltech101
Cifar10
Cifar100
CMM
Country211
CRPE_R
DailyOmni
DASH
Dolly (AC)
DTD
Eurosat
FActScore
Flowers
Food
Geometry3K
GTSRB
HQH
JudgeBench
LLMBar
LogicStruct
MathVerse
MathVision
MathVista
MM-Vet
MMAU
MMBench
MMK12-Bio
MMK12-Chem
MMK12-Math
MMK12-Phys
MNIST
MNLI
MVBench
NaturalQuestion
Pets
PopQA
Real-MM-RAG
RePOPE
SST2
STL10
Sun397
True-False dataset
TruthfulQA MC1
VisuLogic
WHOOPS!
Wiki-C
Wiki-L
Wiki-S
2WikiMultiHopQA
AbstainQA (MMLU)
AmbigQA
Athlete Sport
BioGEN
Book Author
CLAPNQ
CNN/Daily Mail
Company Founder
Company Headquarter
DA
ELI5-WebGPT
ExpertQA
FM2
FreshQA
GAIA
HAGRID
HaluEval-Summary
Hate Speech Ending
History of Science qa
JudgeAnything
JudgeLM val set
KUQ
LLaVA QA90
LogicStruct dataset
Math-Vista
MENSA
MLLM-Judge
MS-COCO
MWPs
NQ Swap
NQ-Open
Official Language
PandaLM test set
POPE-MSCOCO
Proverb Ending
Proverb Translation
QA
QAGS-CNNDM
QuoteSum
Real-World Benchmarks
SAMSum
SC
SCBench
SUM
VerifierBench
VerifyBench
Vizwiz
VLMBias
VQAv2-IDK
WHOOPS
World Capital
xbench-deepsearch
2WikiMQA
AlpacaFact
AOKVQA
ASAP
ASDiv
chain dataset
ContextualJudgeBench
ContraDoc
FactCheckGPT
FACTOR
FAITH-M
FaithBench
Fava
FELM-Science
GSM8K+MathQA
HELM
KLAR
LongBench-Chat & LongBench
LongFact
MathQA
MediaSum
MeetingBank
MT-Bench
OOD Object
OOD Relation
POLITIFACT-HIDDEN
POPE-COCO
StrategyQA
SummEval
SVAMP
TrendFact
Twitter
UnKEBench
Weibo
Wikibio-GPT3
2-hop HOVER
3-hop HOVER
3D-POPE
4-hop HOVER
ActivityNet-FOIL
AFaCTA
Alpaca-Judge
arc
ASKHISTORIANSPIC
BingCheck
BoolQ
Ch-3
CHECKWHY
CheeseBurger
ClassEval
CMHE-HD
CommenseQA
COVID-19 Fake News Dataset
Ensemble Model + Heuristic Post-Processing
CovidQA
Daily-Omni
DanFEVER
DanFEVER XLM-RoBERTa Large
DeepFact-Bench
DevEval
ELI5
ELI5PIC
En-3
ENTITYBIOSPIC
EX-FEVER
expert
EXPERTQAPIC
Fact-FOLX-KG
FactKG
FakeNewsDataset
FakeSV
FakeSV_IM
FakeTT
FakeTT_IM
FinanceBench
FOIL-COCO
FutureOmni
GossipCop
H-Bench
HalluQA
HaluEval2
KNIGHT-Judge
L-Bench
Latest News
LUDWIG, CIRCA
MC Fake
MediaEval2016
MHaluBench
MM COVID
MM-MISLEADING
MR2-en
Music-AVQA
NORMBANK
NORMBANK, LUDWIG, CIRCA
nq
OmniBench
Pheme
POPBIOS-CFPIC
POPBIOS-PPIC
PTSD
R^2-HalBench
ReCOVery
ScienceQA
Social media
TextRNN
SOCIALCHEM
SOCIALCHEM, LUDWIG, CIRCA
SOCIALCHEM, NORMBANK
sub-WikiBio
TripleCom
trivia
UltraChat
Weibo NER
Weibo21
WikiBio
WIKICOLLIDE
WikiTQ
WIQA set consistency
Worldsense