HyperAIHyperAI

Command Palette

Search for a command to run...

الاتساق الواقعي

التحقق من أن النص المولد يتسق مع الحقائق بالنسبة للمادة المصدرية، والكشف عن الهلوسات والأخطاء الواقعية في مخرجات النموذج.

لوحة الصدارة

100 نماذج بالمجموع

مقاييس الأداء

POPE
KILT: FEVER
Re2G
MedClaim
StrategyClaim
TruthfulClaim
B-score evaluation set
MMLU
AMBER
CorFEVER
FEVER
BEAF
CSQA
HLE
MuSiQue
MedMCQA
AVeriTeC
FNC-1
Sepúlveda-Torres R., Vicente M., Saquete E., Lloret E., Palomar M. (2021)
MediEval
SQuAD
GQA
LIAR
MMRel
R-Bench
TruthfulQA
AVHBench
COCO
HotpotQA
MOCHEG
PhD
SNLI
VERITE
A-OKVQA
ARC-C
HellaSwag
NewsCLIPpings
PubmedQA
BIG-Bench
CosmosQA
FaithEval
FakeHealth
LLaVA-Bench
MedQA
MMFakeBench
MMLU Anatomy
MMLU Clinic
MMLU Col-Bio
MMLU Col-Med
MMLU Gene
MMLU Pro-Med
MovieSum
MSCOCO
PubHealth
RAGTruth
RAWFC
RPE
SCIFACT
Biography
CICERO V1
CICERO V2
CLAIMREVIEW2024+
CommonsenseQA 2.0
Disagreement Set
EG-QA
Feverous
HallusionBench
HOVER
MISBENCH
MMEval-Pro
MMVP
PIQA
POPE-A
POPE-P
POPE-R
QASC
RealWorldQA
SIQA
SWAG
TriviaQA
True-False
VMCBench
VStar
5Pils-OOC
ADE
Adversarial GLUE
bAbI
BorderLines
Caltech101
Cifar10
Cifar100
CMM
Country211
CRPE_R
DailyOmni
DASH
Dolly (AC)
DTD
Eurosat
FActScore
Flowers
Food
Geometry3K
GTSRB
HQH
JudgeBench
LLMBar
LogicStruct
MathVerse
MathVision
MathVista
MM-Vet
MMAU
MMBench
MMK12-Bio
MMK12-Chem
MMK12-Math
MMK12-Phys
MNIST
MNLI
MVBench
NaturalQuestion
Pets
PopQA
Real-MM-RAG
RePOPE
SST2
STL10
Sun397
True-False dataset
TruthfulQA MC1
VisuLogic
WHOOPS!
Wiki-C
Wiki-L
Wiki-S
2WikiMultiHopQA
AbstainQA (MMLU)
AmbigQA
Athlete Sport
BioGEN
Book Author
CLAPNQ
CNN/Daily Mail
Company Founder
Company Headquarter
DA
ELI5-WebGPT
ExpertQA
FM2
FreshQA
GAIA
HAGRID
HaluEval-Summary
Hate Speech Ending
History of Science qa
JudgeAnything
JudgeLM val set
KUQ
LLaVA QA90
LogicStruct dataset
Math-Vista
MENSA
MLLM-Judge
MS-COCO
MWPs
NQ Swap
NQ-Open
Official Language
PandaLM test set
POPE-MSCOCO
Proverb Ending
Proverb Translation
QA
QAGS-CNNDM
QuoteSum
Real-World Benchmarks
SAMSum
SC
SCBench
SUM
VerifierBench
VerifyBench
Vizwiz
VLMBias
VQAv2-IDK
WHOOPS
World Capital
xbench-deepsearch
2WikiMQA
AlpacaFact
AOKVQA
ASAP
ASDiv
chain dataset
ContextualJudgeBench
ContraDoc
FactCheckGPT
FACTOR
FAITH-M
FaithBench
Fava
FELM-Science
GSM8K+MathQA
HELM
KLAR
LongBench-Chat & LongBench
LongFact
MathQA
MediaSum
MeetingBank
MT-Bench
OOD Object
OOD Relation
POLITIFACT-HIDDEN
POPE-COCO
StrategyQA
SummEval
SVAMP
TrendFact
Twitter
UnKEBench
Weibo
Wikibio-GPT3
2-hop HOVER
3-hop HOVER
3D-POPE
4-hop HOVER
ActivityNet-FOIL
AFaCTA
Alpaca-Judge
arc
ASKHISTORIANSPIC
BingCheck
BoolQ
Ch-3
CHECKWHY
CheeseBurger
ClassEval
CMHE-HD
CommenseQA
COVID-19 Fake News Dataset
Ensemble Model + Heuristic Post-Processing
CovidQA
Daily-Omni
DanFEVER
DanFEVER XLM-RoBERTa Large
DeepFact-Bench
DevEval
ELI5
ELI5PIC
En-3
ENTITYBIOSPIC
EX-FEVER
expert
EXPERTQAPIC
Fact-FOLX-KG
FactKG
FakeNewsDataset
FakeSV
FakeSV_IM
FakeTT
FakeTT_IM
FinanceBench
FOIL-COCO
FutureOmni
GossipCop
H-Bench
HalluQA
HaluEval2
KNIGHT-Judge
L-Bench
Latest News
LUDWIG, CIRCA
MC Fake
MediaEval2016
MHaluBench
MM COVID
MM-MISLEADING
MR2-en
Music-AVQA
NORMBANK
NORMBANK, LUDWIG, CIRCA
nq
OmniBench
Pheme
POPBIOS-CFPIC
POPBIOS-PPIC
PTSD
R^2-HalBench
ReCOVery
ScienceQA
Social media
TextRNN
SOCIALCHEM
SOCIALCHEM, LUDWIG, CIRCA
SOCIALCHEM, NORMBANK
sub-WikiBio
TripleCom
trivia
UltraChat
Weibo NER
Weibo21
WikiBio
WIKICOLLIDE
WikiTQ
WIQA set consistency
Worldsense