HyperAI
Command Palette
Search for a command to run...
クロスモーダル生成
画像キャプション、テキストから画像への変換、またはビジュアルダイアログなど、あるモダリティに基づいて別のモダリティでコンテンツを生成すること。
リーダーボード
100 モデル 合計
ベンチマーク
COCO
MIMIC-CXR
VizWiz 2020 test-dev
Flickr30k
nocaps in-domain
VinVL (Microsoft Cognitive Services + MSR)
nocaps out-of-domain
PaLI
NoCaps
nocaps entire
coco-captions
OSCAR
nocaps near-domain
GIT2, Single Model
VIST
MSR-VTT
AudioCaps
MSVD
YouCook2
Clotho
HumanML3D
TextCAPS
VisDial v0.9 val
9xFGA (VGG)
CheXpert Plus
CLEVR-Change
cub
VQ-Diffusion-F
IU-Xray
Spot-the-Diff
VizWiz 2020 test
Gibson
HM3D
MSCOCO
nocaps-XD entire
GIT
RefCOCOg
nocaps-val-in-domain
nocaps-val-overall
nocaps-XD in-domain
GIT
nocaps-XD near-domain
GIT
nocaps-XD out-of-domain
GIT
TextCaps 2020
VATEX
BoFiT
Image Paragraph Captioning
Multi-Modal-CelebA-HQ
nocaps-val-near-domain
nocaps-val-out-domain
XM3600
ScanRefer
SCICAP
CNN+LSTM (Vision only, First sentence)
CMD-AD
COCO Karpathy
COCO2017 caption
CoMMuTE
Multi30K
Nymeria
OB-Radix
TV-AD
VggCaps
BOBSL
ChestXray8
Conceptual Captions
ClipCap (MLP + GPT2 tuning)
Daily-PP
DOCCI
Flickr
Flickr30k Captions test
Unified VLP
MS-COCO
MS-CXR
Nr3D
Oxford 102 Flowers
RAT-Diffusion
RefCOCO
VinDr-CXR
WIKIWEB2M
ActivityNet Captions
Chart-to-Text
ChartMind
ChEBI-20
CLEVR-DC
DiagramQG
NBA-Identity
OpenCQA
VC-NBA-2022
whoops
activitynet-captions
BDD-X
COCO2017
Ego4D
EGTEA+ Gaze
Image-Chat_AVD
MSRVTT-CTN
MSVD-CTN
Photo-Chat_AVD
SN-Long
VisualMRC
ActivityNet Caption
BrainHub
COCO-LN500
Flickr8k
HIVAU-70K
How2Sign
Image-Edit-Request
L+M-24
MAD-Eval
ScanQA
VBench
VENUS
Visual Genome
ControlCap
AVA-Captions
Birds-to-Words
Clotho v1
Clotho v2
COCO
Parti Finetuned
COCO-Cap
COCO-EE
EchoVLM dataset
HowToNarrate
iGround
Image-Editing-Request
IU X-Ray
L+M
LingoQA
LLaVAR-2-Cap
LLaVAR-2-VQA
MS COCO (Karpathy Split)
MusicQA
nocaps val
Prismer
Phoenix-2014T
R2R
REVERIE
ShareGPT4V & DCI
Stanford Image Paragraph dataset
ViTT
A-OKVQA
AVSD-DSTC10
AVSD-DSTC7
AVSD-DSTC8
ChartCap
COCO Captions
COCO test
COCO Captions test
From Captions to Visual Concepts and Back
COCO-LN
COMPOSITION-CAP
CSL-Daily
DOCCI500
DRAMA
EE
Emu Edit
Flickr30k → MSCOCO
Flickr30k Entities
Flickr30k-LN
IC
Image Caption
Image Editing Request
Instruct-V2Xum
K-VQG
KnowCap Test
Kollenda et al.
laion-coco
Parti Finetuned
LEVIR-CC
LLaVA-Med
Localized Narratives
Longitudinal-MIMIC
Med-Trinity
MJHQ-30K
Motion-X
MS COCO
MSCOCO → Flickr30k
MSCOCO Test
Multilingual-General
Music4way-Any2T
Music4way-MI2T
Music4way-MusicCaps
Music4way-MV2T
MusicCaps
Narratives
Natural Scenes Dataset (NSD)
nuScenes
OK-VQA
OpenImages-I
Parti-Prompts
Reason2Drive
Reasoning
RefCOCO+
RxR
ShareGPT4V, DCI
Shot2Story20K
SoccerNet-v2
Spot-the-Change
Spotlight
TVC
UCCD
UCM-Captions
UniMER-Test
VEGA
VG
VideoXum
VisDial v1.0 test-std
5xFGA + LS*+
Visual Genome
VQG-COCO
WTS
YOUCOOKII
ACD
AIC-ICC
AppealImage
BanglaLekhaImageCaptions
CNN + 1D CNN
BCT-CHR
BEATv2
BenSMOT
BlendedSkillTalk
BLiSS
Boxing (BX)
CB-300K
CheXpert
ChinaOpen-1k
GVT
CLD
ClothoCaps
CMER-Bench
COCO Caption
COCO-Caption
Colors
BiLSTMS on color generation
COMPOSITIONCAP
Conceptual
ConvAI2
CoVLA
CRG
CTRG-Brain
CUB-200
CUVA
Data-Comp
DnD Group Gesture dataset
DNICC19k
DocParsing
Dubai-CC
DVQA
EE4D-DescCoach
Ego-Exo4D
empatheticdialogues
FetusR
Figure Skating (FS)
Flickr-8k
Flickr30k Test
Flickr30k-lite
Flickr30k⇒MSCOCO
FlickrStyle10K
CapDec
Four Layers
FSVQA
GigaHands
GLaMM
GoodNews
GrowthFetus
HC-STVG
He et al.
Hindi Visual Genome (Challenge Set)
Hindi Visual Genome (Test Set)
HouseTour dataset
IER
Image-Chat
ImageChat
IU X-Ray
J-MID
Kinetics-GEB+
ActBERT-revised
KIT-ML
LeBel's dataset
LN COCO
M3-20M
MAD dataset
MAviS-Bench
Meme-Image-No-Text
MEMECAP
MM-AVS
MMTT
Mol-Instructions
MORE
MS-COCO Karpathy test split
MSCOCO⇒Flickr30k
MSRVTT
MSVD-Indonesian
Multi-Modal CelebA-HQ
No-Caps
NSD
NuInteract
NWPU-Captions
NYTimes800k
Object Pair 1
Object Pair 2
Object Pair 3
OmniDiff
OmniDrive-nuScenes
Overall
PAd1M
Paragraph Caption
PATENTDESC-355K
PCDes
Peir Gross
BiomedGPT
PETARSeg-11k
Previous Caption
Proprietary
proprietary longitudinal chest CT dataset
PV-VTT
QEVD-bio-fit-coach
QEVD-fit-coach
Real-world audio-visual video evaluation set
Recipe1M
Ref-L4
RQA-70K
RSICD
ScanNet++
ScanQAval
SceneCap
Semantic-HOI
SoccerNet-Caption
Spot-the-Dif
STD
SummScreen3D
SurgVLM
Sydney-Captions
Syned
Syned + EE
T2I-FactualBench
Three Layers
TIB
Trailer-Test
Two Layers
UCFCAP
UMD
UniKnowCap Test
V2C
VALOR-32K
VAR test
VDC
vidchapters-7m
VietPET-RoI
VIEWS
visdial
VISTA
Visual News
VQA-E
VRG
W3DA
Waymo
Wizard of Wikipedia
WOMD-Reasoning
XMSMO-News
YoLLaVA
YouCookII test