LSVTD 视频文本理解数据集

本站暂不支持该数据集下载,如需下载请访问上述「发布地址」进行下载(如可用)

LSVTD 全称 large-scale video text dataset,包含来自 21 个自然场景的 100 个视频。该数据集涵盖了广泛的 13 个室内(如书店、商场)和 9 个室外场景,其多样性是 IC15 数据集的 3 倍以上。