日期
机构
发布地址
davar-lab.github.io
许可协议
其他
标签
文本理解
文本识别
视频文本理解
分类
LSVTD 全称 large-scale video text dataset,包含来自 21 个自然场景的 100 个视频。该数据集涵盖了广泛的 13 个室内(如书店、商场)和 9 个室外场景,其多样性是 IC15 数据集的 3 倍以上。