Command Palette
Search for a command to run...
WIT 이미지-텍스트 데이터 세트

WIT는 대규모 다중 모드 및 다국어 데이터 세트인 Wikipedia 기반 이미지 텍스트를 의미합니다. 이 데이터 세트는 108개 위키백과 언어로 작성된 1,150만 개의 고유한 이미지를 포함하는 3,760만 개의 엔터티가 강화된 이미지-텍스트 예시로 구성된 큐레이션된 컬렉션으로 구성되어 있습니다. 이 데이터 세트의 크기는 다중 모드 머신 러닝 모델의 사전 학습 데이터 세트로 사용하기에 적합합니다. WIT에는 4가지 독특한 장점이 있습니다.
- WIT는 이미지-텍스트 예시의 수 측면에서 가장 큰 멀티모달 데이터 세트입니다.
- 100개 이상의 언어가 포함되어 있으며(언어당 최소 12,000개의 예 포함), 많은 이미지에 대해 언어 간 텍스트가 제공됩니다.
- 이전 데이터 세트에 비해 WIT는 더 다양한 개념과 현실 세계의 실체를 나타냅니다.
- WIT는 매우 도전적인 실제 테스트 세트를 제공합니다.
소환
@inproceedings{10.1145/3404835.3463257, 저자 = {스리니바산, 크리슈나, 라만, 카르틱, 첸, 지에차오, 벤더스키, 마이클, 나조크, 마크}, 제목 = {WIT: 다중 모드 및 다중 언어 머신 러닝을 위한 위키피디아 기반 이미지-텍스트 데이터셋}, 연도 = {2021}, ISBN = {9781450380379}, 발행사 = {컴퓨터협회}, 주소 = {미국 뉴욕주 뉴욕}, URL = {https://doi.org/10.1145/3404835.3463257}, doi = {10.1145/3404835.3463257}, 책 제목 = {제44회 ACM SIGIR 정보 검색 연구 개발 국제 학술 대회 논문집}, 페이지 = {2443–2449}, 페이지 수 = {7}, 키워드 = {데이터셋, 멀티모달, 머신러닝, 위키피디아, 다국어, 이미지-텍스트 검색, 신경망}, 위치 = {가상 이벤트, 캐나다}, 시리즈 = {SIGIR '21} }