Datasets.md

June 8, 2023 ยท View on GitHub

  • An overview of multi-modal datasets proposed for large-scale pre-training.

  • Youku-mPLUG: A 10 Million Large-scale Chinese Video-Language Pre-training Dataset and Benchmarks, [Paper] [Github]

  • LAION-5B: An open large-scale dataset for training next generation image-text models, [Paper] [Project]

  • COYO-700M: Image-Text Pair Dataset [Code]

NO.DatasetYearScaleModalityLanguageAvailableURL
01SBU Captions20111Mimage-textEnglishYes[Link]
02Flickr30k2014145Kimage-textEnglishYes[Link]
03COCO2014567Kimage-textEnglishYes[Link]
04Visual Genome20175.4Mimage-textEnglishYes[Link]
05VQA v2.020171.1Mimage-textEnglishYes[Link]
06FashionGen2018300kimage-textEnglishYes[Link]
07CC3M20183Mimage-textEnglishYes[Link]
08GQA20191Mimage-textEnglishYes[Link]
09LAIT202010Mimage-textEnglishNo-
10CC12M202112Mimage-textEnglishYes[Link]
11AltText20211.8Bimage-textEnglishNo-
12TVQA201821,793video-textEnglishYes[Link]
13HT100M2019136Mvideo-textEnglishYes[Link]
14WebVid2M20212.5Mvideo-textEnglishYes[Link]
15YFCC-100M2015100Mimage-textEnglishYes[Link]
16LAION-400M2021400Mimage-textEnglishYes[Link]
17RedCaps202112Mimage-textEnglishYes[Link]
18Wukong2022100Mimage-textChineseYes[Link]
19CxC202124Kimage-textEnglishYes[Link]
20Product1M20211Mimage-textChineseYes[Link]
21WIT202137.5Mimage-textMulti-lingualYes[Link]
22JFT-300M201730Mimage-textEnglishNo-
23JFT-3B20213000Mimage-textEnglishNo-
24IG-3.5B-17k2018350Mimage-textEnglishNo-
25M6-Corpus202160Mimage, image-textChineseNo-
26M5Product20216Mimage, text, table, video, audioEnglishYes[Link]
27Localized Narratives2020849kimage, audio, text, mouse traceEnglishYes[Link]
28RUC-CAS-WenLan202130Mimage-textChineseNo-
29WuDaoMM2022600Mimage-textChineseYes[Link]
30MEP-3M20213Mimage-textChineseYes[Link]
31WSCD2021650Mimage-textChineseNo-