Data

Open AI Datasets

25 widely used datasets for text, code, image, audio, video, and benchmark workflows.

NameProviderCategorySizeLicenseCommercialLink
AudioSetGoogleaudio2,084,320 10s clips (5.8 thousand hours of audio)CC-BY 4.0NoOpen
BIG-BenchBIG-bench Collaborationbenchmark200+ tasksApache 2.0YesOpen
C4 (Colossal Clean Crawled Corpus)Google Researchtext305GB (English subset), 1.7TB (full dataset)ODC-By 1.0YesOpen
Common VoiceMozillaaudio30K+ hoursCC0-1.0YesOpen
CosmopediaHuggingFacetext25B tokensApache 2.0YesOpen
DolmaAI2 (Allen Institute)text4.5TB (v1.7 gzip), 5.4TB (v1.6), 16.4GB (v1.6-sample), 6.4TB (v1.5), 2.9TB (v1.5-sample), 6.0TB (v1)ODC-By 1.0YesOpen
FineWebHuggingFacetext15T tokensODC-By 1.0YesOpen
FineWeb-EduHuggingFacetext15T tokens (45TB compressed)ODC-By 1.0YesOpen
ImageNetStanford/Princetonimage14,197,122 images, 21841 synsets indexedCustom (research)NoOpen
LAION-5BLAIONimage5.85B image-text pairsCC-BY 4.0 (metadata only; images carry original licenses)NoOpen
LibriSpeechOpenSLRaudio1000 hoursCC BY 4.0YesOpen
MS COCOMicrosoftimage330K images (>200K labeled)CC-BY 4.0 (annotations); mixed (Flickr images)YesOpen
MS MARCOMicrosofttext1M+ passages (100K QnA, 1M QnA, 180K NLG, 148K KeyPhrase, Crawling dataset, Conversational search)Custom (non-commercial research only, no license granted)NoOpen
Natural QuestionsGoogletext300K+ questionsCC-BY-SA 3.0YesOpen
Open Images V7Googleimage15,851,536 boxes on 600 classes; 2,785,498 instance segmentations on 350 classes; 3,284,280 relationship annotations on 1,466 relationships; 675,155 localized narratives; 66,391,027 point-level annotations on 5,827 classes; 61,404,966 image-level labels on 20,638 classes; Extension - 478,000 crowdsourced images with 6,000+ classesCC-BY 4.0YesOpen
OpenAssistant ConversationsLAIONtext88.8k rowsApache 2.0YesOpen
RedPajama v2Together AItext100B+ documents (30T+ tokens, 20B deduplicated)CC-BY 4.0YesOpen
SlimPajamaCerebrastext627B tokensApache 2.0YesOpen
SQuAD 2.0Stanfordtext150K questionsCC-BY-SA 4.0YesOpen
StarCoderDataBigCodecode783GBApache 2.0YesOpen
The PileEleutherAItext825 GiBmixed (constituent data)YesOpen
The Stack v2BigCode / HuggingFacecode67.5TB (full), 32.1TB (dedup), ~900B tokens (train)Mixed per-repoNoOpen
UltraChatTsinghua NLPtext~949k rowsMITYesOpen
WebVidUniversity of Oxfordvideo10 million video-text pairsCC-BY 4.0 (metadata); mixed (videos from web)NoOpen
Wikipedia DumpWikimediatext22GB (English)CC-BY-SA-3.0 AND GFDLYesOpen