10 sites données

10 sites pour trouver des jeux de données pour vos modèles

Emmanuel Jakobowicz Mis à jour le : 25 juin 2026 actualités 4 Comments

Lorsque vous essayez de tester des modèles, il est complexe de trouver des jeux de données intéressants. Dans cet article, nous faisons un petit tour de quelques sites vous permettant de vous lancer avec de belles données.

Avant de télécharger : vérifiez la licence. Un jeu de données « public » n’est pas toujours réutilisable librement, surtout en contexte commercial. Repérez la licence (CC0, CC-BY, MIT, ODbL…) et, pour des données personnelles, vérifiez la conformité RGPD. Méfiez-vous aussi des biais et de la qualité : un modèle ne vaut que ce que valent ses données.

Le plus riche : Kaggle

Connu pour ses compétitions, Kaggle est aussi une mine de jeux de données (plusieurs centaines de milliers), souvent accompagnés de notebooks d’exemple qui montrent comment les exploiter. Idéal pour débuter et s’inspirer.

https://www.kaggle.com/datasets

En vous connectant, vous accéderez à des quantités extrêmement larges de données et des exemples de traitements.

Hugging Face Datasets – la référence pour l’IA

Devenu le hub central de l’écosystème IA, Hugging Face héberge un nombre considérable de jeux de données (NLP, vision, audio, multimodal), tous chargeables en une ligne avec la librairie datasets. Incontournable dès qu’on touche au deep learning ou aux LLM. 🔗 https://huggingface.co/datasets

Le plus ancien : UCI Machine Learning Repository

Créé en 1987, c’est la source historique des jeux de données « classiques » du machine learning (Iris, Adult, Wine…). Le site a été entièrement refondu en 2023 (la vieille adresse /ml/ a été abandonnée) et maintient aujourd’hui près de 690 jeux de données bien documentés. 🔗 https://archive.ics.uci.edu/

OpenML – pensé pour l’expérimentation reproductible

OpenML associe jeux de données, tâches et résultats de modèles, le tout interconnecté. Il s’intègre directement avec scikit-learn (fetch_openml), ce qui en fait un excellent terrain de benchmark. 🔗 https://www.openml.org/

L’outil de recherche de jeux de données par Google

Le « Google » des jeux de données : il indexe les datasets publiés partout sur le web et renvoie des liens vers la source. (L’ancienne adresse toolbox.google.com n’est plus valide.) 🔗 https://datasetsearch.research.google.com/

Papers With Code – Datasets

Pour chaque jeu de données, vous voyez les articles, les benchmarks et l’état de l’art associés. Parfait pour trouver les données de référence d’une tâche précise et savoir quels modèles y performent. 🔗 https://paperswithcode.com/datasets

Les données d’Amazon

Amazon n’est pas en reste avec 120 jeux de données disponibles ici :

https://registry.opendata.aws/

Il s’agit encore de données « maison ».

Reddit pour des jeux de données avec discussion

Le site Reddit a une partie réservée aux datasets qui vous permettra de trouver la pépite dont vous avez besoin :

https://www.reddit.com/r/datasets/

Les données d’open data

L’open data est une source sans cesse renouvelée de données. Vous en trouverez quelques-uns dans notre article dédié au sujet.

Awesome public dataset, si vous cherchez des donnez sur un sujet

Si vous cherchez des données disponibles sur un domaine spécifique ce dépôt GitHub rassemble tout ce dont vous avez besoin :

https://github.com/awesomedata/awesome-public-datasets

Pour la vision par ordinateur

Pour les problématiques de vision par ordinateur, il faut des jeux de données spécifiques, visualdata.io rassemble de nombreux liens vers des données :

https://www.visualdata.io/

D’autres jeux de données en vrac

Les données airbnb (avec Paris) : http://insideairbnb.com/

Les données du million de chanson pour de la données sonore : http://millionsongdataset.com/

Les données vocales de la fondation Mozilla (30Gb en anglais et 5Gb en français) : https://voice.mozilla.org/en/datasets

Les données d’images de vêtements de Zalando, aussi appelé fashion-mnist : https://github.com/zalandoresearch/fashion-mnist

Par grand domaine

Vision par ordinateur
  • Roboflow Universe : la plus grande collection de jeux de données et de modèles de vision (détection, segmentation), avec outils d’annotation : https://universe.roboflow.com/
  • Papers With Code (ci-dessus) pour les datasets de référence (COCO, ImageNet…).
  • Fashion-MNIST : le célèbre remplaçant « vêtements » de MNIST, signé Zalando : https://github.com/zalandoresearch/fashion-mnist
  • VisualData.io, cité dans la version d’origine, existe encore mais n’est plus vraiment maintenu : https://www.visualdata.io/
Texte et NLP
  • Hugging Face Datasets (ci-dessus) est aujourd’hui la première source pour le texte.
Audio et voix
  • Mozilla Common Voice : le plus grand corpus vocal libre (licence CC0). Il atteint désormais environ 35 000 heures réparties sur près de 290 langues (l’ancienne adresse voice.mozilla.org est abandonnée) : https://commonvoice.mozilla.org/datasets
  • Million Song Dataset : un million de morceaux… mais attention, il s’agit de caractéristiques audio et de métadonnées, pas de fichiers sonores bruts : http://millionsongdataset.com/
Recherche et science
  • Zenodo : dépôt du CERN qui héberge des jeux de données de recherche avec un DOI citable, tous domaines confondus : https://zenodo.org/
  • Registry of Open Data on AWS : des centaines de jeux de données (souvent volumineux) mis à disposition par de nombreuses organisations (NOAA, NASA, Sentinel, séquençage génomique…), et pas seulement par Amazon : https://registry.opendata.aws/

Autres sources utiles

Charger un jeu de données directement en Python

Pour les exemples et prototypes, inutile de télécharger quoi que ce soit : plusieurs librairies embarquent ou téléchargent les données pour vous.

# scikit-learn : jeux classiques intégrés + OpenML
from sklearn.datasets import load_iris, fetch_openml
iris = load_iris(as_frame=True)
titanic = fetch_openml("titanic", version=1, as_frame=True)

# seaborn : petits jeux pour la visualisation
import seaborn as sns
tips = sns.load_dataset("tips")

# Hugging Face : des centaines de milliers de jeux de données
from datasets import load_dataset
imdb = load_dataset("imdb")

# UCI, via le package officiel
from ucimlrepo import fetch_ucirepo
wine = fetch_ucirepo(id=109)

# Kaggle, via kagglehub
import kagglehub
chemin = kagglehub.dataset_download("zillow/zecon")

Envie d’exploiter ces données avec nos experts ?

Trouver les données n’est que la première étape : encore faut-il les nettoyer, les modéliser et les interpréter. Nous formons à la data science, au machine learning et à Python au quotidien. Découvrez nos formations data ou contactez-nous.

N’hésitez pas à en soumettre d’autres en commentaire de cet article.

Formations data

Des données au modèle : passez à l’action

Vous avez trouvé vos jeux de données ? Reste à construire des modèles fiables. Nos formations data science & machine learning vous y amènent pas à pas, de la manipulation en Python à scikit-learn, sur des cas concrets.

Découvrir nos formations data

Certifié Qualiopi — finançable OPCO Petits groupes À distance ou à Paris

Partager cet article

Comments 4

  1. Bonjour je veux un jeu de données contenant les fichiers avec leurs caractéristiques comme (nom, extension, taille, signature , pays d’origine, etc…)

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *