Jeux de données intégrés à R : lister, charger et explorer (mtcars, iris…)

Trouvez les données d’entraînement prêtes à l’emploi de R, chargez-les et inspectez-les en quelques secondes — aucun fichier à importer

R est livré avec des dizaines de jeux de données intégrés pour l’entraînement et les exemples. Listez-les avec data(), chargez un jeu nommé comme mtcars, iris ou ToothGrowth, inspectez-le avec head() et str(), et extrayez un jeu de données de n’importe quel package installé — tout ce dont vous avez besoin pour commencer à vous entraîner sans importer votre propre fichier.

Date de publication

26 juin 2026

Modifié

7 juillet 2026

AstucePoints clés
  • Les lister : data() ouvre le catalogue des jeux de données disponibles ; library(help = "datasets") liste les jeux de base avec une description d’une ligne.
  • En charger un : tapez simplement son nom — mtcars, iris, ToothGrowth sont chargés à la demande, aucun appel à data() n’est nécessaire pour le package de base datasets.
  • Inspecter d’abord : head() montre les premières lignes, str() montre la structure (types + dimensions), ?mtcars ouvre la page d’aide.
  • Depuis un package : data(package = "ggplot2") liste les jeux de données de ce package ; data(diamonds, package = "ggplot2") en charge un.
  • Les incontournables : mtcars (voitures), iris (fleurs), ToothGrowth (groupes), airquality (série temporelle + NA), USArrests (États), faithful (une forme) — utilisez-les pour vous entraîner à n’importe quelle technique.

Introduction

Vous voulez essayer une fonction de tracé, un modèle ou une recette de manipulation de données — mais vous n’avez pas de jeu de données sous la main, et importer un CSV juste pour expérimenter est un détour. R résout ce problème : il est livré avec des dizaines de petits jeux de données propres, conçus précisément pour l’entraînement et les exemples.

Chaque tutoriel que vous lisez les utilise ; savoir comment les lister, les charger et les inspecter est donc une compétence R de base. Cette leçon couvre les trois, puis passe en revue la poignée de jeux de données que vous rencontrerez le plus souvent et ce à quoi chacun est utile.

Lister les jeux de données disponibles

La fonction data() ouvre le catalogue des jeux de données de R. Appelez-la sans argument pour voir tous les jeux de données disponibles dans vos packages chargés :

data()

Dans RStudio, cela ouvre un onglet listant chaque jeu de données avec une courte description. Vous ne pouvez pas faire circuler cette liste avec un pipe — c’est un visualiseur — donc pour une liste imprimable des jeux de données de base (ceux du package datasets, toujours disponibles), utilisez plutôt library(help = "datasets") :

library(help = "datasets")

Pour obtenir les noms sous forme de vecteur de caractères réellement exploitable, accédez au résultat de data() :

ds <- data()
head(ds$results[, "Item"], 15)
 [1] "AirPassengers"          "BJsales"                "BJsales.lead (BJsales)"
 [4] "BOD"                    "CO2"                    "ChickWeight"           
 [7] "DNase"                  "EuStockMarkets"         "Formaldehyde"          
[10] "HairEyeColor"           "Harman23.cor"           "Harman74.cor"          
[13] "Indometh"               "InsectSprays"           "JohnsonJohnson"        

Cette colonne Item contient le nom à passer pour charger chaque jeu.

Charger un jeu de données intégré

Les jeux de données de base sont chargés à la demande (lazy-loaded) : tapez le nom et R le rend disponible. Aucun appel n’est nécessaire pour mtcars, iris et consorts — ils sont là dès que vous les demandez :

head(mtcars)
                   mpg cyl disp  hp drat    wt  qsec vs am gear carb
Mazda RX4         21.0   6  160 110 3.90 2.620 16.46  0  1    4    4
Mazda RX4 Wag     21.0   6  160 110 3.90 2.875 17.02  0  1    4    4
Datsun 710        22.8   4  108  93 3.85 2.320 18.61  1  1    4    1
Hornet 4 Drive    21.4   6  258 110 3.08 3.215 19.44  1  0    3    1
Hornet Sportabout 18.7   8  360 175 3.15 3.440 17.02  0  0    3    2
Valiant           18.1   6  225 105 2.76 3.460 20.22  1  0    3    1

Vous verrez souvent data("mtcars") dans du code ancien. Cela fonctionne toujours et ne fait aucun mal, mais pour le package de base datasets, c’est redondant — le jeu se charge de toute façon à la première utilisation :

data("mtcars")
head(mtcars, 3)
               mpg cyl disp  hp drat    wt  qsec vs am gear carb
Mazda RX4     21.0   6  160 110 3.90 2.620 16.46  0  1    4    4
Mazda RX4 Wag 21.0   6  160 110 3.90 2.875 17.02  0  1    4    4
Datsun 710    22.8   4  108  93 3.85 2.320 18.61  1  1    4    1

Pour savoir ce que contient un jeu de données — ses variables, ses unités et sa source — ouvrez sa page d’aide avec ? :

?mtcars

Inspecter un jeu de données avant de l’utiliser

Avant de construire quoi que ce soit sur un jeu de données, regardez-le. Trois fonctions vous disent presque tout ce dont vous avez besoin.

head() affiche les premières lignes pour que vous puissiez voir les colonnes et quelques valeurs :

head(iris)
  Sepal.Length Sepal.Width Petal.Length Petal.Width Species
1          5.1         3.5          1.4         0.2  setosa
2          4.9         3.0          1.4         0.2  setosa
3          4.7         3.2          1.3         0.2  setosa
4          4.6         3.1          1.5         0.2  setosa
5          5.0         3.6          1.4         0.2  setosa
6          5.4         3.9          1.7         0.4  setosa

str() montre la structure — les dimensions, le type de chaque colonne et un échantillon de valeurs. C’est le moyen le plus rapide de voir ce avec quoi vous travaillez :

str(iris)
'data.frame':   150 obs. of  5 variables:
 $ Sepal.Length: num  5.1 4.9 4.7 4.6 5 5.4 4.6 5 4.4 4.9 ...
 $ Sepal.Width : num  3.5 3 3.2 3.1 3.6 3.9 3.4 3.4 2.9 3.1 ...
 $ Petal.Length: num  1.4 1.4 1.3 1.5 1.4 1.7 1.4 1.5 1.4 1.5 ...
 $ Petal.Width : num  0.2 0.2 0.2 0.2 0.2 0.4 0.3 0.2 0.2 0.1 ...
 $ Species     : Factor w/ 3 levels "setosa","versicolor",..: 1 1 1 1 1 1 1 1 1 1 ...

Lisez-le ainsi : 150 lignes, 5 colonnes ; quatre mesures numériques et un facteur (Species) à trois niveaux. Et dim() donne seulement le nombre de lignes et de colonnes :

dim(iris)
[1] 150   5

head() pour jeter un œil aux données, str() pour connaître leurs types et leur taille, ? pour la documentation complète — exécutez les trois sur tout nouveau jeu de données.

Les jeux de données que vous rencontrerez le plus souvent

Quelques jeux de données reviennent encore et encore dans les tutoriels. Voici ce qu’est chacun d’eux et le genre de technique qu’il permet de pratiquer.

mtcars — voitures (relations)

Consommation de carburant et caractéristiques techniques de 32 voitures issues d’un magazine de 1974 : 32 lignes, 11 colonnes numériques. Idéal pour les nuages de points, la corrélation et la régression (wt vs mpg).

str(mtcars)
'data.frame':   32 obs. of  11 variables:
 $ mpg : num  21 21 22.8 21.4 18.7 18.1 14.3 24.4 22.8 19.2 ...
 $ cyl : num  6 6 4 6 8 6 8 4 4 6 ...
 $ disp: num  160 160 108 258 360 ...
 $ hp  : num  110 110 93 110 175 105 245 62 95 123 ...
 $ drat: num  3.9 3.9 3.85 3.08 3.15 2.76 3.21 3.69 3.92 3.92 ...
 $ wt  : num  2.62 2.88 2.32 3.21 3.44 ...
 $ qsec: num  16.5 17 18.6 19.4 17 ...
 $ vs  : num  0 0 1 1 0 1 0 1 1 1 ...
 $ am  : num  1 1 1 0 0 0 0 0 0 0 ...
 $ gear: num  4 4 4 3 3 3 3 4 4 4 ...
 $ carb: num  4 4 1 1 2 1 4 2 2 4 ...

iris — fleurs (multi-groupes)

Mesures de pétales et de sépales pour 150 fleurs réparties sur 3 espèces (50 chacune). Le jeu classique pour la classification, les graphiques groupés et le partitionnement (clustering) — trois groupes propres et équilibrés.

head(iris, 3)
  Sepal.Length Sepal.Width Petal.Length Petal.Width Species
1          5.1         3.5          1.4         0.2  setosa
2          4.9         3.0          1.4         0.2  setosa
3          4.7         3.2          1.3         0.2  setosa

ToothGrowth — longueur des dents par dose (comparaisons de groupes)

Longueur des dents pour 60 cobayes ayant reçu de la vitamine C à trois doses par deux modes d’administration. Une référence pour les comparaisons de groupes et les boîtes à moustaches (len selon dose et supp).

head(ToothGrowth)
   len supp dose
1  4.2   VC  0.5
2 11.5   VC  0.5
3  7.3   VC  0.5
4  5.8   VC  0.5
5  6.4   VC  0.5
6 10.0   VC  0.5

airquality — mesures quotidiennes de l’air (série temporelle + données manquantes)

Relevés quotidiens d’ozone, de rayonnement solaire, de vent et de température pour New York, de mai à septembre 1973. Utile pour les séries temporelles, les graphiques en courbes et — surtout — s’entraîner à la gestion des valeurs manquantes, puisque Ozone et Solar.R contiennent des NA :

# Count missing values per column
colSums(is.na(airquality))
  Ozone Solar.R    Wind    Temp   Month     Day 
     37       7       0       0       0       0 

USArrests — criminalité par État américain (un jeu numérique de type matrice)

Taux d’arrestations pour crimes violents et population urbaine pour les 50 États américains. Idéal pour la PCA, le partitionnement (clustering) et les cartes de chaleur — entièrement numérique, avec les noms des États comme noms de lignes.

head(USArrests)
           Murder Assault UrbanPop Rape
Alabama      13.2     236       58 21.2
Alaska       10.0     263       48 44.5
Arizona       8.1     294       80 31.0
Arkansas      8.8     190       50 19.5
California    9.0     276       91 40.6
Colorado      7.9     204       78 38.7

faithful — éruptions (forme de distribution)

Durées d’éruption et temps d’attente du geyser Old Faithful : deux colonnes numériques, une distribution bimodale célèbre. Parfait pour les histogrammes et les graphiques de densité lorsque vous voulez une forme nette.

head(faithful)
  eruptions waiting
1     3.600      79
2     1.800      54
3     3.333      74
4     2.283      62
5     4.533      85
6     2.883      55

Charger un jeu de données depuis un package

Les jeux de données intégrés ne sont pas seulement dans le package de base datasets — la plupart des packages de data science fournissent les leurs. Pour voir ce qu’un package propose, passez son nom à data() :

# List the datasets that come with ggplot2
data(package = "ggplot2")

Pour en charger un précis, nommez le jeu de données et le package. (Le package doit être installé ; vous n’avez pas besoin de le charger avec library() au préalable.)

# Load the 'diamonds' dataset from ggplot2
data(diamonds, package = "ggplot2")
head(diamonds)

C’est ainsi que le reste des leçons Datanovia importe ses données pédagogiques — par exemple, la série de statistiques charge des jeux de type data("ToothGrowth") depuis le package datarium.

Utilisez-les pour vous entraîner

Tout l’intérêt de ces jeux de données est que vous pouvez les insérer dans n’importe quelle recette et que cela fonctionne directement. Envie d’essayer un nuage de points ? Utilisez mtcars. Une boîte à moustaches de groupes ? ToothGrowth. Un histogramme d’une vraie forme ? faithful. Parce que tout le monde a les mêmes données, vous pouvez copier le code de n’importe quel tutoriel et reproduire son résultat exact — ce qui est aussi la raison pour laquelle chaque exemple de ce site les utilise.

# Mean tooth length by dose — a one-line group summary on built-in data
aggregate(len ~ dose, data = ToothGrowth, FUN = mean)
  dose    len
1  0.5 10.605
2  1.0 19.735
3  2.0 26.100

Aucune importation, aucun chemin de fichier, aucune configuration — juste des données prêtes à l’emploi.

Essayez en direct

Les blocs ci-dessus se sont exécutés au moment de la génération. Modifiez celui-ci et appuyez sur Run pour explorer vous-même un jeu de données intégré — il s’exécute dans votre navigateur via webR (aucune installation).

🟢 Avec un agent IA

Demandez à Prova « quel jeu de données R intégré devrais-je utiliser pour m’entraîner à une régression logistique ? » — elle suggère un jeu, écrit le code de chargement, et comme le runtime est juste là, vous l’exécutez pour confirmer que les données ressemblent bien à ce que vous attendez avant de construire dessus. Demander à Prova →

Problèmes courants

data() ne renvoie rien que je puisse utiliser. data() ouvre un visualiseur interactif ; il ne renvoie pas de liste exploitable. Pour les noms sous forme de vecteur, utilisez data()$results[, "Item"]. Pour une référence imprimée des jeux de base, utilisez library(help = "datasets").

« object ‘diamonds’ not found » après data(package = "ggplot2"). Lister les jeux de données d’un package avec data(package = "...") n’en charge aucun — cela montre seulement ce qui est disponible. Pour en charger un réellement, nommez-le : data(diamonds, package = "ggplot2"). Le package doit aussi être installé.

Un jeu de données semble chargé mais n’est pas dans mon environnement. Les jeux de données de base sont chargés à la demande — mtcars fonctionne dès la première utilisation sans apparaître dans votre espace de travail jusque-là. C’est normal ; vous n’avez pas besoin de l’« importer ». Si un jeu d’un autre package ne se charge pas, vérifiez que le package est installé avec installed.packages() ou requireNamespace("pkg").

Questions fréquentes

Appelez data() sans argument pour ouvrir le catalogue des jeux de données disponibles, ou library(help = "datasets") pour une liste imprimée des jeux de base avec leurs descriptions. Pour les noms sous forme de vecteur de caractères, utilisez data()$results[, "Item"].

Tapez simplement son nom — head(mtcars) fonctionne immédiatement car les jeux de données de base sont chargés à la demande. Vous pouvez aussi voir data("mtcars") dans du code ancien ; cela fonctionne toujours mais est redondant pour le package de base datasets.

Utilisez data(name, package = "pkg"), par exemple data(diamonds, package = "ggplot2"). Le package doit être installé, mais vous n’avez pas besoin de le charger avec library() au préalable. Pour voir quels jeux de données un package fournit, exécutez data(package = "pkg").

iris contient 150 mesures de fleurs réparties sur 3 espèces (50 chacune) — quatre colonnes numériques plus un facteur Species. Ses groupes propres et équilibrés en font le jeu de données classique pour s’entraîner à la classification, au partitionnement (clustering) et aux graphiques groupés.

Utilisez str(dataset) pour voir les dimensions et le type de chaque colonne, head(dataset) pour afficher les premières lignes, dim(dataset) pour le nombre de lignes/colonnes, et ?dataset pour ouvrir la page d’aide décrivant chaque variable et sa source.

Testez vos connaissances

En utilisant uniquement des données intégrées : affichez la structure de USArrests, puis montrez ses 3 premières lignes, puis chargez le jeu de données economics du package ggplot2 et affichez son head(). (Si ggplot2 n’est pas disponible dans ce bac à sable, remplacez par n’importe quel jeu de base de votre choix.)

# str() shows structure; head(x, n) takes the data and a row count.
# data(name, package = "pkg") loads a packaged dataset by name.
# 1. Structure str(USArrests) # 2. First 3 rows head(USArrests, 3) # 3. From a package data(economics, package = "ggplot2") head(economics)
# 1. Structure
str(USArrests)

# 2. First 3 rows
head(USArrests, 3)

# 3. From a package
data(economics, package = "ggplot2")
head(economics)

Vous voulez voir les jeux de données fournis avec dplyr. Lequel est correct ?

A. data(dplyr) B. data(package = "dplyr") C. library(dplyr)

Afficher la réponse

B. data(package = "dplyr") liste les jeux de données fournis avec ce package. A tente de charger un jeu de données littéralement nommé dplyr (il n’en existe pas). C attache les fonctions du package mais n’affiche ni ne charge ses jeux de données.

Conclusion

Les jeux de données intégrés à R sont le moyen le plus rapide de s’entraîner à n’importe quoi — listez-les avec data(), chargez un jeu de base simplement en le nommant, inspectez-le avec head()/str()/?, et importez les jeux fournis par des packages avec data(name, package = "pkg"). Optez pour mtcars pour les relations, iris pour les groupes, ToothGrowth pour les comparaisons, airquality pour les données manquantes, USArrests pour le multivarié, et faithful pour la forme de distribution.

Leçons connexes

Cette page vous a-t-elle été utile ?

Prouvez que vous savez le faire. Maîtrisez toute la série Les bases de R — suivez votre parcours, construisez des projets et obtenez un certificat.

Commencer gratuitement →

Passez à Pro — Prova illimité sur vos propres données et un certificat vérifiable qui atteste la compétence.

dès 15 $/mois facturé annuellement

Passer à Pro →

✓ Vous êtes Pro — continuez. The runtime is the judge.

Recevez les nouvelles leçons R & Python par e-mail

Pratique, reproductible, sans spam. Désinscription à tout moment.

Double opt-in. Nous ne partageons jamais votre e-mail.

Partager cette pageXLinkedInRedditHN
Note

Cette leçon est reproductible : chaque résultat de cette page a été produit par le code affiché — modifiez n’importe quel bloc et appuyez sur Run pour le reproduire dans votre navigateur. The runtime is the judge.

Réutilisation

Citation

BibTeX
@online{2026,
  author = {},
  title = {Jeux de données intégrés à R : lister, charger et explorer
    (mtcars, iris…)},
  date = {2026-06-26},
  url = {https://www.datanovia.com/learn/programming/r-foundations/r-built-in-datasets},
  langid = {fr}
}
Veuillez citer ce travail comme suit :
“Jeux de données intégrés à R : lister, charger et explorer (mtcars, iris…).” 2026. June 26. https://www.datanovia.com/learn/programming/r-foundations/r-built-in-datasets.