tidymodels en R : construire, valider et prédire
Un guide pratique et complet du workflow tidymodels en R. Découpez vos données avec rsample, construisez un recipe, spécifiez un modèle linéaire avec parsnip, regroupez le…
La colonne vertébrale de la modélisation prédictive du pilier Machine Learning — le workflow tidymodels en R : divisez vos données avec rsample, prétraitez-les avec les recipes, spécifiez un modèle avec parsnip, regroupez le tout dans un workflow, validez par validation croisée et réglez, puis mesurez une performance honnête avec yardstick. Recipe d’abord, reproductible, la fondation sur laquelle s’appuie chaque leçon supervisée.
Apprendre › Machine Learning › Fondations
L’apprentissage supervisé prédit un résultat pour lequel vous disposez d’étiquettes — le prix d’une maison, l’attrition d’un client, la classe d’une tumeur. Avant de vous tourner vers un algorithme particulier, il vous faut un workflow qui divise vos données honnêtement, les prétraite, ajuste un modèle et mesure la qualité de ses prédictions sur des données qu’il n’a jamais vues. Ce workflow, c’est tidymodels — et c’est la colonne vertébrale que réutilise chaque leçon supervisée de ce pilier.
Cette série Fondations enseigne cette colonne vertébrale une fois pour toutes, afin que les leçons ultérieures (régression pénalisée, classification, arbres, explicabilité) puissent se concentrer sur la méthode et se contenter de dire « ajustez-le grâce au workflow que vous connaissez déjà ».
Le workflow prédictif moderne comporte deux moitiés, et cette série couvre les deux :
rsample), spécifiez un modèle (parsnip), regroupez-le dans un workflow, ajustez sur le jeu d’entraînement, prédisez sur le jeu de test, puis évaluez avec yardstick (RMSE, R², MAE). Passez ensuite d’une simple division à la validation croisée (vfold_cv + fit_resamples) pour une estimation honnête, avec un bref aperçu du réglage des hyperparamètres. C’est aussi la rampe d’accès prédictive pour la régression — le pendant « construire un modèle qui prédit bien » des leçons de biostatistique « interpréter mon modèle ».recipes qui alimente la moitié prétraitement de chaque workflow : normalisation, encodage en variables indicatrices, imputation des données manquantes (y compris le cadrage très recherché « imputation multiple »), transformations d’asymétrie, PCA et suppression des prédicteurs inutiles. Un prétraitement fait correctement — ajusté sur l’entraînement, appliqué au test — pour ne jamais laisser fuiter d’information.La même régression peut répondre à deux questions très différentes :
| Vous voulez… | Allez à | Outils |
|---|---|---|
| Prédire correctement sur de nouvelles données (diviser, valider, régler, déployer) | cette série | tidymodels |
| Interpréter les coefficients, les p-value et les hypothèses | Régression linéaire (Biostatistique) | lm · broom · car |
Chacun est enseigné une fois, dans son foyer naturel, et ils se renvoient l’un à l’autre dans les deux sens — pour que vous ne restiez jamais bloqué sur la mauvaise page pour votre question.
Si vous avez appris la modélisation prédictive avec caret (train(), trainControl(), preProcess()), tidymodels en est le successeur moderne — les mêmes idées, une API plus propre et modulaire. La première leçon inclut une correspondance côte à côte caret → tidymodels pour que la transition soit indolore.
Cette série ancre la moitié apprentissage supervisé du pilier Machine Learning. Les Fondations arrivent en premier (le workflow que réutilise chaque leçon ultérieure) ; puis la sélection de modèles et la validation de modèles, la classification, l’apprentissage statistique (arbres, kNN, ensembles) et l’explicabilité et confiance.
Demandez à Prova « construis-moi un workflow tidymodels qui prédit ce résultat et me dit à quel point il est bon » — elle répond avec du code R que vous pouvez exécuter sur vos propres données, puis vous aide à lire les métriques et à décider si vous pouvez faire confiance au modèle. The runtime is the judge. Demander à Prova →
Prouvez que vous savez le faire. Maîtrisez toute la série Modélisation prédictive en R — suivez votre parcours, construisez des projets et obtenez un certificat.
Passez à Pro — Prova illimité sur vos propres données et un certificat vérifiable qui atteste la compétence.
dès 15 $/mois facturé annuellement
✓ Vous êtes Pro — continuez. The runtime is the judge.
Prêt à passer à la vitesse supérieure ?
Recevez les nouvelles leçons R & Python par e-mail
Pratique, reproductible, sans spam. Désinscription à tout moment.
Double opt-in. Nous ne partageons jamais votre e-mail.
@online{untitled,
author = {},
title = {Construire et valider des modèles avec tidymodels},
url = {https://www.datanovia.com/learn/machine-learning/foundations/},
langid = {fr}
}