Construire et valider des modèles avec tidymodels

La colonne vertébrale de la modélisation prédictive du pilier Machine Learning — le workflow tidymodels en R : divisez vos données avec rsample, prétraitez-les avec les recipes, spécifiez un modèle avec parsnip, regroupez le tout dans un workflow, validez par validation croisée et réglez, puis mesurez une performance honnête avec yardstick. Recipe d’abord, reproductible, la fondation sur laquelle s’appuie chaque leçon supervisée.

ApprendreMachine Learning › Fondations

L’apprentissage supervisé prédit un résultat pour lequel vous disposez d’étiquettes — le prix d’une maison, l’attrition d’un client, la classe d’une tumeur. Avant de vous tourner vers un algorithme particulier, il vous faut un workflow qui divise vos données honnêtement, les prétraite, ajuste un modèle et mesure la qualité de ses prédictions sur des données qu’il n’a jamais vues. Ce workflow, c’est tidymodels — et c’est la colonne vertébrale que réutilise chaque leçon supervisée de ce pilier.

Cette série Fondations enseigne cette colonne vertébrale une fois pour toutes, afin que les leçons ultérieures (régression pénalisée, classification, arbres, explicabilité) puissent se concentrer sur la méthode et se contenter de dire « ajustez-le grâce au workflow que vous connaissez déjà ».

Ce que vous allez apprendre ici

Le workflow prédictif moderne comporte deux moitiés, et cette série couvre les deux :

  1. Construire et valider des modèles avec tidymodels — l’arc complet sur un exemple de régression concret : divisez les données (rsample), spécifiez un modèle (parsnip), regroupez-le dans un workflow, ajustez sur le jeu d’entraînement, prédisez sur le jeu de test, puis évaluez avec yardstick (RMSE, R², MAE). Passez ensuite d’une simple division à la validation croisée (vfold_cv + fit_resamples) pour une estimation honnête, avec un bref aperçu du réglage des hyperparamètres. C’est aussi la rampe d’accès prédictive pour la régression — le pendant « construire un modèle qui prédit bien » des leçons de biostatistique « interpréter mon modèle ».
  2. Ingénierie des caractéristiques avec les recipes — la boîte à outils recipes qui alimente la moitié prétraitement de chaque workflow : normalisation, encodage en variables indicatrices, imputation des données manquantes (y compris le cadrage très recherché « imputation multiple »), transformations d’asymétrie, PCA et suppression des prédicteurs inutiles. Un prétraitement fait correctement — ajusté sur l’entraînement, appliqué au test — pour ne jamais laisser fuiter d’information.

Prédire ou interpréter — deux parcours, à un clic l’un de l’autre

La même régression peut répondre à deux questions très différentes :

Vous voulez… Allez à Outils
Prédire correctement sur de nouvelles données (diviser, valider, régler, déployer) cette série tidymodels
Interpréter les coefficients, les p-value et les hypothèses Régression linéaire (Biostatistique) lm · broom · car

Chacun est enseigné une fois, dans son foyer naturel, et ils se renvoient l’un à l’autre dans les deux sens — pour que vous ne restiez jamais bloqué sur la mauvaise page pour votre question.

Vous venez de caret ?

Si vous avez appris la modélisation prédictive avec caret (train(), trainControl(), preProcess()), tidymodels en est le successeur moderne — les mêmes idées, une API plus propre et modulaire. La première leçon inclut une correspondance côte à côte caret → tidymodels pour que la transition soit indolore.

Toutes les leçons

Note

Cette série ancre la moitié apprentissage supervisé du pilier Machine Learning. Les Fondations arrivent en premier (le workflow que réutilise chaque leçon ultérieure) ; puis la sélection de modèles et la validation de modèles, la classification, l’apprentissage statistique (arbres, kNN, ensembles) et l’explicabilité et confiance.

🟢 Avec un agent IA

Demandez à Prova « construis-moi un workflow tidymodels qui prédit ce résultat et me dit à quel point il est bon » — elle répond avec du code R que vous pouvez exécuter sur vos propres données, puis vous aide à lire les métriques et à décider si vous pouvez faire confiance au modèle. The runtime is the judge. Demander à Prova →

Cette page vous a-t-elle été utile ?

Prouvez que vous savez le faire. Maîtrisez toute la série Modélisation prédictive en R — suivez votre parcours, construisez des projets et obtenez un certificat.

Commencer gratuitement →

Passez à Pro — Prova illimité sur vos propres données et un certificat vérifiable qui atteste la compétence.

dès 15 $/mois facturé annuellement

Passer à Pro →

✓ Vous êtes Pro — continuez. The runtime is the judge.

Recevez les nouvelles leçons R & Python par e-mail

Pratique, reproductible, sans spam. Désinscription à tout moment.

Double opt-in. Nous ne partageons jamais votre e-mail.

Partager cette pageXLinkedInRedditHN

Citation

BibTeX
@online{untitled,
  author = {},
  title = {Construire et valider des modèles avec tidymodels},
  url = {https://www.datanovia.com/learn/machine-learning/foundations/},
  langid = {fr}
}
Veuillez citer ce travail comme suit :
“Construire et valider des modèles avec tidymodels.” n.d. https://www.datanovia.com/learn/machine-learning/foundations/.