Kappa de Fleiss en R : accord entre trois évaluateurs ou plus

Mesurez l’accord inter-évaluateurs lorsque plusieurs évaluateurs classent les mêmes items en catégories — le kappa de Fleiss avec le détail par catégorie, à la manière de irr

Apprenez à calculer le kappa de Fleiss en R — la généralisation du kappa de Cohen à trois évaluateurs ou plus classant des items en catégories. Utilisez la fonction kappam.fleiss() du package irr pour le kappa global et sa significativité, ainsi que le détail par catégorie, et interprétez la force de l’accord.

Date de publication

23 juin 2026

Modifié

7 juillet 2026

AstucePoints clés
  • Le kappa de Fleiss généralise le kappa de Cohen à trois évaluateurs ou plus classant les mêmes items en catégories, corrigé du hasard.
  • Calculez-le avec irr::kappam.fleiss() sur une matrice où les lignes sont les items et les colonnes sont les évaluateurs — elle renvoie le kappa global, un z-test et une p-value.
  • Ajoutez detail = TRUE pour un kappa par catégorie, montrant sur quelles catégories les évaluateurs se sont le plus accordés.
  • Interprétez avec l’échelle de Fleiss : < 0.40 faible, 0.40–0.75 moyen à bon, > 0.75 excellent.
  • Il exige les mêmes catégories pour tous les évaluateurs ; pour exactement deux évaluateurs, utilisez le kappa de Cohen, pour des données ordinales le kappa pondéré.
Obtenez le livre — Inter-Rater Reliability Essentials (PDF)

Introduction

Lorsque de nombreux évaluateurs classent les mêmes items — un panel de médecins diagnostiquant des patients, plusieurs annotateurs étiquetant des données — le kappa de Cohen (deux évaluateurs) ne convient plus. Le kappa de Fleiss étend l’idée à trois évaluateurs ou plus : il mesure dans quelle mesure les évaluateurs s’accordent, au-delà du hasard, sur une classification catégorielle nominale.

Cette leçon calcule le kappa de Fleiss avec le package irr.

Note

Hypothèses du kappa de Fleiss. H₀ : kappa = 0 (accord pas meilleur que le hasard). Hₐ : kappa ≠ 0. kappam.fleiss() rapporte une statistique z et une p-value pour ce test — mais rapportez aussi l’ampleur.

Les données : six évaluateurs, plusieurs diagnostics

Le package irr fournit un jeu de données diagnoses — 30 patients chacun classés par 6 évaluateurs en catégories psychiatriques. Le format est une ligne par patient, une colonne par évaluateur (notes brutes, pas un tableau de contingence). Nous utilisons les trois premiers évaluateurs :

library(irr)

data("diagnoses", package = "irr")
mydata <- diagnoses[, 1:3]
head(mydata, 4)
                   rater1                  rater2                  rater3
1             4. Neurosis             4. Neurosis             4. Neurosis
2 2. Personality Disorder 2. Personality Disorder 2. Personality Disorder
3 2. Personality Disorder        3. Schizophrenia        3. Schizophrenia
4                5. Other                5. Other                5. Other

Calculer le kappa de Fleiss

kappam.fleiss() prend la matrice items × évaluateurs :

library(irr)

data("diagnoses", package = "irr")
mydata <- diagnoses[, 1:3]

kappam.fleiss(mydata)
 Fleiss' Kappa for m Raters

 Subjects = 30 
   Raters = 3 
    Kappa = 0.534 

        z = 9.89 
  p-value = 0 

Le kappa de Fleiss vaut 0.53 avec p < 0.0001 — les trois évaluateurs s’accordent significativement mieux que le hasard. Sur l’échelle de Fleiss (ci-dessous), il s’agit d’un accord moyen à bon.

Détail par catégorie

detail = TRUE décompose le kappa global par catégorie, révélant sur quelles classifications les évaluateurs se sont le plus accordés :

library(irr)

data("diagnoses", package = "irr")
mydata <- diagnoses[, 1:3]

kappam.fleiss(mydata, detail = TRUE)
 Fleiss' Kappa for m Raters

 Subjects = 30 
   Raters = 3 
    Kappa = 0.534 

        z = 9.89 
  p-value = 0 

                        Kappa     z p.value
1. Depression           0.416 3.946   0.000
2. Personality Disorder 0.591 5.608   0.000
3. Schizophrenia        0.577 5.475   0.000
4. Neurosis             0.236 2.240   0.025
5. Other                1.000 9.487   0.000
library(irr)
library(ggpubr)

data("diagnoses", package = "irr")
mydata <- diagnoses[, 1:3]

det <- kappam.fleiss(mydata, detail = TRUE)$detail
cat.df <- data.frame(category = rownames(det), kappa = det[, "Kappa"])

ggbarplot(cat.df, x = "category", y = "kappa", fill = "#3a86d4",
          sort.val = "desc", x.text.angle = 45,
          ylab = "Category kappa", xlab = FALSE)

A bar chart of the per-category Fleiss kappa: agreement is highest for the clear-cut categories and lower for the ambiguous ones.

Les kappas par catégorie montrent que les évaluateurs s’accordent fortement sur les diagnostics distincts et moins sur ceux qui se recoupent — utile pour repérer se situe le désaccord.

Interpréter l’ampleur

Échelle suggérée par Fleiss :

Kappa Accord
< 0.40 faible
0.40–0.75 moyen à bon
> 0.75 excellent

Notre κ = 0.53 global est moyen à bon — un accord acceptable entre les trois évaluateurs, avec une marge pour resserrer les consignes de notation.

Rapport

Le kappa de Fleiss a été calculé pour évaluer l’accord entre trois évaluateurs classant 30 patients en catégories psychiatriques. L’accord entre les évaluateurs était moyen à bon, κ = 0.53, p < 0.0001.

Le kappa de Fleiss compare l’accord observé entre toutes les paires d’évaluateurs à l’accord attendu par hasard d’après les proportions globales des catégories : \(\kappa = \dfrac{\bar{P} - \bar{P}_e}{1 - \bar{P}_e}\). Ici \(\bar{P}\) est la moyenne, sur tous les items, de la proportion de paires d’évaluateurs en accord pour cet item, et \(\bar{P}_e = \sum_j p_j^2\) est l’accord dû au hasard à partir de la proportion marginale \(p_j\) de chaque catégorie. Comme pour le kappa de Cohen, \(\kappa = 1\) correspond à un accord parfait et \(\kappa = 0\) au niveau du hasard.

Essayez en direct

Calculez le kappa de Fleiss sur plus (ou moins) d’évaluateurs à partir du même jeu de données, et observez l’accord changer. Le bac à sable démarre au premier Run.

🟢 Avec un agent IA

Demandez à Prova « J’ai plusieurs évaluateurs classant des items en catégories — calcule le kappa de Fleiss, dis-moi s’ils s’accordent, et sur quelles catégories ils s’accordent le plus » — elle répond avec du code irr que vous pouvez exécuter sur vos propres données. The runtime is the judge. Demander à Prova →

Problèmes courants

Vous avez exactement deux évaluateurs. Le kappa de Fleiss fonctionne pour deux, mais le choix standard pour deux évaluateurs est le kappa de Cohen (qui donne aussi un intervalle de confiance via vcd). Utilisez le kappa de Fleiss quand vous avez trois évaluateurs ou plus.

Vos données forment un tableau de contingence, pas des notes brutes. kappam.fleiss() attend la matrice items × évaluateurs (une ligne par item, une colonne par évaluateur), pas un tableau croisé. Le kappa de Cohen / pondéré utilise le tableau ; le kappa de Fleiss utilise la matrice brute.

Vos catégories sont ordinales. Le kappa de Fleiss traite tous les désaccords de la même manière (nominal). Il n’existe pas de kappa de Fleiss pondéré standard dans irr de base ; si l’ordre compte, envisagez un ICC ou signalez la limite.

Foire aux questions

Le kappa de Fleiss est une statistique qui mesure l’accord entre trois évaluateurs ou plus classant des items en catégories, corrigé du hasard. Il généralise le kappa de Cohen (qui se limite à deux évaluateurs) et est utilisé pour des notes catégorielles nominales issues d’un panel d’évaluateurs.

Le kappa de Cohen mesure l’accord entre exactement deux évaluateurs ; le kappa de Fleiss gère trois évaluateurs ou plus. Celui de Cohen s’appuie sur un tableau de contingence à deux entrées et offre des variantes pondérées pour les données ordinales ; celui de Fleiss s’appuie sur la matrice brute items × évaluateurs et fournit un indice global unique plus le détail par catégorie.

Utilisez l’échelle de Fleiss : en dessous de 0.40 l’accord est faible, 0.40–0.75 est moyen à bon, et au-dessus de 0.75 est excellent. Rapportez la valeur du kappa et sa p-value, et utilisez detail = TRUE pour voir quelles catégories ont porté l’accord ou le désaccord.

Testez votre compréhension

  1. Exécutez-le. Dans la cellule interactive, calculez le kappa de Fleiss pour les trois premiers évaluateurs, puis pour les six. Complétez le blanc. Ajouter plus d’évaluateurs augmente-t-il ou diminue-t-il l’accord ici ?
  2. Conceptuel. Vous avez quatre évaluateurs étiquetant des images. Pourquoi le kappa de Fleiss est-il plus approprié que de calculer le kappa de Cohen sur chaque paire séparément ?

Complétez le blanc avec 1:3, puis essayez toute la matrice diagnoses. Pour la question 2, pensez à obtenir un indice d’accord global unique plutôt que plusieurs indices par paires.

kappam.fleiss(diagnoses[, 1:3])   #> kappa ≈ 0.53
kappam.fleiss(diagnoses)          #> kappa ≈ 0.43 (lower — more raters, more room to disagree)

Pour la question 2 : le kappa de Fleiss fournit un indice d’accord global unique entre les quatre évaluateurs à la fois, en mettant correctement en commun la correction du hasard. Calculer le kappa de Cohen sur chaque paire donne six nombres distincts sans résumé unique (le kappa de Light en fait la moyenne, mais le kappa de Fleiss est la statistique multi-évaluateurs standard).

AstuceQuelle mesure d’accord, et quand ?

Conclusion

Vous savez maintenant calculer le kappa de Fleiss en R pour trois évaluateurs ou plus : exécutez irr::kappam.fleiss() sur la matrice items × évaluateurs pour l’accord global corrigé du hasard et sa p-value, ajoutez detail = TRUE pour la ventilation par catégorie, et lisez l’ampleur sur l’échelle de Fleiss. C’est la statistique d’accord standard lorsqu’ un panel d’évaluateurs classe des items en catégories nominales.

Leçons connexes

Vous préférez un livre ? Inter-Rater Reliability Essentials est disponible en PDF téléchargeable — toutes les leçons de cette série, hors ligne et à vous.

Obtenir le livre (PDF) →Les leçons restent gratuites en ligne.
Cette page vous a-t-elle été utile ?

Prouvez que vous savez le faire. Maîtrisez toute la série Fidélité inter-juges en R — suivez votre parcours, construisez des projets et obtenez un certificat.

Commencer gratuitement →

Passez à Pro — Prova illimité sur vos propres données et un certificat vérifiable qui atteste la compétence.

dès 15 $/mois facturé annuellement

Passer à Pro →

✓ Vous êtes Pro — continuez. The runtime is the judge.

Recevez les nouvelles leçons R & Python par e-mail

Pratique, reproductible, sans spam. Désinscription à tout moment.

Double opt-in. Nous ne partageons jamais votre e-mail.

Partager cette pageXLinkedInRedditHN
Note

Chaque résultat de cette page a été produit par le code affiché, exécuté au moment de la génération dans un environnement R figé — modifiez n’importe quel bloc et faites Run pour le reproduire vous-même.

Réutilisation

Citation

BibTeX
@online{2026,
  author = {},
  title = {Kappa de Fleiss en R : accord entre trois évaluateurs ou
    plus},
  date = {2026-06-23},
  url = {https://www.datanovia.com/learn/biostatistics/inter-rater-reliability/fleiss-kappa-in-r},
  langid = {fr}
}
Veuillez citer ce travail comme suit :
“Kappa de Fleiss en R : accord entre trois évaluateurs ou plus.” 2026. June 23. https://www.datanovia.com/learn/biostatistics/inter-rater-reliability/fleiss-kappa-in-r.