L’Entreposage de Réponse à l’Item (Item Response Warehouse, IRW)

Des ressources libres et ouvertes de données de réponses à l’item harmonisées, destinées à la recherche en psychométrie et en mesure.

Lire l’article (libre accès)


Pourquoi l’IRW existe?

Les chercheurs qui étudient la mesure, en éducation, en psychologie et dans les domaines connexes, ont besoin de données réelles pour tester et comparer leurs méthodes. Ces données existent déjà en grande quantité, mais elles sont dispersées entre de nombreuses études, stockées dans des formats très divers et souvent difficiles à réutiliser en raison d’une documentation ou d’une licence qui n’est pas claire.

Il s’agit d’un problème bien connu. La communauté scientifique a formulé une norme commune pour le résoudre : les données doivent être FAIR — Trouvables (Findable), Accessibles, Interopérables et Réutilisables (Wilkinson et al., 2016). D’autres disciplines ont mis ces principes en pratique en construisant des ressources de données partagées et normalisées. En informatique, la collection d’images étiquetée ImageNet a fourni aux chercheurs un référentiel commun et a contribué à accélérer les progrès de l’intelligence artificielle. La génétique et les neurosciences ont construit des ressources partagées similaires pour leurs propres données.

L’Entreposage de Réponse à l’Item (nous allons utiliser l’acronyme IRW pour être cohérent avec les écrits anglophones sur le sujet) applique les mêmes principes FAIR aux données de réponses aux items. Il rassemble des centaines de jeux de données existants et les remet en forme selon un format commun unique de sorte qu’une méthode testée sur un jeu de données puisse facilement être testée sur des centaines d’autres.

Contenu de l’IRW

L’IRW contient des centaines de jeux de données (« tableaux »), chacun étant un ensemble de réponses individuelles. Une réponse est générée chaque fois qu’une personne (ou une unité) répond à un item (ou une variable). Voici quelques exemples :

  • Réponses d’élèves à des tests d’éducation et d’aptitude
  • Items de sondage mesurant la personnalité ou les attitudes
  • Résultats attribués par des évaluateurs humains
  • Tout autre contexte impliquant des réponses répétées à un ensemble de mesure

Chaque jeu de données de l’IRW est conçu pour être :

  • Trouvable (Findable). Chaque jeu de données est accompagné de métadonnées précalculées — nombre de participants, nombre d’items, densité des réponses, domaine du sujet et autres étiquettes descriptives — afin que les jeux de données puissent être localisés et filtrés sans devoir d’abord être téléchargés.
  • Accessible. Chaque jeu de données peut être récupéré via le navigateur web ou le package irw, avec un compte gratuit.
  • Interopérable. Chaque jeu de données est remis en forme selon une même structure simplifiée (décrite ci-dessous), de sorte que le même code d’analyse puisse s’exécuter sur de nombreux jeux de données avec peu ou pas de modification.
  • Réutilisable. Chaque jeu de données est sous licence ouverte, son origine est documentée et le code utilisé pour le convertir au format de l’IRW est public.

Les jeux de données varient considérablement en taille (allant de quelques dizaines de réponses à plusieurs millions) et en type de réponse (items binaires, évaluations à catégories multiples, scores à crédit partiel, etc.). Chaque jeu de données est également accompagné de métadonnées pré-calculées (nombre de participants, nombre d’items, densité des réponses, domaine du sujet et d’autres étiquettes descriptives pertinentes) afin que les chercheurs puissent trouver les jeux de données pertinents sans devoir d’abord tous les télécharger et les traiter.

Des données standardisées

Schéma montrant une grille colorée de cellules id-item transformée, via une flèche, en un tableau au format long comportant les colonnes id, item et resp, où la couleur de chaque cellule resp correspond à sa cellule d'origine dans la grille.

Chaque jeu de données de l’IRW est remis en forme au format long : une ligne par réponse. Au minimum, chaque ligne comporte trois éléments d’information :

Colonne Signification
id Qui (ou quoi) a produit la réponse (généralement une personne)
item Quelle mesure a produit la réponse (généralement une question ou une tâche)
resp La réponse elle-même, stockée sous forme de score ordinal

Exemple :

id item resp rt cov_age rater
1 Q1 1 2.3 26 a
1 Q2 0 1.8 26 a
2 Q1 1 2.1 31 b
2 Q2 1 2.5 31 b

Lorsqu’un jeu de données comprend des informations supplémentaires (par exemple, temps de réponse, identité de l’évaluateur, covariables telles que l’âge) ces informations sont stockées dans des colonnes additionnelles, nommées de façon cohérente. Cette structure simple et unique couvre un très large éventail de situations en mesure, ce qui permet d’écrire le code d’analyse une seule fois et de l’appliquer à l’ensemble de l’entrepôt de réponse.

La spécification technique complète de la standardisation est disponible sur itemresponsewarehouse.org/standard.html. Des standards plus spécialisés existent également pour le contenu textuel des items, les données par paires et les réponses nominales (catégories qui ne sont pas ordonnées).

Comment l’utiliser?

Il existe trois façons d’obtenir les données de l’IRW selon le degré d’automatisation souhaité.

1. Parcourir dans le navigateur web Explorez les jeux de données et leurs métadonnées directement sur le navigateur de données de l’IRW — aucun compte n’est requis. Le téléchargement d’un jeu de données complet nécessite un compte gratuit Redivis, puisque c’est la plateforme qui héberge les données sous-jacentes.

2. Utiliser le paquet irw (recommandé) Le package irw, disponible pour R et Python, fournit des fonctions simples pour trouver, filtrer et télécharger des données.

# R
devtools::install_github("itemresponsewarehouse/Rpkg")
library(irw)

irw_info()                     # overview of the IRW
irw_list_tables()              # list all available tables
irw_filter(var = "rt")         # find tables that include response times
df <- irw_fetch("4thgrade_math_sirt")   # download one table
# Python
# pip install "git+https://github.com/itemresponsewarehouse/Python-pkg.git"
import irw

irw.info()
irw.list_tables()
irw.filter(var="rt")
df = irw.fetch("4thgrade_math_sirt")

La première fois que vous utilisez le package, il vous sera demandé de vous connecter avec un compte Redivis gratuit. Ensuite, une seule ligne de code télécharge n’importe quel jeu de données directement dans R ou Python. À partir de là, les données sont prêtes à être analysées, par exemple, avec la théorie de réponse aux items ou l’analyse factorielle.

3. Utiliser directement les bibliothèques clientes de Redivis Pour des flux de travail de plus bas niveau ou hors R/Python, les données peuvent également être consultées via les propres bibliothèques clientes R et Python de Redivis. Consultez le guide de démarrage pour plus de détails.

Au-delà du téléchargement des données

Le projet IRW comprend également :

  • Un ensemble croissant de vignettes et des exemples pratiques appliquant des méthodes de mesure classiques, et nouvelles, à de nombreux jeux de données de l’IRW à la fois
  • Des ressources de formation et des exercices pour enseigner la psychométrie avec des données réelles
  • Un processus de contribution pour les chercheurs souhaitant ajouter leurs propres jeux de données à l’entrepôt

En savoir plus

Si vous utilisez des données de l’IRW dans vos travaux, merci de citer les données originales (nous fournissons une fonctionnalité permettant de le faire). Il serait également apprécié que vous citiez l’article introductif mentionné plus haut.


Vous avez des questions, des commentaires ou vous souhaitez contribuer à un jeu de données ? Visitez la page page Contact ou ouvrez un « issue » sur GitHub.