L’Entreposage de Réponse à l’Item (Item Response Warehouse, IRW)
Des ressources libres et ouvertes de données de réponses à l’item harmonisées, destinées à la recherche en psychométrie et en mesure.
Lire l’article (libre accès)
Pourquoi l’IRW existe?
Les chercheurs qui étudient la mesure, en éducation, en psychologie et dans les domaines connexes, ont besoin de données réelles pour tester et comparer leurs méthodes. Ces données existent déjà en grande quantité, mais elles sont dispersées entre de nombreuses études, stockées dans des formats très divers et souvent difficiles à réutiliser en raison d’une documentation ou d’une licence qui n’est pas claire.
Il s’agit d’un problème bien connu. La communauté scientifique a formulé une norme commune pour le résoudre : les données doivent être FAIR — Trouvables (Findable), Accessibles, Interopérables et Réutilisables (Wilkinson et al., 2016). D’autres disciplines ont mis ces principes en pratique en construisant des ressources de données partagées et normalisées. En informatique, la collection d’images étiquetée ImageNet a fourni aux chercheurs un référentiel commun et a contribué à accélérer les progrès de l’intelligence artificielle. La génétique et les neurosciences ont construit des ressources partagées similaires pour leurs propres données.
L’Entreposage de Réponse à l’Item (nous allons utiliser l’acronyme IRW pour être cohérent avec les écrits anglophones sur le sujet) applique les mêmes principes FAIR aux données de réponses aux items. Il rassemble des centaines de jeux de données existants et les remet en forme selon un format commun unique de sorte qu’une méthode testée sur un jeu de données puisse facilement être testée sur des centaines d’autres.
Contenu de l’IRW
L’IRW contient des centaines de jeux de données (« tableaux »), chacun étant un ensemble de réponses individuelles. Une réponse est générée chaque fois qu’une personne (ou une unité) répond à un item (ou une variable). Voici quelques exemples :
- Réponses d’élèves à des tests d’éducation et d’aptitude
- Items de sondage mesurant la personnalité ou les attitudes
- Résultats attribués par des évaluateurs humains
- Tout autre contexte impliquant des réponses répétées à un ensemble de mesure
Chaque jeu de données de l’IRW est conçu pour être :
- Trouvable (Findable). Chaque jeu de données est accompagné de métadonnées précalculées — nombre de participants, nombre d’items, densité des réponses, domaine du sujet et autres étiquettes descriptives — afin que les jeux de données puissent être localisés et filtrés sans devoir d’abord être téléchargés.
- Accessible. Chaque jeu de données peut être récupéré via le navigateur web ou le package
irw, avec un compte gratuit. - Interopérable. Chaque jeu de données est remis en forme selon une même structure simplifiée (décrite ci-dessous), de sorte que le même code d’analyse puisse s’exécuter sur de nombreux jeux de données avec peu ou pas de modification.
- Réutilisable. Chaque jeu de données est sous licence ouverte, son origine est documentée et le code utilisé pour le convertir au format de l’IRW est public.
Les jeux de données varient considérablement en taille (allant de quelques dizaines de réponses à plusieurs millions) et en type de réponse (items binaires, évaluations à catégories multiples, scores à crédit partiel, etc.). Chaque jeu de données est également accompagné de métadonnées pré-calculées (nombre de participants, nombre d’items, densité des réponses, domaine du sujet et d’autres étiquettes descriptives pertinentes) afin que les chercheurs puissent trouver les jeux de données pertinents sans devoir d’abord tous les télécharger et les traiter.
Des données standardisées
Chaque jeu de données de l’IRW est remis en forme au format long : une ligne par réponse. Au minimum, chaque ligne comporte trois éléments d’information :
| Colonne | Signification |
|---|---|
id |
Qui (ou quoi) a produit la réponse (généralement une personne) |
item |
Quelle mesure a produit la réponse (généralement une question ou une tâche) |
resp |
La réponse elle-même, stockée sous forme de score ordinal |
Exemple :
id |
item |
resp |
rt |
cov_age |
rater |
|---|---|---|---|---|---|
| 1 | Q1 | 1 | 2.3 | 26 | a |
| 1 | Q2 | 0 | 1.8 | 26 | a |
| 2 | Q1 | 1 | 2.1 | 31 | b |
| 2 | Q2 | 1 | 2.5 | 31 | b |
Lorsqu’un jeu de données comprend des informations supplémentaires (par exemple, temps de réponse, identité de l’évaluateur, covariables telles que l’âge) ces informations sont stockées dans des colonnes additionnelles, nommées de façon cohérente. Cette structure simple et unique couvre un très large éventail de situations en mesure, ce qui permet d’écrire le code d’analyse une seule fois et de l’appliquer à l’ensemble de l’entrepôt de réponse.
La spécification technique complète de la standardisation est disponible sur itemresponsewarehouse.org/standard.html. Des standards plus spécialisés existent également pour le contenu textuel des items, les données par paires et les réponses nominales (catégories qui ne sont pas ordonnées).
En savoir plus
- Domingue et al. (2025). An introduction to the Item Response Warehouse (IRW): A resource for enhancing data usage in psychometrics. Behavior Research Methods. doi:10.3758/s13428-025-02796-y
- Nadela, Lee, Jain, Gupta, Zhang & Domingue (2026). The Item Response Warehouse: What It Is, How to Use It, and Targets for Potential Improvements. Chinese/English Journal of Educational Measurement and Evaluation. doi:10.59863/CIJG4549
- Wilkinson et al. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data. doi:10.1038/sdata.2016.18
- Site web : itemresponsewarehouse.org
- Code : github.com/itemresponsewarehouse
Si vous utilisez des données de l’IRW dans vos travaux, merci de citer les données originales (nous fournissons une fonctionnalité permettant de le faire). Il serait également apprécié que vous citiez l’article introductif mentionné plus haut.
Vous avez des questions, des commentaires ou vous souhaitez contribuer à un jeu de données ? Visitez la page page Contact ou ouvrez un « issue » sur GitHub.
Comment l’utiliser?
Il existe trois façons d’obtenir les données de l’IRW selon le degré d’automatisation souhaité.
1. Parcourir dans le navigateur web Explorez les jeux de données et leurs métadonnées directement sur le navigateur de données de l’IRW — aucun compte n’est requis. Le téléchargement d’un jeu de données complet nécessite un compte gratuit Redivis, puisque c’est la plateforme qui héberge les données sous-jacentes.
2. Utiliser le paquet
irw(recommandé) Le packageirw, disponible pour R et Python, fournit des fonctions simples pour trouver, filtrer et télécharger des données.La première fois que vous utilisez le package, il vous sera demandé de vous connecter avec un compte Redivis gratuit. Ensuite, une seule ligne de code télécharge n’importe quel jeu de données directement dans R ou Python. À partir de là, les données sont prêtes à être analysées, par exemple, avec la théorie de réponse aux items ou l’analyse factorielle.
3. Utiliser directement les bibliothèques clientes de Redivis Pour des flux de travail de plus bas niveau ou hors R/Python, les données peuvent également être consultées via les propres bibliothèques clientes R et Python de Redivis. Consultez le guide de démarrage pour plus de détails.
Au-delà du téléchargement des données
Le projet IRW comprend également :