Item Response Warehouse (IRW; Хранилище данных об ответах на задания)

Бесплатная, открытая коллекция унифицированных данных об ответах на задания для исследований в области психометрики и измерений.

Читать статью (открытый доступ)


Зачем существует IRW

Исследователям, изучающим измерения — в сфере образования, психологии и смежных областях, — нужны реальные данные для проверки и сравнения своих методов. Такие данные уже существуют в большом количестве. Но они разбросаны по множеству исследований, хранятся в самых разных форматах и зачастую с трудом поддаются повторному использованию из-за неясной документации или лицензирования.

Это хорошо известная проблема. Другие области решили её, создав общие, стандартизированные ресурсы данных. В компьютерных науках коллекция размеченных изображений ImageNet дала исследователям общий ориентир и способствовала стремительному прогрессу в области искусственного интеллекта. Генетика и нейронауки создали похожие общие ресурсы для собственных данных.

Item Response Warehouse (IRW) делает то же самое для данных об ответах на задания. Он объединяет сотни существующих наборов данных и преобразует их в единый общий формат — так что метод, проверенный на одном наборе данных, можно легко проверить на сотнях других.

Что содержится в IRW

IRW содержит сотни наборов данных («таблиц»), каждый из которых представляет собой коллекцию отдельных ответов. Ответ создаётся всякий раз, когда какой-либо человек (или иная единица) реагирует на задание (или иной измерительный стимул). Примеры включают:

  • Ответы учащихся на образовательные тесты и тесты способностей
  • Пункты опросников, измеряющие личностные черты или установки
  • Оценки, выставленные экспертами-людьми
  • Любые другие ситуации, где присутствуют повторяющиеся ответы на набор измерительных стимулов

Для каждого набора данных в IRW верны два утверждения:

  • Открытость. Каждый набор данных лицензирован для повторного использования. Его происхождение документировано, а код, использованный для преобразования в формат IRW, доступен публично.
  • Унифицированность. Каждый набор данных преобразован в одну и ту же простую структуру (описана ниже), поэтому один и тот же код анализа можно применять к множеству наборов данных с минимальными изменениями или вовсе без них.

Наборы данных сильно различаются по объёму (от нескольких сотен ответов до нескольких миллионов) и по типу ответа (задания «да/нет», многокатегориальные оценки, баллы за частичное выполнение и другое). К каждому набору данных также прилагаются заранее рассчитанные метаданные — число участников, число заданий, плотность ответов, предметная область и другие описательные теги, — чтобы исследователи могли находить нужные наборы данных, не скачивая и не обрабатывая все подряд.

Стандарт данных

Сетчатая схема, показывающая, что каждый ответ находится на пересечении одного id и одного item.

Каждый набор данных IRW преобразуется в длинный формат (long format): одна строка на один ответ. Как минимум, каждая строка содержит три элемента информации:

Столбец Значение
id Кто (или что) дал ответ — как правило, человек
item Какой измерительный стимул вызвал ответ — как правило, вопрос или задача
resp Сам ответ, сохранённый в виде порядкового балла

Пример:

id item resp rt cov_age rater
1 Q1 1 2.3 26 a
1 Q2 0 1.8 26 a
2 Q1 1 2.1 31 b
2 Q2 1 2.5 31 b

Если набор данных содержит дополнительную информацию — время ответа, идентификатор эксперта, ковариаты, такие как возраст, — эта информация хранится в дополнительных, единообразно названных столбцах. Эта единая простая структура охватывает чрезвычайно широкий спектр измерительных ситуаций, что и позволяет написать код анализа один раз и применять его ко всему хранилищу.

Полная техническая спецификация стандарта доступна на странице itemresponsewarehouse.org/standard.html. Также существуют более специализированные стандарты для текста заданий, данных попарных сравнений (соревнований) и номинальных (неупорядоченных категориальных) ответов.

Как это использовать

Есть три способа получить данные IRW — в зависимости от того, насколько высокую степень автоматизации вы хотите.

1. Просмотр в веб-браузере Изучайте наборы данных и их метаданные прямо в браузере данных IRW — учётная запись не требуется. Для скачивания полного набора данных требуется бесплатная учётная запись Redivis, поскольку именно эта платформа размещает исходные данные.

2. Использование пакета irw (рекомендуется) Пакет irw, доступный как для R, так и для Python, предоставляет простые функции для поиска, фильтрации и скачивания данных.

# R
devtools::install_github("itemresponsewarehouse/Rpkg")
library(irw)

irw_info()                     # overview of the IRW
irw_list_tables()              # list all available tables
irw_filter(var = "rt")         # find tables that include response times
df <- irw_fetch("4thgrade_math_sirt")   # download one table
# Python
# pip install "git+https://github.com/itemresponsewarehouse/Python-pkg.git"
import irw

irw.info()
irw.list_tables()
irw.filter(var="rt")
df = irw.fetch("4thgrade_math_sirt")

При первом использовании пакета вам будет предложено войти с помощью бесплатной учётной записи Redivis. После этого одна строка кода позволяет скачать любой набор данных прямо в R или Python. После этого данные готовы к анализу с помощью стандартного программного обеспечения — например, пакетов теории ответа на задание или факторного анализа.

3. Прямое использование клиентских библиотек Redivis Для рабочих процессов более низкого уровня или вне R/Python данные также можно получить через собственные клиентские библиотеки Redivis для R и Python. Подробности см. в руководстве по началу работы.

Не только скачивание данных

Проект IRW также включает:

  • Постоянно растущий набор иллюстративных разборов (vignettes) — подробные примеры применения классических и новых методов измерения сразу на многих наборах данных IRW
  • Учебные материалы и наборы упражнений для преподавания психометрики на реальных данных
  • Процесс подачи данных для исследователей, желающих добавить собственные наборы данных в хранилище

Узнать больше

Если вы используете данные IRW в своей работе, пожалуйста, указывайте ссылку на исходные данные (мы предоставили для этого соответствующую функцию). Также будет очень хорошо, если вы процитируете вводную статью, упомянутую выше.


Есть вопросы, отзывы, или хотите предложить набор данных? Посетите страницу контактов или создайте issue на GitHub.