מחסן תגובות לפריטים (Item Response Warehouse, IRW)

אוסף חופשי ופתוח של נתוני תגובה לפריט (item response) מתואמים, למחקר בפסיכומטריקה ובמדידה.

קראו את המאמר (גישה פתוחה)


למה IRW קיים

חוקרים העוסקים במדידה — בחינוך, בפסיכולוגיה ובתחומים קרובים — זקוקים לנתונים אמיתיים כדי לבחון ולהשוות בין השיטות שלהם. נתונים כאלה כבר קיימים בכמויות גדולות. אך הם מפוזרים על פני מחקרים רבים, מאוחסנים בפורמטים שונים רבים, ולעיתים קרובות קשה להשתמש בהם שוב בשל תיעוד או רישוי לא ברורים.

זו בעיה ידועה היטב. תחומים אחרים פתרו אותה על ידי בניית משאבי נתונים משותפים ומתוקננים. במדעי המחשב, אוסף התמונות המתויגות ImageNet סיפק לחוקרים אמת מידה (benchmark) משותפת וסייע להניע קִדמה מהירה בתחום הבינה המלאכותית. גם הגנטיקה ומדעי המוח בנו משאבים משותפים דומים עבור הנתונים שלהם.

מחסן תגובות לפריטים (IRW) עושה את אותו הדבר עבור נתוני תגובה לפריט. הוא מאגד מאות מערכי נתונים קיימים ומעצב אותם מחדש לפורמט משותף אחד — כך ששיטה שנבחנה על מערך נתונים אחד יכולה להיבחן בקלות על מאות מערכי נתונים אחרים.

מה נמצא ב-IRW

IRW מכיל מאות מערכי נתונים (“טבלאות”), וכל אחד מהם הוא אוסף של תגובות בודדות. תגובה נוצרת בכל פעם שאדם כלשהו (או יחידה אחרת) מגיב לפריט (item) (או לבדיקה אחרת). דוגמאות כוללות:

  • תשובות תלמידים במבחני חינוך ויכולת
  • פריטי שאלון המודדים אישיות או עמדות
  • ציונים שניתנו על ידי מעריכים אנושיים
  • כל מצב אחר הכולל תגובות חוזרות ונשנות למערך של כלי מדידה

שני דברים נכונים לגבי כל מערך נתונים ב-IRW:

  • פתוח. לכל מערך נתונים יש רישיון לשימוש חוזר. מקורו מתועד, והקוד ששימש להמרתו לפורמט IRW הוא ציבורי.
  • מתואם (Harmonized). כל מערך נתונים מעוצב מחדש לאותו מבנה פשוט (המתואר בהמשך), כך שאותו קוד ניתוח יכול לפעול על מערכי נתונים רבים בשינוי מועט או ללא שינוי כלל.

מערכי הנתונים שונים מאוד בגודלם (ממאות בודדות של תגובות ועד מיליונים רבים) ובסוג התגובה (פריטים של כן/לא, דירוגים רב-קטגוריאליים, ציונים חלקיים, ועוד). כל מערך נתונים מגיע גם עם מטא-נתונים מחושבים מראש — מספר המשתתפים, מספר הפריטים, צפיפות התגובות, תחום הנושא, ותוויות תיאוריות נוספות — כך שחוקרים יכולים למצוא מערכי נתונים רלוונטיים מבלי להוריד ולעבד את כולם קודם.

תקן הנתונים

תרשים המציג רשת צבעונית של תאי id-item, המומרת באמצעות חץ לטבלה בפורמט ארוך עם עמודות id, item ו-resp, כאשר צבעו של כל תא resp תואם לצבע התא המקורי שלו ברשת.

כל מערך נתונים של IRW מעוצב מחדש לפורמט ארוך (long format): שורה אחת לכל תגובה. לכל הפחות, כל שורה מכילה שלושה פרטי מידע:

עמודה משמעות
id מי (או מה) הפיק את התגובה — בדרך כלל אדם
item איזה כלי מדידה הפיק את התגובה — בדרך כלל שאלה או משימה
resp התגובה עצמה, המאוחסנת כציון סדר (ordinal)

דוגמה:

id item resp rt cov_age rater
1 Q1 1 2.3 26 a
1 Q2 0 1.8 26 a
2 Q1 1 2.1 31 b
2 Q2 1 2.5 31 b

כאשר מערך נתונים כולל מידע נוסף — זמן תגובה, זהות המעריך, משתני עזר כמו גיל — מידע זה מאוחסן בעמודות נוספות בעלות שמות עקביים. מבנה פשוט אחד זה מכסה מגוון עצום של מצבי מדידה, וזה מה שמאפשר לכתוב קוד ניתוח פעם אחת וליישם אותו על פני כל המחסן.

המפרט הטכני המלא של התקן זמין בכתובת itemresponsewarehouse.org/standard.html. קיימים גם תקנים קשורים ומתמחים יותר לטקסט פריטים, לנתוני השוואה זוגית (pairwise) ולתגובות נומינליות (קטגוריות ללא סדר).

איך להשתמש בו

יש שלוש דרכים לקבל נתוני IRW, בהתאם לרמת האוטומציה הרצויה לך.

1. עיון בדפדפן האינטרנט חִקרו מערכי נתונים ואת המטא-נתונים שלהם ישירות בדפדפן הנתונים של IRW — אין צורך בחשבון. הורדת מערך נתונים מלא דורשת חשבון Redivis חינמי, מכיוון שזו הפלטפורמה המארחת את הנתונים הבסיסיים.

2. השתמשו בחבילת irw (מומלץ) חבילת irw, הזמינה הן עבור R והן עבור Python, מספקת פונקציות פשוטות למציאה, סינון והורדה של נתונים.

# R
devtools::install_github("itemresponsewarehouse/Rpkg")
library(irw)

irw_info()                     # overview of the IRW
irw_list_tables()              # list all available tables
irw_filter(var = "rt")         # find tables that include response times
df <- irw_fetch("4thgrade_math_sirt")   # download one table
# Python
# pip install "git+https://github.com/itemresponsewarehouse/Python-pkg.git"
import irw

irw.info()
irw.list_tables()
irw.filter(var="rt")
df = irw.fetch("4thgrade_math_sirt")

בפעם הראשונה שתשתמשו בחבילה, תתבקשו להתחבר באמצעות חשבון Redivis חינמי. לאחר מכן, שורת קוד אחת מורידה כל מערך נתונים ישירות ל-R או ל-Python. מנקודה זו, הנתונים מוכנים לניתוח באמצעות תוכנה סטנדרטית — לדוגמה חבילות תיאוריית תגובה לפריט (item response theory) או ניתוח גורמים.

3. השתמשו ישירות בספריות הלקוח של Redivis עבור זרימות עבודה ברמה נמוכה יותר או שאינן מבוססות R/Python, ניתן לגשת לנתונים גם דרך ספריות הלקוח של Redivis עצמה עבור R ו-Python. לפרטים, ראו את מדריך תחילת העבודה.

מעבר להורדת נתונים

פרויקט IRW כולל גם:

  • אוסף הולך וגדל של דוגמאות מפורטות (vignettes) — דוגמאות מעובדות המיישמות שיטות מדידה קלאסיות וחדשות על פני מערכי נתונים רבים של IRW בו-זמנית
  • משאבי הדרכה ומערכי תרגילים ללימוד פסיכומטריקה עם נתונים אמיתיים
  • תהליך תרומה עבור חוקרים המעוניינים להוסיף מערכי נתונים משלהם למחסן

מידע נוסף

אם אתם משתמשים בנתוני IRW בעבודתכם, אנא צטטו את הנתונים המקוריים (סיפקנו לשם כך את הפונקציונליות הנדרשת). נשמח מאוד גם אם תצטטו את מאמר המבוא שלעיל.


יש לכם שאלות, משוב, או שברצונכם לתרום מערך נתונים? בקרו בדף יצירת הקשר או פתחו issue ב-GitHub.