מחסן תגובות לפריטים (Item Response Warehouse, IRW)
אוסף חופשי ופתוח של נתוני תגובה לפריט (item response) מתואמים, למחקר בפסיכומטריקה ובמדידה.
קראו את המאמר (גישה פתוחה)
למה IRW קיים
חוקרים העוסקים במדידה — בחינוך, בפסיכולוגיה ובתחומים קרובים — זקוקים לנתונים אמיתיים כדי לבחון ולהשוות בין השיטות שלהם. נתונים כאלה כבר קיימים בכמויות גדולות. אך הם מפוזרים על פני מחקרים רבים, מאוחסנים בפורמטים שונים רבים, ולעיתים קרובות קשה להשתמש בהם שוב בשל תיעוד או רישוי לא ברורים.
זו בעיה ידועה היטב. תחומים אחרים פתרו אותה על ידי בניית משאבי נתונים משותפים ומתוקננים. במדעי המחשב, אוסף התמונות המתויגות ImageNet סיפק לחוקרים אמת מידה (benchmark) משותפת וסייע להניע קִדמה מהירה בתחום הבינה המלאכותית. גם הגנטיקה ומדעי המוח בנו משאבים משותפים דומים עבור הנתונים שלהם.
מחסן תגובות לפריטים (IRW) עושה את אותו הדבר עבור נתוני תגובה לפריט. הוא מאגד מאות מערכי נתונים קיימים ומעצב אותם מחדש לפורמט משותף אחד — כך ששיטה שנבחנה על מערך נתונים אחד יכולה להיבחן בקלות על מאות מערכי נתונים אחרים.
מה נמצא ב-IRW
IRW מכיל מאות מערכי נתונים (“טבלאות”), וכל אחד מהם הוא אוסף של תגובות בודדות. תגובה נוצרת בכל פעם שאדם כלשהו (או יחידה אחרת) מגיב לפריט (item) (או לבדיקה אחרת). דוגמאות כוללות:
- תשובות תלמידים במבחני חינוך ויכולת
- פריטי שאלון המודדים אישיות או עמדות
- ציונים שניתנו על ידי מעריכים אנושיים
- כל מצב אחר הכולל תגובות חוזרות ונשנות למערך של כלי מדידה
שני דברים נכונים לגבי כל מערך נתונים ב-IRW:
- פתוח. לכל מערך נתונים יש רישיון לשימוש חוזר. מקורו מתועד, והקוד ששימש להמרתו לפורמט IRW הוא ציבורי.
- מתואם (Harmonized). כל מערך נתונים מעוצב מחדש לאותו מבנה פשוט (המתואר בהמשך), כך שאותו קוד ניתוח יכול לפעול על מערכי נתונים רבים בשינוי מועט או ללא שינוי כלל.
מערכי הנתונים שונים מאוד בגודלם (ממאות בודדות של תגובות ועד מיליונים רבים) ובסוג התגובה (פריטים של כן/לא, דירוגים רב-קטגוריאליים, ציונים חלקיים, ועוד). כל מערך נתונים מגיע גם עם מטא-נתונים מחושבים מראש — מספר המשתתפים, מספר הפריטים, צפיפות התגובות, תחום הנושא, ותוויות תיאוריות נוספות — כך שחוקרים יכולים למצוא מערכי נתונים רלוונטיים מבלי להוריד ולעבד את כולם קודם.
תקן הנתונים
כל מערך נתונים של IRW מעוצב מחדש לפורמט ארוך (long format): שורה אחת לכל תגובה. לכל הפחות, כל שורה מכילה שלושה פרטי מידע:
| עמודה | משמעות |
|---|---|
id |
מי (או מה) הפיק את התגובה — בדרך כלל אדם |
item |
איזה כלי מדידה הפיק את התגובה — בדרך כלל שאלה או משימה |
resp |
התגובה עצמה, המאוחסנת כציון סדר (ordinal) |
דוגמה:
id |
item |
resp |
rt |
cov_age |
rater |
|---|---|---|---|---|---|
| 1 | Q1 | 1 | 2.3 | 26 | a |
| 1 | Q2 | 0 | 1.8 | 26 | a |
| 2 | Q1 | 1 | 2.1 | 31 | b |
| 2 | Q2 | 1 | 2.5 | 31 | b |
כאשר מערך נתונים כולל מידע נוסף — זמן תגובה, זהות המעריך, משתני עזר כמו גיל — מידע זה מאוחסן בעמודות נוספות בעלות שמות עקביים. מבנה פשוט אחד זה מכסה מגוון עצום של מצבי מדידה, וזה מה שמאפשר לכתוב קוד ניתוח פעם אחת וליישם אותו על פני כל המחסן.
המפרט הטכני המלא של התקן זמין בכתובת itemresponsewarehouse.org/standard.html. קיימים גם תקנים קשורים ומתמחים יותר לטקסט פריטים, לנתוני השוואה זוגית (pairwise) ולתגובות נומינליות (קטגוריות ללא סדר).
איך להשתמש בו
יש שלוש דרכים לקבל נתוני IRW, בהתאם לרמת האוטומציה הרצויה לך.
1. עיון בדפדפן האינטרנט חִקרו מערכי נתונים ואת המטא-נתונים שלהם ישירות בדפדפן הנתונים של IRW — אין צורך בחשבון. הורדת מערך נתונים מלא דורשת חשבון Redivis חינמי, מכיוון שזו הפלטפורמה המארחת את הנתונים הבסיסיים.
2. השתמשו בחבילת irw (מומלץ) חבילת irw, הזמינה הן עבור R והן עבור Python, מספקת פונקציות פשוטות למציאה, סינון והורדה של נתונים.
# R
devtools::install_github("itemresponsewarehouse/Rpkg")
library(irw)
irw_info() # overview of the IRW
irw_list_tables() # list all available tables
irw_filter(var = "rt") # find tables that include response times
df <- irw_fetch("4thgrade_math_sirt") # download one table# Python
# pip install "git+https://github.com/itemresponsewarehouse/Python-pkg.git"
import irw
irw.info()
irw.list_tables()
irw.filter(var="rt")
df = irw.fetch("4thgrade_math_sirt")בפעם הראשונה שתשתמשו בחבילה, תתבקשו להתחבר באמצעות חשבון Redivis חינמי. לאחר מכן, שורת קוד אחת מורידה כל מערך נתונים ישירות ל-R או ל-Python. מנקודה זו, הנתונים מוכנים לניתוח באמצעות תוכנה סטנדרטית — לדוגמה חבילות תיאוריית תגובה לפריט (item response theory) או ניתוח גורמים.
3. השתמשו ישירות בספריות הלקוח של Redivis עבור זרימות עבודה ברמה נמוכה יותר או שאינן מבוססות R/Python, ניתן לגשת לנתונים גם דרך ספריות הלקוח של Redivis עצמה עבור R ו-Python. לפרטים, ראו את מדריך תחילת העבודה.
מעבר להורדת נתונים
פרויקט IRW כולל גם:
- אוסף הולך וגדל של דוגמאות מפורטות (vignettes) — דוגמאות מעובדות המיישמות שיטות מדידה קלאסיות וחדשות על פני מערכי נתונים רבים של IRW בו-זמנית
- משאבי הדרכה ומערכי תרגילים ללימוד פסיכומטריקה עם נתונים אמיתיים
- תהליך תרומה עבור חוקרים המעוניינים להוסיף מערכי נתונים משלהם למחסן
מידע נוסף
- Domingue et al. (2025). An introduction to the Item Response Warehouse (IRW): A resource for enhancing data usage in psychometrics. Behavior Research Methods. doi:10.3758/s13428-025-02796-y
- Nadela, Lee, Jain, Gupta, Zhang & Domingue (2026). The Item Response Warehouse: What It Is, How to Use It, and Targets for Potential Improvements. Chinese/English Journal of Educational Measurement and Evaluation. doi:10.59863/CIJG4549
- אתר אינטרנט: itemresponsewarehouse.org
- קוד: github.com/itemresponsewarehouse
אם אתם משתמשים בנתוני IRW בעבודתכם, אנא צטטו את הנתונים המקוריים (סיפקנו לשם כך את הפונקציונליות הנדרשת). נשמח מאוד גם אם תצטטו את מאמר המבוא שלעיל.
יש לכם שאלות, משוב, או שברצונכם לתרום מערך נתונים? בקרו בדף יצירת הקשר או פתחו issue ב-GitHub.