Item Response Warehouse (IRW; Gudang Respons Item)

Koleksi percuma dan terbuka bagi data respons item yang telah diseragamkan (harmonized), untuk penyelidikan psikometrik dan pengukuran.

Baca kertas kerja (akses terbuka)


Mengapa IRW wujud

Penyelidik yang mengkaji pengukuran — dalam bidang pendidikan, psikologi, dan bidang berkaitan — memerlukan data sebenar untuk menguji dan membandingkan kaedah mereka. Data sedemikian sudah wujud dalam jumlah yang besar. Namun ia bertaburan merentasi banyak kajian, disimpan dalam pelbagai format yang berbeza, dan sering sukar digunakan semula kerana dokumentasi atau lesen yang tidak jelas.

Ini adalah masalah yang sudah lama diketahui. Bidang-bidang lain telah menyelesaikannya dengan membina sumber data yang dikongsi dan diseragamkan. Dalam sains komputer, koleksi imej berlabel ImageNet memberikan penyelidik satu penanda aras (benchmark) yang sama dan membantu mempercepatkan kemajuan dalam AI. Genetik dan sains saraf turut membina sumber terkongsi yang serupa untuk data masing-masing.

Item Response Warehouse (IRW) melakukan perkara yang sama untuk data respons item. Ia menghimpunkan ratusan set data sedia ada dan membentuk semula ke dalam satu format yang sama — supaya sesuatu kaedah yang diuji ke atas satu set data boleh diuji dengan mudah ke atas ratusan set data yang lain.

Apa yang terdapat dalam IRW

IRW mengandungi ratusan set data (“jadual”), setiap satunya adalah koleksi respons individu. Satu respons dihasilkan setiap kali seseorang (atau unit lain) memberikan respons kepada sesuatu item (atau ujian lain). Contohnya termasuk:

  • Jawapan pelajar dalam ujian pendidikan dan kebolehan
  • Item soal selidik yang mengukur personaliti atau sikap
  • Pemarkahan yang diberikan oleh penilai manusia
  • Mana-mana situasi lain yang melibatkan respons berulang kepada satu set alat pengukuran

Dua perkara adalah benar bagi setiap set data dalam IRW:

  • Terbuka. Setiap set data dilesenkan untuk penggunaan semula. Asal-usulnya didokumentasikan, dan kod yang digunakan untuk menukarkannya ke format IRW adalah terbuka kepada umum.
  • Diseragamkan (harmonized). Setiap set data dibentuk semula ke dalam struktur mudah yang sama (diterangkan di bawah), supaya kod analisis yang sama boleh dijalankan ke atas banyak set data dengan sedikit atau tiada pengubahsuaian.

Set data berbeza dengan ketara dari segi saiz (daripada beberapa ratus respons kepada berjuta-juta) dan jenis respons (item ya/tidak, penilaian pelbagai kategori, skor separa, dan banyak lagi). Setiap set data juga disertakan dengan metadata yang telah dikira terlebih dahulu — bilangan peserta, bilangan item, kepadatan respons, bidang subjek, dan label deskriptif lain — supaya penyelidik dapat mencari set data yang berkaitan tanpa perlu memuat turun dan memproses kesemuanya terlebih dahulu.

Standard data

Rajah menunjukkan grid berwarna bagi sel id-item, yang diubah melalui anak panah menjadi jadual format panjang dengan lajur id, item dan resp, dengan warna setiap sel resp sepadan dengan warna sel sumbernya dalam grid.

Setiap set data IRW dibentuk semula ke dalam format panjang (long format): satu baris bagi setiap respons. Sekurang-kurangnya, setiap baris mengandungi tiga maklumat:

Lajur Makna
id Siapa (atau apa) yang menghasilkan respons — biasanya seseorang individu
item Alat pengukuran mana yang menghasilkan respons — biasanya satu soalan atau tugasan
resp Respons itu sendiri, disimpan sebagai skor ordinal

Contoh:

id item resp rt cov_age rater
1 Q1 1 2.3 26 a
1 Q2 0 1.8 26 a
2 Q1 1 2.1 31 b
2 Q2 1 2.5 31 b

Apabila sesuatu set data mengandungi maklumat tambahan — masa tindak balas, identiti penilai, kovariat seperti umur — maklumat tersebut disimpan dalam lajur tambahan yang dinamakan secara konsisten. Satu struktur mudah ini merangkumi pelbagai situasi pengukuran yang sangat luas, dan inilah yang membolehkan kod analisis ditulis sekali sahaja dan digunakan merentasi keseluruhan gudang data.

Spesifikasi teknikal penuh bagi standard ini boleh didapati di itemresponsewarehouse.org/standard.html. Standard berkaitan yang lebih khusus turut wujud untuk teks item, data perbandingan berpasangan (pairwise), dan respons nominal (kategori tidak tersusun).

Cara menggunakannya

Terdapat tiga cara untuk mendapatkan data IRW, bergantung kepada tahap automasi yang anda inginkan.

1. Semak imbas dalam pelayar web Terokai set data dan metadatanya terus dalam pelayar data IRW — tiada akaun diperlukan. Memuat turun set data lengkap memerlukan akaun percuma Redivis, kerana itulah platform yang menyimpan data asas.

2. Gunakan pakej irw (disyorkan) Pakej irw, yang tersedia untuk kedua-dua R dan Python, menyediakan fungsi mudah untuk mencari, menapis, dan memuat turun data.

# R
devtools::install_github("itemresponsewarehouse/Rpkg")
library(irw)

irw_info()                     # overview of the IRW
irw_list_tables()              # list all available tables
irw_filter(var = "rt")         # find tables that include response times
df <- irw_fetch("4thgrade_math_sirt")   # download one table
# Python
# pip install "git+https://github.com/itemresponsewarehouse/Python-pkg.git"
import irw

irw.info()
irw.list_tables()
irw.filter(var="rt")
df = irw.fetch("4thgrade_math_sirt")

Pada kali pertama anda menggunakan pakej ini, anda akan diminta untuk log masuk dengan akaun Redivis percuma. Selepas itu, satu baris kod sahaja memuat turun mana-mana set data terus ke dalam R atau Python. Dari situ, data sudah sedia untuk dianalisis menggunakan perisian standard — contohnya pakej teori respons item atau analisis faktor.

3. Gunakan pustaka klien Redivis secara terus Bagi aliran kerja peringkat rendah atau bukan R/Python, data juga boleh diakses melalui pustaka klien R dan Python milik Redivis sendiri. Rujuk Panduan Memulakan untuk maklumat lanjut.

Lebih daripada sekadar memuat turun data

Projek IRW juga merangkumi:

  • Satu koleksi vignette yang semakin berkembang — contoh terperinci yang menerapkan kaedah pengukuran klasik dan baharu ke atas banyak set data IRW secara serentak
  • Sumber latihan dan set masalah untuk mengajar psikometrik menggunakan data sebenar
  • Proses sumbangan untuk penyelidik yang ingin menambah set data mereka sendiri ke dalam gudang data

Ketahui lebih lanjut

Jika anda menggunakan data IRW dalam kajian anda, sila petik (cite) data asal (kami telah menyediakan kefungsian untuk berbuat demikian). Kami turut amat menghargai jika anda memetik kertas kerja pengenalan di atas.


Ada soalan, maklum balas, atau ingin menyumbang set data? Layari halaman Hubungi Kami atau buka isu (issue) di GitHub.