Team: Yusuf Ahmad, Dr. Nadine Dabby, Hilah Barbot, Michele Leardo, Nidhi Hebbar
Overview: Playlab is creating the first open-license dataset of AI-driven formative feedback on middle and high school science writing. Derived from OpenSciEd-aligned tools, this project will build the systems to clean, de-identify, annotate, and prepare a proof-of-concept dataset from thousands of CER (Claims, Evidence, Reasoning)-i interactions.
Subject Focus: Science Writing, Grades 6-12
Targeted Universalism Focus: Centers high-needs student populations across Title I schools, rural districts, and classrooms with high proportions of English Learners. The annotation protocol explicitly incorporates markers for linguistic diversity, multilingual expression, and non-standard academic English. This ensures AI feedback tools recognize valid scientific thinking across diverse writing styles without penalizing cultural or linguistic differences.
Public Goods & Deliverables:
- Annotated CER Dataset: A public, de-identified dataset of 2,000–3,000 multi-turn CER conversation threads (~10,000–15,000 individual interactions) released as structured JSON/CSV files under CC BY 4.0. Each record includes prompt context, student writing, AI feedback turns, revisions, and metadata on CER quality and misconception identification.
- Open-Source Tools: An automated/human-reviewed de-identification pipeline and data preparation scripts released under Apache 2.0.
- Annotation Protocol & Roadmap: A learning-science-grounded annotation rubric for coding CER quality, feedback pedagogical moves, and scientific misconceptions, alongside a roadmap memo for future scaling.