{"id":"W6949516502","doi":"10.5281/zenodo.15174917","title":"Intrinsic and Contextual Factors Impacting Student Ratings of Automatically Generated Questions: A Large-Scale Data Analysis","year":2025,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Intelligent Tutoring Systems and Adaptive Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Nutrasource","funders":"","keywords":"Formative assessment; Set (abstract data type); Key (lock); Data set; Code (set theory); Student life","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009190172,0.0004815783,0.0006487979,0.00183911,0.000470276,0.001223063,0.0005891479,0.0006888824,0.0009417941],"category_scores_gemma":[0.06371684,0.0002284341,0.0005492671,0.002140395,0.0006278268,0.0009765006,0.001371266,0.000964418,0.0006889166],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003833461,"about_ca_system_score_gemma":0.0003773052,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001334356,"about_ca_topic_score_gemma":0.002344895,"domain_scores_codex":[0.9883773,0.006297708,0.001096354,0.001584576,0.002245061,0.000399097],"domain_scores_gemma":[0.860155,0.1111146,0.009982441,0.006917025,0.010114,0.001716876],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00133017,0.001198157,0.8620285,0.0007014188,0.0003930088,0.0002592833,0.009419401,0.003758661,0.01541039,0.0003092343,0.002821754,0.1023701],"study_design_scores_gemma":[0.0000382701,0.0009622507,0.9707168,0.00003619397,0.0001025179,0.000234342,0.001684343,0.01547073,0.00765722,0.0003281024,0.00270869,0.0000605131],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9918739,0.0001253713,0.005335634,0.00005391582,0.000009499189,0.000188436,0.001780049,0.0001235082,0.0005095887],"genre_scores_gemma":[0.9891738,0.00005253066,0.006187213,0.00002643491,0.00001463384,0.0003670259,0.003664055,0.00004196261,0.0004724113],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.009190172,"threshold_uncertainty_score":0.04860288,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04051850945371471,"score_gpt":0.3008131794880423,"score_spread":0.2602946700343276,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}