{"id":"W3049364633","doi":"10.1007/s40037-020-00606-z","title":"Beyond right or wrong: More effective feedback for formative multiple-choice tests","year":2020,"lang":"en","type":"article","venue":"Perspectives on Medical Education","topic":"Memory Processes and Influences","field":"Neuroscience","cited_by":24,"is_retracted":false,"has_abstract":true,"ca_institutions":"The Wilson Centre; University of Toronto","funders":"","keywords":"Formative assessment; Multiple choice; Computer science; Medical education; Medical physics; Management science; Psychology; Medicine; Mathematics education; Mathematics; Statistics; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0001849166,0.0002238873,0.0002443712,0.00007835629,0.0002987898,0.00007213731,0.0004017912,0.0001182455,0.0008381369],"category_scores_gemma":[0.06231235,0.0001565257,0.00008625975,0.0004623439,0.0003213114,0.000515521,0.0000448075,0.000331385,0.00011296],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001317439,"about_ca_system_score_gemma":0.0006645998,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001591181,"about_ca_topic_score_gemma":0.00001317136,"domain_scores_codex":[0.9979784,0.0001182933,0.0002659226,0.0006992885,0.0006285353,0.0003095928],"domain_scores_gemma":[0.9956142,0.003338966,0.0001690798,0.0001847727,0.0002142745,0.0004786876],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.005799331,0.008106526,0.003691863,0.002087327,0.0001537569,0.00002922537,0.5756591,0.0002062964,0.04862572,0.06176724,0.0783209,0.2155527],"study_design_scores_gemma":[0.01358834,0.01237638,0.06818078,0.00131139,0.0002563143,0.0001053941,0.2875384,0.05700426,0.4110202,0.01627281,0.1290597,0.003285962],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.938657,0.0003214087,0.002104184,0.04352608,0.001042118,0.002568888,0.00005314533,0.0002252147,0.01150192],"genre_scores_gemma":[0.9837338,0.00007659712,0.0004209146,0.01406664,0.0008491722,0.0005018031,0.000009139774,0.00002332863,0.0003185693],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3623945,"threshold_uncertainty_score":0.9455862,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02888549548732569,"score_gpt":0.3561502694130367,"score_spread":0.327264773925711,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}