{"id":"W4402440712","doi":"10.5334/pme.1150","title":"Validity in the Next Era of Assessment: Consequences, Social Impact, and Equity","year":2024,"lang":"en","type":"article","venue":"Perspectives on Medical Education","topic":"Innovations in Medical Education","field":"Medicine","cited_by":13,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa; Université de Sherbrooke","funders":"","keywords":"Equity (law); Psychology; Data science; Computer science; Political science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001937022,0.0001099376,0.0001900959,0.0001903882,0.00008514765,0.00005109484,0.000129076,0.0001345793,0.0007372997],"category_scores_gemma":[0.003429946,0.00007221025,0.00005781136,0.0007771079,0.0006471612,0.0001303787,0.00002585112,0.0009460591,0.000007394633],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004783721,"about_ca_system_score_gemma":0.003865495,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002108013,"about_ca_topic_score_gemma":0.000008966596,"domain_scores_codex":[0.9982169,0.0001907066,0.000300998,0.00026694,0.000861228,0.0001632671],"domain_scores_gemma":[0.9992526,0.0002715044,0.00006250705,0.0001672122,0.0001811056,0.00006505573],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0001048858,0.003540639,0.008129264,0.0006461088,0.00008356206,0.00001868604,0.0871928,6.272153e-7,0.0006220268,0.2371698,0.04019754,0.6222941],"study_design_scores_gemma":[0.00118602,0.001035255,0.7668723,0.001937795,0.0001912672,0.0003255906,0.1905835,0.003445813,0.0001178285,0.02693291,0.007053277,0.0003184624],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8906154,0.001036342,0.000312184,0.09937383,0.0005460475,0.0003545409,0.000003597771,0.00002941649,0.007728622],"genre_scores_gemma":[0.9961017,0.0003486288,0.000607312,0.002143437,0.0006433352,0.00006901562,0.00003966908,0.000009300151,0.00003760233],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.758743,"threshold_uncertainty_score":0.8072914,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06212303518764536,"score_gpt":0.4899591385755085,"score_spread":0.4278361033878632,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}