{"id":"W4281641218","doi":"10.1111/medu.14853","title":"When I say <i>…</i> response process validity evidence","year":2022,"lang":"en","type":"article","venue":"Medical Education","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Sherbrooke; McGill University","funders":"","keywords":"Psychology; Process (computing); Equity (law); Cognition; Cognitive psychology; Social psychology; Applied psychology; Computer science; Political science; Psychiatry","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.02397089,0.00007728874,0.0001261254,0.000174666,0.0004146696,0.0001007669,0.000877525,0.00003852001,0.06260707],"category_scores_gemma":[0.03368858,0.00006003937,0.00004895684,0.0007182625,0.00006610215,0.0004147874,0.0001497115,0.0002840771,0.0004933007],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001840024,"about_ca_system_score_gemma":0.00763897,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002766193,"about_ca_topic_score_gemma":0.00001525435,"domain_scores_codex":[0.991674,0.001660428,0.0004972039,0.0003568082,0.005644239,0.0001673134],"domain_scores_gemma":[0.9966722,0.002069047,0.0002034266,0.0004754998,0.0004040888,0.0001757448],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0003855434,0.0005810526,0.03118008,0.000009809371,0.000003812474,0.000002026171,0.007508868,0.0001637521,0.0001001302,0.0005864597,0.777921,0.1815575],"study_design_scores_gemma":[0.0002735773,0.0002735845,0.05204906,0.00004504917,0.000009865834,0.00003037747,0.00579252,0.00843928,0.0001987301,0.02591216,0.9068004,0.000175407],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8177279,0.0002049084,0.001229434,0.1741563,0.002500477,0.0002649023,0.000003312694,0.00004396898,0.003868879],"genre_scores_gemma":[0.9682976,0.00001334823,0.0002163586,0.02187605,0.0001794923,0.000264635,0.00000906135,0.000005543428,0.00913791],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1813821,"threshold_uncertainty_score":0.9979868,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2864561348748174,"score_gpt":0.5686232695119959,"score_spread":0.2821671346371786,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}