{"id":"W3176216966","doi":"10.2196/17670","title":"Evidence of Construct Validity of Computer-Based Tests for Clinical Reasoning: Instrument Validation Study","year":2021,"lang":"en","type":"article","venue":"JMIR Serious Games","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Construct (python library); Construct validity; Test (biology); Medical education; Psychology; Clinical psychology; Psychometrics; Medicine; Computer science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.001020213,0.0001506761,0.0007746894,0.00005226065,0.00003209119,0.0000148768,0.0001061162,0.000120493,0.00004718002],"category_scores_gemma":[0.03458493,0.0001328426,0.0002433672,0.0002115037,0.0001857373,0.00004202115,0.00006722727,0.0001514314,0.00000289357],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003214562,"about_ca_system_score_gemma":0.000627524,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002535928,"about_ca_topic_score_gemma":0.00001013644,"domain_scores_codex":[0.9977971,0.0002524919,0.0009895581,0.0004012033,0.0003735783,0.000186082],"domain_scores_gemma":[0.9824905,0.01575942,0.0004473417,0.0005424755,0.0005962354,0.0001640601],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0005192235,0.002771492,0.906459,0.0002236316,0.0001098345,0.00003389593,0.0001307272,0.00002642845,0.0004800881,0.00005385285,0.001011795,0.08818002],"study_design_scores_gemma":[0.005388261,0.008027309,0.9643894,0.005604346,0.0003343674,0.00002832198,0.0001965955,0.0009884983,0.01460772,0.0000814857,0.0002021285,0.0001515576],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9967558,0.000233182,0.00080529,0.0004554331,0.0004723106,0.001163498,0.00002082625,0.00004240464,0.00005120878],"genre_scores_gemma":[0.9846818,0.0001026496,0.01474033,0.0001480567,0.0001637484,0.00007162533,0.0000350925,0.00001622757,0.00004048253],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.08802846,"threshold_uncertainty_score":0.9735472,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1502308032585819,"score_gpt":0.4491462071111116,"score_spread":0.2989154038525297,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}