{"id":"W3176216966","doi":"10.2196/17670","title":"Evidence of Construct Validity of Computer-Based Tests for Clinical Reasoning: Instrument Validation Study","year":2021,"lang":"en","type":"article","venue":"JMIR Serious Games","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Construct (python library); Construct validity; Test (biology); Medical education; Psychology; Clinical psychology; Psychometrics; Medicine; Computer science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06815371,0.0006903148,0.0007869918,0.003317246,0.000656574,0.001686487,0.001790127,0.00108788,0.001419398],"category_scores_gemma":[0.1845177,0.0005267491,0.002078983,0.002921967,0.002555756,0.001654855,0.002276689,0.001192864,0.0002752886],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001730065,"about_ca_system_score_gemma":0.002803924,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002166834,"about_ca_topic_score_gemma":0.002695601,"domain_scores_codex":[0.9401222,0.03363787,0.006807929,0.002684348,0.01573802,0.001009627],"domain_scores_gemma":[0.6695199,0.2569742,0.02887152,0.01483089,0.02759743,0.002206093],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0009413395,0.001797889,0.9475188,0.0005169244,0.001231633,0.00004264191,0.002574168,0.00085224,0.0005703924,0.0007147176,0.0004848976,0.04275424],"study_design_scores_gemma":[0.0005058897,0.003872009,0.9808862,0.0007414651,0.0005542915,0.0002411478,0.001877368,0.007368055,0.001237363,0.0007856931,0.001869647,0.00006093259],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9870767,0.0009949383,0.006789958,0.0002578692,0.00009166461,0.001020999,0.0004024452,0.00004417145,0.003321305],"genre_scores_gemma":[0.9929193,0.0003071225,0.005262693,0.0001291711,0.00002263225,0.0007443046,0.0004437978,0.0000146106,0.0001564087],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.06815371,"threshold_uncertainty_score":0.3604355,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1502308032585819,"score_gpt":0.4491462071111116,"score_spread":0.2989154038525297,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}