{"id":"W2498525818","doi":"10.1186/s12909-016-0714-1","title":"Validity of a new assessment rubric for a short-answer test of clinical reasoning","year":2016,"lang":"en","type":"article","venue":"BMC Medical Education","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"The Wilson Centre; Memorial University of Newfoundland; University Health Network; University of Toronto","funders":"University of Toronto","keywords":"Rubric; Generalizability theory; Certification; Medical education; Test (biology); Psychology; Competence (human resources); Construct validity; Medicine; Applied psychology; Clinical psychology; Psychometrics; Social psychology; Mathematics education","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.00264481,0.0001092537,0.0005842439,0.00005908864,0.00001944681,0.000003376771,0.0001234447,0.0002400013,0.0006809077],"category_scores_gemma":[0.5261185,0.00006855212,0.0002821781,0.0001464819,0.0001727511,0.00003417577,0.00003180738,0.0001474746,0.000008502613],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004638311,"about_ca_system_score_gemma":0.01096769,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008767137,"about_ca_topic_score_gemma":0.00002597698,"domain_scores_codex":[0.9976243,0.0001142102,0.001129645,0.0002975254,0.0006469602,0.0001873979],"domain_scores_gemma":[0.9046615,0.09203414,0.0005557585,0.0007276752,0.000664168,0.001356699],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001123128,0.002047471,0.760063,0.0001055671,0.0000210201,5.587139e-7,0.00003273313,9.923556e-8,0.00008540207,0.0008968125,0.02739208,0.209243],"study_design_scores_gemma":[0.003001494,0.001242187,0.9821338,0.007433603,0.0002818215,0.00001540452,0.0000831625,0.0003863878,0.0004726947,0.001037713,0.003799909,0.0001117983],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9310347,0.0001190837,0.06021652,0.004782786,0.001412763,0.0005833925,0.00001376131,0.00003284857,0.001804123],"genre_scores_gemma":[0.9565378,0.0001993971,0.03998436,0.000492127,0.001289904,0.00005148298,0.00003564997,0.00001639633,0.001392883],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5234737,"threshold_uncertainty_score":0.9946392,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1331455526702405,"score_gpt":0.500389192385086,"score_spread":0.3672436397148455,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}