{"id":"W2122398545","doi":"10.1016/j.amjsurg.2012.09.002","title":"Assessing clinical judgment using the Script Concordance test: the importance of using specialty-specific experts to develop the scoring key","year":2012,"lang":"en","type":"article","venue":"The American Journal of Surgery","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":21,"is_retracted":false,"has_abstract":false,"ca_institutions":"Université de Montréal; McGill University","funders":"","keywords":"Concordance; Test (biology); Specialty; Reliability (semiconductor); Key (lock); Medicine; Scoring system; Cronbach's alpha; Medical education; Psychology; Medical physics; Computer science; Family medicine; Clinical psychology; Psychometrics; Surgery; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01039902,0.0002193746,0.0009594571,0.00007722584,0.0003852536,0.00008971617,0.0004445667,0.00003722078,0.00003436926],"category_scores_gemma":[0.03985114,0.00008896083,0.0003909857,0.001033556,0.001208106,0.00018521,0.0001485093,0.000657181,0.000003683078],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001483524,"about_ca_system_score_gemma":0.0007909929,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00006863825,"about_ca_topic_score_gemma":0.000002713882,"domain_scores_codex":[0.99607,0.0006533206,0.001762428,0.0001822094,0.0008012066,0.0005307884],"domain_scores_gemma":[0.9354051,0.0601752,0.002647846,0.000811973,0.0006182659,0.0003415699],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002471776,0.0002027978,0.9518226,0.00000499204,0.0001190324,0.00003917031,0.001175641,0.0001170534,0.001099087,0.00003445932,0.002831549,0.04230648],"study_design_scores_gemma":[0.0003727822,0.0001452917,0.9788015,0.003089768,0.0002916407,0.001124207,0.01092264,0.0001633474,0.0008185538,0.00005756967,0.004008735,0.0002039544],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9859105,0.003154152,0.002212622,0.006434469,0.00196726,0.0002016852,0.000001829471,0.000008593027,0.0001088784],"genre_scores_gemma":[0.9875036,0.0007614931,0.003126215,0.005174519,0.003380015,0.000003008413,3.570302e-7,0.00003473201,0.00001598655],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0606649,"threshold_uncertainty_score":0.9682366,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2193784326796066,"score_gpt":0.4300570789545134,"score_spread":0.2106786462749068,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}