{"id":"W2970977809","doi":"10.11157/fohpe.v20i2.321","title":"Script concordance test examinations: Student perception and study approaches","year":2019,"lang":"en","type":"article","venue":"Focus on Health Professional Education A Multi-Professional Journal","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Concordance; Construct (python library); Multiple choice; Test (biology); Psychology; Construct validity; Medical education; Perception; Psychometrics; Medicine; Clinical psychology; Computer science; Significant difference; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gpt","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"grok","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"opus","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.002328797,0.0003478685,0.000638218,0.0003569098,0.0008423687,0.00006741926,0.0002011467,0.0002054619,0.0006310196],"category_scores_gemma":[0.006969909,0.0002508067,0.000126486,0.0002993415,0.0001092435,0.0002270675,0.0001234141,0.001662924,0.0003060476],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005609127,"about_ca_system_score_gemma":0.004551359,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007988515,"about_ca_topic_score_gemma":0.00002224497,"domain_scores_codex":[0.9956228,0.0007804911,0.001166195,0.0006612851,0.001260003,0.0005092907],"domain_scores_gemma":[0.9926098,0.004773694,0.0007460132,0.0003848238,0.0005555583,0.000930102],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0004672826,0.01964585,0.8316765,0.0001511272,0.00006325598,0.0000112783,0.006572718,0.000005276721,0.0001523648,0.00045892,0.01628942,0.124506],"study_design_scores_gemma":[0.005466512,0.002420876,0.9382606,0.006167429,0.000045282,0.0002087037,0.04571664,0.0003809637,0.000007289968,0.0002905142,0.0007947359,0.0002404135],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9532461,0.0008777039,0.0000707717,0.03623723,0.006281496,0.002825143,0.00001835295,0.00005812231,0.0003850423],"genre_scores_gemma":[0.9755314,0.0002540784,0.003567726,0.006266617,0.0008214093,0.000303181,0.00006999466,0.00004723664,0.01313834],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1242655,"threshold_uncertainty_score":0.9999944,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1071179608798967,"score_gpt":0.4778008864963227,"score_spread":0.370682925616426,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}