{"id":"W2891885683","doi":"10.1016/j.hpe.2018.09.001","title":"Guidelines for Creating Written Clinical Reasoning Exams: Insight from a Delphi Study","year":2018,"lang":"en","type":"article","venue":"Health Professions Education","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Likert scale; Delphi method; Guideline; Medical education; Scale (ratio); Delphi; Psychology; Snowball sampling; Relevance (law); Medicine; Computer science; Artificial intelligence; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.002794581,0.0001789041,0.0005615578,0.0001083259,0.0006932094,0.00002320954,0.000117418,0.0001922512,0.000147905],"category_scores_gemma":[0.1563694,0.0001379474,0.0001165574,0.000281156,0.00009222089,0.00007094681,0.00006757242,0.0003688218,0.00008616518],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001372338,"about_ca_system_score_gemma":0.00392441,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001789984,"about_ca_topic_score_gemma":0.0002478868,"domain_scores_codex":[0.9967709,0.0004547958,0.001531569,0.0005737116,0.0002815124,0.000387514],"domain_scores_gemma":[0.9838374,0.01243816,0.0006273427,0.0007345937,0.001702686,0.0006598072],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003289413,0.004307866,0.5070366,0.00005926945,0.00006461317,0.000001135451,0.009992363,2.38077e-7,0.00001134762,0.0002411434,0.1736464,0.3043101],"study_design_scores_gemma":[0.004388587,0.004107812,0.901889,0.0135314,0.0002510005,0.00000819973,0.04284525,0.001020842,0.00002243892,0.0008776877,0.0307737,0.0002840447],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9559922,0.0009133178,0.00227433,0.03258677,0.00374006,0.003156632,0.0000165741,0.0001581114,0.001162013],"genre_scores_gemma":[0.9050304,0.0001785865,0.06522082,0.01867743,0.007309773,0.0007770522,0.0003294301,0.00004921298,0.002427277],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3948524,"threshold_uncertainty_score":0.8507369,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.282272881405195,"score_gpt":0.5888860901688526,"score_spread":0.3066132087636577,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}