{"id":"W4385236484","doi":"10.2196/48978","title":"Performance of ChatGPT on the Situational Judgement Test—A Professional Dilemmas–Based Examination for Doctors in the United Kingdom","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":44,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Institute for Health and Care Research","keywords":"Judgement; Test (biology); Situational ethics; Medical education; Psychology; Teamwork; Clinical judgement; Medicine; Applied psychology; Social psychology; Family medicine; Management; Political science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008965283,0.0004708702,0.0006969576,0.001731951,0.0008292312,0.001215836,0.0006548782,0.0009016508,0.005154486],"category_scores_gemma":[0.06436347,0.0005087597,0.0008094238,0.0006592061,0.0009644934,0.0009982336,0.004529133,0.0009148421,0.002129221],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00264181,"about_ca_system_score_gemma":0.002531605,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01060348,"about_ca_topic_score_gemma":0.01489038,"domain_scores_codex":[0.9902486,0.004330355,0.0021226,0.0009145454,0.001683734,0.0007001381],"domain_scores_gemma":[0.9474772,0.01889213,0.008836116,0.002814457,0.01561579,0.00636424],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00318517,0.0008044216,0.7854775,0.0009687819,0.00009709966,0.002814364,0.03410112,0.001360588,0.005963431,0.0005316471,0.01827328,0.1464226],"study_design_scores_gemma":[0.0001664137,0.003399623,0.9550115,0.0004939319,0.00004941651,0.003328532,0.01261763,0.004814842,0.005715695,0.0003079209,0.01391371,0.0001808569],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9904704,0.0002818011,0.001120599,0.0005551985,0.00009924075,0.0004227588,0.0005164121,0.0001189665,0.006414579],"genre_scores_gemma":[0.9921494,0.0001851764,0.00379612,0.0002205958,0.00002316166,0.0002418249,0.0005261943,0.00003118291,0.002826342],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01060348,"threshold_uncertainty_score":0.04741353,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1817766227857167,"score_gpt":0.4728353424075032,"score_spread":0.2910587196217865,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}