{"id":"W4386893393","doi":"10.1016/j.ajp.2023.103770","title":"Appraising the performance of ChatGPT in psychiatry using 100 clinical case vignettes","year":2023,"lang":"en","type":"article","venue":"Asian Journal of Psychiatry","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":77,"is_retracted":false,"has_abstract":false,"ca_institutions":"Queen's University","funders":"","keywords":"Grading (engineering); Mental health; Psychiatry; Psychology; Medicine; Medical education","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00780904,0.0003198799,0.0003573328,0.001510065,0.001938133,0.0015482,0.0009924623,0.001761345,0.002763721],"category_scores_gemma":[0.07253944,0.0003463373,0.0004786722,0.001367123,0.001246696,0.001301797,0.002052685,0.001556881,0.0004518983],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003823534,"about_ca_system_score_gemma":0.001784098,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003632159,"about_ca_topic_score_gemma":0.01084443,"domain_scores_codex":[0.9923306,0.005669008,0.0005724876,0.0001950221,0.0008026845,0.0004303781],"domain_scores_gemma":[0.9473032,0.03990081,0.00419509,0.000791823,0.004155673,0.00365322],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003473071,0.004975545,0.3674797,0.002914114,0.0002652358,0.04342156,0.3224462,0.0108595,0.005962355,0.007551854,0.02156771,0.2090831],"study_design_scores_gemma":[0.0004446258,0.00753616,0.4751207,0.003314129,0.0003051206,0.04945919,0.3825147,0.02775973,0.006080941,0.005550177,0.04139548,0.0005189158],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9907149,0.000548467,0.001258052,0.001781857,0.00006704675,0.0004279281,0.0001131426,0.00002007635,0.005068467],"genre_scores_gemma":[0.9924245,0.0006870278,0.005486477,0.000288968,0.00004584748,0.0002498712,0.0001453487,0.00001005226,0.0006617957],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.00780904,"threshold_uncertainty_score":0.04129869,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1655565224239388,"score_gpt":0.4824548562779592,"score_spread":0.3168983338540204,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}