{"id":"W4394689344","doi":"10.2196/54067","title":"Using ChatGPT in Psychiatry to Design Script Concordance Tests in Undergraduate Medical Education: Mixed Methods Study","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":30,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université Laval; Université de Montréal","funders":"","keywords":"Concordance; Medical education; Psychology; Expert opinion; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05222661,0.0008835399,0.0009277902,0.002883112,0.001800033,0.002145849,0.001502255,0.0008777818,0.002049813],"category_scores_gemma":[0.09804997,0.0007486808,0.0009534055,0.001857389,0.001761658,0.001248584,0.002609362,0.001015333,0.0003803053],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003460714,"about_ca_system_score_gemma":0.003462852,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002964961,"about_ca_topic_score_gemma":0.007270614,"domain_scores_codex":[0.9515393,0.03854107,0.002899762,0.002593301,0.003355784,0.001070735],"domain_scores_gemma":[0.8171972,0.150472,0.009287748,0.006712429,0.01393038,0.002400133],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.003730219,0.01419509,0.3312343,0.002758221,0.000437047,0.001542196,0.3607407,0.001975651,0.006756882,0.001738903,0.001223865,0.2736669],"study_design_scores_gemma":[0.003174009,0.05037748,0.5258561,0.002319837,0.0009965298,0.002214259,0.3399241,0.0243601,0.02663411,0.004065969,0.01949191,0.000585597],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9854749,0.0001224385,0.008078068,0.000056891,0.00001817116,0.005101238,0.0001019717,0.00002850107,0.001017678],"genre_scores_gemma":[0.950705,0.0002394105,0.03419062,0.0002662308,0.00003941018,0.01332396,0.0002116279,0.00003553296,0.0009881189],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05222661,"threshold_uncertainty_score":0.276204,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.160236527378206,"score_gpt":0.5630832943110788,"score_spread":0.4028467669328728,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}