{"id":"W4386438954","doi":"10.1007/s00404-023-07185-4","title":"Performance of ChatGPT in Israeli Hebrew OBGYN national residency examinations","year":2023,"lang":"en","type":"article","venue":"Archives of Gynecology and Obstetrics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":18,"is_retracted":false,"has_abstract":false,"ca_institutions":"McGill University; Jewish General Hospital","funders":"","keywords":"Medicine; Human genetics; Hebrew; Family medicine; Gynecology; Genetics; Classics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001002996,0.000179349,0.0002265788,0.001251361,0.001379533,0.001051299,0.0007732589,0.0007260868,0.003159066],"category_scores_gemma":[0.004715709,0.0001965417,0.0002030108,0.001205919,0.0005944839,0.0005333534,0.001412026,0.0008389801,0.0008630679],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003127938,"about_ca_system_score_gemma":0.003380175,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.09615503,"about_ca_topic_score_gemma":0.1666281,"domain_scores_codex":[0.9988244,0.0002372265,0.00007699619,0.0001080351,0.0001967558,0.0005565328],"domain_scores_gemma":[0.9969382,0.0004604309,0.0006321366,0.00006951192,0.0007293431,0.001170311],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001726936,0.000174682,0.9908201,0.00001500298,0.00001084623,0.0003167535,0.002457302,0.00005571816,0.0002277915,0.00008621605,0.0009964273,0.004666548],"study_design_scores_gemma":[0.000003128237,0.00008108139,0.9927938,0.0000181683,0.000005168236,0.0001347039,0.006071921,0.00008222436,0.00008404414,0.00001318548,0.0007080018,0.000004652639],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9977106,0.00007736607,0.000007788556,0.0001655129,0.0000198755,0.000007389121,0.0001369078,0.000001480763,0.001873053],"genre_scores_gemma":[0.9980729,0.00006869243,0.00001708814,0.00007989136,0.00001394405,0.000008485259,0.0001974846,0.000002433935,0.001539175],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.09615503,"threshold_uncertainty_score":0.1911907,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09443597876947529,"score_gpt":0.3797961080783587,"score_spread":0.2853601293088834,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}