{"id":"W4391056731","doi":"10.1016/j.ajog.2023.11.582","title":"557 Evaluating the Validity of ChatGPT Responses on Common Obstetric Issues: Potential Clinical Applications and Implications","year":2024,"lang":"en","type":"article","venue":"American Journal of Obstetrics and Gynecology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"McMaster University; Hamilton Health Sciences","funders":"","keywords":"Rating scale; Medicine; Clinical psychology; Family medicine; Gynecology; Statistics; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04934976,0.0004263824,0.0008448312,0.00312566,0.001404886,0.002086068,0.001365239,0.001456683,0.004609614],"category_scores_gemma":[0.2496142,0.0003951975,0.001020655,0.00223325,0.001968337,0.001989532,0.00250912,0.001319515,0.001150785],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001747995,"about_ca_system_score_gemma":0.002954559,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004431009,"about_ca_topic_score_gemma":0.006557962,"domain_scores_codex":[0.9582927,0.02735638,0.004741373,0.001671212,0.006800988,0.0011372],"domain_scores_gemma":[0.6429701,0.2766222,0.02736433,0.009757535,0.04024079,0.00304502],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007175456,0.0004699048,0.9194567,0.0007519576,0.0001840909,0.000360754,0.01269665,0.0004629559,0.001325111,0.001068417,0.001638653,0.06086725],"study_design_scores_gemma":[0.0001330547,0.001325363,0.9575349,0.001107688,0.0001956917,0.0005985842,0.02287142,0.004423854,0.002893039,0.002390803,0.006420787,0.0001048504],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9785743,0.0005306705,0.004194146,0.001173834,0.00027791,0.0008972333,0.0007112818,0.00004556003,0.01359514],"genre_scores_gemma":[0.9846311,0.000557937,0.009599842,0.0008126828,0.000154676,0.00191261,0.0006574578,0.0000312568,0.001642292],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.04934976,"threshold_uncertainty_score":0.2609895,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2331820833391499,"score_gpt":0.5193950102622276,"score_spread":0.2862129269230776,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}