{"id":"W4393157595","doi":"10.1002/ijgo.15501","title":"Evaluating the validity of <scp>ChatGPT</scp> responses on common obstetric issues: Potential clinical applications and implications","year":2024,"lang":"en","type":"article","venue":"International Journal of Gynecology & Obstetrics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":19,"is_retracted":false,"has_abstract":true,"ca_institutions":"McMaster University; Hamilton Health Sciences","funders":"","keywords":"Rating scale; Psychology; Clinical psychology; Cognitive reframing; Medicine; Applied psychology; Social psychology; Developmental psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1627878,0.0006659777,0.0009445723,0.003920804,0.001152079,0.001884856,0.001398819,0.001238974,0.003932397],"category_scores_gemma":[0.4185968,0.0003398902,0.001116635,0.002916367,0.002494481,0.002252757,0.003449135,0.0009528797,0.001163599],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002117976,"about_ca_system_score_gemma":0.003390623,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002271543,"about_ca_topic_score_gemma":0.003848299,"domain_scores_codex":[0.8308998,0.1215595,0.0167828,0.004791681,0.0240127,0.001953429],"domain_scores_gemma":[0.3557945,0.455233,0.0618505,0.01594118,0.107552,0.003628795],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002622528,0.0006102708,0.717908,0.004728162,0.0004220035,0.0007260112,0.04196851,0.001868023,0.006001924,0.00105852,0.008651941,0.2134342],"study_design_scores_gemma":[0.0003113765,0.003458384,0.923835,0.00338908,0.000285211,0.001289364,0.0249227,0.01565292,0.008555463,0.001782183,0.0162714,0.0002468423],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9543281,0.0009955926,0.02257383,0.002657461,0.0004600694,0.004054391,0.001207047,0.0003472677,0.01337628],"genre_scores_gemma":[0.9657422,0.0005337397,0.02567748,0.0008011339,0.0002692138,0.004959504,0.0008783602,0.0000910033,0.001047339],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8372122,"threshold_uncertainty_score":0.8609146,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2973606947576407,"score_gpt":0.5439631681952952,"score_spread":0.2466024734376545,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}