{"id":"W4401445967","doi":"10.1177/08850666241267871","title":"Evaluating the Appropriateness, Consistency, and Readability of ChatGPT in Critical Care Recommendations","year":2024,"lang":"en","type":"article","venue":"Journal of Intensive Care Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":19,"is_retracted":false,"has_abstract":true,"ca_institutions":"London Health Sciences Centre; University of Toronto; Western University","funders":"","keywords":"Readability; Medicine; Likert scale; Consistency (knowledge bases); Misinformation; Set (abstract data type); MEDLINE; Medical physics; Family medicine; Statistics; Linguistics; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.001161372,0.00009987345,0.0004022349,0.0002202382,0.00006440691,0.00000980387,0.00006534023,0.00007714127,0.00007907886],"category_scores_gemma":[0.02328672,0.00005599522,0.00007266779,0.0002995583,0.0004903232,0.00008145565,0.00002256813,0.0005107577,0.00000136467],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001935201,"about_ca_system_score_gemma":0.0006466906,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005071752,"about_ca_topic_score_gemma":0.0001046904,"domain_scores_codex":[0.998296,0.0001626378,0.0009250901,0.0001503042,0.0003287648,0.0001371511],"domain_scores_gemma":[0.9864524,0.001543505,0.0001579187,0.0001729569,0.01157092,0.0001023078],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"qualitative","study_design_scores_codex":[0.0006026168,0.00005958368,0.04022579,0.004197063,0.00009895457,0.000149526,0.2211842,0.00001221923,0.006888541,0.001368687,0.004285946,0.7209269],"study_design_scores_gemma":[0.0001302588,0.003313581,0.008049469,0.007673115,0.0003948469,0.0008107249,0.9700359,0.0006591472,0.005231113,0.002524737,0.001088974,0.00008815566],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8237877,0.0372831,0.0001681552,0.1360951,0.002091905,0.0002885946,0.000004975906,0.000007096139,0.0002733178],"genre_scores_gemma":[0.9963323,0.0006776138,0.0004450584,0.001894719,0.000610276,0.000006659478,0.000009105143,0.000009792551,0.00001441417],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7488517,"threshold_uncertainty_score":0.9849405,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3342901520009643,"score_gpt":0.5577223676223869,"score_spread":0.2234322156214226,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}