{"id":"W4401445967","doi":"10.1177/08850666241267871","title":"Evaluating the Appropriateness, Consistency, and Readability of ChatGPT in Critical Care Recommendations","year":2024,"lang":"en","type":"article","venue":"Journal of Intensive Care Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":19,"is_retracted":false,"has_abstract":true,"ca_institutions":"London Health Sciences Centre; University of Toronto; Western University","funders":"","keywords":"Readability; Medicine; Likert scale; Consistency (knowledge bases); Misinformation; Set (abstract data type); MEDLINE; Medical physics; Family medicine; Statistics; Linguistics; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09871794,0.001273334,0.001231104,0.002472518,0.0006368886,0.004297419,0.002173645,0.001809759,0.002444494],"category_scores_gemma":[0.4160535,0.0008048505,0.002820205,0.001299625,0.001409742,0.003469954,0.003411427,0.002264501,0.0007083265],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003740447,"about_ca_system_score_gemma":0.005003991,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004203575,"about_ca_topic_score_gemma":0.006183811,"domain_scores_codex":[0.9077333,0.06758326,0.01001112,0.003012153,0.01080772,0.0008524368],"domain_scores_gemma":[0.4087352,0.5188122,0.02601057,0.0143951,0.02912389,0.002923092],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01513679,0.004268446,0.322423,0.0124705,0.002403095,0.001050693,0.04752697,0.0261766,0.00807104,0.001717558,0.01603794,0.5427174],"study_design_scores_gemma":[0.006281877,0.03520915,0.5362793,0.01795651,0.006624798,0.003646485,0.02571834,0.2699951,0.03521629,0.009825076,0.05050812,0.002738952],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9399485,0.001406739,0.04207214,0.001967327,0.000298719,0.006564238,0.001521039,0.001923899,0.004297397],"genre_scores_gemma":[0.8553444,0.000842485,0.1339244,0.0007719602,0.0001203938,0.006143658,0.001713059,0.0002388707,0.0009007232],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9012821,"threshold_uncertainty_score":0.5220766,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3342901520009643,"score_gpt":0.5577223676223869,"score_spread":0.2234322156214226,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}