{"id":"W4401322393","doi":"10.1016/j.aucc.2024.07.036","title":"Evaluating the appropriateness, consistency, and readability of ChatGPT in critical care recommendations","year":2024,"lang":"en","type":"article","venue":"Australian Critical Care","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto; Western University","funders":"","keywords":"Medicine; Readability; Consistency (knowledge bases); Appropriateness criteria; Medical physics; Linguistics; Radiology; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06341838,0.0005850462,0.001388253,0.004966315,0.0008709701,0.003931409,0.001645784,0.002455289,0.003003112],"category_scores_gemma":[0.5664656,0.0004935412,0.001839412,0.002589057,0.001069608,0.004217666,0.002454097,0.002450426,0.0009442983],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002216268,"about_ca_system_score_gemma":0.003365056,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008625736,"about_ca_topic_score_gemma":0.01254089,"domain_scores_codex":[0.9235607,0.0415353,0.0168027,0.002882528,0.01442512,0.0007936645],"domain_scores_gemma":[0.3618831,0.5449596,0.03387649,0.01237819,0.0437124,0.003190129],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.008732677,0.001666177,0.5741511,0.009488749,0.002653631,0.0009382846,0.02252769,0.006578444,0.003388001,0.001406591,0.02584686,0.3426219],"study_design_scores_gemma":[0.001737696,0.007818832,0.8413993,0.01432911,0.004520825,0.002722789,0.01682971,0.05928257,0.01099934,0.004191756,0.0354108,0.0007572701],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9613699,0.005220406,0.01081934,0.004420038,0.0007275179,0.002449301,0.00534889,0.0008660946,0.008778475],"genre_scores_gemma":[0.9523654,0.001899336,0.03763177,0.001224899,0.0002621472,0.00134595,0.003657647,0.0001664524,0.001446377],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9365816,"threshold_uncertainty_score":0.3353924,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4545252341154738,"score_gpt":0.5849867038464664,"score_spread":0.1304614697309927,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}