{"id":"W6910537080","doi":"10.48620/85260","title":"A comparison of large language model-generated and published perioperative neurocognitive disorder recommendations: a cross-sectional web-based analysis","year":2025,"lang":"en","type":"article","venue":"Open Access CRIS of the University of Bern","topic":"Intensive Care Unit Cognitive Disorders","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Neurocognitive; Perioperative; Reliability (semiconductor); MEDLINE; Quality (philosophy); Patient safety; Quality of life (healthcare)","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07093826,0.0006063918,0.001241208,0.008240563,0.0004064859,0.002669506,0.001134039,0.0009686024,0.00167233],"category_scores_gemma":[0.2626929,0.0005470977,0.002718476,0.008018394,0.0006439224,0.002437501,0.001746258,0.001099442,0.0003657425],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001896629,"about_ca_system_score_gemma":0.002100038,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006539293,"about_ca_topic_score_gemma":0.005421529,"domain_scores_codex":[0.9398237,0.0363804,0.01282312,0.004640327,0.005673293,0.0006590833],"domain_scores_gemma":[0.5141378,0.3679949,0.07449636,0.01219348,0.02926689,0.00191052],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001798419,0.0004982703,0.96838,0.001855169,0.003051616,0.0001210267,0.002905271,0.002902433,0.0001919198,0.0001855374,0.002447249,0.01566315],"study_design_scores_gemma":[0.0008143895,0.00149161,0.9632819,0.001338966,0.002239527,0.0003138395,0.00397421,0.02056303,0.0007574941,0.000523664,0.004552352,0.0001489103],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9775887,0.0008939956,0.003961293,0.000356932,0.00003138782,0.001406465,0.01476704,0.000128954,0.000865394],"genre_scores_gemma":[0.9749618,0.0003334883,0.00806571,0.0002230786,0.0000253497,0.00224416,0.01392144,0.00005274894,0.0001723666],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07093826,"threshold_uncertainty_score":0.3751619,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03503860180602209,"score_gpt":0.3987508128312685,"score_spread":0.3637122110252464,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}