{"id":"W4414750656","doi":"10.1038/s41746-025-01943-1","title":"A longitudinal analysis of declining medical safety messaging in generative AI models","year":2025,"lang":"en","type":"article","venue":"npj Digital Medicine","topic":"Ethics and Social Impacts of AI","field":"Social Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Disclaimer; Generative grammar; The Internet; Generative model; Function (biology); Patient safety; MEDLINE","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002248041,0.0001081466,0.0005512408,0.0004840313,0.000196281,0.00005899113,0.0002695613,0.0001932615,0.000163613],"category_scores_gemma":[0.005608228,0.0000908668,0.0001090757,0.002197694,0.0008627761,0.0005604419,0.00007306221,0.0003632258,9.191443e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001231725,"about_ca_system_score_gemma":0.0006478297,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003124585,"about_ca_topic_score_gemma":0.01016384,"domain_scores_codex":[0.9978912,0.0001255937,0.0005220243,0.0002295063,0.0009381403,0.0002935225],"domain_scores_gemma":[0.9982663,0.0009999503,0.0001085784,0.0001326844,0.0003081721,0.0001843486],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00007218671,0.0001590412,0.1331928,0.0000275059,0.00089816,0.00004823691,0.04725134,0.001172133,0.00001326105,0.79395,0.0009139859,0.02230138],"study_design_scores_gemma":[0.00562261,0.0004864571,0.1884101,0.003518772,0.002122167,0.000001312997,0.08325312,0.07554454,0.00005595496,0.6258653,0.01408281,0.001036796],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.2038505,0.0005888296,0.01404399,0.101534,0.0002848668,0.00019167,0.00001788797,0.00004660932,0.6794416],"genre_scores_gemma":[0.9968696,0.0002570401,0.00005120031,0.002012048,0.0001126845,0.000003212122,0.00001522974,0.000004625317,0.0006743272],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7930191,"threshold_uncertainty_score":0.6713977,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0645174626387021,"score_gpt":0.4407533161531101,"score_spread":0.376235853514408,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}