{"id":"W4393054030","doi":"10.1136/bmj-2023-078538","title":"Current safeguards, risk mitigation, and transparency measures of large language models against the generation of health disinformation: repeated cross sectional analysis","year":2024,"lang":"en","type":"article","venue":"BMJ","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":100,"is_retracted":false,"has_abstract":true,"ca_institutions":"Western University","funders":"Cancer Council South Australia; National Health and Medical Research Council; Medical Research Council; Cancer Council Australia","keywords":"Disinformation; Transparency (behavior); Public health; Business; Environmental health; Medicine; Internet privacy; Computer security; Political science; Computer science; Social media; Law; Nursing","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1203981,0.001043825,0.0006816832,0.002727865,0.0009378988,0.003472631,0.001318573,0.001352738,0.002649643],"category_scores_gemma":[0.4005078,0.0008349877,0.002383024,0.001426856,0.002358894,0.006158713,0.0029593,0.002472759,0.0005916894],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003133577,"about_ca_system_score_gemma":0.004594732,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003702304,"about_ca_topic_score_gemma":0.002913435,"domain_scores_codex":[0.9081022,0.06212812,0.006587064,0.005214284,0.01597603,0.001992322],"domain_scores_gemma":[0.349113,0.4071847,0.116608,0.05025253,0.07237975,0.004461946],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01137296,0.006280542,0.7395064,0.003229163,0.004522176,0.00016035,0.01722051,0.007733063,0.004363155,0.003605762,0.006254028,0.195752],"study_design_scores_gemma":[0.001364398,0.03530862,0.8638787,0.003005234,0.007071543,0.0005083832,0.008617248,0.02835537,0.02889016,0.00494671,0.01757175,0.0004818169],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9744761,0.001846731,0.01452968,0.001749854,0.00008181053,0.001514759,0.001370988,0.0004629193,0.00396726],"genre_scores_gemma":[0.9896207,0.0002976466,0.007558275,0.000449915,0.00004760865,0.0009189047,0.0006661664,0.00005233697,0.0003883929],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1203981,"threshold_uncertainty_score":0.6367334,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1804547810020689,"score_gpt":0.4596778665274531,"score_spread":0.2792230855253842,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}