{"id":"W4394063739","doi":"10.1101/2024.04.05.24305411","title":"Red Teaming Large Language Models in Medicine: Real-World Insights on Model Behavior","year":2024,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Thinkpath Engineering Services (Canada)","funders":"Pfizer","keywords":"Categorization; The Internet; Health care; Psychology; Process (computing); Applied psychology; Medicine; Computer science; Medical education; Artificial intelligence; Political science; World Wide Web","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03411266,0.0008992361,0.0006529814,0.001285408,0.0008294928,0.002992926,0.001628284,0.00186361,0.00306107],"category_scores_gemma":[0.1484317,0.0006041105,0.001037544,0.0008554978,0.001419421,0.003734964,0.002890297,0.002463833,0.0007890313],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002093839,"about_ca_system_score_gemma":0.001333194,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003776908,"about_ca_topic_score_gemma":0.005320456,"domain_scores_codex":[0.9712647,0.02468568,0.000574629,0.002003486,0.001111194,0.0003603499],"domain_scores_gemma":[0.7433103,0.233218,0.006323532,0.01067838,0.004730692,0.001739124],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002683558,0.001627494,0.1925305,0.001782825,0.0006355007,0.001305418,0.03150852,0.4359639,0.01080836,0.03225815,0.02141274,0.2674829],"study_design_scores_gemma":[0.00008964456,0.0004130506,0.009236252,0.0001881018,0.00005900806,0.000252224,0.002512445,0.9441359,0.002541299,0.03512486,0.005362743,0.00008443057],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.693666,0.0008892558,0.2907335,0.00493186,0.0001508215,0.000395166,0.001261165,0.002347168,0.005625018],"genre_scores_gemma":[0.8843267,0.0001328877,0.1128579,0.0004966954,0.00004103466,0.0002215655,0.0009315996,0.0002324883,0.0007592604],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9658873,"threshold_uncertainty_score":0.1804072,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1692653049772334,"score_gpt":0.4503235276946304,"score_spread":0.281058222717397,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}