{"id":"W4389763594","doi":"10.1080/03007995.2023.2295411","title":"The use of large language models in medicine: proceeding with caution","year":2023,"lang":"en","type":"article","venue":"Current Medical Research and Opinion","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia; University of British Columbia Hospital; Carleton University; University of Toronto","funders":"","keywords":"Medicine; Transparency (behavior); Consistency (knowledge bases); Liability; Internet privacy; Computer security; Artificial intelligence; Law","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002314938,0.0000508736,0.0001192333,0.0002144697,0.0001381094,0.00001137306,0.00006166864,0.00005598686,0.00002615848],"category_scores_gemma":[0.002780492,0.00002760958,0.00001011347,0.0007669678,0.0003141439,0.00009424792,0.00004387796,0.0004542568,0.000007369773],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003849707,"about_ca_system_score_gemma":0.0003472987,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005564079,"about_ca_topic_score_gemma":0.0001608688,"domain_scores_codex":[0.9982591,0.00007474425,0.0002469805,0.0001481051,0.0009325526,0.0003384906],"domain_scores_gemma":[0.9984968,0.0008796471,0.00002950071,0.0001065181,0.0002524715,0.0002351121],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000532892,0.0002568787,0.06174699,0.0009539053,0.00001324772,0.00001329731,0.01268694,0.000007898949,0.0001318364,0.01784903,0.02464104,0.881166],"study_design_scores_gemma":[0.002432825,0.006275526,0.1140997,0.02818076,0.00003108181,0.00007201078,0.1148294,0.4582787,0.003084692,0.0359574,0.2362232,0.0005346116],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9757509,0.003321683,0.0005428175,0.01927835,0.0004092677,0.0005439263,0.000002799479,0.00002534087,0.000124948],"genre_scores_gemma":[0.9877523,0.01167784,0.00001134329,0.00002858867,0.0003442705,0.0000477949,0.00005297322,0.000005964856,0.00007897102],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8806314,"threshold_uncertainty_score":0.332871,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.6244928489176927,"score_gpt":0.5985246997722155,"score_spread":0.02596814914547729,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}