{"id":"W4396732548","doi":"10.1016/j.soard.2024.04.014","title":"Performance of artificial intelligence in bariatric surgery: comparative analysis of ChatGPT-4, Bing, and Bard in the American Society for Metabolic and Bariatric Surgery textbook of bariatric surgery questions","year":2024,"lang":"en","type":"review","venue":"Surgery for Obesity and Related Diseases","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":38,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; McMaster University","funders":"","keywords":"Medicine; Surgery; General surgery","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01299496,0.0005994864,0.0008249045,0.001894145,0.0003460236,0.001835186,0.001058718,0.001067419,0.002582465],"category_scores_gemma":[0.1363222,0.000270064,0.0008208535,0.001387842,0.001002099,0.002162548,0.001823562,0.001087867,0.00118763],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001036427,"about_ca_system_score_gemma":0.0006788216,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003140333,"about_ca_topic_score_gemma":0.003140503,"domain_scores_codex":[0.9863197,0.007612051,0.001414339,0.0009962044,0.003173275,0.0004842636],"domain_scores_gemma":[0.8139884,0.1579176,0.01130714,0.00288709,0.01014384,0.003755964],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"not_applicable","study_design_scores_codex":[0.006794867,0.001726392,0.8151956,0.001858506,0.0004753526,0.0006022646,0.02472668,0.006548487,0.003935445,0.0006370963,0.006537393,0.1309619],"study_design_scores_gemma":[0.000225729,0.004097221,0.9528317,0.0005176023,0.0002197552,0.0005915851,0.01144302,0.02109597,0.003251745,0.000781153,0.004833405,0.0001109844],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"review","genre_scores_codex":[0.9942426,0.0004555493,0.0008572373,0.0003053334,0.00003875719,0.0001002157,0.0002666166,0.000136933,0.003596688],"genre_scores_gemma":[0.9956712,0.0003774629,0.001364733,0.0001765722,0.00003258662,0.0001343951,0.0008893368,0.00006266683,0.001290967],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.01299496,"threshold_uncertainty_score":0.06872475,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1251716679673075,"score_gpt":0.4009056248275413,"score_spread":0.2757339568602338,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}