{"id":"W4407863291","doi":"10.1093/jcag/gwae055","title":"Artificial intelligence in hepatology: a comparative analysis of ChatGPT-4, Bing, and Bard at answering clinical questions","year":2025,"lang":"en","type":"article","venue":"Journal of the Canadian Association of Gastroenterology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"St. Joseph’s Healthcare Hamilton; McMaster University","funders":"","keywords":"Hepatology; Internal medicine; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02403355,0.0005441207,0.001148163,0.002873458,0.0005230436,0.001883918,0.0009153006,0.001191745,0.001830243],"category_scores_gemma":[0.142922,0.0002772559,0.001192211,0.001700736,0.001064901,0.002789709,0.002353722,0.001301199,0.0007436207],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001497141,"about_ca_system_score_gemma":0.001114099,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004287184,"about_ca_topic_score_gemma":0.00507802,"domain_scores_codex":[0.9793017,0.01450302,0.001535378,0.00102502,0.003171507,0.000463333],"domain_scores_gemma":[0.7874858,0.1874998,0.006940444,0.003765107,0.01081767,0.003491219],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01110218,0.002072595,0.623646,0.003753815,0.001169414,0.0007331065,0.0339691,0.007270841,0.002502984,0.001261701,0.009362783,0.3031555],"study_design_scores_gemma":[0.0005944899,0.005872852,0.8976595,0.001445427,0.0008669006,0.001250562,0.01833785,0.05721452,0.002388594,0.002914872,0.01118255,0.0002717646],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9868139,0.001493701,0.002784359,0.001220706,0.0001138021,0.0004270958,0.0005679154,0.0002709354,0.006307572],"genre_scores_gemma":[0.9921949,0.0007444118,0.003968391,0.000525697,0.00007492093,0.0004140558,0.0009269185,0.00006182065,0.001088892],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02403355,"threshold_uncertainty_score":0.1271031,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09499270277325696,"score_gpt":0.4276149646195133,"score_spread":0.3326222618462564,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}