{"id":"W4403681525","doi":"10.1001/jamanetworkopen.2024.37711","title":"Performance of Multimodal Artificial Intelligence Chatbots Evaluated on Clinical Oncology Cases","year":2024,"lang":"en","type":"article","venue":"JAMA Network Open","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":43,"is_retracted":false,"has_abstract":true,"ca_institutions":"University Health Network; Princess Margaret Cancer Centre; University of Toronto","funders":"AstraZeneca Canada; AstraZeneca","keywords":"Chatbot; Multimodal therapy; Artificial intelligence; Medicine; Computer science; Internal medicine; Natural language processing; Medical physics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01858445,0.001164448,0.001120314,0.002302523,0.0007533956,0.001714735,0.001076428,0.001391252,0.004049043],"category_scores_gemma":[0.1354759,0.0003327927,0.0007039271,0.00087694,0.000869333,0.00168216,0.002473345,0.000972398,0.00180794],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001359157,"about_ca_system_score_gemma":0.0009666925,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00166345,"about_ca_topic_score_gemma":0.001747409,"domain_scores_codex":[0.9792131,0.0139029,0.001858531,0.00204406,0.002278236,0.0007032081],"domain_scores_gemma":[0.8116496,0.1540414,0.01113816,0.004770841,0.01381658,0.004583437],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.02272049,0.007837158,0.3905624,0.004901464,0.0007412907,0.001730195,0.02498894,0.02324359,0.02285638,0.0009077587,0.009120249,0.4903901],"study_design_scores_gemma":[0.001461303,0.02716579,0.657501,0.001576177,0.0008840493,0.002460829,0.01365809,0.23634,0.04088542,0.003491072,0.01398665,0.0005895967],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9877806,0.0002750434,0.006153196,0.0002224321,0.00008210053,0.000812428,0.0004555426,0.00107061,0.003148164],"genre_scores_gemma":[0.9832312,0.0001566109,0.01290369,0.0002589592,0.00006429414,0.0008313008,0.0008576793,0.00009703221,0.001599272],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01858445,"threshold_uncertainty_score":0.09828514,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5008204620269682,"score_gpt":0.5705068335257164,"score_spread":0.06968637149874823,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}