{"id":"W4408394670","doi":"10.1111/coa.14302","title":"Comparison of <scp>ChatGPT</scp> ‐4, Copilot, Bard and Gemini Ultra on an Otolaryngology Question Bank","year":2025,"lang":"en","type":"article","venue":"Clinical Otolaryngology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"Ottawa Hospital; University of Calgary; University of Toronto; University of Ottawa","funders":"","keywords":"Otorhinolaryngology; Medicine; Medical education; Psychology; Surgery","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01283989,0.001459189,0.001647288,0.002334366,0.0004800658,0.001907321,0.001604706,0.00164108,0.004642137],"category_scores_gemma":[0.08354697,0.0005219023,0.001379971,0.001233834,0.0006014345,0.004012114,0.003139094,0.001380632,0.002479412],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00169792,"about_ca_system_score_gemma":0.002025137,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008418215,"about_ca_topic_score_gemma":0.01087394,"domain_scores_codex":[0.9902695,0.005270488,0.001368516,0.001097212,0.001614367,0.0003798624],"domain_scores_gemma":[0.8899512,0.09392687,0.004122502,0.002391345,0.0062505,0.003357601],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.05151423,0.003578162,0.2692458,0.009129263,0.001684487,0.0006631119,0.0129761,0.01693214,0.01845821,0.001801174,0.04973802,0.5642793],"study_design_scores_gemma":[0.004537311,0.02815712,0.5612344,0.0023378,0.002044675,0.001648921,0.01192234,0.2706599,0.06187806,0.003871229,0.05061132,0.001096943],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9784506,0.001194805,0.005051505,0.0007606337,0.0001878764,0.0009513413,0.00428831,0.003682108,0.005432817],"genre_scores_gemma":[0.9588334,0.0006407694,0.0240713,0.0005826159,0.000104286,0.001304776,0.01029643,0.0004339383,0.003732476],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01283989,"threshold_uncertainty_score":0.06790471,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.152628034797595,"score_gpt":0.5079875413353315,"score_spread":0.3553595065377365,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}