{"id":"W4385812326","doi":"10.1177/08465371231193716","title":"Comparative Performance of ChatGPT and Bard in a Text-Based Radiology Knowledge Assessment","year":2023,"lang":"en","type":"article","venue":"Canadian Association of Radiologists Journal","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":94,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hamilton Health Sciences; Juravinski Hospital; University of Toronto; McMaster University","funders":"","keywords":"Medicine; Subspecialty; Neuroradiology; Radiology; Nuclear medicine; Medical physics; Pathology; Neurology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00989369,0.001004651,0.00104001,0.005045197,0.0004191737,0.001780399,0.00125355,0.001142187,0.00265721],"category_scores_gemma":[0.06573881,0.0003529224,0.0008578761,0.001657632,0.0004585598,0.002615675,0.003761956,0.0009427637,0.001956297],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00106553,"about_ca_system_score_gemma":0.0008458606,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004479302,"about_ca_topic_score_gemma":0.006589713,"domain_scores_codex":[0.9865628,0.006912869,0.001412389,0.001961605,0.002632903,0.0005175202],"domain_scores_gemma":[0.9175711,0.06110752,0.004386466,0.002960618,0.01021557,0.003758771],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01110519,0.001861868,0.2439817,0.004189369,0.0008224466,0.000659884,0.008108387,0.005566876,0.01106196,0.0007465035,0.01851758,0.6933782],"study_design_scores_gemma":[0.000894126,0.008110923,0.7965521,0.001242481,0.0009108598,0.001991099,0.007252097,0.1323906,0.01840569,0.002000954,0.02949443,0.0007545556],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9732817,0.001175641,0.0102552,0.0004382338,0.0003010579,0.0008708292,0.003491998,0.003889395,0.006295801],"genre_scores_gemma":[0.9549223,0.0006394713,0.03205666,0.0003713286,0.0002283998,0.001015255,0.006006179,0.0002813506,0.004479037],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.00989369,"threshold_uncertainty_score":0.05232346,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1115391610351686,"score_gpt":0.4219256449286377,"score_spread":0.3103864838934691,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}