{"id":"W7118483765","doi":"10.2196/73715","title":"Assessing the Quality of Artificial Intelligence Explanations on Atrial Fibrillation: A Comparative Analysis of ChatGPT and Google Gemini (Preprint)","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"","funders":"","keywords":"Quality (philosophy); Quality assessment; Expert system; Key (lock)","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007812691,0.0003678863,0.0005850069,0.004748295,0.0004796218,0.002186559,0.0007397484,0.001040876,0.002531258],"category_scores_gemma":[0.1700936,0.0002257577,0.000789443,0.002995596,0.0006027906,0.003398435,0.001830772,0.0009490742,0.0003555822],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007820585,"about_ca_system_score_gemma":0.001257379,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01044657,"about_ca_topic_score_gemma":0.01078044,"domain_scores_codex":[0.9939516,0.003292752,0.0006716609,0.0002815966,0.001616163,0.0001861034],"domain_scores_gemma":[0.6902574,0.2869863,0.00977581,0.003431343,0.008353974,0.0011952],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.007020723,0.0005227474,0.6843455,0.005743464,0.001818795,0.001161797,0.02328921,0.007064009,0.002432228,0.002531194,0.009216702,0.2548536],"study_design_scores_gemma":[0.0003746461,0.001655915,0.9145842,0.001934228,0.003250834,0.001717142,0.01577596,0.03680272,0.004197751,0.004159403,0.01528428,0.0002630012],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9845896,0.003116122,0.002669035,0.001013689,0.00006363496,0.0001290584,0.002493458,0.0004989623,0.005426505],"genre_scores_gemma":[0.9929667,0.001038778,0.002802056,0.0001119756,0.00004563098,0.00003831744,0.002384213,0.00007155385,0.0005408807],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01044657,"threshold_uncertainty_score":0.04131794,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5322185268027898,"score_gpt":0.6376486891815975,"score_spread":0.1054301623788076,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}