{"id":"W4416649127","doi":"10.1177/15910199251396358","title":"Large language model responses to patient-oriented neurointerventional queries: A multirater assessment of accuracy, completeness, safety, and actionability","year":2025,"lang":"en","type":"article","venue":"Interventional Neuroradiology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"","keywords":"Subspecialty; MEDLINE; Inclusion (mineral); Patient safety; Perception; Readability; Human factors and ergonomics; Health care","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003748931,0.0001502379,0.0003552336,0.0002955003,0.0001156552,0.0000112784,0.00008896171,0.00008672823,0.000256371],"category_scores_gemma":[0.001176191,0.0001429999,0.0001987571,0.000221831,0.0001490663,0.00009899583,0.0001409788,0.0002203747,0.000006435077],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000113684,"about_ca_system_score_gemma":0.0002823176,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001442752,"about_ca_topic_score_gemma":0.0001214164,"domain_scores_codex":[0.9980202,0.0002971381,0.0008716604,0.0004008627,0.0001781195,0.0002320614],"domain_scores_gemma":[0.9985095,0.0005380778,0.0001756332,0.0002674087,0.0004026729,0.0001067003],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01220714,0.005629859,0.7936452,0.001880166,0.0004345584,0.00006219768,0.002919211,0.001366113,0.0579937,0.09812069,0.004102218,0.02163894],"study_design_scores_gemma":[0.0006545549,0.003200849,0.9419646,0.0005880703,0.00009433725,0.000159267,0.001940293,0.03486077,0.005020558,0.003570545,0.007704231,0.0002419505],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9580465,0.00009759005,0.0340465,0.006190402,0.0005897988,0.0005384473,0.0002216099,0.0000352653,0.0002338978],"genre_scores_gemma":[0.9960239,0.00001568754,0.001560712,0.001441327,0.00004168934,0.00006630286,0.0001576826,0.00001120693,0.0006814798],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1483194,"threshold_uncertainty_score":0.5831367,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08882158998891279,"score_gpt":0.4638725315596065,"score_spread":0.3750509415706937,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}