{"id":"W4416649127","doi":"10.1177/15910199251396358","title":"Large language model responses to patient-oriented neurointerventional queries: A multirater assessment of accuracy, completeness, safety, and actionability","year":2025,"lang":"en","type":"article","venue":"Interventional Neuroradiology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"","keywords":"Subspecialty; MEDLINE; Inclusion (mineral); Patient safety; Perception; Readability; Human factors and ergonomics; Health care","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07056585,0.000821261,0.001057594,0.002981271,0.0009465222,0.001839135,0.0009271796,0.0008671246,0.001674804],"category_scores_gemma":[0.2040189,0.0004881193,0.001426149,0.001284501,0.001556778,0.002004107,0.007426788,0.001087108,0.0007650811],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001269222,"about_ca_system_score_gemma":0.001950535,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002371817,"about_ca_topic_score_gemma":0.004285037,"domain_scores_codex":[0.9439667,0.03642369,0.00709077,0.004057081,0.007127683,0.001334115],"domain_scores_gemma":[0.7437644,0.1704658,0.02373266,0.02026149,0.03855457,0.003221127],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003279099,0.0009739464,0.7968577,0.001643974,0.0008080931,0.0005528609,0.08689491,0.003360591,0.006970565,0.0007255564,0.004378057,0.09355468],"study_design_scores_gemma":[0.000654557,0.003947989,0.8445831,0.001105917,0.001099001,0.002162537,0.04823032,0.05744202,0.01941974,0.004750915,0.01578772,0.0008162237],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9855364,0.0002296965,0.009934241,0.000213465,0.00004620534,0.000940338,0.0009247252,0.0002053544,0.00196963],"genre_scores_gemma":[0.9857158,0.0001621718,0.01101202,0.0001499525,0.00002627503,0.001327726,0.001076477,0.00005989802,0.0004696289],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07056585,"threshold_uncertainty_score":0.3731924,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08882158998891279,"score_gpt":0.4638725315596065,"score_spread":0.3750509415706937,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}