{"id":"W4407019191","doi":"10.1080/10903127.2025.2460775","title":"Accuracy of Commercial Large Language Model (ChatGPT) to Predict the Diagnosis for Prehospital Patients Suitable for Ambulance Transport Decisions: Diagnostic Accuracy Study","year":2025,"lang":"en","type":"article","venue":"Prehospital Emergency Care","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Medicine; Medical emergency; Emergency medical services; Diagnostic accuracy; Emergency medicine; Triage; Intensive care medicine; Radiology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006203414,0.00102656,0.0007783459,0.001810566,0.0004743387,0.001555708,0.00117758,0.001315304,0.001191524],"category_scores_gemma":[0.02948605,0.0002770448,0.001040384,0.0005883603,0.0005048569,0.00104349,0.001079274,0.001521542,0.0007388921],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001085285,"about_ca_system_score_gemma":0.001431373,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009188813,"about_ca_topic_score_gemma":0.006127628,"domain_scores_codex":[0.9976913,0.001090453,0.0002132579,0.0005355732,0.0003111807,0.0001583842],"domain_scores_gemma":[0.9827267,0.01371249,0.0006965867,0.0008582289,0.001459064,0.0005469436],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00371957,0.000955445,0.7017361,0.0002498558,0.0009523611,0.0007582594,0.0006758115,0.107023,0.004676964,0.0005925577,0.003728598,0.1749315],"study_design_scores_gemma":[0.0001024197,0.000784784,0.03840657,0.00005788706,0.0002804685,0.0008115061,0.0003012316,0.9540853,0.003495682,0.001104875,0.0005188785,0.00005045669],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9725026,0.0004827776,0.02326584,0.0006036157,0.0001008579,0.0001221283,0.0007831962,0.000665552,0.001473448],"genre_scores_gemma":[0.9899598,0.00008630062,0.00867309,0.000116,0.00002138106,0.00002995185,0.0008050369,0.00002792035,0.0002803659],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.009188813,"threshold_uncertainty_score":0.03280717,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06145698107124997,"score_gpt":0.4222631523210531,"score_spread":0.3608061712498031,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}