{"id":"W4405763712","doi":"10.1515/tnsci-2022-0361","title":"A pilot evaluation of the diagnostic accuracy of ChatGPT-3.5 for multiple sclerosis from case reports","year":2024,"lang":"en","type":"article","venue":"Translational Neuroscience","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Wilfrid Laurier University; University of Ottawa","funders":"","keywords":"Modalities; Presentation (obstetrics); Medical physics; Medical diagnosis; Clinical Practice; Computer science; Medicine; Data science; Artificial intelligence; Machine learning; Pathology; Physical therapy; Surgery","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01733535,0.001338603,0.0007053266,0.004459321,0.0006041653,0.002204623,0.002144011,0.001913287,0.003188651],"category_scores_gemma":[0.08743957,0.0004224867,0.001659303,0.00140594,0.0008137926,0.001893255,0.00210315,0.001203394,0.001591071],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001372325,"about_ca_system_score_gemma":0.001998411,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009045282,"about_ca_topic_score_gemma":0.009707922,"domain_scores_codex":[0.9921646,0.004350087,0.001099923,0.001226708,0.0009101613,0.0002484662],"domain_scores_gemma":[0.8843243,0.09834146,0.002904581,0.004912678,0.008225806,0.001291217],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.007831376,0.002092628,0.5641978,0.005038886,0.001808897,0.005989534,0.005224404,0.05963499,0.0113323,0.002447934,0.03778671,0.2966146],"study_design_scores_gemma":[0.001252868,0.003266678,0.1592287,0.001651383,0.001790219,0.01051573,0.003175184,0.7440498,0.03295649,0.007989644,0.03371758,0.0004056414],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.912906,0.002254998,0.05042404,0.002346652,0.0004555453,0.001495288,0.01521799,0.009767638,0.005131914],"genre_scores_gemma":[0.9019074,0.0007043682,0.07962294,0.0004663097,0.0001432431,0.0005725176,0.01526593,0.0003528464,0.0009644144],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01733535,"threshold_uncertainty_score":0.09167916,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4738638373127297,"score_gpt":0.4594358640871005,"score_spread":0.01442797322562922,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}