{"id":"W4388237833","doi":"10.2196/47532","title":"The Accuracy and Potential Racial and Ethnic Biases of GPT-4 in the Diagnosis and Triage of Health Conditions: Evaluation Study","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":64,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Institute on Minority Health and Health Disparities; National Institute on Aging; National Institutes of Health","keywords":"Triage; Ethnic group; Medicine; Medical diagnosis; Health care; Race (biology); Family medicine; Emergency medicine; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02841775,0.0006422083,0.0009163587,0.001293009,0.0005343347,0.001109774,0.001330814,0.001159549,0.001514566],"category_scores_gemma":[0.1048823,0.0004333573,0.001493516,0.0008968894,0.001156335,0.001292361,0.002174502,0.0007027719,0.0005625134],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001683229,"about_ca_system_score_gemma":0.001486773,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004232419,"about_ca_topic_score_gemma":0.003060786,"domain_scores_codex":[0.9760391,0.01718401,0.001846416,0.001730168,0.00262413,0.0005761596],"domain_scores_gemma":[0.8752273,0.07532398,0.0207171,0.00803175,0.01744254,0.00325731],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00742616,0.0008342078,0.9503415,0.0004213771,0.0006848343,0.0001984743,0.002449167,0.001932688,0.0003544287,0.0001759967,0.001392485,0.0337887],"study_design_scores_gemma":[0.001831321,0.009582353,0.9445367,0.0002200331,0.0008667608,0.001010331,0.001624104,0.03562621,0.001470155,0.0005414882,0.002582692,0.0001079275],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9960269,0.00031775,0.001017217,0.0001774941,0.00003522115,0.0006211311,0.0005513015,0.00003772589,0.00121528],"genre_scores_gemma":[0.9951014,0.0001925365,0.002868592,0.0001372211,0.000080193,0.0005770343,0.0008144137,0.0000117129,0.0002169564],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9715822,"threshold_uncertainty_score":0.1502892,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3388489175866713,"score_gpt":0.5900203259822512,"score_spread":0.2511714083955799,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}