{"id":"W4288048604","doi":"10.2196/39235","title":"Issues With Variability in Electronic Health Record Data About Race and Ethnicity: Descriptive Analysis of the National COVID Cohort Collaborative Data Enclave","year":2022,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Racial and Ethnic Identity Research","field":"Social Sciences","cited_by":43,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Center for Advancing Translational Sciences; U.S. National Library of Medicine; National Institutes of Health","keywords":"Ethnic group; Health care; Descriptive statistics; Consistency (knowledge bases); Race (biology); Health equity; Medicine; Computer science; Database; Data science; Statistics; Political science; Sociology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06540991,0.0003169366,0.0005306238,0.005000049,0.001355851,0.002389727,0.001585901,0.0006671066,0.001182136],"category_scores_gemma":[0.1412506,0.0005146482,0.001078854,0.008210124,0.00226718,0.002253676,0.003117466,0.001120094,0.0002498549],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003064218,"about_ca_system_score_gemma":0.003252255,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02535512,"about_ca_topic_score_gemma":0.03329826,"domain_scores_codex":[0.9095662,0.03899809,0.01681574,0.01010866,0.02178967,0.002721634],"domain_scores_gemma":[0.7368966,0.1277811,0.06883553,0.04209146,0.02208882,0.002306534],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001400959,0.00007562093,0.9882509,0.00007225177,0.0001981636,0.00006254498,0.003901089,0.000349781,0.0002074466,0.0009518068,0.001552442,0.004237846],"study_design_scores_gemma":[0.00001452794,0.0001571682,0.9799364,0.0001931425,0.00008470392,0.0003894281,0.008216298,0.00290594,0.001028555,0.0005989861,0.006413578,0.00006129419],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9709329,0.0003381439,0.01085001,0.0007214939,0.00004011783,0.0006210545,0.01426624,0.0001004556,0.002129487],"genre_scores_gemma":[0.9860914,0.00006737628,0.004780836,0.0003475294,0.0000224148,0.0009730307,0.007365864,0.00009062596,0.0002608421],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9345901,"threshold_uncertainty_score":0.3459248,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07326107058090033,"score_gpt":0.4426929443615468,"score_spread":0.3694318737806465,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}