{"id":"W3158739288","doi":"10.1371/journal.pone.0264270","title":"Avoiding bias when inferring race using name-based approaches","year":2022,"lang":"en","type":"article","venue":"PLoS ONE","topic":"Names, Identity, and Discrimination Research","field":"Social Sciences","cited_by":54,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"Fonds National de la Recherche Luxembourg; Canada Research Chairs","keywords":"Inference; Race (biology); Imputation (statistics); Computer science; Data science; Racial bias; Econometrics; Artificial intelligence; Machine learning; Mathematics; Sociology; Missing data","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1618964,0.001318976,0.00233295,0.006542211,0.003732591,0.007898136,0.005516529,0.002959997,0.006432026],"category_scores_gemma":[0.4800104,0.001027524,0.003095394,0.011197,0.004148554,0.008182928,0.005558574,0.003732783,0.002102221],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00217279,"about_ca_system_score_gemma":0.004410601,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01583735,"about_ca_topic_score_gemma":0.01898657,"domain_scores_codex":[0.7581241,0.203869,0.009931618,0.01249251,0.01374174,0.001841056],"domain_scores_gemma":[0.537592,0.3743218,0.03071784,0.04191731,0.01419864,0.001252442],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009409719,0.0003894453,0.4091437,0.002475532,0.005334213,0.0005567211,0.01273802,0.03083138,0.0009480341,0.1962289,0.02601272,0.3144003],"study_design_scores_gemma":[0.0003613061,0.0003983338,0.099678,0.001756387,0.001696549,0.0006894422,0.005955331,0.1530652,0.006215652,0.6492756,0.08052206,0.0003861845],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06248622,0.0025887,0.9127433,0.00568615,0.0008803284,0.0008577229,0.003286687,0.000961352,0.01050959],"genre_scores_gemma":[0.4533714,0.0007295802,0.5360059,0.002499488,0.0003934529,0.001408537,0.002543825,0.0002458291,0.002802042],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8381037,"threshold_uncertainty_score":0.8562001,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4989682414370745,"score_gpt":0.3578808874921893,"score_spread":0.1410873539448851,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}