{"id":"W4403917138","doi":"10.2139/ssrn.5002806","title":"Evaluation of Bias Towards Medical Professionals in Large Language Models","year":2024,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Interpreting and Communication in Healthcare","field":"Health Professions","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"McMaster University","funders":"","keywords":"Health professionals; Psychology; Computer science; Business; Data science; Political science; Health care","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1060429,0.001456862,0.001319039,0.001687562,0.001506807,0.003466451,0.002416839,0.002769887,0.007798613],"category_scores_gemma":[0.3757303,0.0006960236,0.002422369,0.001885899,0.003009064,0.005246103,0.004047595,0.002487446,0.001075292],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002013669,"about_ca_system_score_gemma":0.003018199,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007113658,"about_ca_topic_score_gemma":0.004857717,"domain_scores_codex":[0.9034478,0.08378219,0.003805226,0.004523444,0.003486232,0.0009550484],"domain_scores_gemma":[0.1679684,0.8070037,0.006007505,0.011827,0.00580495,0.001388379],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.06948788,0.003963289,0.4024158,0.00419543,0.0102458,0.0009122375,0.01028999,0.2034318,0.006464082,0.02597806,0.01276372,0.249852],"study_design_scores_gemma":[0.004009732,0.004262249,0.03446677,0.0006377687,0.003687915,0.0005887679,0.003190045,0.8879104,0.008350521,0.04771312,0.004950705,0.0002320509],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.906222,0.001697617,0.08068049,0.002078492,0.0002270424,0.0006457689,0.002088578,0.00105191,0.005308112],"genre_scores_gemma":[0.9786027,0.0001475324,0.01742539,0.0002879525,0.00009634545,0.0002072751,0.002381788,0.0002022287,0.0006487872],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8939571,"threshold_uncertainty_score":0.5608149,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1299748723480145,"score_gpt":0.5179970597707143,"score_spread":0.3880221874226998,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}