{"id":"W4400267547","doi":"10.48550/arxiv.2407.00983","title":"FairMedFM: Fairness Benchmarking for Medical Imaging Foundation Models","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Health Systems, Economic Evaluations, Quality of Life","field":"Economics, Econometrics and Finance","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Alliance de recherche numérique du Canada; National Natural Science Foundation of China","keywords":"Benchmarking; Foundation (evidence); Medical imaging; Computer science; Artificial intelligence; Medical physics; Medicine; Political science; Economics; Management; Law","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03255142,0.001652667,0.001345102,0.002723383,0.001731566,0.004245738,0.002924155,0.002909067,0.006867123],"category_scores_gemma":[0.1094372,0.0005826381,0.001530998,0.0023159,0.002043536,0.003777166,0.004626645,0.002784622,0.001356104],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003584071,"about_ca_system_score_gemma":0.004883002,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008277558,"about_ca_topic_score_gemma":0.008336105,"domain_scores_codex":[0.9829792,0.0108847,0.0007505614,0.001777146,0.002905293,0.0007032029],"domain_scores_gemma":[0.9499813,0.03494008,0.002151353,0.008085601,0.003853984,0.000987621],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001886899,0.0006904828,0.0219748,0.001476948,0.0006199931,0.0002823528,0.0006453934,0.4425577,0.002079394,0.1672924,0.1218765,0.2386172],"study_design_scores_gemma":[0.0002411664,0.0002507191,0.002804234,0.0003462944,0.00006669415,0.0002023552,0.0001226174,0.8095509,0.003331653,0.1591811,0.02382404,0.0000781823],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.103861,0.006901136,0.8194597,0.006717898,0.001078172,0.0009835403,0.0153505,0.01700515,0.02864287],"genre_scores_gemma":[0.601436,0.001493905,0.3692938,0.002062261,0.0003726527,0.001190701,0.01735043,0.00267717,0.004123093],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.03255142,"threshold_uncertainty_score":0.1721504,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4038101694259849,"score_gpt":0.3339806588013662,"score_spread":0.06982951062461867,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}