{"id":"W4416149271","doi":"10.1371/journal.pone.0332716","title":"Evaluating the impact of sex bias on AI models in musculoskeletal ultrasound of joint recess distension","year":2025,"lang":"en","type":"article","venue":"PLoS ONE","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"Novo Nordisk","keywords":"Overfitting; Confounding; Binary classification; Convolutional neural network; Joint (building); Artificial neural network","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.009848099,0.0009397549,0.0005446258,0.0008549079,0.0004004056,0.001284774,0.0008965122,0.0008649135,0.0009286494],"category_scores_gemma":[0.02522876,0.0002936014,0.0008519255,0.0004621765,0.0005807901,0.0009261425,0.001069668,0.001073771,0.0005710465],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001121835,"about_ca_system_score_gemma":0.001238077,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01226828,"about_ca_topic_score_gemma":0.01042542,"domain_scores_codex":[0.9983472,0.000738538,0.0001425347,0.0003698451,0.0002526308,0.0001492771],"domain_scores_gemma":[0.9900025,0.006518359,0.0007611666,0.0008526515,0.001681668,0.0001835909],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001482767,0.000308773,0.4513555,0.0002723948,0.0009330302,0.0003992825,0.000603555,0.3161337,0.006930667,0.001434542,0.003986066,0.2161598],"study_design_scores_gemma":[0.00002776977,0.0003346702,0.04269534,0.0001118129,0.0001573046,0.0003112822,0.0002057357,0.9456543,0.006812496,0.001630148,0.002020984,0.00003807951],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9346981,0.00272187,0.05581648,0.001164745,0.0002477162,0.0002034613,0.001401335,0.0006155772,0.00313075],"genre_scores_gemma":[0.9840065,0.0003080645,0.01278113,0.0003079981,0.00004564856,0.00007833938,0.001480764,0.00004589498,0.000945702],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9901519,"threshold_uncertainty_score":0.05208236,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4894997218426143,"score_gpt":0.5056085661303448,"score_spread":0.01610884428773046,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}