{"id":"W4413036724","doi":"10.1016/j.mlwa.2025.100717","title":"Cross-domain fairness audit of sentiment label bias in foundation models: Comparing human and machine annotations on tweets and reviews","year":2025,"lang":"en","type":"article","venue":"Machine Learning with Applications","topic":"Sentiment Analysis and Opinion Mining","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University; Vector Institute; Humber Polytechnic; Brock University","funders":"","keywords":"Foundation (evidence); Audit; Domain (mathematical analysis); Computer science; Artificial intelligence; Information retrieval; Natural language processing; Machine learning; Business; Accounting; Mathematics; Political science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04237472,0.001178524,0.001051193,0.001360415,0.001591759,0.002383582,0.00110413,0.00119684,0.00115179],"category_scores_gemma":[0.09850067,0.0003987766,0.0007323407,0.0009988914,0.00143202,0.003137404,0.003097973,0.00236418,0.00101091],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001220649,"about_ca_system_score_gemma":0.00185836,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003685419,"about_ca_topic_score_gemma":0.005532674,"domain_scores_codex":[0.9781411,0.01528454,0.0009482134,0.002645575,0.002313271,0.0006672865],"domain_scores_gemma":[0.9200873,0.04832961,0.005683652,0.01506681,0.00923343,0.001599213],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.009630711,0.001417628,0.408427,0.0009584943,0.001145103,0.0004637213,0.006829441,0.0958555,0.02555578,0.009103731,0.03737356,0.4032393],"study_design_scores_gemma":[0.0003933896,0.001712397,0.115466,0.000329455,0.0002710282,0.0004744554,0.003583261,0.7930726,0.0352962,0.03059983,0.01858131,0.0002201162],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8953946,0.001143584,0.09000143,0.001530804,0.0004456138,0.0002931663,0.001860956,0.003233651,0.006096212],"genre_scores_gemma":[0.9772369,0.00008025768,0.01914684,0.0002921279,0.00007525869,0.0001128764,0.001838024,0.0001810253,0.001036847],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9576253,"threshold_uncertainty_score":0.2241016,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06347665065719738,"score_gpt":0.341585826618393,"score_spread":0.2781091759611956,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}