{"id":"W4402671710","doi":"10.18653/v1/2024.acl-long.487","title":"Why Don’t Prompt-Based Fairness Metrics Correlate?","year":2024,"lang":"en","type":"article","venue":"","topic":"Ethics and Social Impacts of AI","field":"Social Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Fonds de recherche du Québec – Nature et technologies; Alliance de recherche numérique du Canada; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research; Microsoft Research","keywords":"Computer science","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0471768,0.001369315,0.001360615,0.002459301,0.001280006,0.003663639,0.001516382,0.001603978,0.002335699],"category_scores_gemma":[0.2987459,0.0006325539,0.0005944768,0.002402126,0.002243213,0.006534521,0.00378325,0.002814187,0.001776646],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00165113,"about_ca_system_score_gemma":0.002216763,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003007681,"about_ca_topic_score_gemma":0.003048499,"domain_scores_codex":[0.9415818,0.03786911,0.003187151,0.006464093,0.009498186,0.001399568],"domain_scores_gemma":[0.7697364,0.1547709,0.01716376,0.02812925,0.0270574,0.003142301],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001720937,0.0004558874,0.385065,0.00136282,0.001115192,0.000341502,0.008117127,0.04497689,0.01008149,0.04046724,0.02579881,0.4804971],"study_design_scores_gemma":[0.000243922,0.001399082,0.1888863,0.0008218937,0.0004100095,0.0009801232,0.004902612,0.3874146,0.0404688,0.3338449,0.03998718,0.000640635],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3662599,0.003354286,0.5959634,0.00518463,0.001146385,0.0006472481,0.00272426,0.005682143,0.01903778],"genre_scores_gemma":[0.9336383,0.0002393729,0.06129276,0.0008046986,0.0001722383,0.0003929517,0.001113618,0.0007509986,0.001595166],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0471768,"threshold_uncertainty_score":0.2494978,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05030863215565093,"score_gpt":0.3741215084521705,"score_spread":0.3238128762965196,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}