{"id":"W7117572006","doi":"10.2139/ssrn.5986385","title":"Can Author Manipulation of AI Referees be Welfare Improving?","year":2025,"lang":"","type":"preprint","venue":"SSRN Electronic Journal","topic":"Ethics and Social Impacts of AI","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Delegate; Welfare; Quality (philosophy); Enforcement; Moral hazard","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02359808,0.0004886495,0.0009565887,0.003283314,0.0036662,0.007822085,0.001819314,0.006873533,0.05563012],"category_scores_gemma":[0.1700722,0.0003683571,0.0007871231,0.003154991,0.006178082,0.00969249,0.003306623,0.003138878,0.00536072],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002899539,"about_ca_system_score_gemma":0.005751253,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003478117,"about_ca_topic_score_gemma":0.003487497,"domain_scores_codex":[0.9736388,0.01650728,0.0008739267,0.001825112,0.004848874,0.002305959],"domain_scores_gemma":[0.799825,0.1375515,0.02360556,0.01780867,0.01625148,0.004957895],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0008364987,0.0008832079,0.02203704,0.0006684674,0.0002852895,0.0005708573,0.005231532,0.001822447,0.004541245,0.7657906,0.04418142,0.1531513],"study_design_scores_gemma":[0.0003256751,0.0004328095,0.01438947,0.0002925335,0.0002157089,0.0004850143,0.004087404,0.003978849,0.003219055,0.8988128,0.0736891,0.00007164353],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.1815051,0.004711034,0.04190744,0.171569,0.002472027,0.000393904,0.0008028621,0.0007075304,0.5959311],"genre_scores_gemma":[0.9307114,0.001630471,0.006162095,0.01343143,0.001929962,0.0002656698,0.0001212069,0.0001386854,0.04560912],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9764019,"threshold_uncertainty_score":0.1861013,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03725190857702265,"score_gpt":0.3606561912399207,"score_spread":0.3234042826628981,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}