{"id":"W4396882011","doi":"10.48550/arxiv.2405.06156","title":"A Sharp Test for the Judge Leniency Design","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Legal Systems and Judicial Processes","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada; National Science and Technology Council; National Taiwan University; Academia Sinica","keywords":"Test (biology); Psychology; Political science; Economics; Computer science; Law and economics; Geology","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2043069,0.002493724,0.005679782,0.004363503,0.002541575,0.006487338,0.008181213,0.01106623,0.01903205],"category_scores_gemma":[0.5629057,0.001717798,0.004410438,0.003318513,0.01982057,0.01333024,0.007748447,0.01542825,0.002012175],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002650521,"about_ca_system_score_gemma":0.005209635,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006596124,"about_ca_topic_score_gemma":0.0003942271,"domain_scores_codex":[0.8151013,0.1337886,0.007143944,0.02126649,0.01930521,0.003394511],"domain_scores_gemma":[0.3218009,0.5951087,0.03401984,0.03354627,0.01195378,0.003570391],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001735905,0.0004871767,0.01829465,0.0007061755,0.00100343,0.0005676948,0.001013398,0.02313078,0.001516069,0.8728729,0.004491251,0.07418054],"study_design_scores_gemma":[0.001646798,0.002737815,0.007606616,0.0002579816,0.000425815,0.0004015588,0.000350402,0.08818668,0.003164846,0.8878766,0.007175101,0.0001697706],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07524385,0.0006780502,0.9013647,0.003725383,0.0003382149,0.001848364,0.0006496574,0.0005215969,0.01563026],"genre_scores_gemma":[0.7607087,0.0002899044,0.2272255,0.003102663,0.0004846255,0.004005983,0.0005687968,0.0001113174,0.003502455],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.2043069,"threshold_uncertainty_score":0.9812312,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1642564874775866,"score_gpt":0.2428496142406453,"score_spread":0.07859312676305866,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}