{"id":"W4416608666","doi":"10.48550/arxiv.2505.22960","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Multi-Agent Systems and Negotiation","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Government of Canada; Canadian Institute for Advanced Research","keywords":"Diversity (politics); Task (project management); Key (lock); Scaling; Empirical research","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.002117485,0.0004418653,0.001187774,0.0003207835,0.0002066991,0.0001435426,0.001193649,0.0002256169,0.00001619095],"category_scores_gemma":[0.001043249,0.0004039285,0.0002678215,0.0003555634,0.00003060029,0.0002095604,0.001321581,0.0003899139,0.0002180256],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002179406,"about_ca_system_score_gemma":0.0002416318,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003286865,"about_ca_topic_score_gemma":0.000004780696,"domain_scores_codex":[0.9954571,0.001224953,0.001278667,0.001041157,0.0006842804,0.0003139151],"domain_scores_gemma":[0.9954168,0.001543918,0.001194059,0.00127443,0.0004621657,0.0001086493],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00005213829,0.005063424,0.7862351,0.1635349,0.00193692,0.0002336761,0.00933543,0.01824787,0.01324371,0.001561509,0.00006941986,0.0004859648],"study_design_scores_gemma":[0.002599779,0.0002957019,0.7349686,0.04013479,0.0004067761,0.00002715728,0.0003253061,0.2139966,0.006201808,0.0001431385,0.000007858324,0.0008925106],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9072672,0.0002531739,0.0877315,0.00004537453,0.0007653391,0.003617015,0.00003448499,0.0001913114,0.00009465814],"genre_scores_gemma":[0.9978298,0.000007710792,0.001054973,0.00005623219,0.0001186021,0.0005068631,0.00003703298,0.00002011764,0.0003686544],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1957487,"threshold_uncertainty_score":0.9998413,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05343403047859336,"score_gpt":0.3164274788861809,"score_spread":0.2629934484075875,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}