{"id":"W4416608666","doi":"10.48550/arxiv.2505.22960","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Multi-Agent Systems and Negotiation","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Government of Canada; Canadian Institute for Advanced Research","keywords":"Diversity (politics); Task (project management); Key (lock); Scaling; Empirical research","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0424491,0.0008715608,0.001087738,0.002676878,0.001340786,0.004935779,0.002448607,0.001236337,0.004021046],"category_scores_gemma":[0.2781021,0.0005789166,0.0008164541,0.002249999,0.006376286,0.01116891,0.005627756,0.003669875,0.0005387589],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002656203,"about_ca_system_score_gemma":0.002332907,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001472811,"about_ca_topic_score_gemma":0.001020859,"domain_scores_codex":[0.9617137,0.02945293,0.00129356,0.002820038,0.004127877,0.0005919622],"domain_scores_gemma":[0.562866,0.3936027,0.01445698,0.02134022,0.005893451,0.001840643],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001589567,0.0009400513,0.05011056,0.002889049,0.0005930254,0.0002428116,0.01533147,0.07168227,0.008466144,0.2653331,0.003539612,0.5792823],"study_design_scores_gemma":[0.0004021641,0.001556656,0.02726114,0.001071198,0.0005013619,0.0004433732,0.006517537,0.5718457,0.01512953,0.3473044,0.02772929,0.0002376989],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6092877,0.009913468,0.3400902,0.003968332,0.000135383,0.0007666966,0.0003105567,0.001387746,0.03413993],"genre_scores_gemma":[0.945057,0.0007019574,0.05285387,0.0002301576,0.00005169228,0.0002264744,0.0001384062,0.0001752149,0.0005651705],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0424491,"threshold_uncertainty_score":0.224495,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05343403047859336,"score_gpt":0.3164274788861809,"score_spread":0.2629934484075875,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}