{"id":"W4416159353","doi":"10.48550/arxiv.2511.07396","title":"C3PO: Optimized Large Language Model Cascades with Probabilistic Cost Constraints for Reasoning","year":2025,"lang":"","type":"preprint","venue":"ArXiv.org","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Probabilistic logic; Regret; Inference; Generalization; Scalability; Cascade; Set (abstract data type)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001673115,0.001062546,0.001407766,0.0002874579,0.0006435576,0.000505853,0.002617652,0.0006819478,0.00007317554],"category_scores_gemma":[0.001560532,0.001007436,0.0004318394,0.0004402479,0.0004283853,0.0004580456,0.002332923,0.001467486,0.00002978135],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004487063,"about_ca_system_score_gemma":0.002348725,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001448958,"about_ca_topic_score_gemma":0.0001066089,"domain_scores_codex":[0.993386,0.0002525519,0.001261892,0.002840094,0.0006492322,0.001610226],"domain_scores_gemma":[0.9944237,0.0006888151,0.0007563137,0.002744349,0.000974592,0.0004121691],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003319716,0.0004149022,0.008084306,0.001726139,0.0004952586,0.0001098185,0.01333632,0.9343066,0.0001185159,0.0284343,0.0001558981,0.01248593],"study_design_scores_gemma":[0.003515533,0.00008954246,0.0003029298,0.002463907,0.0002730376,0.00003055025,0.0005265203,0.9902831,0.0003618148,0.0008569541,0.0002285478,0.001067616],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1361535,0.0004691243,0.8544468,0.0004988957,0.001056095,0.004041271,0.0003458863,0.0003233676,0.002665007],"genre_scores_gemma":[0.6444901,0.00005685505,0.3507927,0.0004917878,0.0002753077,0.0008840504,0.00006833216,0.00005614076,0.002884727],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.5083365,"threshold_uncertainty_score":0.9992376,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04827555444929198,"score_gpt":0.3026207778427652,"score_spread":0.2543452233934732,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}