{"id":"W4404348686","doi":"10.48550/arxiv.2410.24128","title":"Q-learning for Quantile MDPs: A Decomposition, Performance, and Convergence Analysis","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Advanced Control Systems Optimization","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Institut de Valorisation des Données; National Science Foundation","keywords":"Quantile; Convergence (economics); Decomposition; Computer science; Econometrics; Economics; Macroeconomics; Chemistry","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007027749,0.001439805,0.001760554,0.0009961919,0.0005969389,0.001551626,0.001588663,0.00185033,0.003521937],"category_scores_gemma":[0.02423566,0.0007170318,0.001051377,0.001096977,0.002013861,0.002510102,0.002773243,0.003817173,0.0005089864],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001789568,"about_ca_system_score_gemma":0.00266267,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004633233,"about_ca_topic_score_gemma":0.002447012,"domain_scores_codex":[0.9981534,0.0009325988,0.00008715641,0.000317115,0.0003477268,0.0001621133],"domain_scores_gemma":[0.9885103,0.00927459,0.0005183847,0.0003800204,0.0009939981,0.0003227954],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007576071,0.000068193,0.000959555,0.0001297027,0.00004336582,0.00004645451,0.00007605367,0.8860139,0.0005727323,0.07259779,0.001714371,0.03770207],"study_design_scores_gemma":[0.000005899732,0.00001520281,0.0000433668,0.000009166774,0.000003005995,0.000006611704,0.000004667072,0.9855956,0.0001177545,0.01398475,0.0002106136,0.000003405982],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004122648,0.0002990293,0.9942366,0.0002759151,0.00002616851,0.00004173318,0.00002951237,0.00008463926,0.0008838024],"genre_scores_gemma":[0.4563063,0.001574138,0.5358427,0.0005736274,0.0001973485,0.0006571873,0.000376381,0.0003151139,0.004157234],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007027749,"threshold_uncertainty_score":0.03716671,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0201990711061497,"score_gpt":0.1828583552687975,"score_spread":0.1626592841626477,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}