{"id":"W4404348686","doi":"10.48550/arxiv.2410.24128","title":"Q-learning for Quantile MDPs: A Decomposition, Performance, and Convergence Analysis","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Advanced Control Systems Optimization","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Institut de Valorisation des Données; National Science Foundation","keywords":"Quantile; Convergence (economics); Decomposition; Computer science; Econometrics; Economics; Macroeconomics; Chemistry","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0001035158,0.0002294042,0.0003445924,0.0004093041,0.0000987032,0.00005551725,0.0001574048,0.0001803535,0.0000180869],"category_scores_gemma":[0.00001149615,0.0002876429,0.000162684,0.0005781327,0.00003242615,0.0001314367,0.0001766136,0.000329661,0.00001901203],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001375754,"about_ca_system_score_gemma":0.00002212266,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001740234,"about_ca_topic_score_gemma":0.00002299029,"domain_scores_codex":[0.9990613,0.0000258204,0.0001852101,0.0004815646,0.00003874482,0.0002073923],"domain_scores_gemma":[0.9994321,0.00006582162,0.00007693633,0.0002470213,0.0001015896,0.00007650322],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001917571,0.000004301728,0.002778649,0.0005017581,0.0006462211,0.00001119597,0.0001016604,0.9936817,0.00005061803,0.001991232,0.00004568017,0.0001678673],"study_design_scores_gemma":[0.0002311049,0.00002640092,0.0005451342,0.0001025585,0.0009758706,0.000001702138,0.00007196599,0.9961322,0.00004578922,0.001320231,0.0002551121,0.0002919267],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4552581,0.0002468844,0.5430235,0.00000435977,0.0002816712,0.0002707204,0.00002035617,0.0003555832,0.000538876],"genre_scores_gemma":[0.9976984,0.0005515815,0.0008874623,0.000004416061,0.00005668613,0.000007471472,0.00009067879,0.00003943858,0.0006639017],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.5424403,"threshold_uncertainty_score":0.9999576,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0201990711061497,"score_gpt":0.1828583552687975,"score_spread":0.1626592841626477,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}