{"id":"W4417094986","doi":"10.48550/arxiv.2502.16772","title":"Model-Based Exploration in Monitored Markov Decision Processes","year":2025,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Alberta Innovates; University of Alberta; Alberta Machine Intelligence Institute; Alliance de recherche numérique du Canada; Mitacs; Canadian Institute for Advanced Research","keywords":"Markov decision process; Leverage (statistics); Exploit; Partially observable Markov decision process; Convergence (economics); Reinforcement learning; Process (computing); Markov process","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0002501029,0.0002855513,0.0002786808,0.0006444781,0.000102911,0.0001802977,0.001861694,0.0002930464,0.000003815133],"category_scores_gemma":[0.0001872438,0.0003452389,0.00009393856,0.001232197,0.00004780241,0.0007239733,0.001320756,0.0005273288,0.00002116087],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003569837,"about_ca_system_score_gemma":0.0009362958,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004013475,"about_ca_topic_score_gemma":0.00003268558,"domain_scores_codex":[0.998232,0.000095421,0.0002807833,0.0009373333,0.0001623364,0.0002920952],"domain_scores_gemma":[0.9980543,0.0002331352,0.0002424097,0.001101044,0.0002877184,0.00008135097],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003785432,0.00004234869,0.002430648,0.0001699342,0.00001112932,0.00004690917,0.0001463372,0.9906114,0.000002671305,0.005635169,0.00009994454,0.0007656101],"study_design_scores_gemma":[0.000471573,0.00002776491,0.0002086262,0.0004240923,0.00001792979,1.455365e-7,0.00002598419,0.9852636,0.0001091861,0.01309288,0.00005633954,0.000301843],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01732162,0.00002736939,0.9797597,0.00008160986,0.0004289268,0.0003657768,0.000003610578,0.0002233634,0.001788018],"genre_scores_gemma":[0.9642405,0.0001247848,0.03390205,0.00006959899,0.00002184024,0.000003322414,0.00002298371,0.00001030099,0.001604599],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9469189,"threshold_uncertainty_score":0.9999,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09140309050084275,"score_gpt":0.2201448655673335,"score_spread":0.1287417750664907,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}