{"id":"W2972435663","doi":"10.65109/hlnw2204","title":"Safe Policy Improvement with an Estimated Baseline Policy","year":2020,"lang":"en","type":"preprint","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"Microsoft (Canada)","funders":"","keywords":"Baseline (sea); Reinforcement learning; Bootstrapping (finance); Computer science; Variance (accounting); Control (management); Machine learning; Artificial intelligence; Econometrics; Mathematics; Economics; Political science; Accounting","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004450984,0.001748659,0.001639959,0.0007854746,0.0006618664,0.001287495,0.001868345,0.001859857,0.002669002],"category_scores_gemma":[0.02220611,0.0006565921,0.0007797445,0.0005603595,0.001770607,0.00221281,0.002240492,0.004248686,0.001179094],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001458404,"about_ca_system_score_gemma":0.004516162,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004782636,"about_ca_topic_score_gemma":0.004019497,"domain_scores_codex":[0.9972755,0.000763748,0.000156162,0.0008518738,0.0006183012,0.0003343656],"domain_scores_gemma":[0.9913292,0.005190293,0.0006094324,0.001536756,0.0009998465,0.0003343684],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004584149,0.0002014848,0.001932777,0.0001744414,0.00008391867,0.0001189041,0.0001684374,0.8362374,0.004758542,0.014219,0.002796578,0.1388501],"study_design_scores_gemma":[0.0000299746,0.0001159012,0.000210667,0.0000249938,0.00001195639,0.00003433771,0.00001769504,0.9866998,0.002442415,0.009709762,0.0006896282,0.00001281162],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02971185,0.0004772156,0.9640121,0.0003728943,0.00009804301,0.00009711578,0.0001143666,0.002820909,0.00229558],"genre_scores_gemma":[0.7126206,0.0002015967,0.28375,0.0004276767,0.00006830563,0.0002126696,0.0004196321,0.0003881711,0.001911406],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004782636,"threshold_uncertainty_score":0.0235393,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03920345239348902,"score_gpt":0.3165527323400888,"score_spread":0.2773492799465999,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}