{"id":"W7124156211","doi":"10.65109/qppa8970","title":"Using spatial hints to improve policy reuse in a reinforcement learning agent","year":2010,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Reinforcement learning; Reuse; Exploit; Robustness (evolution); Task (project management); Domain (mathematical analysis); Policy learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication","research_integrity","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001671121,0.0007334338,0.0006525699,0.00138381,0.0004754678,0.001126509,0.003363423,0.0004011605,0.0008767394],"category_scores_gemma":[0.003398428,0.0007789025,0.0001826801,0.001930463,0.0001447839,0.0009934554,0.005393448,0.002303683,0.001114199],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008976587,"about_ca_system_score_gemma":0.001245506,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.012297,"about_ca_topic_score_gemma":0.0004806806,"domain_scores_codex":[0.9933829,0.0002337185,0.001679377,0.001398508,0.001394897,0.001910611],"domain_scores_gemma":[0.9952477,0.000158051,0.000608097,0.002846481,0.0003147802,0.0008249317],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004178656,0.00006127624,0.001909668,0.00004686599,0.00003492156,0.00004857804,0.004686185,0.9257485,0.04353429,0.004782466,0.000111446,0.01899397],"study_design_scores_gemma":[0.001181767,0.0008927755,0.001567416,0.0001489233,0.00001960015,0.00001955526,0.0000989019,0.9809281,0.006056323,0.00009443454,0.008107757,0.0008843984],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08490539,0.000007219462,0.8982509,0.001781749,0.003784799,0.001263056,5.748178e-7,0.0001701856,0.009836136],"genre_scores_gemma":[0.8961776,0.0000200585,0.08829288,0.001352145,0.0008389019,0.00002534222,0.000003420038,0.00006648761,0.01322309],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8112723,"threshold_uncertainty_score":0.999998,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03122750528605815,"score_gpt":0.3106378969221901,"score_spread":0.279410391636132,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}