{"id":"W4302917494","doi":"10.48550/arxiv.1806.06161","title":"BaRC: Backward Reachability Curriculum for Robotic Reinforcement\\n Learning","year":2018,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Office of Naval Research; Natural Sciences and Engineering Research Council of Canada; Toyota Research Institute","keywords":"Reinforcement learning; Computer science; Leverage (statistics); Bottleneck; Reachability; Prior probability; Flexibility (engineering); Artificial intelligence; Optimal control; Curriculum; Mathematical optimization; Machine learning; Bayesian probability; Theoretical computer science; Mathematics","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0009659015,0.000623202,0.0006551808,0.0003613019,0.0005116225,0.0003363629,0.003342953,0.000513152,0.00009444075],"category_scores_gemma":[0.0004787385,0.0007282321,0.0005281841,0.0006557574,0.0002810368,0.0006539741,0.004076254,0.001183042,0.0002989375],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006113162,"about_ca_system_score_gemma":0.0003360177,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001547381,"about_ca_topic_score_gemma":0.00000966798,"domain_scores_codex":[0.9960981,0.0002791982,0.0005507282,0.001893077,0.0002618302,0.0009170566],"domain_scores_gemma":[0.9957428,0.0002989427,0.0007272328,0.002286247,0.0006274197,0.0003173528],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0000200499,0.00004121683,0.004128111,0.0002335725,0.0001196084,0.00002316105,0.0002031334,0.9495648,0.000006594971,0.04458521,0.0008955518,0.0001789943],"study_design_scores_gemma":[0.0006580616,0.0003592705,0.0003014176,0.0001658439,0.0001176632,0.000003189523,0.00007141081,0.9875356,0.00004623558,0.005885622,0.004092628,0.0007630402],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.009523658,0.00002345994,0.9812831,0.0001135403,0.001580965,0.001099868,0.000001571254,0.0006622817,0.00571151],"genre_scores_gemma":[0.971337,0.00008242089,0.01597942,0.00009571214,0.0002580701,0.000007884392,0.00007965478,0.00004995068,0.01210993],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9653037,"threshold_uncertainty_score":0.9995169,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06339507954544266,"score_gpt":0.2106728572109922,"score_spread":0.1472777776655496,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}