{"id":"W7124264120","doi":"10.65109/zliw2815","title":"Mastering Robot Control through Point-based Reinforcement Learning with Pre-training","year":2024,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Robustness (evolution); Robot; Leverage (statistics); Robotics; Limiting; Rendering (computer graphics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001037126,0.001293846,0.0009598927,0.0002911232,0.0003201633,0.0005946276,0.001706188,0.001032422,0.001870448],"category_scores_gemma":[0.004883422,0.0005990312,0.0004673296,0.0002096243,0.001092757,0.001033632,0.001293156,0.002045214,0.0003675372],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006234611,"about_ca_system_score_gemma":0.00121734,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005241322,"about_ca_topic_score_gemma":0.005097632,"domain_scores_codex":[0.999512,0.0001078342,0.00002552687,0.0001339099,0.0001384537,0.00008236561],"domain_scores_gemma":[0.9977703,0.001415726,0.0002312459,0.0002151107,0.0002607188,0.0001068894],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001078806,0.00009401386,0.0006497996,0.00006627152,0.0000240982,0.00007022321,0.00006071751,0.9319742,0.00439193,0.0021568,0.0005094089,0.05989465],"study_design_scores_gemma":[0.000008882959,0.00004008393,0.00005473695,0.000004249306,0.000003179547,0.000008643381,0.000002890103,0.9981807,0.0008266385,0.0007649335,0.0001017146,0.000003334479],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.03196106,0.0001899406,0.9644992,0.0001298645,0.0000399132,0.00008092785,0.00001675763,0.001233236,0.001849093],"genre_scores_gemma":[0.8869786,0.0001192129,0.1110194,0.0001600677,0.0000289668,0.0001729806,0.00006456568,0.00008330071,0.001373025],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005241322,"threshold_uncertainty_score":0.01042163,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02640634819717081,"score_gpt":0.2616624150467427,"score_spread":0.2352560668495719,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}