{"id":"W3206880326","doi":"10.1109/icra48506.2021.9561450","title":"Learning robust driving policies without online exploration","year":2021,"lang":"en","type":"article","venue":"","topic":"Autonomous Vehicle Technology and Safety","field":"Engineering","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Huawei Technologies (Canada)","funders":"","keywords":"Reinforcement learning; Offline learning; Computer science; Artificial intelligence; Representation (politics); Machine learning; Online learning; Online and offline; Training set; Robot; Scale (ratio)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007536214,0.000801637,0.0008710444,0.0003397109,0.0002434185,0.0006297775,0.001517372,0.0008399732,0.001285698],"category_scores_gemma":[0.003266771,0.0005070572,0.0005374385,0.0003127798,0.0005801158,0.00128904,0.001078263,0.001749442,0.0004636503],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005112725,"about_ca_system_score_gemma":0.001064475,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005341039,"about_ca_topic_score_gemma":0.00520957,"domain_scores_codex":[0.9996951,0.00005272505,0.00001546956,0.0000994869,0.00008747596,0.0000497449],"domain_scores_gemma":[0.9990473,0.0003810151,0.0001582408,0.0001884863,0.0001774778,0.00004738692],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006251308,0.00007666585,0.00069149,0.00003174263,0.00003674499,0.00004797617,0.00005092612,0.9035808,0.004273976,0.002410528,0.0009265954,0.08781002],"study_design_scores_gemma":[0.000002901535,0.00001653167,0.00005649872,0.000001541235,0.000001912372,0.000006502854,0.000002105227,0.9987252,0.0005134949,0.0005629888,0.0001077328,0.000002565299],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01993222,0.0000834527,0.9775313,0.0001050279,0.00002587484,0.00003336079,0.00004198467,0.001220993,0.001025832],"genre_scores_gemma":[0.8817435,0.00008550502,0.1155991,0.0001308698,0.00003862075,0.000136908,0.0001802986,0.0001230427,0.001962153],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005341039,"threshold_uncertainty_score":0.01061994,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01796128547711093,"score_gpt":0.2250142006271975,"score_spread":0.2070529151500866,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}