{"id":"W4388904319","doi":"10.1016/j.ifacol.2023.10.924","title":"Reinforcement Learning with Partial Parametric Model Knowledge","year":2023,"lang":"en","type":"article","venue":"IFAC-PapersOnLine","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Honeywell (Canada); University of British Columbia","funders":"","keywords":"Reinforcement learning; Computer science; Ignorance; Bridge (graph theory); Parametric statistics; Control (management); Linear-quadratic regulator; Complete information; Partial least squares regression; Mathematical optimization; Artificial intelligence; Mathematics; Machine learning; Mathematical economics; Statistics; Law","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001745091,0.001053414,0.001226027,0.000409424,0.0003037303,0.001075313,0.001804298,0.000984277,0.001880137],"category_scores_gemma":[0.006135347,0.0005029648,0.0007350406,0.0004410881,0.001623158,0.001856481,0.001674811,0.001888555,0.0003622758],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005963186,"about_ca_system_score_gemma":0.001265076,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002697314,"about_ca_topic_score_gemma":0.002173207,"domain_scores_codex":[0.9989585,0.0003676467,0.00004388382,0.0002018328,0.0003276695,0.0001003459],"domain_scores_gemma":[0.9969639,0.001861955,0.0003340562,0.0004197652,0.0002891809,0.0001311612],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006325766,0.00005631717,0.0003212191,0.00007682748,0.00005253003,0.00008111729,0.00006784549,0.9394135,0.001262593,0.02008204,0.0004964265,0.03802623],"study_design_scores_gemma":[0.00001120948,0.00003946074,0.00003508895,0.000005559454,0.000005421701,0.00001058211,0.000002994765,0.9901736,0.000370951,0.009029055,0.0003097763,0.000006245799],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.006929967,0.0001201472,0.9911972,0.0001399246,0.00002474205,0.00001999848,0.00001566454,0.0002592572,0.001293054],"genre_scores_gemma":[0.8733368,0.0002113468,0.1231257,0.0001695693,0.00007096744,0.0001518711,0.00007083255,0.00006806757,0.002794868],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.002697314,"threshold_uncertainty_score":0.009229004,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03105641342737652,"score_gpt":0.2772597253850733,"score_spread":0.2462033119576967,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}