{"id":"W4388904319","doi":"10.1016/j.ifacol.2023.10.924","title":"Reinforcement Learning with Partial Parametric Model Knowledge","year":2023,"lang":"en","type":"article","venue":"IFAC-PapersOnLine","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Honeywell (Canada); University of British Columbia","funders":"","keywords":"Reinforcement learning; Computer science; Ignorance; Bridge (graph theory); Parametric statistics; Control (management); Linear-quadratic regulator; Complete information; Partial least squares regression; Mathematical optimization; Artificial intelligence; Mathematics; Machine learning; Mathematical economics; Statistics; Law","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0005063401,0.0003229807,0.0003101971,0.0004479796,0.0003381061,0.0002227778,0.0009497675,0.0001123135,0.00003966528],"category_scores_gemma":[0.0002079332,0.0002721128,0.0001046728,0.002410161,0.00007943751,0.0004942676,0.0004679033,0.000501024,0.001112853],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001159669,"about_ca_system_score_gemma":0.0001996759,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001427532,"about_ca_topic_score_gemma":0.000004628732,"domain_scores_codex":[0.997424,0.00007547824,0.0004107598,0.000606055,0.0006828856,0.000800835],"domain_scores_gemma":[0.9985473,0.0002073434,0.0001908146,0.0006948176,0.0001400536,0.0002196416],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001542624,0.00002588973,0.000615198,0.00002571118,0.00004130489,0.00002670484,0.001071513,0.9899426,0.0001864165,0.003655751,0.00005106312,0.004342497],"study_design_scores_gemma":[0.0007267643,0.0003772778,0.000212831,0.00004567804,0.00001958028,0.000009769219,0.0001028914,0.9947497,0.0003062855,0.00003362799,0.003040003,0.0003755759],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0162413,0.00005523584,0.9737559,0.0007541433,0.0002646323,0.0002917163,8.765306e-7,0.001213616,0.00742258],"genre_scores_gemma":[0.5937899,0.0001006684,0.3781015,0.00026224,0.0001976295,0.00005227608,0.0000643363,0.00005519176,0.02737622],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.5956544,"threshold_uncertainty_score":0.9999731,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03105641342737652,"score_gpt":0.2772597253850733,"score_spread":0.2462033119576967,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}