{"id":"W4367189765","doi":"10.48550/arxiv.2304.13223","title":"Reinforcement Learning with Partial Parametric Model Knowledge","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia; Honeywell (Canada)","funders":"","keywords":"Reinforcement learning; Computer science; Ignorance; Bridge (graph theory); Parametric statistics; Control (management); Complete information; Linear-quadratic regulator; Mathematical optimization; Artificial intelligence; Mathematics; Mathematical economics; Law","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001778506,0.001091645,0.001260222,0.0004041858,0.000314809,0.001178108,0.001758385,0.0010473,0.001887991],"category_scores_gemma":[0.007345061,0.000537941,0.0007430749,0.0004589151,0.001701366,0.001928006,0.001816238,0.001944647,0.0003847866],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006470944,"about_ca_system_score_gemma":0.001286333,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002774829,"about_ca_topic_score_gemma":0.002138957,"domain_scores_codex":[0.9988455,0.0004350728,0.00004658184,0.0002416686,0.0003214919,0.0001097508],"domain_scores_gemma":[0.9963042,0.002337651,0.0003911293,0.0004908048,0.0003255587,0.0001507906],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006685634,0.00005074746,0.0003332841,0.00006992486,0.00004898905,0.00007983195,0.00006040439,0.9493887,0.001049429,0.018956,0.0005188607,0.02937694],"study_design_scores_gemma":[0.00001105707,0.00003332433,0.00003432493,0.000004814686,0.000005550121,0.000009413384,0.000002884089,0.9898302,0.0003171449,0.009475103,0.0002705195,0.000005672016],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.009320205,0.0001394915,0.9884235,0.0001914587,0.00002804028,0.00002159546,0.00002313905,0.0003142533,0.001538308],"genre_scores_gemma":[0.8924066,0.0001953276,0.1040976,0.0001825791,0.00006640104,0.0001436838,0.00008510384,0.00007178871,0.002750821],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002774829,"threshold_uncertainty_score":0.009405792,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1275187607125167,"score_gpt":0.2153923316058258,"score_spread":0.08787357089330913,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}