{"id":"W4367189765","doi":"10.48550/arxiv.2304.13223","title":"Reinforcement Learning with Partial Parametric Model Knowledge","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia; Honeywell (Canada)","funders":"","keywords":"Reinforcement learning; Computer science; Ignorance; Bridge (graph theory); Parametric statistics; Control (management); Complete information; Linear-quadratic regulator; Mathematical optimization; Artificial intelligence; Mathematics; Mathematical economics; Law","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0004584053,0.0004972244,0.0004578717,0.0007436739,0.0003232142,0.0002926296,0.002353586,0.0003304075,0.00001701379],"category_scores_gemma":[0.0001084718,0.0005286958,0.0002103202,0.0017781,0.0001302245,0.0004464255,0.003688654,0.001403139,0.000619991],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000417097,"about_ca_system_score_gemma":0.0005162961,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00006695862,"about_ca_topic_score_gemma":0.00001018772,"domain_scores_codex":[0.9971403,0.0001570074,0.0003480338,0.001380267,0.0002556148,0.0007187268],"domain_scores_gemma":[0.9972821,0.0002092699,0.0004691135,0.001539698,0.0002394977,0.000260265],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002383786,0.00002634869,0.001387618,0.00008196537,0.0001210906,0.0001380856,0.0003134072,0.9315094,0.000001794011,0.06609155,0.0002003181,0.00010455],"study_design_scores_gemma":[0.0005473852,0.0001877007,0.0001070068,0.0001426398,0.0000872675,0.000002496123,0.00005074046,0.9959229,0.0000376981,0.001499839,0.0007807211,0.0006336432],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01134499,0.00002058389,0.9783932,0.0000530696,0.0004123901,0.0004143725,9.770239e-7,0.001054446,0.008305999],"genre_scores_gemma":[0.9604179,0.0001504885,0.005064649,0.00003230584,0.00005939856,0.00000401283,0.00002877761,0.00005242564,0.03419009],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9733285,"threshold_uncertainty_score":0.9997165,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1275187607125167,"score_gpt":0.2153923316058258,"score_spread":0.08787357089330913,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}