{"id":"W2113710263","doi":"10.1109/icca.2003.1595047","title":"A Reinfrocement Learning Approach to Online Learning in Control","year":2003,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Control (management); Online learning; Artificial intelligence; Multimedia","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008429115,0.0001972692,0.0002483925,0.0002801797,0.0001325343,0.0001733364,0.0006097209,0.00006891241,0.00004128454],"category_scores_gemma":[0.0006242898,0.0001879409,0.00005428794,0.0007696665,0.0000165652,0.0002809492,0.0001524862,0.0005820355,0.0001436164],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001220298,"about_ca_system_score_gemma":0.00006980276,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002487027,"about_ca_topic_score_gemma":0.00000326418,"domain_scores_codex":[0.9978509,0.0002646606,0.0004086824,0.0004942559,0.0004313515,0.000550181],"domain_scores_gemma":[0.9991852,0.0001172026,0.0001015808,0.000366125,0.00007204783,0.0001578558],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000003878411,0.00005626019,0.008072795,0.000008111127,0.000009474701,0.00000435468,0.0006151054,0.9510173,0.0001588685,0.03838383,0.00009815115,0.001571882],"study_design_scores_gemma":[0.0009746065,0.00023275,0.00178803,0.00001969779,0.000003349304,0.000008521991,0.0002689456,0.9669209,0.000113302,0.00005570611,0.02934275,0.0002714748],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004952986,0.00002100365,0.9171923,0.0002640324,0.00009781752,0.0002941538,5.938745e-8,0.00029679,0.07688082],"genre_scores_gemma":[0.8200285,0.000005584158,0.1671893,0.00081763,0.00002130253,0.00002349487,0.000003430002,0.0000157724,0.01189493],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8150756,"threshold_uncertainty_score":0.7664007,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01819162284227271,"score_gpt":0.2458991582055008,"score_spread":0.2277075353632281,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}