{"id":"W2951621135","doi":"10.2316/j.2019.201-2931","title":"MODEL-FREE ONLINE REINFORCEMENT LEARNING OF A ROBOTIC MANIPULATOR","year":2019,"lang":"en","type":"article","venue":"Mechatronic systems and control","topic":"Advanced Control Systems Optimization","field":"Engineering","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Torque; Reinforcement learning; Joint (building); Robot manipulator; Manipulator (device); Computer science; Control theory (sociology); Artificial intelligence; Control engineering; Robot; Simulation; Engineering; Control (management); Structural engineering; Physics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005204188,0.0006267083,0.0006433137,0.0001615096,0.0003072807,0.0003755583,0.0008830077,0.000824155,0.0024921],"category_scores_gemma":[0.001324103,0.0003767255,0.0003242615,0.0001254564,0.0007577722,0.0005719929,0.0008855226,0.0009697788,0.0003875649],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005603945,"about_ca_system_score_gemma":0.0008185378,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006758488,"about_ca_topic_score_gemma":0.005087458,"domain_scores_codex":[0.9998291,0.00005022036,0.000005465999,0.00004033437,0.0000447213,0.00003020173],"domain_scores_gemma":[0.9996395,0.0001658011,0.0000598629,0.00004315548,0.00005330174,0.00003843558],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006368163,0.00002641946,0.0001531346,0.00002806984,0.00001212588,0.00005982992,0.00002232076,0.9844073,0.001299728,0.003066366,0.0003062481,0.01055482],"study_design_scores_gemma":[0.00000874282,0.00002295308,0.00003057419,0.000001629925,0.000001491125,0.000005682841,0.000001071135,0.9985363,0.0001482095,0.001164418,0.00007720337,0.000001739048],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08314173,0.0003014814,0.9086227,0.0004096742,0.00005850529,0.0000487479,0.00003987861,0.000912825,0.006464358],"genre_scores_gemma":[0.9745342,0.00004778667,0.0224374,0.0000433678,0.00001765474,0.00005275729,0.00002507208,0.00002554955,0.002816105],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006758488,"threshold_uncertainty_score":0.01343828,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.006969709640097293,"score_gpt":0.1888515896554948,"score_spread":0.1818818800153975,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}