{"id":"W7124283399","doi":"10.65109/cwyu2303","title":"Two-Level Actor-Critic Using Multiple Teachers","year":2023,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; University of Alberta","funders":"","keywords":"Inefficiency; Variety (cybernetics); Sample (material); Domain (mathematical analysis); Action (physics); Forcing (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001994855,0.001822682,0.001863827,0.0004993625,0.0006932816,0.001519482,0.003421202,0.002838273,0.00839643],"category_scores_gemma":[0.004808561,0.0009426806,0.0006982407,0.0004920588,0.001712387,0.00134396,0.002474606,0.003706017,0.001973137],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001506935,"about_ca_system_score_gemma":0.001616993,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004945134,"about_ca_topic_score_gemma":0.007304112,"domain_scores_codex":[0.999109,0.0002480215,0.00004959559,0.0002703646,0.0002028097,0.0001202336],"domain_scores_gemma":[0.9977096,0.001375034,0.0001594539,0.0002132594,0.000328344,0.0002142047],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0002027966,0.0001265689,0.0006559896,0.0001050285,0.00007629848,0.0001894681,0.0001063445,0.9437379,0.001525164,0.0162398,0.001860738,0.03517386],"study_design_scores_gemma":[0.0000263934,0.00002328128,0.00002328028,0.000005372131,0.000007319299,0.00001109926,0.000003978007,0.9969748,0.0002281451,0.002286647,0.0004049444,0.000004745978],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01123415,0.0003165477,0.9793875,0.0004274813,0.0001284833,0.0001122451,0.00004277725,0.001207562,0.007143234],"genre_scores_gemma":[0.7753491,0.0002040483,0.2056591,0.0004536843,0.0001346683,0.0004512222,0.0001636412,0.0002241542,0.01736041],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00839643,"threshold_uncertainty_score":0.02808881,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1396883853120315,"score_gpt":0.336168527520682,"score_spread":0.1964801422086505,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}