{"id":"W7124283399","doi":"10.65109/cwyu2303","title":"Two-Level Actor-Critic Using Multiple Teachers","year":2023,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; University of Alberta","funders":"","keywords":"Inefficiency; Variety (cybernetics); Sample (material); Domain (mathematical analysis); Action (physics); Forcing (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001091311,0.0005227746,0.0004521891,0.0005131398,0.0006617896,0.001028711,0.001941039,0.0002101153,0.0004548347],"category_scores_gemma":[0.0008704702,0.0005549085,0.000256269,0.002352133,0.0002436636,0.00125095,0.001558352,0.000710086,0.003339478],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003396288,"about_ca_system_score_gemma":0.0004258656,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004800924,"about_ca_topic_score_gemma":0.0000212107,"domain_scores_codex":[0.9951946,0.0002632968,0.0008387793,0.001013368,0.001126774,0.001563221],"domain_scores_gemma":[0.9970341,0.0006714218,0.0002336374,0.0014364,0.000213463,0.0004109895],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000004255915,0.0000347965,0.007172674,0.00005339539,0.00008055336,0.00006996172,0.003587365,0.9687784,0.002748238,0.003853041,0.0009379444,0.01267936],"study_design_scores_gemma":[0.001038845,0.0001029932,0.003058821,0.0001279911,0.00004255468,0.00001888291,0.0007564931,0.9917464,0.0007615403,0.00009694548,0.001567679,0.000680873],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03559991,0.00004943963,0.9520414,0.0006074743,0.003357385,0.0004222926,0.000004014446,0.0008737792,0.007044287],"genre_scores_gemma":[0.8687646,0.00003306491,0.106742,0.0004327626,0.0003077631,0.000006241791,0.000008460751,0.00006475639,0.02364037],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8452994,"threshold_uncertainty_score":0.9996902,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1396883853120315,"score_gpt":0.336168527520682,"score_spread":0.1964801422086505,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}