{"id":"W4285604500","doi":"10.24963/ijcai.2022/440","title":"Multi-policy Grounding and Ensemble Policy Learning for Transfer Learning with Dynamics Mismatch","year":2022,"lang":"en","type":"article","venue":"Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University; University of Toronto","funders":"","keywords":"Computer science; Task (project management); Quality (philosophy); Imitation; Feature (linguistics); Policy learning; Artificial intelligence; Transfer of learning; Ensemble learning; Machine learning; Algorithm; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0008477565,0.000297853,0.0003013169,0.0004983012,0.00104971,0.0004849099,0.001647534,0.00006740851,0.00002704742],"category_scores_gemma":[0.0008066078,0.0002503875,0.0001331941,0.0007033254,0.0002175589,0.0004894105,0.0007147017,0.000847212,0.000007447737],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004520312,"about_ca_system_score_gemma":0.0002259229,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001927072,"about_ca_topic_score_gemma":0.0000284746,"domain_scores_codex":[0.9974313,0.00004089286,0.0006186008,0.0005849238,0.0008768204,0.0004474346],"domain_scores_gemma":[0.9984489,0.0002167528,0.0004189728,0.000178575,0.0006368375,0.00009993421],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001136809,0.0000744414,0.0007128984,0.00005404244,0.00005245817,7.834656e-7,0.003318614,0.2383092,0.004093891,0.7449074,0.000008712052,0.008353806],"study_design_scores_gemma":[0.0001589705,0.000628082,0.0002901963,0.0001761661,0.00001499808,0.00003937485,0.002811808,0.9681931,0.01287531,0.0139038,0.0005953997,0.0003128481],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05129258,0.000007896906,0.9309913,0.01308618,0.0003810738,0.0006020953,0.00000548679,0.0001485206,0.003484864],"genre_scores_gemma":[0.9864537,0.00004285971,0.01143975,0.0002183397,0.0001262527,0.0001064593,0.000005277387,0.00003268978,0.001574663],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9351611,"threshold_uncertainty_score":0.9999948,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05565352146568232,"score_gpt":0.2892777634608105,"score_spread":0.2336242419951282,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}