{"id":"W4285604500","doi":"10.24963/ijcai.2022/440","title":"Multi-policy Grounding and Ensemble Policy Learning for Transfer Learning with Dynamics Mismatch","year":2022,"lang":"en","type":"article","venue":"Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University; University of Toronto","funders":"","keywords":"Computer science; Task (project management); Quality (philosophy); Imitation; Feature (linguistics); Policy learning; Artificial intelligence; Transfer of learning; Ensemble learning; Machine learning; Algorithm; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001749411,0.001165704,0.001680891,0.0006398403,0.0005987828,0.001019539,0.00185507,0.00207453,0.002721145],"category_scores_gemma":[0.006175009,0.0006458058,0.0006900317,0.0006224684,0.001235947,0.001933169,0.001954819,0.002315111,0.0005068091],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009915106,"about_ca_system_score_gemma":0.00169961,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004404291,"about_ca_topic_score_gemma":0.002259575,"domain_scores_codex":[0.9993881,0.0001761164,0.00003704671,0.0001581871,0.0001329075,0.0001076205],"domain_scores_gemma":[0.9979014,0.001265815,0.0002188454,0.0002256922,0.0002636647,0.0001245188],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006422516,0.00005565157,0.0005469858,0.00003197197,0.00003521807,0.00005508794,0.0000629295,0.9285411,0.001109674,0.007198868,0.0005015644,0.06179679],"study_design_scores_gemma":[0.000004131989,0.0000173757,0.0000247633,0.000002788569,0.000002245729,0.000005270063,0.000002634106,0.9978279,0.0002175073,0.001783552,0.0001096328,0.000002258575],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.013247,0.0001660041,0.9850551,0.000116697,0.00003705635,0.00003258789,0.00001567701,0.000436197,0.0008935964],"genre_scores_gemma":[0.7903178,0.0001882864,0.205793,0.0002211819,0.00006949922,0.000240502,0.0001312064,0.0001504581,0.002888124],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004404291,"threshold_uncertainty_score":0.009251893,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05565352146568232,"score_gpt":0.2892777634608105,"score_spread":0.2336242419951282,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}