{"id":"W4393146598","doi":"10.1609/aaai.v38i21.30555","title":"Multi-world Model in Continual Reinforcement Learning","year":2024,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Elevator Systems and Control","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Reinforcement learning; Reinforcement; Computer science; Psychology; Artificial intelligence; Social psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001447654,0.0006730751,0.000850714,0.0004831888,0.0003420501,0.001008722,0.001746409,0.001256274,0.003040923],"category_scores_gemma":[0.005040393,0.0004518364,0.0006631953,0.0005113271,0.001630118,0.002555807,0.001219621,0.002504404,0.0004019954],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001021512,"about_ca_system_score_gemma":0.0006052191,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004792901,"about_ca_topic_score_gemma":0.005055132,"domain_scores_codex":[0.9993553,0.0002708891,0.00002371828,0.0001792226,0.0001074062,0.00006341247],"domain_scores_gemma":[0.9980165,0.001312883,0.0001615673,0.0002122272,0.0001617401,0.0001351078],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004249081,0.00003730454,0.0006749139,0.00002934155,0.00004300439,0.00009495111,0.0000821604,0.9154528,0.0004604262,0.07077609,0.0006573274,0.0116492],"study_design_scores_gemma":[0.000004680319,0.00001050802,0.00005516187,0.000002843081,0.00000319577,0.000009349615,0.000003338865,0.9728635,0.00006644254,0.02672117,0.0002555567,0.000004176369],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03513118,0.0004693478,0.9565989,0.0008526189,0.0001161031,0.00003449224,0.0001577824,0.0004132016,0.006226268],"genre_scores_gemma":[0.9257669,0.0003119243,0.0672961,0.0002188665,0.00008699046,0.000142068,0.0001731121,0.00008215287,0.005921921],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004792901,"threshold_uncertainty_score":0.01017284,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05302181981312896,"score_gpt":0.2761287857989702,"score_spread":0.2231069659858412,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}