{"id":"W4417531150","doi":"10.48550/arxiv.2512.16848","title":"Meta-RL Induces Exploration in Language Agents","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Canadian Institute for Advanced Research; Schweizerischer Nationalfonds zur Förderung der Wissenschaftlichen Forschung; National Science Foundation","keywords":"Reinforcement learning; Task (project management); Adaptation (eye); Generalization; Key (lock); Constructed language; Language model","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0004897697,0.0002935117,0.0004369344,0.0003402085,0.00006255194,0.0001957987,0.001607913,0.000246234,0.00005146986],"category_scores_gemma":[0.0001553333,0.0002768718,0.0001712576,0.0004188255,0.00002691276,0.0005298262,0.002121509,0.0007733636,0.0001997669],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001149546,"about_ca_system_score_gemma":0.0001701235,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001978858,"about_ca_topic_score_gemma":0.000033607,"domain_scores_codex":[0.9980005,0.0001880835,0.0004807347,0.0006476881,0.0003809754,0.0003019947],"domain_scores_gemma":[0.9983081,0.0001013425,0.0002848236,0.001177238,0.0000724093,0.00005612988],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000004224997,0.00006947588,0.03941293,0.0001979111,0.0006757928,0.00007770165,0.009270216,0.9451861,0.0002383962,0.001590183,0.0010261,0.002250957],"study_design_scores_gemma":[0.00199148,0.0002502457,0.2280144,0.001248763,0.001488683,0.000006053463,0.00123157,0.727092,0.02009915,0.003464952,0.01177239,0.003340279],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4124493,0.0005060596,0.5767218,0.001315001,0.001820338,0.0005315147,0.000003792863,0.0003136655,0.006338577],"genre_scores_gemma":[0.983425,0.0001135961,0.007960121,0.0005951169,0.00009874441,0.0001350186,0.00005298546,0.0000141867,0.007605242],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.5709757,"threshold_uncertainty_score":0.9999683,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1989101466940288,"score_gpt":0.3392292654941045,"score_spread":0.1403191188000758,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}