{"id":"W4417531150","doi":"10.48550/arxiv.2512.16848","title":"Meta-RL Induces Exploration in Language Agents","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Canadian Institute for Advanced Research; Schweizerischer Nationalfonds zur Förderung der Wissenschaftlichen Forschung; National Science Foundation","keywords":"Reinforcement learning; Task (project management); Adaptation (eye); Generalization; Key (lock); Constructed language; Language model","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001552595,0.0008935712,0.000809032,0.0003530298,0.0003739505,0.0008759184,0.001401515,0.0009106967,0.001629325],"category_scores_gemma":[0.005613687,0.0005678997,0.0006459292,0.0002134266,0.001623155,0.001527274,0.002318072,0.001493752,0.0003689363],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006584385,"about_ca_system_score_gemma":0.0009787434,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001146066,"about_ca_topic_score_gemma":0.001970226,"domain_scores_codex":[0.9992837,0.0003307133,0.00003100632,0.0001564442,0.00009904343,0.00009918891],"domain_scores_gemma":[0.9980762,0.001001411,0.0002305332,0.0004044464,0.0001538326,0.0001334827],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001593085,0.0001011057,0.002023747,0.0001193676,0.00008468558,0.0001355782,0.000204929,0.9212615,0.01118914,0.0197105,0.001021665,0.04398864],"study_design_scores_gemma":[0.000019429,0.00005816613,0.0001323164,0.000008866548,0.000008761152,0.00001979229,0.00001720652,0.9872602,0.001742791,0.01026642,0.0004585571,0.000007433012],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1436455,0.0003983764,0.8473548,0.0005598178,0.00006819837,0.00008516954,0.00008115968,0.002098722,0.005708339],"genre_scores_gemma":[0.9241508,0.00009442004,0.07356457,0.0001770342,0.00001879399,0.0001279359,0.00006788404,0.0001478652,0.001650712],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.001629325,"threshold_uncertainty_score":0.008211017,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1989101466940288,"score_gpt":0.3392292654941045,"score_spread":0.1403191188000758,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}