{"id":"W4402474348","doi":"10.1109/ccece59415.2024.10667224","title":"LLM4RL: Enhancing Reinforcement Learning with Large Language Models","year":2024,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Western University","funders":"","keywords":"Reinforcement learning; Computer science; Reinforcement; Artificial intelligence; Human–computer interaction; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002034064,0.0009163123,0.0008139384,0.0003413307,0.0003510303,0.0008983766,0.002030813,0.001068572,0.003575714],"category_scores_gemma":[0.008145447,0.0004370412,0.0006524483,0.0002509625,0.0008531513,0.001734427,0.002609151,0.00232398,0.0008983792],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007648355,"about_ca_system_score_gemma":0.001489151,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004461543,"about_ca_topic_score_gemma":0.005555122,"domain_scores_codex":[0.9990523,0.0004050053,0.00004765163,0.000171931,0.0002370789,0.00008598687],"domain_scores_gemma":[0.997521,0.001500783,0.0001627885,0.0003530705,0.0003095247,0.0001528488],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000217572,0.0003543615,0.001317416,0.000183061,0.00009157447,0.0001799825,0.0001718597,0.7748485,0.01175163,0.01751231,0.005254717,0.1881171],"study_design_scores_gemma":[0.00001485194,0.00003095498,0.00002625702,0.00000399577,0.000004856005,0.000008784254,0.000004184294,0.9934676,0.001210767,0.004596062,0.0006269495,0.00000462662],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01198691,0.0001823048,0.9820663,0.0002980897,0.00006909948,0.00006669326,0.00006049871,0.003744903,0.001525185],"genre_scores_gemma":[0.5985888,0.0001915705,0.3960954,0.0005039959,0.0000680712,0.0002666379,0.0002749628,0.0004800238,0.003530611],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004461543,"threshold_uncertainty_score":0.01196194,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01082649117583488,"score_gpt":0.246022324639814,"score_spread":0.2351958334639791,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}