{"id":"W7124313799","doi":"10.65109/vmil8420","title":"Off-the-Grid MARL: Datasets and Baselines for Offline Multi-Agent Reinforcement Learning","year":2023,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Institut National de la Recherche Scientifique","funders":"","keywords":"Reinforcement learning; Bespoke; Online and offline; Measure (data warehouse); Power (physics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.003428652,0.0006841744,0.0005743796,0.0003682821,0.001478403,0.001066913,0.001739787,0.0001993574,0.0002384882],"category_scores_gemma":[0.00145674,0.0005414913,0.0002294878,0.001183228,0.0002898468,0.0008138176,0.00281709,0.0006342201,0.0005794273],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001045632,"about_ca_system_score_gemma":0.0002086467,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008500217,"about_ca_topic_score_gemma":0.00002310915,"domain_scores_codex":[0.9946089,0.0002729897,0.001427075,0.00125437,0.001009251,0.00142746],"domain_scores_gemma":[0.9957938,0.00133755,0.0005983585,0.001561687,0.0003261045,0.0003824958],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004425328,0.00003517016,0.0004604026,0.000239332,0.0001393639,0.0000171032,0.0007749003,0.9048359,0.0001148634,0.001788395,0.05627861,0.03527165],"study_design_scores_gemma":[0.001442747,0.0004669402,0.0004262399,0.0001006624,0.00007646018,0.0000111173,0.0002513522,0.6853937,0.0002070271,0.00001214313,0.3111478,0.000463764],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0004439493,0.0005097089,0.9881077,0.005510629,0.002552854,0.002028936,0.0000653832,0.0004989455,0.0002819062],"genre_scores_gemma":[0.3705989,0.01977317,0.2357368,0.01039962,0.004547171,0.001148449,0.008770355,0.0005547107,0.3484708],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.7523708,"threshold_uncertainty_score":0.9999701,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05639460265554716,"score_gpt":0.3100390074822671,"score_spread":0.2536444048267199,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}