{"id":"W4416125924","doi":"10.54254/2755-2721/2026.tj29489","title":"On-Policy Vs. Off-Policy Reinforcement Learning in ConnectX: Seat-Stratified Performance and the Role of Action Masking","year":2025,"lang":"","type":"article","venue":"Applied and Computational Engineering","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Pooling; Robustness (evolution); Generalization; Masking (illustration); Reinforcement learning; Reinforcement; Lever; Set (abstract data type)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0005075422,0.0002862678,0.0003592713,0.0006150053,0.0002575765,0.0002024282,0.0002749883,0.00009878605,0.000003293289],"category_scores_gemma":[0.0001356478,0.0002701615,0.00004547257,0.0008968415,0.0001432412,0.0001959004,0.0002759793,0.0005267455,0.000002333285],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001362537,"about_ca_system_score_gemma":0.0003008746,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00005778857,"about_ca_topic_score_gemma":8.679169e-7,"domain_scores_codex":[0.9982467,0.00004314379,0.0006080646,0.0003697723,0.000375631,0.0003566339],"domain_scores_gemma":[0.9986607,0.0007939984,0.0002202002,0.0001948113,0.00006821903,0.00006202263],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007236317,0.000006659051,0.0001031297,0.0001089511,0.00003231254,2.929889e-7,0.0007853931,0.545228,0.0001030328,0.4238756,0.000001245047,0.029683],"study_design_scores_gemma":[0.001968435,0.00009958249,0.003890689,0.0002868911,0.00001469065,0.000004452263,0.0001709903,0.9880619,0.0005210944,0.004441516,0.0003314248,0.0002083403],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1154541,0.0002629584,0.8754475,0.0008070526,0.000129277,0.0005314215,5.259707e-7,0.00006494929,0.007302196],"genre_scores_gemma":[0.9974712,0.0003228918,0.001661935,0.0002398342,0.00007209657,0.00003864363,0.000007009397,0.00001419517,0.0001721804],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8820171,"threshold_uncertainty_score":0.9999751,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.005874809224640797,"score_gpt":0.2240839369894798,"score_spread":0.218209127764839,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}