{"id":"W4416125924","doi":"10.54254/2755-2721/2026.tj29489","title":"On-Policy Vs. Off-Policy Reinforcement Learning in ConnectX: Seat-Stratified Performance and the Role of Action Masking","year":2025,"lang":"","type":"article","venue":"Applied and Computational Engineering","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Pooling; Robustness (evolution); Generalization; Masking (illustration); Reinforcement learning; Reinforcement; Lever; Set (abstract data type)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005204041,0.00164078,0.001289152,0.0004161379,0.0004204804,0.001036377,0.001748407,0.001942066,0.003274448],"category_scores_gemma":[0.01455641,0.0003894317,0.0004908455,0.0001990886,0.001579409,0.00188698,0.00179073,0.003095128,0.0007815962],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001094968,"about_ca_system_score_gemma":0.002528451,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004090247,"about_ca_topic_score_gemma":0.004450075,"domain_scores_codex":[0.9984433,0.0005934987,0.000075852,0.0003586364,0.000257484,0.0002713007],"domain_scores_gemma":[0.9947015,0.003276402,0.0004216808,0.0006356672,0.0004059895,0.0005587778],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.006238192,0.001562424,0.01291871,0.0005536396,0.0002915518,0.0001694459,0.0002001986,0.8075521,0.009735447,0.005847433,0.005156765,0.149774],"study_design_scores_gemma":[0.00038256,0.002833823,0.002676639,0.00008542307,0.00006876909,0.00007303974,0.00007999157,0.9808255,0.006670204,0.004876666,0.001380234,0.0000472234],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8116808,0.003429479,0.1616936,0.001471346,0.0004446788,0.0005385173,0.0004172029,0.005730188,0.01459406],"genre_scores_gemma":[0.9770817,0.0001820913,0.01955325,0.000363614,0.00003320385,0.0001692114,0.0002852785,0.0001445122,0.00218714],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.005204041,"threshold_uncertainty_score":0.02752191,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.005874809224640797,"score_gpt":0.2240839369894798,"score_spread":0.218209127764839,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}