{"id":"W7117118041","doi":"10.1145/3756681.3756971","title":"Reinforcement Learning vs Supervised Learning: A tug of war to generate refactored code accurately","year":2025,"lang":"","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Code refactoring; Reinforcement learning; Code (set theory); Source code; Java; Software; Suite","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002733645,0.001328032,0.0009509764,0.0006694714,0.0003580091,0.0008220275,0.001502932,0.001210512,0.001561243],"category_scores_gemma":[0.01044801,0.0004845903,0.0006385725,0.000466548,0.001126455,0.001636658,0.001230897,0.002465203,0.0007316959],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009325017,"about_ca_system_score_gemma":0.001692397,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004013429,"about_ca_topic_score_gemma":0.003244247,"domain_scores_codex":[0.9984005,0.0006573343,0.00007550536,0.0004442187,0.0002933838,0.0001290641],"domain_scores_gemma":[0.9949111,0.003016657,0.0003817759,0.001034113,0.0004909901,0.0001653686],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003486297,0.0002457067,0.003206417,0.0001417778,0.00008416755,0.00008846394,0.0001535432,0.7135705,0.007755642,0.005149092,0.002653749,0.2666023],"study_design_scores_gemma":[0.00001629754,0.00006537289,0.0001432829,0.000009170427,0.00000812183,0.00001544187,0.00000987096,0.9942742,0.001727846,0.00322595,0.0004982204,0.000006196341],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06070663,0.0007667468,0.9304304,0.0006804191,0.0001000875,0.0001154256,0.0000729824,0.004951452,0.002175776],"genre_scores_gemma":[0.7626691,0.000326976,0.2327867,0.0006980443,0.00009237883,0.000189089,0.000330994,0.0006174258,0.002289338],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004013429,"threshold_uncertainty_score":0.01445711,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04580367929897999,"score_gpt":0.3140277163149539,"score_spread":0.2682240370159739,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}