{"id":"W4410552853","doi":"10.1109/saner64311.2025.00070","title":"Exploring the Potential of Llama Models in Automated Code Refinement: A Replication Study","year":2025,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Polytechnique Montréal; Concordia University","funders":"","keywords":"Computer science; Replication (statistics); Code (set theory); Programming language; Mathematics; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02322661,0.001636965,0.001147017,0.001363201,0.0011288,0.002853413,0.003712812,0.002115743,0.003164992],"category_scores_gemma":[0.1498069,0.001023447,0.002382641,0.001147851,0.002204988,0.0072921,0.003529954,0.004155079,0.001737908],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00188169,"about_ca_system_score_gemma":0.002956746,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008674148,"about_ca_topic_score_gemma":0.008449577,"domain_scores_codex":[0.9783393,0.01437724,0.00128055,0.002448095,0.003041211,0.0005135976],"domain_scores_gemma":[0.7874101,0.1335409,0.007623637,0.05468135,0.01498408,0.001759904],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01266085,0.01199167,0.1110094,0.005604014,0.001578253,0.002315395,0.02305754,0.1970197,0.04471056,0.03179282,0.03467646,0.5235833],"study_design_scores_gemma":[0.001853648,0.007025648,0.02251769,0.0007022248,0.000906432,0.001002758,0.003910379,0.8473815,0.0278912,0.02358139,0.06269466,0.0005325075],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8347199,0.00129393,0.1383982,0.001900243,0.0003315904,0.001745032,0.001294915,0.01272917,0.007587085],"genre_scores_gemma":[0.8511473,0.0003402016,0.13852,0.0007579267,0.0000749827,0.001832061,0.002134567,0.002361097,0.002831922],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9767734,"threshold_uncertainty_score":0.1228355,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05302030036310057,"score_gpt":0.3186383970244456,"score_spread":0.265618096661345,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}