{"id":"W6912122487","doi":"10.5281/zenodo.16416715","title":"Can LLMs Write CI? A Study on Automatic Generation of GitHub Actions Configurations (Replication Package)","year":2025,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Software Engineering Research","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Trent University","funders":"","keywords":"Documentation; Scripting language; Software; Replication (statistics); Metadata; Rewriting","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"bench_or_experimental","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"not_applicable","genre":"dataset","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.008405761,0.001950894,0.001321231,0.003773396,0.001425622,0.003553044,0.004501947,0.001822457,0.1655245],"category_scores_gemma":[0.0697114,0.001443049,0.002252779,0.005161442,0.0008439075,0.005471459,0.003514274,0.003367035,0.1212721],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002382611,"about_ca_system_score_gemma":0.003098252,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01606158,"about_ca_topic_score_gemma":0.01380202,"domain_scores_codex":[0.9935961,0.00237261,0.0005568701,0.001038018,0.002169271,0.0002672235],"domain_scores_gemma":[0.9171509,0.04091875,0.002354508,0.0264105,0.01210111,0.001064246],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003740001,0.0003140712,0.002566738,0.001162325,0.00006283572,0.00006460574,0.0003338751,0.001859941,0.000984478,0.002687066,0.9307489,0.05884125],"study_design_scores_gemma":[0.001483766,0.0008374967,0.0245375,0.001190447,0.0002133938,0.0002142071,0.001557981,0.01973779,0.01526284,0.01410583,0.9205155,0.0003431158],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"empirical","genre_scores_codex":[0.02082512,0.0008657059,0.06567282,0.00514864,0.002057432,0.005263449,0.6623127,0.1279946,0.1098595],"genre_scores_gemma":[0.05846404,0.0007607425,0.111398,0.002569451,0.0003202552,0.01580337,0.7436174,0.03489481,0.032172],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9915943,"threshold_uncertainty_score":0.5537345,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06386664889347299,"score_gpt":0.2955125222868887,"score_spread":0.2316458733934157,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}