{"id":"W4415746321","doi":"10.1109/icsme64153.2025.00077","title":"Can LLMs Write CI? a Study on Automatic Generation of GitHub Actions Configurations","year":2025,"lang":"","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Trent University","funders":"Natural Sciences and Engineering Research Council of Canada; Alliance de recherche numérique du Canada","keywords":"Executable; Automation; Similarity (geometry); Quality (philosophy); Software; Code (set theory)","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004006775,0.001721536,0.0006013305,0.001744648,0.0007029933,0.001756443,0.002594185,0.001425588,0.004117515],"category_scores_gemma":[0.02751347,0.0008017833,0.0009993108,0.001565829,0.0009703836,0.003371549,0.002033683,0.002239718,0.002834459],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001836128,"about_ca_system_score_gemma":0.002062604,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008615357,"about_ca_topic_score_gemma":0.01394444,"domain_scores_codex":[0.9959431,0.001822908,0.0002775922,0.001063423,0.0006989317,0.0001940138],"domain_scores_gemma":[0.9818597,0.01084898,0.001135907,0.00435292,0.001372892,0.0004296083],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00253003,0.001581725,0.04535697,0.00483246,0.0003268747,0.001757691,0.004949281,0.09573624,0.02331083,0.009288295,0.1074521,0.7028775],"study_design_scores_gemma":[0.0006518314,0.001897423,0.03053147,0.0008955693,0.0002431481,0.002096965,0.004036846,0.7573304,0.07362053,0.01091961,0.1174733,0.0003028787],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7176997,0.002995743,0.1251036,0.001157572,0.0005143954,0.0009499867,0.01871194,0.1181016,0.0147654],"genre_scores_gemma":[0.7169682,0.000814124,0.1982524,0.0007119006,0.00005145794,0.0007440163,0.06985001,0.007334002,0.005273972],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.008615357,"threshold_uncertainty_score":0.02119011,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07000254763821248,"score_gpt":0.3420604817036072,"score_spread":0.2720579340653947,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}