{"id":"W7117165756","doi":"10.1145/3756681.3756985","title":"Large Language Models as Robust Data Generators in Software Analytics: Are We There Yet?","year":2025,"lang":"","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Saskatchewan","funders":"","keywords":"Adversarial system; Robustness (evolution); Software quality; Software; Data quality; Data modeling; Source code; Software metric; Context (archaeology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01849705,0.002022671,0.001301895,0.001270581,0.0007462793,0.003735033,0.003127031,0.002448752,0.002486524],"category_scores_gemma":[0.1005514,0.0008660775,0.001670004,0.001104261,0.002713367,0.007481707,0.004002443,0.006179212,0.002686807],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001431237,"about_ca_system_score_gemma":0.002183934,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003302742,"about_ca_topic_score_gemma":0.00551969,"domain_scores_codex":[0.9857431,0.00953697,0.0007107591,0.001629184,0.002003015,0.0003768763],"domain_scores_gemma":[0.9402594,0.04111735,0.002526663,0.01165218,0.003624009,0.0008203657],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001266066,0.0006958626,0.02551604,0.001375518,0.0007137245,0.0005191803,0.00161533,0.5529106,0.01233823,0.02603595,0.02514706,0.3518664],"study_design_scores_gemma":[0.00008538026,0.0003411493,0.001564807,0.0002447419,0.00006197659,0.0001862774,0.000285206,0.9490222,0.008136431,0.03181967,0.00816645,0.00008564645],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1243404,0.006350152,0.8336653,0.01196767,0.001063143,0.0007168527,0.003705239,0.01309542,0.005095792],"genre_scores_gemma":[0.6829662,0.00203127,0.3002091,0.003281411,0.0003565878,0.0008159201,0.00643512,0.001256547,0.002647826],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.981503,"threshold_uncertainty_score":0.0978229,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04894563841330968,"score_gpt":0.3169293484392279,"score_spread":0.2679837100259183,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}