{"id":"W7117152675","doi":"10.1145/3756681.3756995","title":"Can We Enhance Bug Report Quality Using LLMs?: An Empirical Study of LLM-Based Bug Report Generation","year":2025,"lang":"","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Calgary","funders":"","keywords":"Triage; Quality (philosophy); Software regression; Empirical research; Software; Software bug","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01105282,0.001207063,0.0007126674,0.003027015,0.0003776766,0.001556577,0.001987491,0.001284769,0.0007659102],"category_scores_gemma":[0.09064268,0.0005062531,0.0008202079,0.00186324,0.0009025834,0.003438687,0.001621876,0.001936193,0.0009015168],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00119214,"about_ca_system_score_gemma":0.001451616,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005792437,"about_ca_topic_score_gemma":0.007258382,"domain_scores_codex":[0.9916937,0.00383495,0.0006947433,0.001787302,0.001703677,0.0002856147],"domain_scores_gemma":[0.9399415,0.03915252,0.005416915,0.009911431,0.004349294,0.001228362],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.001499581,0.001484905,0.2254683,0.002166126,0.0004903839,0.0005221125,0.0028643,0.06604167,0.01802867,0.001075456,0.02557824,0.6547801],"study_design_scores_gemma":[0.0005041106,0.003155193,0.1131064,0.0003712197,0.0004870228,0.001333657,0.001468145,0.8247908,0.03092909,0.003892232,0.01970445,0.0002575634],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9081673,0.004489121,0.04679954,0.001139571,0.0001636209,0.0003403412,0.003650326,0.03343617,0.00181404],"genre_scores_gemma":[0.9309261,0.0004887584,0.05847355,0.0003048685,0.0000420732,0.000158383,0.007950746,0.0008312848,0.0008242306],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9889472,"threshold_uncertainty_score":0.05845356,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1264404597549885,"score_gpt":0.4516062958092152,"score_spread":0.3251658360542268,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}