{"id":"W4414814497","doi":"10.22214/ijraset.2025.74423","title":"Evaluating Multi-Agent AI Systems for Automated Bug Detection and Code Refactoring","year":2025,"lang":"en","type":"article","venue":"International Journal for Research in Applied Science and Engineering Technology","topic":"Software Engineering Research","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Code refactoring; Dataflow; Pipeline (software); Scalability; Code (set theory); Debugging; False positive paradox; Software; Abstraction","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00841913,0.001239456,0.0006318571,0.001550129,0.0006740122,0.001646853,0.002549502,0.001381073,0.002147385],"category_scores_gemma":[0.0215721,0.0005254459,0.0005857021,0.0007463831,0.000882547,0.001778172,0.0022079,0.001099253,0.0005769947],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001994128,"about_ca_system_score_gemma":0.002947889,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008176761,"about_ca_topic_score_gemma":0.006385158,"domain_scores_codex":[0.9933985,0.002699917,0.0005292153,0.001163635,0.001834687,0.0003739378],"domain_scores_gemma":[0.9789336,0.01144165,0.001839886,0.003250047,0.003427304,0.001107614],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.00487267,0.003273121,0.03574406,0.001695671,0.0009247828,0.0003180304,0.0008863693,0.5852757,0.0437132,0.007359688,0.004489544,0.3114472],"study_design_scores_gemma":[0.0002389717,0.001271295,0.00399914,0.00003874259,0.0001214652,0.00006126137,0.0001388057,0.976825,0.0132717,0.001825134,0.002173589,0.00003485282],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7567882,0.001183838,0.2180896,0.0005778711,0.000225519,0.001167937,0.0005681131,0.01264593,0.008753076],"genre_scores_gemma":[0.8380367,0.0001743133,0.1590976,0.0001043461,0.00002637663,0.0002903666,0.0006331789,0.0002119196,0.001425188],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.00841913,"threshold_uncertainty_score":0.04452515,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1092967595237065,"score_gpt":0.4670050707181387,"score_spread":0.3577083111944322,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}