{"id":"W7160228089","doi":"","title":"Bugspyter : detecting code bugs in Jupyter Notebooks using LLMs","year":2025,"lang":"en","type":"other","venue":"cIRcle (University of British Columbia)","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Root cause; Software bug; Debugging; Security bug; Software; Reliability (semiconductor); Code (set theory); Root (linguistics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002209132,0.00187059,0.0007356661,0.00317548,0.0008704902,0.001877869,0.002532513,0.001236038,0.005301943],"category_scores_gemma":[0.02493886,0.001485422,0.0008629715,0.00112467,0.0011126,0.003802906,0.00258861,0.001747189,0.002693667],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001709573,"about_ca_system_score_gemma":0.002842725,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01764846,"about_ca_topic_score_gemma":0.02170456,"domain_scores_codex":[0.996633,0.0005180311,0.0002319131,0.0008982793,0.001480111,0.0002386445],"domain_scores_gemma":[0.981593,0.007574347,0.003360968,0.004147259,0.002783716,0.0005407595],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002312176,0.001021681,0.1867193,0.001951862,0.0004170201,0.003097008,0.007124837,0.05175497,0.05474186,0.01112983,0.1587597,0.5209698],"study_design_scores_gemma":[0.0003137302,0.000805407,0.06281632,0.0006321803,0.0002588679,0.001068871,0.001487477,0.6823668,0.1260386,0.009297513,0.114468,0.0004462787],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"software","genre_gemma":"methods","genre_scores_codex":[0.2566137,0.0005928228,0.210458,0.000846309,0.0002536903,0.0007584406,0.006538519,0.5152854,0.008653115],"genre_scores_gemma":[0.5843228,0.0003843528,0.364238,0.0004598522,0.00004939654,0.0005460407,0.01181683,0.02325209,0.01493075],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.01764846,"threshold_uncertainty_score":0.03509146,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01325093786287073,"score_gpt":0.1979960847619892,"score_spread":0.1847451468991184,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}