{"id":"W4384026501","doi":"10.1109/msr59073.2023.00085","title":"Defectors: A Large, Diverse Python Dataset for Defect Prediction","year":2023,"lang":"en","type":"preprint","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Python (programming language); Computer science; Approx; Machine learning; Artificial intelligence; Source lines of code; Source code; Data mining; Programming language; Software; Operating system","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001094616,0.0002624974,0.0002523424,0.0003718785,0.000115674,0.0003260705,0.001692225,0.0002659856,0.00002443799],"category_scores_gemma":[0.001642442,0.0002547907,0.0002330643,0.0003618069,0.0000188661,0.0002340571,0.004472035,0.0005040686,0.0003131348],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001612648,"about_ca_system_score_gemma":0.0001636645,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001424421,"about_ca_topic_score_gemma":0.0000504895,"domain_scores_codex":[0.9976014,0.00006084492,0.0002401873,0.001013262,0.000515066,0.0005692538],"domain_scores_gemma":[0.9966465,0.00131114,0.00006347574,0.001702482,0.0001202005,0.0001561561],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000018465,0.0001246207,0.01283133,0.0009007413,0.0002838119,0.00005103222,0.0003041952,0.009219329,0.00004857431,0.002746228,0.9704227,0.00304892],"study_design_scores_gemma":[0.002051337,0.0004704652,0.04827022,0.0005123399,0.0001344325,0.0000226199,0.00004880262,0.7298001,0.0008656732,0.009620717,0.2065888,0.001614514],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.002686757,0.00006270234,0.9814125,0.0001400731,0.002726631,0.0009743894,0.009654864,0.002319195,0.0000228979],"genre_scores_gemma":[0.3355923,0.0003657981,0.5710664,0.0005287189,0.003818559,0.00630605,0.07482872,0.0006225874,0.006870796],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.763834,"threshold_uncertainty_score":0.9999904,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06861649982258129,"score_gpt":0.3296325204209574,"score_spread":0.2610160205983761,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}