{"id":"W2971805364","doi":"10.48550/arxiv.2103.03506","title":"Does chronology matter in JIT defect prediction? A Partial Replication Study","year":2021,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Software Engineering Research","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Computer science; Eclipse; Brier score; Wilcoxon signed-rank test; Code (set theory); Replication (statistics); Data mining; Statistics; Artificial intelligence; Set (abstract data type); Mathematics; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"reproducibility","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"reproducibility","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06875312,0.001042142,0.001294612,0.002340695,0.001244415,0.002613981,0.002538321,0.001684927,0.004365799],"category_scores_gemma":[0.2732901,0.000810976,0.003552592,0.002868166,0.001490284,0.005571732,0.001785089,0.002142649,0.001779813],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001156752,"about_ca_system_score_gemma":0.002264715,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01832116,"about_ca_topic_score_gemma":0.01049945,"domain_scores_codex":[0.9727982,0.01402265,0.002371142,0.007311584,0.002824822,0.0006715322],"domain_scores_gemma":[0.5696887,0.2582159,0.03823818,0.09132437,0.03958078,0.002952031],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001833095,0.0005218019,0.9197436,0.0009620822,0.002335626,0.0005034069,0.004180006,0.003313569,0.00173888,0.001593244,0.005585529,0.05768919],"study_design_scores_gemma":[0.0004692276,0.003148882,0.8958704,0.001129744,0.003966637,0.001591942,0.004754948,0.05009041,0.004610551,0.007820562,0.02625497,0.0002917061],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9553434,0.008262306,0.02348111,0.001978136,0.0005488306,0.0004035029,0.005230047,0.0005975942,0.004155045],"genre_scores_gemma":[0.9909393,0.0005039127,0.004063662,0.0004108789,0.0001709715,0.0001766156,0.002495924,0.000269293,0.0009694663],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9312469,"threshold_uncertainty_score":0.3636056,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0369766811427843,"score_gpt":0.2026109663909568,"score_spread":0.1656342852481725,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}