{"id":"W2727682072","doi":"10.1109/msr.2017.7","title":"Do Not Trust Build Results at Face Value - An Empirical Study of 30 Million CPAN Builds","year":2017,"lang":"en","type":"article","venue":"","topic":"Software System Performance and Reliability","field":"Computer Science","cited_by":19,"is_retracted":false,"has_abstract":true,"ca_institutions":"Polytechnique Montréal","funders":"Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs","keywords":"Computer science; Code (set theory); Empirical research; Software; Software evolution; Software engineering; Software system; Operating system; Software construction; Programming language","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01270956,0.0004590052,0.0004511541,0.002522036,0.001044153,0.001834516,0.001723203,0.0009451439,0.001719626],"category_scores_gemma":[0.111335,0.0004909217,0.0003871313,0.003230472,0.002258846,0.003209244,0.002041269,0.002475223,0.0007809119],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001392114,"about_ca_system_score_gemma":0.0008334125,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005152489,"about_ca_topic_score_gemma":0.005560119,"domain_scores_codex":[0.9884351,0.003463871,0.0007959021,0.00128345,0.005145967,0.0008755074],"domain_scores_gemma":[0.7750393,0.1533379,0.03055445,0.01763722,0.01865824,0.00477282],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0004868754,0.0005486357,0.9358679,0.000146822,0.0001852907,0.0008585745,0.006993668,0.0102321,0.0009963767,0.001862112,0.002864682,0.03895704],"study_design_scores_gemma":[0.00001789221,0.0005420485,0.9647596,0.00006689126,0.000056915,0.0009650469,0.00603312,0.02033677,0.001366729,0.001335355,0.004463017,0.00005658907],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9974795,0.000128997,0.0007711864,0.000138075,0.000005622007,0.0000183349,0.0002487792,0.00005991937,0.001149604],"genre_scores_gemma":[0.9986998,0.0000599228,0.0004687469,0.00002931435,0.00000674581,0.0000177589,0.0004074284,0.00004791722,0.0002624284],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9872904,"threshold_uncertainty_score":0.06721538,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04495576005706785,"score_gpt":0.3429298480288655,"score_spread":0.2979740879717976,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}