{"id":"W4393740131","doi":"10.5281/zenodo.6994692","title":"Flakify: A Black-Box, Language Model-based Predictor for Flaky Tests – Replication Package","year":2022,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Software Testing and Debugging Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"","keywords":"Replication (statistics); Black box; Computer science; R package; Programming language; Artificial intelligence; Mathematics; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.005490847,0.003313323,0.001557373,0.002812527,0.0007954733,0.00351736,0.003580126,0.001534546,0.09419644],"category_scores_gemma":[0.04140652,0.001417983,0.002711942,0.001534007,0.0007060166,0.004088611,0.003507469,0.003668678,0.1099589],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001061338,"about_ca_system_score_gemma":0.004369263,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00744907,"about_ca_topic_score_gemma":0.009320468,"domain_scores_codex":[0.9967158,0.0007372918,0.0003286664,0.00100411,0.0009112034,0.0003030024],"domain_scores_gemma":[0.9890416,0.005856366,0.0005757049,0.002149875,0.001971815,0.0004046335],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0006203468,0.0001055627,0.006234293,0.0006563365,0.0001613977,0.000153594,0.00009991444,0.007923801,0.001498767,0.002458132,0.8948949,0.0851929],"study_design_scores_gemma":[0.001057161,0.0004010634,0.009106966,0.0007731798,0.0002374996,0.0004695791,0.0002734462,0.2670189,0.02112242,0.04869882,0.6505524,0.0002886061],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"software","genre_gemma":"dataset","genre_scores_codex":[0.003771136,0.0004154833,0.1500843,0.001061065,0.0006406014,0.0005937295,0.1957687,0.6410118,0.006653112],"genre_scores_gemma":[0.03922654,0.0003840933,0.2320252,0.001842202,0.0003539013,0.003493964,0.6040801,0.1013146,0.0172794],"genre_candidate":"dataset","genre_consensus":null,"teacher_disagreement_score":0.9945092,"threshold_uncertainty_score":0.3151185,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03671388466794158,"score_gpt":0.283911857080683,"score_spread":0.2471979724127414,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}