{"id":"W2892938424","doi":"10.1109/bigdata.2018.8622095","title":"Predicting computational reproducibility of data analysis pipelines in large population studies using collaborative filtering","year":2018,"lang":"en","type":"preprint","venue":"","topic":"Data Visualization and Analytics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"Compute Canada","keywords":"Reproducibility; Computer science; Pipeline transport; Population; Process (computing); Set (abstract data type); Pipeline (software); Data mining; Relevance (law); Speedup; Variance (accounting); Statistics; Mathematics; Parallel computing; Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1133353,0.001400216,0.001411151,0.003460811,0.001538848,0.003664457,0.002753319,0.002950021,0.001252546],"category_scores_gemma":[0.3650471,0.001009975,0.002981717,0.002801256,0.002624608,0.00329724,0.002775014,0.002681731,0.0003628724],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002050497,"about_ca_system_score_gemma":0.003775315,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005670411,"about_ca_topic_score_gemma":0.004106662,"domain_scores_codex":[0.9506388,0.03458011,0.003454365,0.006019942,0.004619599,0.0006871938],"domain_scores_gemma":[0.435361,0.4797499,0.02143996,0.05006177,0.01156013,0.001827235],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002158106,0.0005053167,0.2633317,0.0007232932,0.002963829,0.0005821742,0.001904585,0.4584213,0.008355772,0.01674625,0.005154724,0.239153],"study_design_scores_gemma":[0.0001761184,0.0003568239,0.02951725,0.00009229768,0.0002893341,0.000314355,0.0001584983,0.9228415,0.00850871,0.03636666,0.001278259,0.000100238],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1447979,0.0006313118,0.8501135,0.001143776,0.00009230868,0.0002933503,0.0004396281,0.001796789,0.0006914323],"genre_scores_gemma":[0.6443244,0.0001775673,0.3532752,0.0002582594,0.0001010634,0.0005656527,0.0007434684,0.0002912553,0.0002631538],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8866647,"threshold_uncertainty_score":0.5993814,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.189093103643665,"score_gpt":0.4506390377404407,"score_spread":0.2615459340967757,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}