{"id":"W3029302266","doi":"10.1109/vl/hcc50065.2020.9127202","title":"Code Duplication and Reuse in Jupyter Notebooks","year":2020,"lang":"en","type":"preprint","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Victoria","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Reuse; Computer science; Code (set theory); Code reuse; Software; Software engineering; Source code; Sample (material); Programming language; Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.006941642,0.000612653,0.0005753954,0.003847,0.001720988,0.003508424,0.001855305,0.001000946,0.002514607],"category_scores_gemma":[0.08158562,0.0009538347,0.0004865964,0.00355141,0.002616354,0.007186115,0.005020166,0.001172834,0.0005621556],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001594993,"about_ca_system_score_gemma":0.001749639,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003191418,"about_ca_topic_score_gemma":0.005491337,"domain_scores_codex":[0.9911179,0.002564354,0.0006379817,0.001402426,0.003730171,0.0005471092],"domain_scores_gemma":[0.9040951,0.05539738,0.01675834,0.01528826,0.00620493,0.002256044],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001894291,0.000618783,0.4047123,0.001662166,0.0002638693,0.007541803,0.2107837,0.003564868,0.03019883,0.009450188,0.01165392,0.3176551],"study_design_scores_gemma":[0.0001724378,0.001678249,0.6487384,0.00176846,0.0003868741,0.01707881,0.08600216,0.02497924,0.05262815,0.01713616,0.1487713,0.000659786],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.978983,0.0004929383,0.01506177,0.0003634658,0.00002253703,0.00009485606,0.000231591,0.001690489,0.0030594],"genre_scores_gemma":[0.9639039,0.0003353416,0.02920829,0.0001916054,0.00002743018,0.0001368753,0.0006912792,0.0009849259,0.004520251],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9930584,"threshold_uncertainty_score":0.03671139,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04363914024277774,"score_gpt":0.2955356706236401,"score_spread":0.2518965303808623,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}