{"id":"W4391096379","doi":"10.1109/bigdata59044.2023.10386531","title":"Refactoring ETL Flows in The Wild","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Code refactoring; Computer science; IBM; Context (archaeology); Pipeline (software); Data integration; Data flow diagram; Data mining; Database; Software engineering; Operating system; Software","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007409404,0.001558787,0.0006143223,0.00195479,0.0009702048,0.001973526,0.002683853,0.001150848,0.001482322],"category_scores_gemma":[0.03566964,0.001037885,0.001355696,0.001585505,0.001314132,0.00447615,0.002428153,0.002322457,0.0009232453],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001144661,"about_ca_system_score_gemma":0.001842021,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004749093,"about_ca_topic_score_gemma":0.004194457,"domain_scores_codex":[0.9949352,0.001326213,0.0005016456,0.001182639,0.001711141,0.0003431302],"domain_scores_gemma":[0.9633391,0.0145115,0.002337449,0.01421145,0.004998452,0.0006019686],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001115081,0.0009527648,0.04741264,0.000817016,0.0003157968,0.001879442,0.003176938,0.08045189,0.07379559,0.0111553,0.02036494,0.7585626],"study_design_scores_gemma":[0.0002315308,0.0006508135,0.01123106,0.000269136,0.0002099897,0.001448713,0.001163728,0.751318,0.1424036,0.03336167,0.0575043,0.0002074997],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3139299,0.0007990208,0.6204793,0.00144815,0.0003750586,0.0006847024,0.001992784,0.05726042,0.00303056],"genre_scores_gemma":[0.4487873,0.0004263091,0.5350908,0.0006689703,0.00008399905,0.00030657,0.00575631,0.005106059,0.003773685],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007409404,"threshold_uncertainty_score":0.03918517,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04099050327581285,"score_gpt":0.2888281117088855,"score_spread":0.2478376084330726,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}