{"id":"W4391785473","doi":"10.1007/s00778-024-00835-2","title":"Assisted design of data science pipelines","year":2024,"lang":"en","type":"article","venue":"The VLDB Journal","topic":"Machine Learning and Data Classification","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Berlin Center for Machine Learning; Banting and Best Diabetes Centre, University of Toronto; Technische Universität Berlin","keywords":"Pipeline transport; Computer science; Data science; Engineering; Mechanical engineering","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005937485,0.001584789,0.001342202,0.002162931,0.00106955,0.002019424,0.004105815,0.001453104,0.008305961],"category_scores_gemma":[0.01376023,0.001152607,0.001595175,0.0009189249,0.001269031,0.002827313,0.004150177,0.001865216,0.003088539],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001411263,"about_ca_system_score_gemma":0.003912994,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003856159,"about_ca_topic_score_gemma":0.004054166,"domain_scores_codex":[0.9965822,0.000901247,0.0002758582,0.0009878473,0.0008891906,0.0003635999],"domain_scores_gemma":[0.9917263,0.003275013,0.0007231186,0.001929477,0.001634809,0.0007112386],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001447202,0.00113609,0.009201289,0.001198066,0.0002375984,0.0008000667,0.001189056,0.1545352,0.05841273,0.02511346,0.02159364,0.7251356],"study_design_scores_gemma":[0.0001060839,0.000226016,0.0008622737,0.00004154924,0.00004833666,0.0001440187,0.0001348901,0.9341605,0.03320212,0.01009422,0.02092204,0.00005805137],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0195507,0.0002341662,0.9277346,0.0002323541,0.000037165,0.0007013865,0.0002706219,0.04948231,0.001756619],"genre_scores_gemma":[0.2097425,0.0001126632,0.7849005,0.0001728487,0.00002214534,0.0004454643,0.00103327,0.001501471,0.002069079],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008305961,"threshold_uncertainty_score":0.0314008,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1634969110956813,"score_gpt":0.3746252582239727,"score_spread":0.2111283471282914,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}