{"id":"W3011592252","doi":"10.14778/3236187.3236199","title":"Efficient construction of approximate ad-hoc ML models through materialization and reuse","year":2018,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Management and Algorithms","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Online analytical processing; Reuse; Dimension (graph theory); Cluster analysis; Variety (cybernetics); Data warehouse; Data mining; Construct (python library); Mixture model; Machine learning; Artificial intelligence; Mathematics; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005820089,0.002239894,0.0026906,0.002072199,0.001352458,0.004736695,0.004772128,0.002010555,0.003478918],"category_scores_gemma":[0.02814713,0.001900309,0.003330502,0.003361834,0.002338055,0.00886617,0.007094474,0.003888268,0.001700565],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00276346,"about_ca_system_score_gemma":0.003867926,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009648849,"about_ca_topic_score_gemma":0.01222227,"domain_scores_codex":[0.9941534,0.001990157,0.0004469168,0.001042756,0.001848381,0.0005183237],"domain_scores_gemma":[0.9811611,0.01048174,0.001044312,0.005667471,0.001261922,0.0003835097],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001844845,0.0002067581,0.002581585,0.0001338083,0.0001187136,0.0002194178,0.0003984245,0.8080758,0.002749464,0.03882231,0.004327176,0.1421821],"study_design_scores_gemma":[0.00001323061,0.00001956592,0.0000602112,0.000004352838,0.00001115777,0.00002889935,0.00005403761,0.9783036,0.001054648,0.01961759,0.0008241465,0.000008479864],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01480209,0.0001400397,0.9811152,0.0002788879,0.00001375053,0.00009025913,0.0001477287,0.002600904,0.0008110786],"genre_scores_gemma":[0.2331043,0.0002091332,0.7622724,0.0002355616,0.00006519612,0.0002665839,0.001310746,0.0008793594,0.001656732],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009648849,"threshold_uncertainty_score":0.03077996,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0167162247919843,"score_gpt":0.2200566624691846,"score_spread":0.2033404376772003,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}