{"id":"W4287671863","doi":"10.48550/arxiv.2009.02373","title":"Table Scraps: An Actionable Framework for Multi-Table Data Wrangling\\n From An Artifact Study of Computational Journalism","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Visualization and Analytics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Parallels; Table (database); Artifact (error); Context (archaeology); Journalism; Data science; Task (project management); Code (set theory); Set (abstract data type); Data mining; Artificial intelligence; Engineering; Political science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003771994,0.0002728332,0.0004373953,0.0002111547,0.0002797737,0.0004116172,0.003657414,0.0001985649,0.00007556313],"category_scores_gemma":[0.0001436352,0.0003233767,0.0000734281,0.0007455655,0.00005311101,0.002035466,0.002042017,0.0004536558,0.00001252427],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006084731,"about_ca_system_score_gemma":0.0003568176,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007069565,"about_ca_topic_score_gemma":0.0001429131,"domain_scores_codex":[0.997568,0.0001958947,0.0003859375,0.001369931,0.0002184383,0.0002618365],"domain_scores_gemma":[0.9966143,0.000183453,0.0005599309,0.001894315,0.0004667349,0.0002812698],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0000614338,0.001938699,0.002815099,0.00005562073,0.0003182201,0.00006396146,0.001080557,0.9156543,0.00001736727,0.07704677,0.0006692265,0.000278755],"study_design_scores_gemma":[0.0009148656,0.000173393,0.0004981479,0.00006029715,0.0001314467,9.202611e-7,0.0009329614,0.9321942,0.00003328999,0.06398997,0.0007600455,0.0003104444],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06068041,0.00001754672,0.9371791,0.00008119235,0.0004076338,0.000409216,0.001058991,0.000133038,0.00003282503],"genre_scores_gemma":[0.8619446,0.00002363461,0.1350723,0.0001824546,0.0001514264,0.000001119129,0.002430883,0.00002622123,0.0001673898],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8021069,"threshold_uncertainty_score":0.9999219,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2921002124729303,"score_gpt":0.3206074615157642,"score_spread":0.02850724904283392,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}