{"id":"W4366549844","doi":"10.1145/3544548.3581271","title":"Dirty Data in the Newsroom: Comparing Data Preparation in Journalism and Data Science","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Visualization and Analytics","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Workflow; Computer science; Data science; Context (archaeology); Big data; Thematic analysis; Data modeling; Journalism; Information retrieval; Data mining; Qualitative research; Database; Sociology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1142609,0.0004810122,0.000776741,0.01161155,0.01255125,0.01996895,0.002694709,0.00250785,0.002014108],"category_scores_gemma":[0.3489255,0.001187242,0.0008252881,0.01404218,0.02745814,0.02417577,0.01807449,0.004730084,0.0003296765],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01094494,"about_ca_system_score_gemma":0.01183116,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00610741,"about_ca_topic_score_gemma":0.006670935,"domain_scores_codex":[0.8470829,0.1206854,0.007816026,0.004949961,0.0148159,0.004649721],"domain_scores_gemma":[0.4977778,0.4103688,0.04216093,0.01888316,0.02342467,0.007384659],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0002080723,0.00007447763,0.02694152,0.0004548854,0.00002259877,0.000212187,0.9342729,0.00009801297,0.0005774769,0.01994167,0.0006831906,0.01651299],"study_design_scores_gemma":[0.00002786876,0.00008786545,0.02009134,0.0005201023,0.00002528118,0.0002447306,0.9491666,0.0006759061,0.0008008076,0.01501814,0.01328655,0.00005485281],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9285364,0.001319146,0.03142127,0.007869188,0.0003049513,0.0007512746,0.0002480826,0.0001114762,0.0294382],"genre_scores_gemma":[0.9856706,0.0005172413,0.011178,0.0008585065,0.00006960375,0.0005727644,0.0001880085,0.0001262463,0.00081907],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1142609,"threshold_uncertainty_score":0.6042764,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2672447097259812,"score_gpt":0.4532393490338437,"score_spread":0.1859946393078625,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}