{"id":"W4386466998","doi":"10.23889/ijpds.v6i1.1757","title":"A scoping review of preprocessing methods for unstructured text data to assess data quality.","year":2022,"lang":"en","type":"review","venue":"PubMed","topic":"Biomedical Text Mining and Ontologies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Manitoba; George & Fay Yee Centre for Healthcare Innovation; Manitoba Health","funders":"Canada Research Chairs","keywords":"Computer science; Preprocessor; Punctuation; Stop words; Data quality; Data pre-processing; Information retrieval; Lexical analysis; Natural language processing; Artificial intelligence; Data mining","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3251268,0.00384566,0.01104639,0.05858688,0.005064684,0.01305001,0.007522121,0.006554489,0.00848936],"category_scores_gemma":[0.5852748,0.00382527,0.01416049,0.04518956,0.006576534,0.01167418,0.009601528,0.004953821,0.002451197],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01844604,"about_ca_system_score_gemma":0.07373671,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01017957,"about_ca_topic_score_gemma":0.01843218,"domain_scores_codex":[0.6791096,0.1343331,0.1303153,0.00815331,0.04643526,0.00165344],"domain_scores_gemma":[0.2846391,0.513486,0.07404356,0.01778963,0.1079821,0.002059633],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","study_design_scores_codex":[0.0002484309,0.00005306979,0.001420572,0.7597259,0.002903338,0.0001751641,0.002945043,0.0003129449,0.0004681725,0.002747273,0.01076447,0.2182356],"study_design_scores_gemma":[0.00007535446,0.0000927323,0.001194915,0.9540827,0.003774512,0.000158369,0.0008207847,0.0001644844,0.000406351,0.001627077,0.03753997,0.00006263844],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.00159219,0.9367198,0.02041633,0.007063176,0.002319143,0.02488645,0.003143965,0.0002512823,0.003607614],"genre_scores_gemma":[0.01511483,0.8142836,0.07543863,0.003519455,0.0007032015,0.0859601,0.00372867,0.0002208503,0.001030628],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.6748732,"threshold_uncertainty_score":0.8322389,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.6516293020376296,"score_gpt":0.5791308034657566,"score_spread":0.07249849857187296,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}