{"id":"W2780044948","doi":"10.1109/eisic.2017.19","title":"Text Mining in Unclean, Noisy or Scrambled Datasets for Digital Forensics Analytics","year":2017,"lang":"en","type":"article","venue":"","topic":"Algorithms and Data Compression","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Calgary","funders":"","keywords":"Computer science; Punctuation; Preprocessor; String (physics); Digital forensics; Suffix; Mobile device; Data mining; Analytics; Natural language processing; Artificial intelligence; Information retrieval; World Wide Web; Computer security","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002348668,0.00135833,0.001144627,0.01144314,0.001443345,0.002233323,0.001632208,0.002034947,0.001343743],"category_scores_gemma":[0.01269179,0.0003465044,0.00114628,0.008131248,0.0007510043,0.00391572,0.00159728,0.001468844,0.00301971],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005460235,"about_ca_system_score_gemma":0.001095415,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0009872547,"about_ca_topic_score_gemma":0.001676139,"domain_scores_codex":[0.9976942,0.0004562702,0.0004284741,0.0006039175,0.0006713443,0.0001457207],"domain_scores_gemma":[0.9920406,0.003799273,0.001271267,0.001411291,0.001268526,0.0002090139],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001415729,0.001213161,0.03194204,0.002310358,0.0004305659,0.00387063,0.001579443,0.02837022,0.0843583,0.008418539,0.04751189,0.7885791],"study_design_scores_gemma":[0.0001871556,0.0007305016,0.04022482,0.000728517,0.0004960293,0.003739135,0.006506724,0.6684401,0.1290708,0.06790066,0.08175568,0.0002198523],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.3254881,0.005320063,0.5845717,0.004232138,0.0007398954,0.001329509,0.0538292,0.0188061,0.00568325],"genre_scores_gemma":[0.4014413,0.001638483,0.5328238,0.0004917757,0.0005646516,0.0009070843,0.05896231,0.0005475797,0.002623028],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01144314,"threshold_uncertainty_score":0.01242107,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05723131250928121,"score_gpt":0.3220233973309604,"score_spread":0.2647920848216792,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}