{"id":"W2950281387","doi":"10.48550/arxiv.1307.8060","title":"Extracting Information-rich Part of Texts using Text Denoising","year":2013,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Advanced Text Analysis Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Western University","funders":"","keywords":"Readability; Computer science; Search engine indexing; Set (abstract data type); Text processing; Information retrieval; Relation (database); Noise reduction; Natural language processing; Artificial intelligence; Domain (mathematical analysis); Rest (music); Information extraction; Data mining; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0002963039,0.0003131187,0.0004422423,0.0006243793,0.0001765572,0.0001849944,0.001751882,0.0002738422,0.00003994174],"category_scores_gemma":[0.000106169,0.0003696821,0.0002148814,0.0009659148,0.00009879383,0.003123777,0.002107553,0.000541381,0.00005830245],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002751447,"about_ca_system_score_gemma":0.0001929021,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000235412,"about_ca_topic_score_gemma":0.00001138479,"domain_scores_codex":[0.9982975,0.00009991444,0.000484403,0.0006069484,0.0001638886,0.0003473358],"domain_scores_gemma":[0.9968199,0.0001548477,0.001092394,0.001346501,0.000472345,0.0001140773],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001435325,0.0001641791,0.008272204,0.0003377749,0.0003472231,0.00008424872,0.001332001,0.7590559,0.001303612,0.2019471,0.00040806,0.02673334],"study_design_scores_gemma":[0.000243776,0.00002911374,0.0005138429,0.0003796814,0.0001533783,0.0000101396,0.0001869355,0.9132751,0.00473957,0.07841587,0.001267443,0.0007851319],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2794711,0.00004033977,0.7184516,0.00001452598,0.0001380551,0.0001931915,0.000003041132,0.0002387824,0.00144928],"genre_scores_gemma":[0.9292099,0.00006687938,0.07044008,0.000039935,0.00003864995,7.827849e-7,0.000008555769,0.00001322735,0.0001819338],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.6497388,"threshold_uncertainty_score":0.9998755,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07351421345146757,"score_gpt":0.2180698850273546,"score_spread":0.144555671575887,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}