{"id":"W2152061679","doi":"10.1145/1321211.1321246","title":"Removing manually generated boilerplate from electronic texts","year":2007,"lang":"en","type":"article","venue":"Proceedings of CASCON","topic":"Software Engineering Research","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université du Québec à Montréal; University of New Brunswick","funders":"","keywords":"Computer science; Boilerplate text; Metadata; Parsing; Template; Information retrieval; ASCII; World Wide Web; Natural language processing; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006007814,0.002044185,0.002030993,0.009767527,0.001878892,0.003612294,0.00207752,0.001718472,0.01001026],"category_scores_gemma":[0.0493256,0.0018735,0.001591039,0.009082248,0.001852483,0.003251555,0.003714885,0.002720064,0.01749408],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001421164,"about_ca_system_score_gemma":0.003596561,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004627495,"about_ca_topic_score_gemma":0.006557422,"domain_scores_codex":[0.9905324,0.00210504,0.001358498,0.002416778,0.003233939,0.000353269],"domain_scores_gemma":[0.9283932,0.03170477,0.002947759,0.02168307,0.01474188,0.0005293427],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000707271,0.0003482267,0.01194908,0.002952424,0.0001815809,0.002870661,0.004639418,0.004947,0.06409403,0.0096029,0.1059959,0.7917114],"study_design_scores_gemma":[0.0002214885,0.0003113653,0.03059706,0.0008575229,0.0004284939,0.004376694,0.003277116,0.08708426,0.2805083,0.02131157,0.5706049,0.000421232],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1288483,0.001590005,0.7484623,0.001712418,0.00279112,0.002234496,0.02962325,0.06893142,0.01580662],"genre_scores_gemma":[0.1172192,0.0006290168,0.7892835,0.0005907996,0.0004087764,0.001340675,0.0589736,0.01370677,0.01784763],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01001026,"threshold_uncertainty_score":0.03348768,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.008669633716138785,"score_gpt":0.244718544950474,"score_spread":0.2360489112343352,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}