{"id":"W2004782477","doi":"10.1109/hicss.2010.58","title":"An n-Gram Based Approach to Multi-Labeled Web Page Genre Classification","year":2010,"lang":"en","type":"article","venue":"","topic":"Authorship Attribution and Profiling","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"Killam Trusts","keywords":"Computer science; Web page; n-gram; Classifier (UML); Popularity; Artificial intelligence; Support vector machine; Information retrieval; Set (abstract data type); Precision and recall; World Wide Web; Language model","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002129273,0.001095932,0.001161102,0.007614458,0.001641063,0.001731243,0.001104543,0.001747012,0.001844803],"category_scores_gemma":[0.008372516,0.0002518621,0.0009022386,0.004886616,0.0006150397,0.002195948,0.0009506363,0.00150599,0.002415344],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001001582,"about_ca_system_score_gemma":0.001087731,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005460427,"about_ca_topic_score_gemma":0.01152847,"domain_scores_codex":[0.9965785,0.001377104,0.0003149832,0.0004928815,0.001019572,0.0002170095],"domain_scores_gemma":[0.9949304,0.002155203,0.0004643665,0.0006696637,0.00155509,0.000225148],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007767772,0.001075718,0.01363597,0.0002692232,0.0001680516,0.0003792382,0.0006552502,0.01135067,0.02814831,0.004375679,0.01262304,0.9265422],"study_design_scores_gemma":[0.00003888943,0.0002335766,0.01121234,0.00007747294,0.00008335106,0.0006775071,0.0005924013,0.9466376,0.01675832,0.01423382,0.009348034,0.0001066467],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1194035,0.001502817,0.8605697,0.0009955975,0.000526719,0.0007367106,0.002515567,0.006924446,0.006824889],"genre_scores_gemma":[0.3493408,0.0004295352,0.6403479,0.00027571,0.0003283766,0.0004431105,0.003435143,0.0001877206,0.005211684],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007614458,"threshold_uncertainty_score":0.01126081,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07747908222797885,"score_gpt":0.3240996072120708,"score_spread":0.246620524984092,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}