{"id":"W2407195633","doi":"","title":"A Statistical Model for Measuring Structural Similarity between Webpages","year":2015,"lang":"en","type":"article","venue":"Recent Advances in Natural Language Processing","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Similarity (geometry); Computer science; Web page; Statistical model; Task (project management); Measure (data warehouse); Artificial intelligence; Structural similarity; Information retrieval; Natural language processing; Data mining; Image (mathematics); World Wide Web","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002785242,0.0007924805,0.0009879731,0.004417133,0.0005316645,0.001381917,0.001810478,0.001536042,0.001905782],"category_scores_gemma":[0.01403848,0.000605488,0.001373427,0.002715086,0.001269836,0.003756871,0.0009085711,0.001592238,0.002039571],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001092542,"about_ca_system_score_gemma":0.00122287,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003529934,"about_ca_topic_score_gemma":0.003101707,"domain_scores_codex":[0.99773,0.0006042411,0.0001458847,0.0006109598,0.000779711,0.0001291879],"domain_scores_gemma":[0.9927382,0.003832511,0.001118814,0.0009972011,0.001136069,0.0001772135],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005636811,0.0008825797,0.04529995,0.000443891,0.0006585313,0.0008334274,0.0007293574,0.5388482,0.04520677,0.1242035,0.007738075,0.234592],"study_design_scores_gemma":[0.00001040139,0.00009926474,0.005682963,0.00001379365,0.00004124791,0.0002543211,0.00003330246,0.9596612,0.001951214,0.03100012,0.001216012,0.0000360574],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04989413,0.0001872014,0.9462584,0.0002361756,0.00003386753,0.0001148222,0.0006827622,0.00103252,0.001560199],"genre_scores_gemma":[0.7521824,0.0004626511,0.2375225,0.0003341252,0.0002002026,0.0009045416,0.003299981,0.0003433567,0.004750206],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004417133,"threshold_uncertainty_score":0.01472992,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03928171059953837,"score_gpt":0.3505640517397068,"score_spread":0.3112823411401684,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}