{"id":"W2080132606","doi":"10.14778/1938545.1938547","title":"Automatic wrappers for large scale web extraction","year":2011,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Web Data Mining and Analysis","field":"Computer Science","cited_by":135,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Noise (video); Scale (ratio); Noisy data; Extraction (chemistry); Data extraction; Data mining; Information extraction; Training set; Artificial intelligence; Machine learning; Information retrieval; Pattern recognition (psychology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002602196,0.001668507,0.001613682,0.004270602,0.001297967,0.002185107,0.001884611,0.001476621,0.003021597],"category_scores_gemma":[0.01139046,0.001200313,0.001828758,0.004085403,0.0008858842,0.004344186,0.003520199,0.002041779,0.006799802],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004966936,"about_ca_system_score_gemma":0.001346164,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000926681,"about_ca_topic_score_gemma":0.001707474,"domain_scores_codex":[0.9972093,0.0006067707,0.0004008726,0.0007326978,0.0008799857,0.0001704273],"domain_scores_gemma":[0.992426,0.001960974,0.000627239,0.003818888,0.00102461,0.0001421712],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0002291385,0.0003347528,0.005182769,0.000811688,0.0003316313,0.0008256119,0.0005330854,0.02544559,0.04993481,0.01702368,0.04627993,0.8530673],"study_design_scores_gemma":[0.00006642007,0.000129073,0.003284306,0.0002080914,0.0002187438,0.001336194,0.000190671,0.6150351,0.2012489,0.09832586,0.07982334,0.0001333824],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003154902,0.0001929454,0.9661502,0.00007452469,0.00003154033,0.00009006762,0.0007244122,0.02909285,0.000488524],"genre_scores_gemma":[0.04740198,0.0002877382,0.9415964,0.0001583595,0.00006681975,0.0001996986,0.005358897,0.003137903,0.00179219],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004270602,"threshold_uncertainty_score":0.01376188,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02415002081639386,"score_gpt":0.2448207655012949,"score_spread":0.2206707446849011,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}