{"id":"W2927581056","doi":"10.1007/978-3-030-14799-0_7","title":"Robust Web Data Extraction Based on Unsupervised Visual Validation","year":2019,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Web Data Mining and Analysis","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":false,"ca_institutions":"Université du Québec à Montréal","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Extractor; Robustness (evolution); Artificial intelligence; Data extraction; Information extraction; Information retrieval; Data mining; Machine learning","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002294601,0.0009271901,0.001143031,0.00466042,0.0006127926,0.003290145,0.001994157,0.00122557,0.002702751],"category_scores_gemma":[0.007467305,0.0005963705,0.001470629,0.002455616,0.0009480637,0.002392243,0.002623857,0.001076289,0.003153679],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005264796,"about_ca_system_score_gemma":0.001078906,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002328152,"about_ca_topic_score_gemma":0.002930873,"domain_scores_codex":[0.9972916,0.000449243,0.0001966777,0.0005923219,0.001262323,0.0002077789],"domain_scores_gemma":[0.9935767,0.001989463,0.0004527849,0.001690909,0.002193833,0.00009628054],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003628911,0.0001959343,0.003540768,0.0002515981,0.0001472444,0.0001616146,0.0001212059,0.01606132,0.09394462,0.003980491,0.006829635,0.8744026],"study_design_scores_gemma":[0.00004546901,0.0001109167,0.005607121,0.0000907853,0.00009204679,0.0004762031,0.0001355114,0.8216895,0.1497022,0.01165933,0.01031326,0.000077561],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01493545,0.0002479451,0.9767457,0.00006921817,0.00005778908,0.0001163959,0.0003946301,0.006026827,0.001406178],"genre_scores_gemma":[0.2344297,0.0003011219,0.7552177,0.0001593015,0.00006812705,0.0003138645,0.003198639,0.001578695,0.004732795],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00466042,"threshold_uncertainty_score":0.01213515,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05360116226821633,"score_gpt":0.2863784460066002,"score_spread":0.2327772837383839,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}