{"id":"W3061846580","doi":"10.48550/arxiv.2008.07680","title":"An Annotated Corpus of Webtables for Information Extraction Tasks","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Information retrieval; Annotation; Relationship extraction; Paragraph; Information extraction; Natural language processing; Task (project management); Benchmark (surveying); Table (database); Sentence; Artificial intelligence; Context (archaeology); Data mining; World Wide Web","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0001579781,0.000156954,0.0002155499,0.000195342,0.00007088586,0.00008475284,0.0009498437,0.0001843639,0.00000431334],"category_scores_gemma":[0.00003616719,0.0001940198,0.0001008777,0.0002933612,0.00002836853,0.001489617,0.0003744343,0.000226726,0.000009843145],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008830971,"about_ca_system_score_gemma":0.0001701908,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001674888,"about_ca_topic_score_gemma":0.00001418176,"domain_scores_codex":[0.9990339,0.00004988921,0.0002409406,0.0004372241,0.00007339293,0.0001645957],"domain_scores_gemma":[0.9985089,0.0000531332,0.000394869,0.0006786441,0.0002678938,0.00009653316],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007035618,0.00005830378,0.0006063635,0.0002607827,0.00005252942,0.00001323033,0.0007361753,0.7642668,0.000886971,0.2240962,0.0001415038,0.008810809],"study_design_scores_gemma":[0.0003305473,0.00006871114,0.0004335224,0.00003555684,0.00002875874,0.000001401073,0.00007059664,0.9742252,0.0009241819,0.02271492,0.0009788598,0.0001877887],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1246647,0.000009926206,0.8738919,0.00007270066,0.0004185747,0.0003132348,0.00003355373,0.0001700506,0.0004252749],"genre_scores_gemma":[0.9821651,0.00002959005,0.01756531,0.0000612097,0.00004252221,0.000001285037,0.00007842941,0.000006350446,0.00005017101],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8575004,"threshold_uncertainty_score":0.7911897,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09069754288968365,"score_gpt":0.2105369483483559,"score_spread":0.1198394054586722,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}