{"id":"W3023215888","doi":"10.18653/v1/2020.acl-main.142","title":"TACRED Revisited: A Thorough Evaluation of the TACRED Relation Extraction Task","year":2020,"lang":"en","type":"preprint","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Bundesministerium für Wirtschaft und Energie; Banting and Best Diabetes Centre, University of Toronto; Bundesministerium für Bildung und Forschung","keywords":"Computer science; Heuristics; Word error rate; Test set; Ceiling (cloud); Task (project management); Artificial intelligence; Machine learning; Categorization; Set (abstract data type); Relation (database); Relationship extraction; Baseline (sea); Test (biology); Natural language processing; Data mining","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001643742,0.0002401859,0.0002897645,0.0001143448,0.0001028251,0.0002053911,0.00162529,0.0003755052,0.00003111511],"category_scores_gemma":[0.0009452464,0.0001704519,0.0001832225,0.0006227431,0.00003887104,0.0005489117,0.001488774,0.000838001,0.000008468329],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002363157,"about_ca_system_score_gemma":0.0003803563,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00009591191,"about_ca_topic_score_gemma":0.000007114606,"domain_scores_codex":[0.9967265,0.0005718003,0.0005314942,0.0006877074,0.001325981,0.0001564878],"domain_scores_gemma":[0.9969194,0.00008608087,0.0008783262,0.001300564,0.0007723515,0.00004328741],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00008179019,0.0002222189,0.0006161479,0.001298655,0.0002621749,0.00001062354,0.006025752,0.002189664,0.1647705,0.2230013,0.02226653,0.5792546],"study_design_scores_gemma":[0.000259084,0.00003939753,0.002607874,0.0006808335,0.0001961675,0.00001548951,0.00002333426,0.4675883,0.05931132,0.4681628,0.0007055575,0.0004098908],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.002111976,0.003491337,0.9837143,0.004429501,0.0006067062,0.001365526,0.000009769641,0.0008126603,0.003458219],"genre_scores_gemma":[0.6499074,0.00003294783,0.3495595,0.0001837384,0.000101932,0.00005958525,0.0000317359,0.00001340183,0.0001097919],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.6477954,"threshold_uncertainty_score":0.6950825,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05276423341358141,"score_gpt":0.3516876449361465,"score_spread":0.2989234115225651,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}