{"id":"W3023215888","doi":"10.18653/v1/2020.acl-main.142","title":"TACRED Revisited: A Thorough Evaluation of the TACRED Relation Extraction Task","year":2020,"lang":"en","type":"preprint","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Bundesministerium für Wirtschaft und Energie; Banting and Best Diabetes Centre, University of Toronto; Bundesministerium für Bildung und Forschung","keywords":"Computer science; Heuristics; Word error rate; Test set; Ceiling (cloud); Task (project management); Artificial intelligence; Machine learning; Categorization; Set (abstract data type); Relation (database); Relationship extraction; Baseline (sea); Test (biology); Natural language processing; Data mining","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01420248,0.004886067,0.002120035,0.003938848,0.001978572,0.003217067,0.005447582,0.004031656,0.009481296],"category_scores_gemma":[0.03005211,0.0009468564,0.002236223,0.002971274,0.001446634,0.007945906,0.003820609,0.004321498,0.008641817],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002083413,"about_ca_system_score_gemma":0.001739743,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01526503,"about_ca_topic_score_gemma":0.02510771,"domain_scores_codex":[0.9885364,0.004880492,0.000886531,0.003127967,0.001983734,0.0005848597],"domain_scores_gemma":[0.9794562,0.009406908,0.0006098997,0.007058987,0.002871224,0.0005966669],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002678733,0.002004984,0.009012975,0.005299394,0.001685611,0.001836288,0.001425618,0.07022765,0.02459571,0.004246465,0.2370196,0.6399668],"study_design_scores_gemma":[0.0006738497,0.002349499,0.0202579,0.001100241,0.0008620145,0.004723191,0.002741831,0.6517718,0.07523753,0.01194448,0.2278597,0.0004779383],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4395274,0.02829167,0.2704554,0.004628534,0.004119349,0.002477147,0.05732064,0.1232626,0.06991725],"genre_scores_gemma":[0.5151126,0.003028265,0.2614387,0.003100016,0.0004901235,0.000833707,0.1701609,0.009430806,0.03640489],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01526503,"threshold_uncertainty_score":0.07511079,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05276423341358141,"score_gpt":0.3516876449361465,"score_spread":0.2989234115225651,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}