{"id":"W2899501643","doi":"10.18653/v1/p19-1386","title":"The KnowRef Coreference Corpus: Removing Gender and Number Cues for Difficult Pronominal Anaphora Resolution","year":2019,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":44,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research; Microsoft Research","keywords":"Coreference; Computer science; Antecedent (behavioral psychology); Anaphora (linguistics); Benchmark (surveying); Natural language processing; Artificial intelligence; Task (project management); Context (archaeology); Feature (linguistics); Resolution (logic); Linguistics; Psychology","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004181809,0.001583537,0.001337688,0.004343906,0.003953681,0.001799829,0.002820628,0.003176128,0.007747754],"category_scores_gemma":[0.02010937,0.0006479099,0.0007672533,0.004228852,0.001605551,0.004415453,0.003878044,0.003064511,0.004315852],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009324654,"about_ca_system_score_gemma":0.002030332,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006389229,"about_ca_topic_score_gemma":0.01392089,"domain_scores_codex":[0.9949735,0.002313082,0.0004269766,0.001232588,0.0008328252,0.0002209178],"domain_scores_gemma":[0.9862185,0.007444417,0.0004542908,0.00378853,0.001816843,0.0002773509],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.000995483,0.001081587,0.005904465,0.006975337,0.0003234536,0.001700368,0.005258283,0.01814539,0.04109532,0.01827966,0.4337181,0.4665226],"study_design_scores_gemma":[0.000666298,0.0005593674,0.02434526,0.0008994968,0.0002447513,0.004224721,0.005608339,0.1408864,0.09332953,0.03241239,0.6964645,0.0003590389],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.3871116,0.01729401,0.3371564,0.004954629,0.002434832,0.001786377,0.1544444,0.03851648,0.0563013],"genre_scores_gemma":[0.3459873,0.001915567,0.3134597,0.001182305,0.0004081173,0.002268999,0.3207075,0.004161814,0.009908681],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007747754,"threshold_uncertainty_score":0.02591878,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03347918295935006,"score_gpt":0.2585531899851128,"score_spread":0.2250740070257628,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}