{"id":"W4389519304","doi":"10.18653/v1/2023.crac-sharedtask.5","title":"McGill at CRAC 2023: Multilingual Generalization of Entity-Ranking Coreference Resolution Models","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Canadian Institute for Advanced Research; Nvidia","keywords":"Coreference; Computer science; Task (project management); Ranking (information retrieval); Generalization; Preprocessor; Natural language processing; Artificial intelligence; F1 score; Encoder; Resolution (logic); Machine learning; Information retrieval","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003171452,0.00008938916,0.0001772922,0.0003232877,0.0002250593,0.00006424074,0.0005238953,0.00005418928,0.000656975],"category_scores_gemma":[0.0009912177,0.00007226448,0.00006653438,0.001107922,0.00005910772,0.0005643734,0.0006631873,0.00004592008,0.0007503096],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004349811,"about_ca_system_score_gemma":0.0000151689,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005658884,"about_ca_topic_score_gemma":0.001417143,"domain_scores_codex":[0.9973412,0.0001926641,0.0006111696,0.0004157542,0.001235018,0.0002041605],"domain_scores_gemma":[0.9986,0.0003332355,0.0002028593,0.0005486042,0.000264401,0.00005092369],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001171709,0.0001721524,0.001686047,0.00006314426,0.00004971496,0.00001211305,0.001286352,0.2170698,0.007137246,0.4913048,0.1976222,0.0834792],"study_design_scores_gemma":[0.0004426668,0.00004563653,0.004426344,0.00002588841,0.00001786813,7.829285e-7,0.000824515,0.8003722,0.005609822,0.1217887,0.06623349,0.0002121271],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7405632,0.00004730477,0.2110598,0.0007432348,0.00102848,0.0004569195,0.0004740068,0.0002683724,0.0453587],"genre_scores_gemma":[0.9690009,0.0001079832,0.00224329,0.0002427483,0.0000305662,0.000007809768,0.0001763382,0.00000681448,0.02818349],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5833023,"threshold_uncertainty_score":0.9643962,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4044293887468424,"score_gpt":0.44015659461111,"score_spread":0.03572720586426759,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}