{"id":"W4389519304","doi":"10.18653/v1/2023.crac-sharedtask.5","title":"McGill at CRAC 2023: Multilingual Generalization of Entity-Ranking Coreference Resolution Models","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Canadian Institute for Advanced Research; Nvidia","keywords":"Coreference; Computer science; Task (project management); Ranking (information retrieval); Generalization; Preprocessor; Natural language processing; Artificial intelligence; F1 score; Encoder; Resolution (logic); Machine learning; Information retrieval","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01540488,0.006824624,0.003274566,0.003010191,0.003094965,0.004226867,0.009665418,0.006553987,0.03001189],"category_scores_gemma":[0.02635426,0.002139193,0.003946576,0.003621006,0.001394849,0.005144678,0.007665102,0.00856001,0.0220465],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004145322,"about_ca_system_score_gemma":0.006577379,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.1114674,"about_ca_topic_score_gemma":0.1895595,"domain_scores_codex":[0.9901337,0.004401378,0.0003097375,0.002938853,0.001371812,0.000844545],"domain_scores_gemma":[0.9870685,0.003805466,0.0002574265,0.00557878,0.00236396,0.0009257721],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001235855,0.0006646479,0.001479454,0.0008694773,0.0008497255,0.0004645551,0.0001687994,0.03254237,0.007621952,0.002577978,0.7826648,0.1688604],"study_design_scores_gemma":[0.002751403,0.00153167,0.007596069,0.0004684094,0.0006873088,0.001162146,0.0004856739,0.6700093,0.03651227,0.02222231,0.2557452,0.0008281691],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1177034,0.01353913,0.3385423,0.009660493,0.01053398,0.004008729,0.2600748,0.199494,0.04644308],"genre_scores_gemma":[0.1897508,0.00125093,0.2484793,0.00320047,0.0008169151,0.002772975,0.5025365,0.01017835,0.04101375],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.1114674,"threshold_uncertainty_score":0.2216372,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4044293887468424,"score_gpt":0.44015659461111,"score_spread":0.03572720586426759,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}