{"id":"W2980941473","doi":"10.18653/v1/w19-5351","title":"Linguistic Evaluation of German-English Machine Translation Using a Test Suite","year":2019,"lang":"en","type":"preprint","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Banting and Best Diabetes Centre, University of Toronto; Bundesministerium für Bildung und Forschung","keywords":"German; Valency; Computer science; Punctuation; Linguistics; Natural language processing; Test suite; Verb; Suite; Artificial intelligence; Test (biology); Machine translation; Test case; History","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001553957,0.0002356597,0.0003192154,0.0002847071,0.00003961003,0.0001737101,0.00102653,0.000267999,0.00002633246],"category_scores_gemma":[0.001410875,0.0002152675,0.00010687,0.000266922,0.00002876807,0.0002299887,0.0005242456,0.0004791735,0.000002992368],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001489028,"about_ca_system_score_gemma":0.000432479,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002251008,"about_ca_topic_score_gemma":0.00001924605,"domain_scores_codex":[0.997808,0.0001370411,0.0004512588,0.0005437006,0.0008787379,0.0001812137],"domain_scores_gemma":[0.9963737,0.0002235059,0.000424251,0.0008923185,0.002048976,0.00003730423],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004284536,0.0007875693,0.003463719,0.00559575,0.0002609699,0.00002522094,0.0403433,0.02983998,0.03969026,0.02722823,0.0003773065,0.8523449],"study_design_scores_gemma":[0.0001845692,0.00002344077,0.00006098227,0.0003211497,0.00008598331,0.00000303121,0.000002419381,0.9569545,0.009480849,0.03259258,0.00004440761,0.0002461248],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004517848,0.007323623,0.9821919,0.00006843366,0.000915968,0.0008816243,0.00001925822,0.0006750257,0.003406352],"genre_scores_gemma":[0.5960189,0.000007228798,0.4037609,0.00003642442,0.00009859511,0.00000894914,0.00002878737,0.00001244028,0.0000277635],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9271145,"threshold_uncertainty_score":0.8778355,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05688717792736218,"score_gpt":0.3638439371814072,"score_spread":0.306956759254045,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}