{"id":"W4416655590","doi":"10.1080/0907676x.2025.2590066","title":"Measuring lexical distance between parallel corpora: the case of AI-generated news translation","year":2025,"lang":"en","type":"article","venue":"Perspectives","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"Institut de Valorisation des Données; Canada First Research Excellence Fund","keywords":"Translation (biology); Machine translation; Feature (linguistics); Measure (data warehouse); Lexical item","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01134554,0.0006622268,0.001064138,0.005968092,0.002436602,0.004415732,0.001732622,0.001664628,0.001737993],"category_scores_gemma":[0.08774677,0.0006415781,0.0006030032,0.01230158,0.003048704,0.006528333,0.002978256,0.001475488,0.0009284852],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001954848,"about_ca_system_score_gemma":0.001358688,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004200558,"about_ca_topic_score_gemma":0.004405372,"domain_scores_codex":[0.9803541,0.01067685,0.001654633,0.002490285,0.004410608,0.0004136068],"domain_scores_gemma":[0.9194137,0.05654335,0.004874115,0.009062611,0.009583557,0.0005226845],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001687084,0.0006986132,0.05346472,0.002185561,0.0004923634,0.00635165,0.02689481,0.06140768,0.02430988,0.1385339,0.006618479,0.6773553],"study_design_scores_gemma":[0.000269344,0.0008687706,0.0565008,0.0005592681,0.0003544014,0.006189988,0.01950567,0.5627391,0.0593121,0.2315465,0.06178907,0.0003649229],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5671891,0.002989261,0.4018571,0.001824071,0.0002864752,0.0005834682,0.001123624,0.0009151915,0.02323167],"genre_scores_gemma":[0.665984,0.0005075326,0.3289727,0.0001049863,0.0001018236,0.0003426797,0.00151753,0.0002865291,0.002182072],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01134554,"threshold_uncertainty_score":0.06000173,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04217812593225261,"score_gpt":0.3094155154243002,"score_spread":0.2672373894920476,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}