{"id":"W7107956285","doi":"10.5683/sp3/mfztwz","title":"Replication data for: Measuring Lexical Distance between Parallel Corpora: The Case of AI-Generated News Translation","year":2025,"lang":"","type":"dataset","venue":"Borealis","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"","keywords":"Code (set theory); Replication (statistics); Distance measures; Measure (data warehouse); Histogram; Translation (biology); Statistical analysis","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00561072,0.00217381,0.001142159,0.003850477,0.00173089,0.002782028,0.002625181,0.001940016,0.02865134],"category_scores_gemma":[0.02848293,0.0006398436,0.001388422,0.005053602,0.001300882,0.00177591,0.002728219,0.002078537,0.05690517],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001524631,"about_ca_system_score_gemma":0.002070334,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01764715,"about_ca_topic_score_gemma":0.03371215,"domain_scores_codex":[0.9931369,0.002011986,0.0009371036,0.001695444,0.001834375,0.0003842962],"domain_scores_gemma":[0.9800456,0.005234746,0.001019708,0.008282373,0.004734401,0.0006831157],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0004172612,0.0001765048,0.00285185,0.0009065581,0.00009451602,0.0001712308,0.000271765,0.001052349,0.001556271,0.001402541,0.9662584,0.02484084],"study_design_scores_gemma":[0.001044105,0.0002055662,0.02568766,0.0003409334,0.0001335224,0.0006698727,0.0008349236,0.009419502,0.01010955,0.004558907,0.9468133,0.0001821129],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.007994636,0.0003055677,0.004098513,0.0004684797,0.0003544507,0.0002827266,0.9718997,0.007584787,0.007011063],"genre_scores_gemma":[0.00759725,0.00004915896,0.00697676,0.00007723043,0.0000434241,0.0004932026,0.9823513,0.0005828492,0.00182877],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.02865134,"threshold_uncertainty_score":0.09584826,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1759319550522254,"score_gpt":0.3642493565269515,"score_spread":0.1883174014747261,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}