{"id":"W1726342440","doi":"","title":"Identifying Parallel Documents from a Large Bilingual Collection of Texts: Application to Parallel Article Extraction in Wikipedia.","year":2011,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":26,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Parallel corpora; Baseline (sea); Natural language processing; Relation (database); Machine translation; Information retrieval; Artificial intelligence; Relationship extraction; Resource (disambiguation); Order (exchange); Bilingual dictionary; Information extraction; Data mining","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003397388,0.000111162,0.0001434552,0.0002308336,0.00005873483,0.0000579201,0.0004420322,0.00008504716,0.0000379632],"category_scores_gemma":[0.000066491,0.0001048486,0.0000337057,0.0007604982,0.000013393,0.0008946902,0.000164423,0.0001282691,0.00003438652],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008633865,"about_ca_system_score_gemma":0.00004788127,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002552941,"about_ca_topic_score_gemma":0.001018069,"domain_scores_codex":[0.9987459,0.00005159985,0.0003528144,0.000387536,0.0002383117,0.0002238701],"domain_scores_gemma":[0.9992883,0.00004340295,0.0001464972,0.0003694698,0.00008923742,0.0000631311],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0006032377,0.002886461,0.1090921,0.0001441426,0.00008738848,0.0000581755,0.04751596,0.0001566574,0.4960136,0.1464823,0.002062063,0.1948979],"study_design_scores_gemma":[0.001921884,0.0002796406,0.06403602,0.0001714246,0.00002425972,0.00001427396,0.0007136736,0.06237179,0.5130939,0.3562331,0.0003875492,0.000752488],"study_design_candidate":"bench_or_experimental","study_design_consensus":"bench_or_experimental","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1525806,0.0001812202,0.8459975,0.00007127839,0.00008190353,0.0003276232,0.000001190787,0.0002581502,0.0005005487],"genre_scores_gemma":[0.554512,0.000006436995,0.4452387,0.00007724509,0.00001505407,0.00004382966,0.000002159539,0.000004872973,0.00009976299],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.4019314,"threshold_uncertainty_score":0.4275602,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02187158583543474,"score_gpt":0.3141396691065393,"score_spread":0.2922680832711045,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}