{"id":"W2515051907","doi":"10.1145/2960811.2960817","title":"Using a Dictionary and n-gram Alignment to Improve Fine-grained Cross-Language Plagiarism Detection","year":2016,"lang":"en","type":"article","venue":"","topic":"Academic integrity and plagiarism","field":"Social Sciences","cited_by":16,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"University of Waterloo; University of Tehran","keywords":"Computer science; Plagiarism detection; Similarity (geometry); Focus (optics); Cross-language information retrieval; Information retrieval; Natural language processing; Precision and recall; Artificial intelligence; Machine translation; n-gram; Range (aeronautics); Language model","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009757945,0.0001094076,0.0001101551,0.00007886159,0.0005544421,0.0000762442,0.0001190246,0.0005288502,0.0003287534],"category_scores_gemma":[0.0004656015,0.00007700635,0.00004252332,0.0001460159,0.0001841948,0.0002822383,0.00006431561,0.0003111737,0.00005243414],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001861688,"about_ca_system_score_gemma":0.0000687201,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007679531,"about_ca_topic_score_gemma":0.001743668,"domain_scores_codex":[0.9987907,0.0001171478,0.0001816163,0.0002745861,0.0003147229,0.0003212226],"domain_scores_gemma":[0.9993772,0.0002093724,0.00005280304,0.0001059326,0.00006640353,0.0001882791],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001968823,0.00008259667,0.006207808,0.0000175572,0.0000728604,0.00002174726,0.03364842,0.00001042792,0.5372245,0.04926401,0.00212292,0.3711303],"study_design_scores_gemma":[0.006923058,0.001419434,0.03538112,0.0005097644,0.0002512696,0.0001232711,0.05463886,0.004524019,0.3066715,0.08373205,0.5020738,0.003751835],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.881632,0.00007049786,0.08858687,0.004081209,0.0007619931,0.0004401439,0.0000306348,0.0001856021,0.02421109],"genre_scores_gemma":[0.9871922,0.00002506333,0.001590148,0.0005921996,0.0004909119,0.00001533299,0.000001025982,0.000008706318,0.01008438],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4999509,"threshold_uncertainty_score":0.9989284,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01922021491713604,"score_gpt":0.3318187537036996,"score_spread":0.3125985387865635,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}