{"id":"W2885961833","doi":"10.1177/0165551518787696","title":"Cross-lingual text alignment for fine-grained plagiarism detection","year":2018,"lang":"en","type":"article","venue":"Journal of Information Science","topic":"Topic Modeling","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Institute for Research in Fundamental Sciences; University of Waterloo; University of Tehran","keywords":"Computer science; Plagiarism detection; Similarity (geometry); Natural language processing; Information retrieval; Filter (signal processing); Granularity; Source text; Artificial intelligence; Weighting; Range (aeronautics); Machine translation; Scheme (mathematics); Programming language","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["research_integrity"],"domain":null,"study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["research_integrity"],"consensus_categories":[],"category_scores_codex":[0.002825356,0.001326134,0.001667916,0.01145399,0.002316334,0.002414641,0.001322933,0.001472694,0.004669132],"category_scores_gemma":[0.01340469,0.0006134453,0.001018858,0.00902734,0.0007065483,0.00422277,0.002736796,0.001465665,0.005236231],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007595062,"about_ca_system_score_gemma":0.001638738,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00253159,"about_ca_topic_score_gemma":0.004642366,"domain_scores_codex":[0.9959112,0.001108039,0.0005304851,0.001096457,0.001128907,0.0002249008],"domain_scores_gemma":[0.9910492,0.002885916,0.00147326,0.00200457,0.002288413,0.0002987006],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007254222,0.000307299,0.01518786,0.001227533,0.0003025098,0.0006792598,0.002468579,0.004574118,0.08810363,0.004773357,0.0150793,0.8665711],"study_design_scores_gemma":[0.0002644359,0.001112398,0.08714765,0.0003403479,0.000861663,0.006829501,0.00420775,0.5615447,0.2005441,0.03286862,0.1038586,0.0004201813],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1646197,0.005005793,0.7956952,0.0005226765,0.0002769681,0.0007830434,0.003288967,0.02155316,0.008254449],"genre_scores_gemma":[0.513926,0.001198333,0.4709214,0.0001534469,0.0002370457,0.000445305,0.007149094,0.001116479,0.004852957],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9985273,"threshold_uncertainty_score":0.01561981,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02045516974507706,"score_gpt":0.3085947324421366,"score_spread":0.2881395626970595,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}