{"id":"W2767748721","doi":"10.48550/arxiv.1711.02149","title":"Detecting Disguised Plagiarism","year":2017,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Academic integrity and plagiarism","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Plagiarism detection; Computer science; Source code; Preprocessor; Set (abstract data type); Code (set theory); Programming language; Information retrieval; Software engineering; Natural language processing","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["research_integrity"],"domain":null,"study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["research_integrity"],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.006170237,0.0009254364,0.0008868952,0.008186621,0.001439118,0.002528541,0.001793213,0.001664132,0.003238916],"category_scores_gemma":[0.08602493,0.0006386026,0.0006599639,0.004047991,0.002236128,0.004144145,0.002713502,0.002273147,0.001801114],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001112749,"about_ca_system_score_gemma":0.001797772,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001307244,"about_ca_topic_score_gemma":0.002131358,"domain_scores_codex":[0.9900232,0.001863372,0.000817468,0.002016272,0.00488663,0.0003930333],"domain_scores_gemma":[0.9097503,0.03041842,0.01794897,0.0208848,0.01968441,0.001312985],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0009365402,0.0003843914,0.1340556,0.002112957,0.0003754849,0.002005103,0.008137936,0.007111436,0.1493504,0.0366072,0.01909893,0.639824],"study_design_scores_gemma":[0.0001566784,0.001149788,0.1494172,0.0007813344,0.0004763773,0.005489963,0.002878696,0.1777373,0.4881725,0.0736988,0.09955671,0.0004845746],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.4806615,0.00152212,0.4715161,0.001891906,0.0003311067,0.0009606516,0.00218234,0.02540431,0.01552991],"genre_scores_gemma":[0.746062,0.0004201227,0.2439342,0.0002950494,0.0001178017,0.0002392188,0.002037906,0.001939244,0.004954444],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9983359,"threshold_uncertainty_score":0.03263175,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1066676674268585,"score_gpt":0.2394823423565825,"score_spread":0.132814674929724,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}