{"id":"W1969795835","doi":"10.1145/1227310.1227324","title":"Plagiarism detection using feature-based neural networks","year":2007,"lang":"en","type":"article","venue":"","topic":"Academic integrity and plagiarism","field":"Social Sciences","cited_by":75,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Plagiarism detection; Computer science; Feature (linguistics); Relevance (law); Detector; Artificial neural network; Similarity (geometry); Artificial intelligence; Feature engineering; Code (set theory); Similarity measure; Feature extraction; Measure (data warehouse); Pattern recognition (psychology); Machine learning; Data mining; Deep learning; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["research_integrity"],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"bench_or_experimental","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["research_integrity"],"consensus_categories":[],"category_scores_codex":[0.001961451,0.0007868564,0.0008402022,0.004979164,0.0006074671,0.001259833,0.001090191,0.0009814056,0.001408034],"category_scores_gemma":[0.01069985,0.0002590612,0.0004705465,0.001884108,0.0004417742,0.001603305,0.0007065732,0.0008958417,0.0007481082],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001068538,"about_ca_system_score_gemma":0.0006270118,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004988308,"about_ca_topic_score_gemma":0.005852296,"domain_scores_codex":[0.9986155,0.0003094417,0.0001286031,0.0003422047,0.0004901281,0.000114178],"domain_scores_gemma":[0.9903554,0.004380316,0.001733387,0.0005655944,0.002743518,0.00022191],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0005481282,0.0004708003,0.02545963,0.0002231776,0.0001793884,0.0001491489,0.0001910644,0.03701305,0.02542388,0.0008718544,0.003513384,0.9059566],"study_design_scores_gemma":[0.00003497647,0.0001727805,0.01803422,0.0000376995,0.0000642781,0.0001404004,0.00006238531,0.9539017,0.02390533,0.002450133,0.001146429,0.00004960645],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4857149,0.001079698,0.4955466,0.0006311759,0.000136863,0.0003745229,0.0008878481,0.009769527,0.005858845],"genre_scores_gemma":[0.8862064,0.0001767892,0.110641,0.00006648996,0.00006109917,0.0001267499,0.0006239483,0.00006459498,0.002033039],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9990186,"threshold_uncertainty_score":0.01037329,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02383288585388381,"score_gpt":0.3070886043220694,"score_spread":0.2832557184681856,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}