{"id":"W6930199428","doi":"10.5281/zenodo.10153319","title":"Whodunit: Classifying Code as Human Authored or GPT-4 Generated - A case study on CodeChef problems","year":2024,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Wnt/β-catenin signaling in development and cancer","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Classifier (UML); Stylometry; Genetic programming; Source code; Code (set theory); Generative grammar","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001765843,0.001136789,0.0005540861,0.004397476,0.001067561,0.001587905,0.001593086,0.002199715,0.004007495],"category_scores_gemma":[0.01528846,0.0002396917,0.0008032626,0.003504171,0.0009358369,0.00226363,0.001517035,0.001676969,0.003682429],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002798673,"about_ca_system_score_gemma":0.001374462,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02047131,"about_ca_topic_score_gemma":0.04169715,"domain_scores_codex":[0.9969811,0.0005953452,0.0002901885,0.000753813,0.00112823,0.0002513159],"domain_scores_gemma":[0.9903887,0.004655514,0.0007120319,0.001831968,0.001889838,0.0005218973],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"observational","study_design_scores_codex":[0.001014997,0.001048599,0.06872646,0.002092267,0.0001310632,0.001631109,0.001857845,0.01429613,0.004904857,0.006425749,0.6293108,0.2685602],"study_design_scores_gemma":[0.0004701191,0.0008042057,0.1069058,0.0007648242,0.00008301459,0.00387666,0.002986809,0.2487987,0.02400167,0.009922503,0.6011519,0.0002337186],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6724092,0.004957268,0.02270867,0.00397911,0.0009419086,0.001134501,0.2296117,0.02686586,0.03739187],"genre_scores_gemma":[0.4383157,0.001090645,0.0612571,0.001151322,0.0001953659,0.0009232629,0.4769666,0.002298224,0.01780178],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02047131,"threshold_uncertainty_score":0.04070431,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0990945898844975,"score_gpt":0.3311874211369192,"score_spread":0.2320928312524217,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}