{"id":"W4400221730","doi":"10.48550/arxiv.2406.19896","title":"AuthAttLyzer-V2: Unveiling Code Authorship Attribution using Enhanced Ensemble Learning Models &amp; Generating Benchmark Dataset","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Authorship Attribution and Profiling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Mitacs","keywords":"Benchmark (surveying); Ensemble learning; Code (set theory); Computer science; Artificial intelligence; Attribution; Authorship attribution; Natural language processing; Machine learning; Psychology; Programming language; Geography; Cartography","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.002265611,0.000723319,0.0006692235,0.0005594972,0.0009669932,0.0007516014,0.001891176,0.0008869916,0.00005661062],"category_scores_gemma":[0.0001891474,0.0008888306,0.0003508038,0.001437585,0.0001262364,0.0009017827,0.004898482,0.003059752,0.0002394504],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008395078,"about_ca_system_score_gemma":0.0006743204,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001830939,"about_ca_topic_score_gemma":0.00007836254,"domain_scores_codex":[0.9946409,0.0009411699,0.0006443831,0.002437657,0.0003216253,0.001014211],"domain_scores_gemma":[0.9968316,0.000274846,0.0005990525,0.001539814,0.0003229182,0.0004317547],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002016999,0.00003257126,0.0001068488,0.0002010582,0.00009318675,0.0001072128,0.0007072022,0.8573323,0.004362253,0.1362933,0.0001920611,0.0005518807],"study_design_scores_gemma":[0.0002433911,0.00002832282,0.000007891621,0.0004388528,0.0001428813,0.00001415771,0.00007688938,0.8950588,0.003331409,0.09919009,0.0006204948,0.0008468927],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2427338,0.000332073,0.7538471,0.00008729507,0.001228751,0.0003403247,0.0004133857,0.0006604011,0.0003568111],"genre_scores_gemma":[0.9694781,0.00008771669,0.02621848,0.00008952609,0.0002863627,0.000002870253,0.002622879,0.00005772402,0.001156334],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7276286,"threshold_uncertainty_score":0.9993562,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2650517305723782,"score_gpt":0.2680320229951121,"score_spread":0.002980292422733954,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}