{"id":"W4400221730","doi":"10.48550/arxiv.2406.19896","title":"AuthAttLyzer-V2: Unveiling Code Authorship Attribution using Enhanced Ensemble Learning Models &amp; Generating Benchmark Dataset","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Authorship Attribution and Profiling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Mitacs","keywords":"Benchmark (surveying); Ensemble learning; Code (set theory); Computer science; Artificial intelligence; Attribution; Authorship attribution; Natural language processing; Machine learning; Psychology; Programming language; Geography; Cartography","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003517768,0.002338056,0.0008316783,0.00581938,0.001187397,0.00153537,0.002288869,0.00196054,0.001940669],"category_scores_gemma":[0.008554515,0.0003906739,0.001422259,0.003219719,0.0007807222,0.001685284,0.001978613,0.002147782,0.002803279],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001223952,"about_ca_system_score_gemma":0.001443843,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0149972,"about_ca_topic_score_gemma":0.02803744,"domain_scores_codex":[0.9976162,0.0005633059,0.0001835872,0.0007183675,0.0006526675,0.0002658562],"domain_scores_gemma":[0.994229,0.001757688,0.0003506788,0.001880237,0.001479881,0.0003025183],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001079588,0.00212084,0.07938714,0.001206877,0.0008016431,0.0009461124,0.0006324613,0.1142239,0.01130722,0.003330287,0.3953514,0.3896125],"study_design_scores_gemma":[0.0003929101,0.0009488958,0.04500037,0.0001810818,0.0001831566,0.0009911063,0.0005817958,0.8214661,0.03039876,0.006220436,0.09347422,0.0001612082],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.6872849,0.003487567,0.07221731,0.001538321,0.001578393,0.001114277,0.1699565,0.05077553,0.01204715],"genre_scores_gemma":[0.4179807,0.0005583387,0.1128111,0.000373178,0.0002129023,0.0007774026,0.4560919,0.001444984,0.009749456],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.0149972,"threshold_uncertainty_score":0.02981985,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2650517305723782,"score_gpt":0.2680320229951121,"score_spread":0.002980292422733954,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}