{"id":"W4393743078","doi":"10.5281/zenodo.7479227","title":"Dataset for a systematic literature review on source code similarity measurement and clone detection: techniques, applications, and challenges","year":2022,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Software Engineering Research","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Saskatchewan","funders":"","keywords":"Similarity (geometry); Computer science; Code (set theory); Source code; clone (Java method); Information retrieval; Data mining; Programming language; Artificial intelligence; Biology; Genetics; DNA","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.005606061,0.001875354,0.003665396,0.01996318,0.001185703,0.002536525,0.002083437,0.002266389,0.1200738],"category_scores_gemma":[0.05338473,0.0009242213,0.003103274,0.02546451,0.0005916147,0.001837702,0.003381205,0.002139964,0.02090789],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003047626,"about_ca_system_score_gemma":0.01118416,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01205524,"about_ca_topic_score_gemma":0.03208587,"domain_scores_codex":[0.9915598,0.001791336,0.003759818,0.0009570392,0.001462725,0.0004692568],"domain_scores_gemma":[0.955836,0.02784853,0.005981456,0.002364526,0.007061802,0.0009076877],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000914685,0.00009136157,0.002182233,0.2325487,0.001193331,0.0002768492,0.0003771342,0.0006549433,0.0007648254,0.002122087,0.7343456,0.02452825],"study_design_scores_gemma":[0.0024572,0.0001362024,0.01315127,0.05791458,0.001924607,0.0003689,0.0005838724,0.0002228545,0.0006174766,0.002949595,0.9195285,0.0001450254],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.0003018201,0.001187802,0.0001931267,0.0001944125,0.00003537205,0.0003793007,0.9970065,0.0000879975,0.0006137292],"genre_scores_gemma":[0.003433634,0.003371468,0.003523139,0.0007432507,0.0000501328,0.01229543,0.9745945,0.0001338085,0.001854663],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9943939,"threshold_uncertainty_score":0.4016868,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05538046540992728,"score_gpt":0.2685129997402276,"score_spread":0.2131325343303004,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}