{"id":"W6950269185","doi":"10.5281/zenodo.6977583","title":"NatGen: Generative pre-training by \"Naturalizing\" source code","year":2022,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Radioactive contamination and transfer","field":"Environmental Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Discovery Air (Canada)","funders":"","keywords":"Source code; Code (set theory); Generative grammar; Natural language; Generative model; Code generation; KPI-driven code analysis; Software","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0003373971,0.0002309013,0.000188546,0.00014605,0.001615548,0.000308587,0.0009605639,0.0001132113,0.5493262],"category_scores_gemma":[0.0001127803,0.0002480189,0.00006582384,0.0003892277,0.0002489373,0.000131573,0.0008163675,0.000471869,0.008457375],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004116678,"about_ca_system_score_gemma":0.000002175429,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007448273,"about_ca_topic_score_gemma":0.000005115282,"domain_scores_codex":[0.9978639,0.0004226917,0.0001816317,0.0006041387,0.0005759635,0.0003515973],"domain_scores_gemma":[0.999319,0.000016065,0.000117577,0.0003547622,0.00003213722,0.0001605294],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00001319547,0.00005681788,0.000003890314,0.00001223296,0.00005254774,0.000006603498,0.001794106,0.00005432028,0.001964381,0.0002439878,0.9315211,0.06427678],"study_design_scores_gemma":[0.0003414052,0.00009711274,0.000114478,0.00001220553,0.00001637096,0.00003109137,0.0003493645,0.0001958365,0.0001356594,0.0000141706,0.9984125,0.0002797264],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"other","genre_gemma":"other","genre_scores_codex":[0.0003354097,0.0001946958,0.00550619,0.000405264,0.0001270112,0.0005352831,0.0007565863,0.0009102629,0.9912293],"genre_scores_gemma":[0.0287537,0.0001702302,0.0003744396,0.0007773801,0.0001873374,3.361774e-7,0.006053899,0.008472174,0.9552105],"genre_candidate":"other","genre_consensus":"other","teacher_disagreement_score":0.5408688,"threshold_uncertainty_score":0.9999972,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02309372474196294,"score_gpt":0.233985160368437,"score_spread":0.2108914356264741,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}