{"id":"W4400266869","doi":"10.1145/3643991.3644907","title":"PeaTMOSS: A Dataset and Initial Analysis of Pre-Trained Models in Open-Source Software","year":2024,"lang":"en","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"National Science Foundation","keywords":"Computer science; Open source software; Open source; Software; Artificial intelligence; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004908894,0.00009780343,0.0002231423,0.0004786894,0.00001980652,0.0003786353,0.001036866,0.0000424738,0.00003495539],"category_scores_gemma":[0.0002455966,0.00008558702,0.00003529052,0.0022519,0.00003678217,0.0008504431,0.001126544,0.0001279139,0.00000348848],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002955367,"about_ca_system_score_gemma":0.00008855922,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006335197,"about_ca_topic_score_gemma":0.0001242349,"domain_scores_codex":[0.9988605,0.00004109233,0.0002031087,0.000422825,0.0002646025,0.0002078575],"domain_scores_gemma":[0.9985303,0.0008109812,0.00001341131,0.0005392033,0.00003035518,0.00007579676],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001203448,0.0005424367,0.03043186,0.0009293808,0.003033482,0.0007923687,0.01756375,0.6106331,0.0004537065,0.04730019,0.02148119,0.2667182],"study_design_scores_gemma":[0.0001668507,0.00004094489,0.00890311,0.00003641883,0.00003318507,0.000005125709,0.00001643624,0.9894487,0.00008682011,0.0006173481,0.0005334553,0.0001116649],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06087443,0.0002345235,0.9381148,0.0001213292,0.00003705838,0.0001532006,0.0002031078,0.0001992586,0.00006226922],"genre_scores_gemma":[0.9420179,0.00001176662,0.057581,0.00004233325,0.0000109852,0.00002354861,0.0001457478,0.00001034532,0.0001564433],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8811434,"threshold_uncertainty_score":0.3651189,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03556240376042519,"score_gpt":0.3328252172419072,"score_spread":0.297262813481482,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}