{"id":"W4391094351","doi":"10.1109/bigdata59044.2023.10386503","title":"GPT in Data Science: A Practical Exploration of Model Selection","year":2023,"lang":"en","type":"article","venue":"","topic":"Machine Learning and Data Classification","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Selection (genetic algorithm); Computer science; Data modeling; Data science; Artificial intelligence; Software engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03985386,0.001251837,0.001388246,0.003249807,0.00164698,0.005487856,0.003642382,0.002308459,0.004314327],"category_scores_gemma":[0.1348365,0.0009739209,0.002564297,0.003961395,0.003761961,0.005635,0.005073861,0.006286067,0.0007065763],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003204638,"about_ca_system_score_gemma":0.005327246,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006855682,"about_ca_topic_score_gemma":0.009692971,"domain_scores_codex":[0.9741299,0.02208502,0.0006834153,0.001005359,0.00180518,0.000291183],"domain_scores_gemma":[0.8276935,0.158767,0.002147837,0.007526064,0.003078251,0.0007873636],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001383013,0.0001315829,0.005355196,0.0006348782,0.0002779549,0.0004742977,0.002141719,0.3162918,0.0006400162,0.5720196,0.004712321,0.09718221],"study_design_scores_gemma":[0.00004149677,0.00005429113,0.0002650327,0.0001576492,0.00003026925,0.0001106384,0.0002672033,0.5688046,0.0003707119,0.4243804,0.005492345,0.0000252761],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.008657834,0.0003483344,0.9813688,0.004899668,0.0000449353,0.0001779362,0.0001456467,0.0003346939,0.004022176],"genre_scores_gemma":[0.1333961,0.0003946506,0.8637186,0.0007573224,0.00007516586,0.0005078762,0.0002172355,0.0002058155,0.0007271283],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.03985386,"threshold_uncertainty_score":0.2107698,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2597187824055493,"score_gpt":0.4325973325874891,"score_spread":0.1728785501819398,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}