{"id":"W4415169429","doi":"10.1007/s10639-025-13801-4","title":"Generative AI in Data Science Programming: Differences in Performance Between Groups With and Without AI-assistance","year":2025,"lang":"en","type":"article","venue":"Education and Information Technologies","topic":"Innovative Human-Technology Interaction","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"ca_institutions":"Simon Fraser University","funders":"British Columbia Knowledge Development Fund; Canada Foundation for Innovation","keywords":"Context (archaeology); Generative grammar; Science education; Significant difference; Educational technology","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.00215833,0.000473478,0.0005580902,0.0009657642,0.0007085405,0.003015839,0.0009268012,0.001089006,0.005007155],"category_scores_gemma":[0.02059526,0.0002709957,0.0005613704,0.0004976189,0.001436556,0.001625997,0.002657875,0.001641478,0.002615803],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005581712,"about_ca_system_score_gemma":0.001347763,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002138692,"about_ca_topic_score_gemma":0.001984536,"domain_scores_codex":[0.9984468,0.0005122302,0.0001233564,0.0002740968,0.0002994184,0.0003441129],"domain_scores_gemma":[0.9832183,0.009683303,0.00137122,0.001553753,0.001349803,0.002823663],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01129181,0.01781881,0.4901431,0.0005821949,0.0004015611,0.001218369,0.06011191,0.009273994,0.02948589,0.007663048,0.003358224,0.368651],"study_design_scores_gemma":[0.0008431366,0.01303097,0.8093265,0.0003169109,0.0004636142,0.001550605,0.03584631,0.0571229,0.02799069,0.03534137,0.01784021,0.0003268594],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9947739,0.00006651029,0.0009487984,0.0001376775,0.00002482972,0.00003505057,0.00004937626,0.0001008231,0.003863065],"genre_scores_gemma":[0.9956148,0.00005664796,0.0008475942,0.00006967659,0.000007345427,0.00003731895,0.0001192,0.0000249371,0.003222486],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9978417,"threshold_uncertainty_score":0.01675057,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02383347926566382,"score_gpt":0.3105078002408833,"score_spread":0.2866743209752194,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}