{"id":"W4406993411","doi":"10.1007/s10639-025-13370-6","title":"Predicting data science performance from log data: using machine learning","year":2025,"lang":"en","type":"article","venue":"Education and Information Technologies","topic":"Big Data and Business Intelligence","field":"Business, Management and Accounting","cited_by":3,"is_retracted":false,"has_abstract":false,"ca_institutions":"Simon Fraser University","funders":"British Columbia Knowledge Development Fund; Canada Foundation for Innovation","keywords":"Computer science; Educational technology; Science education; Data science; Machine learning; Mathematics education; Artificial intelligence; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001374532,0.0006646556,0.0003905216,0.002900325,0.0002528864,0.001573603,0.0004369612,0.0007007919,0.001492598],"category_scores_gemma":[0.01074195,0.0001787259,0.0003674456,0.002044857,0.0002512088,0.00152821,0.0004388916,0.000816312,0.001186157],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006168981,"about_ca_system_score_gemma":0.0006539063,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007453302,"about_ca_topic_score_gemma":0.006341511,"domain_scores_codex":[0.9994899,0.0001602395,0.00004955662,0.00007515318,0.0001514756,0.00007366487],"domain_scores_gemma":[0.9934037,0.004366147,0.0007218895,0.0003605146,0.0008140639,0.0003336194],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006330758,0.002001577,0.6532928,0.000140503,0.0001907957,0.0001403235,0.0001127047,0.1574118,0.003463852,0.001224193,0.005165546,0.1762228],"study_design_scores_gemma":[0.00001692633,0.0002355011,0.07081192,0.00001859551,0.0000262298,0.00003568464,0.0001101583,0.9218595,0.00383537,0.002172306,0.0008567284,0.00002106643],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9711465,0.0003243866,0.02163103,0.0007331062,0.00006630846,0.00005616341,0.001599443,0.0006313697,0.003811733],"genre_scores_gemma":[0.9932016,0.0001379752,0.00444565,0.00003838737,0.00005163507,0.00002018404,0.001273462,0.00001862136,0.0008125615],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007453302,"threshold_uncertainty_score":0.0148198,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07699128705415802,"score_gpt":0.3200711976206982,"score_spread":0.2430799105665402,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}