{"id":"W4392445341","doi":"10.1145/3636555.3636876","title":"Does Difficulty even Matter? Investigating Difficulty Adjustment and Practice Behavior in an Open-Ended Learning Task","year":2024,"lang":"en","type":"article","venue":"","topic":"Innovative Teaching and Learning Methods","field":"Psychology","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"Leibniz-Gemeinschaft; Deutsche Forschungsgemeinschaft","keywords":"Task (project management); Computer science; Intervention (counseling); Space (punctuation); Cognitive psychology; Psychology; Mathematics education; Applied psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"bench_or_experimental","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"}],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002438081,0.0002739284,0.0003038333,0.0001947738,0.000231509,0.0004201675,0.0002931595,0.000164909,0.000769789],"category_scores_gemma":[0.0007595175,0.0001709053,0.00003018169,0.0004208559,0.0001146059,0.0005824892,0.0002464428,0.001251521,0.0001315278],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001008959,"about_ca_system_score_gemma":0.00003804434,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001269237,"about_ca_topic_score_gemma":0.00009742818,"domain_scores_codex":[0.9943385,0.00380268,0.0004443322,0.0007974144,0.0001974701,0.0004196042],"domain_scores_gemma":[0.9982896,0.001085447,0.0001389213,0.0002971706,0.00006938466,0.0001195093],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"observational","study_design_scores_codex":[0.0002591963,0.001661692,0.2559313,0.0001750366,0.0002342422,0.0005287748,0.09947792,0.0001327976,0.4237654,0.02167468,0.007793614,0.1883654],"study_design_scores_gemma":[0.0006781864,0.00035806,0.969992,0.0001329473,0.0000734671,0.0001256914,0.01326377,0.0004259125,0.00009410913,0.000132882,0.01433282,0.0003900897],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9755234,0.0001668283,0.001212778,0.001879368,0.0008212425,0.0004956583,0.000006197068,0.0003122285,0.01958235],"genre_scores_gemma":[0.9685991,0.000002955515,0.01605589,0.0008527758,0.0001799477,0.0002016547,0.0000571548,0.00005510503,0.01399538],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7140607,"threshold_uncertainty_score":0.842865,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07063212001494298,"score_gpt":0.433313213453595,"score_spread":0.3626810934386521,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}