{"id":"W4396833177","doi":"10.1145/3613904.3642773","title":"CodeAid: Evaluating a Classroom Deployment of an LLM-based Programming Assistant that Balances Student and Educator Needs","year":2024,"lang":"en","type":"article","venue":"","topic":"Online Learning and Analytics","field":"Computer Science","cited_by":206,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Code (set theory); Software deployment; Transparency (behavior); Thematic analysis; Class (philosophy); Multimedia; Software engineering; Mathematics education; Programming language; Qualitative research; Psychology; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0045589,0.000854949,0.0004398453,0.001026791,0.000855334,0.002071832,0.002469965,0.001479662,0.003652591],"category_scores_gemma":[0.03071313,0.0004018632,0.0003100238,0.0006277553,0.001036878,0.002746389,0.00290957,0.001306604,0.001897029],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001313832,"about_ca_system_score_gemma":0.00245452,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003364362,"about_ca_topic_score_gemma":0.005143194,"domain_scores_codex":[0.9952186,0.002048491,0.0003830001,0.0008238333,0.001109766,0.0004163605],"domain_scores_gemma":[0.97832,0.01251009,0.001003645,0.002030215,0.003766488,0.002369454],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.005830352,0.01234362,0.03220152,0.00521984,0.0001739496,0.001727922,0.0405146,0.009936091,0.1550567,0.004641376,0.033364,0.69899],"study_design_scores_gemma":[0.005410754,0.05432487,0.08743555,0.001723308,0.0006733935,0.003458804,0.0410442,0.16521,0.1984754,0.01001678,0.4312353,0.0009916872],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9152126,0.000401633,0.05813219,0.0006748594,0.0001436937,0.00237643,0.000868891,0.01124605,0.01094369],"genre_scores_gemma":[0.8298848,0.00040285,0.154052,0.0006620788,0.00006778472,0.001848857,0.002050331,0.001119057,0.009912056],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0045589,"threshold_uncertainty_score":0.02411008,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03321512878270768,"score_gpt":0.3645469566558219,"score_spread":0.3313318278731143,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}