{"id":"W4381189738","doi":"10.5206/cjsotlrcacea.2023.1.10960","title":"Evaluating and Improving the Formative Use of Student Evaluation of Teaching","year":2023,"lang":"en","type":"article","venue":"The Canadian Journal for the Scholarship of Teaching and Learning","topic":"Evaluation of Teaching Practices","field":"Social Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Western University","funders":"University of Guelph","keywords":"Formative assessment; Set (abstract data type); Mathematics education; Psychology; Pedagogy; Computer science; Medical education; Medicine","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","sts","research_integrity"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.165452,0.0001086809,0.0001832501,0.000204067,0.01098086,0.0005211647,0.0004862551,0.00006577634,0.0000137823],"category_scores_gemma":[0.06548788,0.00006301146,0.00009136992,0.0001602994,0.00039568,0.0009726417,0.00006534558,0.002511282,5.775329e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001485566,"about_ca_system_score_gemma":0.0008090321,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.03603856,"about_ca_topic_score_gemma":0.01871892,"domain_scores_codex":[0.9859659,0.01188233,0.0004933111,0.0001321959,0.001208504,0.0003177393],"domain_scores_gemma":[0.9882543,0.00986442,0.001071556,0.0001818986,0.0004994407,0.0001283585],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00003824214,0.00001201452,0.04151088,0.00005311961,0.0002367209,3.570412e-7,0.4723339,0.03878351,0.0009982504,0.01442206,0.00009074659,0.4315202],"study_design_scores_gemma":[0.001724375,0.0006379861,0.3407091,0.0009975872,0.001746953,0.00004318261,0.4888272,0.1421792,0.0001166681,0.01397138,0.008651679,0.0003946599],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9912335,0.000744746,0.000204415,0.00667334,0.0002715761,0.0004998737,0.000003820043,0.00001252344,0.0003562554],"genre_scores_gemma":[0.9985402,0.0000321147,0.0009022407,0.00006352079,0.0001317705,0.00001108467,0.000001388469,0.00001444399,0.0003032312],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4311255,"threshold_uncertainty_score":0.99979,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3875223066973931,"score_gpt":0.5120943162826713,"score_spread":0.1245720095852783,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}