{"id":"W4381189738","doi":"10.5206/cjsotlrcacea.2023.1.10960","title":"Evaluating and Improving the Formative Use of Student Evaluation of Teaching","year":2023,"lang":"en","type":"article","venue":"The Canadian Journal for the Scholarship of Teaching and Learning","topic":"Evaluation of Teaching Practices","field":"Social Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Western University","funders":"University of Guelph","keywords":"Formative assessment; Set (abstract data type); Mathematics education; Psychology; Pedagogy; Computer science; Medical education; Medicine","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1456987,0.0006570645,0.0007851394,0.003963597,0.000960968,0.005651317,0.001793678,0.0007653416,0.001402734],"category_scores_gemma":[0.3576687,0.0002965028,0.0007872281,0.003430567,0.001293181,0.00366964,0.002641218,0.001632658,0.0004881649],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003123402,"about_ca_system_score_gemma":0.005578021,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004291239,"about_ca_topic_score_gemma":0.008619637,"domain_scores_codex":[0.8844162,0.06973182,0.01070904,0.003390172,0.02973085,0.002021987],"domain_scores_gemma":[0.4558782,0.3273959,0.0556206,0.03089417,0.1227165,0.007494622],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000369149,0.0008685814,0.5608039,0.0005621883,0.0002489434,0.00002914655,0.01114935,0.0006064802,0.00201722,0.0009928525,0.002852549,0.4194996],"study_design_scores_gemma":[0.00007820263,0.002458763,0.9609187,0.0008634698,0.0001723707,0.00009943311,0.008035892,0.004189478,0.01024482,0.002339185,0.01038804,0.0002115474],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9639428,0.0008937003,0.02290119,0.001431519,0.0002799024,0.0008174588,0.0005263364,0.0002489475,0.00895811],"genre_scores_gemma":[0.9697459,0.00050096,0.02645491,0.000262275,0.0001126412,0.0009208882,0.000557025,0.00005606252,0.001389302],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1456987,"threshold_uncertainty_score":0.7705375,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3875223066973931,"score_gpt":0.5120943162826713,"score_spread":0.1245720095852783,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}