{"id":"W3034035587","doi":"10.31045/jes.3.2.7","title":"A Thirty State Analysis of Teacher Supervision and Evaluation Systems in the ESSA Era","year":2020,"lang":"en","type":"article","venue":"Journal of Educational Supervision","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"University of Toronto; University of Minnesota; Princeton University","keywords":"Formative assessment; Accountability; Summative assessment; Public administration; Legislation; Policy analysis; Politics; State (computer science); Political science; Psychology; Law; Pedagogy; Computer science","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006028315,0.00006690983,0.0001842706,0.00155356,0.002091622,0.00265154,0.000404635,0.0003130396,0.001667497],"category_scores_gemma":[0.01357922,0.0002166558,0.0002044833,0.002696923,0.002136529,0.002180854,0.002183345,0.0009500938,0.0001049191],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.008712731,"about_ca_system_score_gemma":0.006341292,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.06933139,"about_ca_topic_score_gemma":0.09513627,"domain_scores_codex":[0.9966496,0.001694419,0.0002147466,0.0003823011,0.0005951836,0.0004638235],"domain_scores_gemma":[0.9842855,0.007166383,0.003214721,0.001142294,0.003682042,0.0005090263],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002012558,0.0002834026,0.7254902,0.0002028267,0.00006479923,0.0002379528,0.1688748,0.002492394,0.001100657,0.04377749,0.003343325,0.05393094],"study_design_scores_gemma":[0.00001277246,0.0001487636,0.8107675,0.000274466,0.00006646941,0.00007899349,0.1488399,0.004352152,0.001320174,0.004158598,0.02993306,0.00004723088],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9897822,0.0001884211,0.001503138,0.0008996332,0.000007663801,0.00003770967,0.0003222477,0.0000174953,0.007241425],"genre_scores_gemma":[0.998774,0.00005744168,0.0003796802,0.00004506749,0.000002202172,0.00002935799,0.0001387259,0.000004816463,0.0005687546],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.06933139,"threshold_uncertainty_score":0.1378556,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1739923189409111,"score_gpt":0.4769084655628433,"score_spread":0.3029161466219322,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}