{"id":"W4408031439","doi":"10.1080/10401334.2025.2461991","title":"Beyond Student Evaluations of Teaching and Educator Portfolios: A Multisource, Longitudinal System for Evaluating Teaching","year":2025,"lang":"en","type":"article","venue":"Teaching and Learning in Medicine","topic":"Reflective Practices in Education","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Columbia College","funders":"","keywords":"Medical education; Mathematics education; Teaching method; Psychology; Computer science; Pedagogy; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","sts"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.03833611,0.0001676941,0.0004044774,0.0005074896,0.002805422,0.00007623358,0.0001807662,0.00009886707,0.000008712243],"category_scores_gemma":[0.04251476,0.0001556346,0.00003577629,0.0001860018,0.0002577905,0.0002750056,0.00007167175,0.002015166,4.196801e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003436272,"about_ca_system_score_gemma":0.0003198709,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008420801,"about_ca_topic_score_gemma":0.0002957348,"domain_scores_codex":[0.9930065,0.005149255,0.000566564,0.0004260849,0.0005374639,0.0003140984],"domain_scores_gemma":[0.9935161,0.005544697,0.000552833,0.0001600312,0.0001340425,0.00009224104],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"qualitative","study_design_scores_codex":[0.00004137271,0.0001561746,0.4107,0.0002836912,0.00007604563,7.417029e-7,0.2918444,0.0005331027,0.000959929,0.03326467,0.000156636,0.2619832],"study_design_scores_gemma":[0.002176713,0.000536571,0.2667834,0.00329307,0.0004457378,0.0000102601,0.7024586,0.01194473,0.000008819265,0.001662951,0.01038098,0.0002981228],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.930626,0.001461398,0.005573344,0.003246587,0.0006603511,0.0007004397,6.263535e-7,0.00008210193,0.05764919],"genre_scores_gemma":[0.9788736,0.00003207982,0.01889456,0.00009003826,0.0004007583,0.0000935872,0.000006682455,0.00001642906,0.001592284],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4106142,"threshold_uncertainty_score":0.9984928,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04901732876771051,"score_gpt":0.4991829524736445,"score_spread":0.450165623705934,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}