{"id":"W4386878517","doi":"10.1111/medu.15218","title":"To prove or improve? Examining how paradoxical tensions shape evaluation practices in accreditation contexts","year":2023,"lang":"en","type":"article","venue":"Medical Education","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"Toronto Metropolitan University; Centre for Global Health Research; The Wilson Centre; University of Toronto; Centre for Addiction and Mental Health","funders":"","keywords":"Accreditation; Credibility; Context (archaeology); Public relations; Situated; Sociology; Medical education; Psychology; Political science; Medicine; Computer science; Law","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1671192,0.000522537,0.0008549347,0.005234564,0.01771597,0.02310982,0.004172132,0.004170981,0.002793383],"category_scores_gemma":[0.2232099,0.001052733,0.0006832598,0.003568233,0.05312762,0.01752632,0.02110404,0.006638817,0.0003343742],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01682397,"about_ca_system_score_gemma":0.02040664,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005097823,"about_ca_topic_score_gemma":0.006199109,"domain_scores_codex":[0.7959856,0.1666048,0.005593532,0.007243267,0.01856906,0.0060037],"domain_scores_gemma":[0.6515794,0.291689,0.01756234,0.01183879,0.01908263,0.008247755],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00006249661,0.00007216649,0.01019758,0.0003442288,0.00002874957,0.0004887579,0.8913143,0.0003124874,0.0007002349,0.06753507,0.0009717618,0.02797225],"study_design_scores_gemma":[0.00002750083,0.0001091823,0.007428533,0.0007189318,0.00002278052,0.000438619,0.8792264,0.001594071,0.0007890098,0.0837586,0.02580568,0.00008058283],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8528161,0.003681818,0.04894241,0.04179138,0.000279466,0.0003107786,0.00003810825,0.0001465367,0.05199337],"genre_scores_gemma":[0.9941732,0.0002666214,0.004290559,0.0006233161,0.00001772674,0.00006285089,0.000007310322,0.00002852833,0.0005299337],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8328809,"threshold_uncertainty_score":0.8838212,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4123731071423443,"score_gpt":0.5956808583089721,"score_spread":0.1833077511666278,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}